一项突破性架构设计正悄然改写大模型推理的底层逻辑——无问芯穹团队摒弃传统跨集群KV Cache传输范式,首创‘Token-only传输+本地重算’机制,将原本高度依赖网络稳定性的远程缓存同步,转化为确定性极强的本地计算任务。实测显示:在MD端重算100个Token的KV Cache,平均耗时仅305.2ms,峰值锁定于321.4ms,标准差低至4.8ms;相较之下,以太网传输方案平均延迟达185.4ms,拥堵时飙升至512.6ms,标准差高达96.3ms,且未计入24.5ms的H2D/D2H转换开销及不可预测的排队延迟。为兼顾用户体验与负载均衡,团队创新引入‘追赶式’与‘一次性’双模动态交接策略:启用追赶模式时,PDD可在略增RLD负载前提下,使首字延迟(TTFT)与每秒输出Token数(OTPS)完全对标同集群PD分离效果。该PDD架构远超单纯网络优化范畴,承载着无问芯穹对下一代Model-as-a-Service(MaaS)基础设施的核心判断——‘极简局部异构 + 灵活远端分离’。未来,无需在单一机房堆砌庞杂异构芯片,仅需在主算力中心部署少量‘接力手’节点,即可如云原生调度般,将海量解码任务智能分发至全国乃至全球的低成本边缘算力节点。依托DRC技术,KV Cache传输数据量压缩一个数量级,但其跨域延迟仍为最大瓶颈。分析600万真实线上请求发现:30%请求输出Token<100,40%≤500;对这类短输出场景,KV Cache跨集群传输耗时占端到端延迟的43%–56%,成为体验‘死刑’的根源。新架构下,延迟下降50%,综合成本降低近40%,闲置算力被深度盘活,全域异构芯片各司其长,产业价值全面释放。
来源:量子位
