‘Token接力’重构大模型推理架构:PD分离实现延迟减半、成本降40%,全国算力首次真正联动

无问芯穹提出‘Token接力’PDD架构,以本地重算替代跨集群KV Cache传输,实现延迟减半、成本降40%。通过双模动态交接保障用户体验,践行‘极简局部异构+灵活远端分离’理念,推动全国异构算力高效协同,破解大模型短输出场景下的首字延迟顽疾。

一项突破性架构设计正悄然改写大模型推理的底层逻辑——无问芯穹团队摒弃传统跨集群KV Cache传输范式,首创‘Token-only传输+本地重算’机制,将原本高度依赖网络稳定性的远程缓存同步,转化为确定性极强的本地计算任务。实测显示:在MD端重算100个Token的KV Cache,平均耗时仅305.2ms,峰值锁定于321.4ms,标准差低至4.8ms;相较之下,以太网传输方案平均延迟达185.4ms,拥堵时飙升至512.6ms,标准差高达96.3ms,且未计入24.5ms的H2D/D2H转换开销及不可预测的排队延迟。为兼顾用户体验与负载均衡,团队创新引入‘追赶式’与‘一次性’双模动态交接策略:启用追赶模式时,PDD可在略增RLD负载前提下,使首字延迟(TTFT)与每秒输出Token数(OTPS)完全对标同集群PD分离效果。该PDD架构远超单纯网络优化范畴,承载着无问芯穹对下一代Model-as-a-Service(MaaS)基础设施的核心判断——‘极简局部异构 + 灵活远端分离’。未来,无需在单一机房堆砌庞杂异构芯片,仅需在主算力中心部署少量‘接力手’节点,即可如云原生调度般,将海量解码任务智能分发至全国乃至全球的低成本边缘算力节点。依托DRC技术,KV Cache传输数据量压缩一个数量级,但其跨域延迟仍为最大瓶颈。分析600万真实线上请求发现:30%请求输出Token<100,40%≤500;对这类短输出场景,KV Cache跨集群传输耗时占端到端延迟的43%–56%,成为体验‘死刑’的根源。新架构下,延迟下降50%,综合成本降低近40%,闲置算力被深度盘活,全域异构芯片各司其长,产业价值全面释放。

来源:量子位

AI 前线

瓴羊发布企业级AI员工矩阵:Data+Agent+FDE三位一体驱动业务增长

2026-7-30 10:41:58

AI 前线

AlphaFold核心团队集体出走:诺奖得主领衔加盟Anthropic,AI科研范式从单点突破转向通用平台

2026-7-30 16:42:19

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧
个人中心
购物车
优惠劵
今日签到
有新私信 私信列表
搜索