Vivix发布VMI实时推理架构:30B级视频扩散模型实现毫秒级流式生成

Vivix推出VMI统一流式推理架构,通过低精度感知训练、去噪误差校正与计算-通信-显存协同调度,首次在30B级视频扩散模型上实现毫秒级实时生成,单卡吞吐超10,000 video tokens/s,PCIe带宽利用率达88%+,突破精度、容量与实时性不可兼得的技术瓶颈。

视频扩散模型的实时化长期受困于精度-效率悖论:降低数值精度虽可节省显存与算力,却极易引发去噪链路中误差的指数级累积——表现为动作失真、角色漂移与时序抖动。Vivix此次发布的VMI(Vivix Model Infra)并非简单量化压缩,而是一套端到端协同优化的统一流式推理架构。其核心突破在于三重协同:第一,以Blackwell GPU原生支持的NVFP4 GEMM为终极目标,在训练与知识蒸馏阶段即嵌入低精度感知机制,辅以帧间去噪误差动态校正,从源头抑制量化漂移;第二,首创计算-通信-显存联合调度引擎,通过多CUDA Stream异步并行、Mega Kernel融合计算与通信、CUDA Graphs整图固化,彻底消除Python解释器、CPU调度与PCIe带宽瓶颈;第三,支撑高达30B有效激活参数的高质量视频模型,在8×8×4高保真VAE压缩下达成单卡超10,000 video tokens/s吞吐,PCIe带宽利用率突破88%。相较当前主流‘轻量世界模型’依赖小参数(1–5B)或过度压缩(16×16×8)所导致的动作受限与伪影频发,VMI真正实现了大容量、高保真与强实时性的三角平衡。

来源:量子位

AI 前线

Hi3D闭门峰会首次解密AI驱动的3D产业演进路径:从生成式建模到智能制造新范式

2026-7-26 15:42:03

AI 前线

Claude Opus 5正式发布:智能体级自主性跃升,代码生成更审慎、更可靠,定价维持不变

2026-7-26 17:42:03

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧
个人中心
购物车
优惠劵
今日签到
有新私信 私信列表
搜索