视频扩散模型的实时化长期受困于精度-效率悖论:降低数值精度虽可节省显存与算力,却极易引发去噪链路中误差的指数级累积——表现为动作失真、角色漂移与时序抖动。Vivix此次发布的VMI(Vivix Model Infra)并非简单量化压缩,而是一套端到端协同优化的统一流式推理架构。其核心突破在于三重协同:第一,以Blackwell GPU原生支持的NVFP4 GEMM为终极目标,在训练与知识蒸馏阶段即嵌入低精度感知机制,辅以帧间去噪误差动态校正,从源头抑制量化漂移;第二,首创计算-通信-显存联合调度引擎,通过多CUDA Stream异步并行、Mega Kernel融合计算与通信、CUDA Graphs整图固化,彻底消除Python解释器、CPU调度与PCIe带宽瓶颈;第三,支撑高达30B有效激活参数的高质量视频模型,在8×8×4高保真VAE压缩下达成单卡超10,000 video tokens/s吞吐,PCIe带宽利用率突破88%。相较当前主流‘轻量世界模型’依赖小参数(1–5B)或过度压缩(16×16×8)所导致的动作受限与伪影频发,VMI真正实现了大容量、高保真与强实时性的三角平衡。
来源:量子位
