视频生成正面临前所未有的规模化挑战——一面是信息密度爆炸式增长:720P单帧图像经视觉编码即产生近千patch token,一秒24帧视频叠加音频波形与文本指令后,序列长度可达纯文本任务的数百倍;另一面是计算成本急剧攀升:稠密模型持续扩大,推理延迟加剧、能效比下降,而收益却难线性增长。面对这一困局,Sand.ai另辟蹊径,于2025年11月率先启动MoE架构转型,并于8个月后发布MAGI-2 Preview——全球首个统一音视频生成的千亿级稀疏MoE模型。其创新采用Multi-Head MoE+Head Parallel联合架构:文本、画面与声音共享同一Transformer主干,在每层自注意力中实时交互,实现口型、动作、声画节奏的端到端协同生成。为攻克细粒度专家训练难题,团队自研两大底层引擎:高性能MoE算子库MagiMoE(支持Triton/BF16路径,深度融合路由与专家计算)、分布式混合优化器MagiMuon(Muon主导大矩阵更新,AdamW适配常规参数),显著提升训练稳定性与通信效率。更关键的是,它摒弃传统‘token级路由’范式,转而以attention head为单元进行特征维度解耦路由,使不同专家专注语义、运动、声学等异构模态,从根本上释放MoE在多模态视频建模中的表达潜力。
来源:智东西
