全球首个千亿参数MoE视频生成模型开源:Sand.ai突破视频AI的容量与成本双瓶颈

Sand.ai发布全球首个千亿参数MoE视频生成模型MAGI-2 Preview,首创Multi-Head MoE与Head Parallel融合架构,通过自研MagiMoE算子库和MagiMuon优化器,突破视频生成中token爆炸与训练成本高昂的双重瓶颈,实现音画协同、模态解耦的高效生成。

视频生成正面临前所未有的规模化挑战——一面是信息密度爆炸式增长:720P单帧图像经视觉编码即产生近千patch token,一秒24帧视频叠加音频波形与文本指令后,序列长度可达纯文本任务的数百倍;另一面是计算成本急剧攀升:稠密模型持续扩大,推理延迟加剧、能效比下降,而收益却难线性增长。面对这一困局,Sand.ai另辟蹊径,于2025年11月率先启动MoE架构转型,并于8个月后发布MAGI-2 Preview——全球首个统一音视频生成的千亿级稀疏MoE模型。其创新采用Multi-Head MoE+Head Parallel联合架构:文本、画面与声音共享同一Transformer主干,在每层自注意力中实时交互,实现口型、动作、声画节奏的端到端协同生成。为攻克细粒度专家训练难题,团队自研两大底层引擎:高性能MoE算子库MagiMoE(支持Triton/BF16路径,深度融合路由与专家计算)、分布式混合优化器MagiMuon(Muon主导大矩阵更新,AdamW适配常规参数),显著提升训练稳定性与通信效率。更关键的是,它摒弃传统‘token级路由’范式,转而以attention head为单元进行特征维度解耦路由,使不同专家专注语义、运动、声学等异构模态,从根本上释放MoE在多模态视频建模中的表达潜力。

来源:智东西

AI 前线

‘AI原生数据库’是概念炒作?甲骨文高管直言:实效才是AI落地的唯一标尺

2026-8-6 8:42:40

AI 前线

华为WATCH GT 7系列发布:美学再突破,运动健康功能全面跃升

2026-8-6 10:42:40

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧
个人中心
购物车
优惠劵
今日签到
有新私信 私信列表
搜索