MiniMax重磅开源H3——全球首个面向有声视频精细化编辑的通用全模态生成系统。该模型支持4–15秒高质量音视频同步生成,涵盖21:9、16:9、4:3、1:1、3:4、9:16等全比例适配,输出帧率达24FPS,音频采样率32kHz、立体声。默认输出分辨率为短边768像素,搭配专属模块H3-Regenerate-2K可一键升级至2K画质。H3深度支持中、英、日、韩、法、德等11种主流语言,并对更多语种提供泛化能力。系统采用双轨架构:H3-Base-FL2VA专注首尾帧驱动生成(支持零图→文生视频、单图→首/尾帧生视频、双图→插值视频);H3-Base-Ref2VA则实现多模态联合参考——最多接入9张图像、3段视频(单段2–15秒,总长≤15秒)、3段音频(同上约束,须与视觉内容协同输入),总计支持12个跨模态输入单元,胜任角色一致性保持、动作迁移、唇形同步、音色克隆等高阶编辑任务。MiniMax提供两种落地路径:一是本地部署H3-Base(含完整推理组件链:处理器、分词器、文本编码器、Omni Transformer、Visual VAE与Audio VAE),兼容SGLang、vLLM、diffusers及ComfyUI等主流框架,支持多GPU并行;二是‘本地+API’协同的2K工作流:先由H3-Context-IR理解并增强用户指令,再经本地H3-Base生成768p基础内容,最后调用H3-Regenerate-2K融合原始上下文重生成超清2K版本。官方已在Hugging Face开放全部模型权重、可复现案例(含文生音视频、首帧驱动、多模态参考编辑)、详细参数说明与示例代码。开源当日,华为昇腾、摩尔线程、沐曦、海光、昆仑芯、天数智芯、壁仞科技、AMD、Intel等芯片厂商,以及Hugging Face、魔搭ModelScope、ComfyUI、RunningHub、fal等开发平台与推理框架(含vLLM-Omni、SGLang)共16家生态伙伴已完成全栈适配。
来源:智东西
