ITCOW牛新网 8月3日消息,MiniMax 今日把新一代通用视频模型 H3 的权重与系统组件一次性推到开源社区,这款被官方定义为“通用型全模态生成系统”的模型,不再把文生视频、图生视频、音画同步当作彼此孤立的任务,而是用同一套上下文中间表示(Context-IR)把文本、图像、视频、音频揉进统一对话流,再吐出最高 2K 分辨率、最长 15 秒、带 32kHz 原生立体声音轨的成片。

MiniMax 开源通用视频模型 H3

据ITCOW牛新网了解,H3 的工程拆解由三块拼成:H3-Context-IR 负责把用户丢进来的复杂多模态指令(比如“用这张首帧图、这段 8 秒街景视频和一段粤语旁白,生成 12 秒夜景转场”)提炼成模型内部更好消费的上下文中间表示,MiniMax 明确建议把该模块 API 接进生成流水线,否则输出质量会明显打折;H3-Base 拿着中间表示出 768p/24FPS 的初版音视频;H3-Regenerate-2K 再把初版连原始上下文回喂一次,以 2K 重绘细节,兼顾生成稳定性与高分辨率保真度。输入侧分两条腿走——H3-Base-FL2VA 支持文生视频、首帧生视频、尾帧生视频及首尾帧生视频四种模式,H3-Base-Ref2VA 则开全模态参考:最多 9 张图、3 段视频、3 段音频(音视频须搭配图/视频出现),混合文件总数不超 12 个,且每段参考媒体时长锁在 2–15 秒。输出宽高比覆盖 21:9 到 9:16 主流画幅,稳定支持中英日韩法德西葡意阿俄等 11 种语言,其他语种给不同程度兼容。

从首尾帧控制、参考视频风格迁移到原生立体声对齐,H3 把过去需要串联多个专用模型(文生视频+图生视频+音效生成+超分)的流水线,收进一个社区许可(MiniMax H3 Community License)下开源,Hugging Face 镜像 huggingface.co/MiniMaxAI/MiniMax-H3 已就位。随着权重放出,短视频广告、游戏过场、虚拟人播报这类“多模态上下文→成片”的生产环节,又多了一枚可自部署的中国开源选项。