共计 1235 个字符,预计需要花费 4 分钟才能阅读完成。
通用视频模型 MiniMax H3 正式开源, 支持多模态上下文、2K 分辨率
此次开源的 H3 被定位为通用型全模态生成系统 , 能够处理由文本、图像、视频和音频组合而成的上下文, 并生成带有立体声音频的视频内容。对于正在快速发展的 AI 视频赛道而言, 这类模型的重点不只是“能生成视频”, 而是能否准确理解复杂参考素材与指令, 并在输出中保持一致性。
📌 从文生视频走向全模态参考生成
MiniMax H3 的核心特征在于对多模态上下文的统一理解 。用户不再只能输入一段文字提示词, 还可以结合图片、视频片段和音频素材, 让模型围绕更明确的视觉风格、人物状态、镜头变化或声音信息进行生成。
根据已公布的信息,H3 在预训练阶段就面向任务泛化进行设计 , 因此具备较广泛的多模态理解与生成能力。换句话说, 它更强调对复杂指令的跟随能力, 而非单一的文本到视频转换。
🔍 输出规格: 最长 15 秒, 支持 24 FPS 与立体声
在生成规格方面,MiniMax H3 支持 4 至 15 秒的视频输出, 帧率为 24 FPS, 并可生成 32 kHz 立体声音频。画幅方面, 模型支持多种常见比例, 包括横屏、方形和竖屏格式, 覆盖短视频、宣传片、社媒内容等不同使用场景。
- 视频时长: 支持 4–15 秒输出。
- 画面比例: 包括 21:9、16:9、4:3、1:1、3:4、9:16 等。
- 默认分辨率: 短边默认 768 像素。
- 高分辨率: 通过 H3-Regenerate-2K 可生成 2K 分辨率结果。
- 音频能力: 支持 32 kHz 原生立体声输出。
💡 两个基础版本覆盖不同输入方式
从输入模式看,H3 提供了面向不同创作流程的两个基础版本 。其中,H3-Base-FL2VA 主要用于首尾帧相关场景: 用户可以不输入图像, 直接进行文生视频; 也可以输入首帧、尾帧, 或同时输入首尾帧, 以控制视频起点和终点。
另一版本 H3-Base-Ref2VA 则面向更复杂的全模态参考生成。它支持最多 9 张图像、最多 3 段视频以及最多 3 段音频输入。不过音频不能单独作为唯一输入, 必须与图像或视频配合使用; 所有类型素材合计最多 12 个文件, 视频和音频总时长均有 15 秒限制。
📊 三模块架构: 理解、生成与 2K 再生成
完整的 H3 系统由三个模块组成, 分别负责上下文处理、基础生成和高分辨率再生成 。这种拆分方式也反映出当前 AI 视频模型的一大趋势: 先提升对复杂输入的理解, 再通过分阶段生成提升画面质量。
- H3-Context-IR: 负责理解并提炼多模态指令, 将复杂输入转换为模型更易处理的上下文中间表示。
- H3-Base: 根据上下文中间表示生成音频和视频, 输出 768p 结果。
- H3-Regenerate-2K: 将 768p 结果与原始上下文再次输入系统, 用于生成细节更丰富的 2K 视频。
🚀 行业观察: 开源或降低视频生成应用门槛
MiniMax H3 基于 MiniMax H3 Community License 发布。随着模型开源, 开发者和内容工具团队有机会围绕其构建更定制化的视频生成流程, 例如广告分镜、短剧片段、虚拟人素材、产品展示视频等。