大模型
MiniMax开源H3视频模型:33B参数支持2K分辨率+原生立体声,成本仅为竞品1/3
发布时间:2026年08月03日 14:00:00MiniMax于7月31日发布H3视频模型,8月2日将权重上传至Hugging Face。该模型33B参数,支持文本/图像/视频/音频四模态统一理解与生成,可生成4-15秒2K分辨率、24fps视频,配32kHz立体声。定价仅为竞品1/3,上线ComfyUI、Runway、Leonardo.ai等十余个平台。但许可证限制较严格,禁止在美国、欧盟、英国、韩国使用。
发布概况
MiniMax于7月31日正式发布H3视频模型,并于8月2日将权重上传至Hugging Face。H3是少数同时支持视频生成与原生音频同步的可下载模型之一。
模型规格
技术参数
- 参数量:33B
- 架构:统一理解文本/图像/视频/音频四模态
- 输出分辨率:最高2K(2048×2048)
- 帧率:24fps
- 视频时长:4-15秒
- 音频:32kHz立体声,原生同步
定价
- 2K分辨率下每秒价格仅为竞品1/3
- 托管API无使用限制
生态整合
H3已上线十余个平台:
- ComfyUI
- Runway
- Leonardo.ai
- Topview
- 以及更多AI创作平台
许可证限制
MiniMax社区许可证
许可证并非完全开放,存在以下限制:
- 地域限制:禁止在美国、欧盟、英国、韩国直接使用权重
- 收入门槛:年收入超过2000万美元的企业须书面授权
- 署名要求:须在屏幕使用中标注来源
- 托管API无限制:通过MiniMax官方API使用则不受地域限制
能力特点
四模态统一理解
H3能够同时处理文本、图像、视频和音频输入,在单一上下文中理解多模态信息:
- 文本描述生成视频
- 图像+文本生成视频
- 视频+音频联合生成
- 视频编辑与风格迁移
原生音频同步
不同于大多数需要后期配音的视频生成模型,H3原生生成与视频内容匹配的立体声音频,大幅降低了视频制作的工作流复杂度。
行业影响
视频生成领域的竞争
H3以极低价格和开源策略进入市场,对视频生成领域形成冲击:
- 被业界称为"视频界的DeepSeek"
- 打破字节跳动等企业的定价体系
- 推动视频生成技术向更广泛的创作者群体开放
开源与商业化的平衡
H3的许可证策略代表了开源AI领域的一种新平衡:
- 通过开源权重建立技术影响力
- 通过地域限制保护核心市场
- 通过API提供无限制使用渠道
后续观察
H3在社区中的采用率、竞品的价格跟进策略、以及MiniMax后续模型的迭代方向,将是关键观察点。