大模型

MiniMax开源H3视频模型:33B参数支持2K分辨率+原生立体声,成本仅为竞品1/3

发布时间:2026年08月03日 14:00:00

MiniMax于7月31日发布H3视频模型,8月2日将权重上传至Hugging Face。该模型33B参数,支持文本/图像/视频/音频四模态统一理解与生成,可生成4-15秒2K分辨率、24fps视频,配32kHz立体声。定价仅为竞品1/3,上线ComfyUI、Runway、Leonardo.ai等十余个平台。但许可证限制较严格,禁止在美国、欧盟、英国、韩国使用。


发布概况

MiniMax于7月31日正式发布H3视频模型,并于8月2日将权重上传至Hugging Face。H3是少数同时支持视频生成与原生音频同步的可下载模型之一。

模型规格

技术参数

  • 参数量:33B
  • 架构:统一理解文本/图像/视频/音频四模态
  • 输出分辨率:最高2K(2048×2048)
  • 帧率:24fps
  • 视频时长:4-15秒
  • 音频:32kHz立体声,原生同步

定价

  • 2K分辨率下每秒价格仅为竞品1/3
  • 托管API无使用限制

生态整合

H3已上线十余个平台:

  • ComfyUI
  • Runway
  • Leonardo.ai
  • Topview
  • 以及更多AI创作平台

许可证限制

MiniMax社区许可证

许可证并非完全开放,存在以下限制:

  • 地域限制:禁止在美国、欧盟、英国、韩国直接使用权重
  • 收入门槛:年收入超过2000万美元的企业须书面授权
  • 署名要求:须在屏幕使用中标注来源
  • 托管API无限制:通过MiniMax官方API使用则不受地域限制

能力特点

四模态统一理解

H3能够同时处理文本、图像、视频和音频输入,在单一上下文中理解多模态信息:

  • 文本描述生成视频
  • 图像+文本生成视频
  • 视频+音频联合生成
  • 视频编辑与风格迁移

原生音频同步

不同于大多数需要后期配音的视频生成模型,H3原生生成与视频内容匹配的立体声音频,大幅降低了视频制作的工作流复杂度。

行业影响

视频生成领域的竞争

H3以极低价格和开源策略进入市场,对视频生成领域形成冲击:

  • 被业界称为"视频界的DeepSeek"
  • 打破字节跳动等企业的定价体系
  • 推动视频生成技术向更广泛的创作者群体开放

开源与商业化的平衡

H3的许可证策略代表了开源AI领域的一种新平衡:

  • 通过开源权重建立技术影响力
  • 通过地域限制保护核心市场
  • 通过API提供无限制使用渠道

后续观察

H3在社区中的采用率、竞品的价格跟进策略、以及MiniMax后续模型的迭代方向,将是关键观察点。