Skip to main content
MiniMax H3 是 MiniMax 推出的通用全模态生成模型,现已以开放权重形式提供。它能在单一上下文中联合理解文本、图像、视频和音频,并生成带原生立体声音频的视频:语音、音效和音乐在单次前向传播中一并建模,而非事后叠加。输出最高支持 2K 分辨率、24fps,时长约 15 秒。 ComfyUI 原生支持 MiniMax H3。文档分为五个页面:
  • 概述(本页):模型能力、工作流索引、输出分辨率与加速技巧
  • 原生工作流:文生视频、图生视频、参考生视频,以及高级原生节点技巧
  • 多帧参考:将参考帧锚定在输出时间线上的特定位置
  • Fun ControlNet Union:使用控制视频驱动 H3,或使用遮罩进行视频修补
  • 提示词指南:MiniMax 官方提示词编写指南、通用技巧与提示词嵌入
H3 的开放权重让你可以在本地运行该模型。对本地生成的输出进行商业使用需要 MiniMax 商业许可证,该许可证可通过 Comfy(唯一官方经销商)获取。在 Comfy Cloud 上生成的输出已包含商业使用权。

主要功能

  • 原生立体声音频:对话、音效和音乐可与视频一同生成,并在同一个 MP4 文件中同步
  • 多模态上下文:文本、图像、视频和音频参考可在单次生成中组合使用
  • 参考驱动生成:从参考素材中锁定角色身份、风格、动作、相机运镜或声音
  • 指令遵循:使用自然语言描述参考素材与目标镜头之间的关系
  • 准确的文本渲染:拼写文本和品牌元素渲染清晰
  • 开放权重:在 ComfyUI 中本地运行,可完全控制每个参数

入门

ComfyUI 支持开放权重的 MiniMax H3。开始使用:
  1. 将 ComfyUI 更新到 0.30.0 或更高版本
  2. 前往模板库 > 视频,选择任意一个 MiniMax H3 工作流
  3. 按照弹出窗口的提示下载模型并运行工作流
模型文件托管在 Hugging Face 的 Comfy-Org/MiniMax-H3 仓库中。

工作流索引

模板库目前附带五个示例工作流。它们只是示例模板,并非完整列表:通过原生 MiniMax H3 节点,该模型支持更多生成模式,您可以使用这些节点构建更多工作流。

文生视频(T2V)

根据文本提示词生成视频,并带有原生立体声音频

图生视频(I2V)

根据输入图像生成视频,并支持可选的首帧/尾帧控制

参考生视频(R2V)

通过参考图像、视频和音频,锁定角色、风格、动作、相机运动或声音

多帧参考

使用链式连接的 Add Guide 节点,将参考帧锚定在输出时间线上的指定位置

Fun ControlNet Union

使用 Canny、Depth、HED、MLSD 或 Pose 控制视频驱动 H3,或使用遮罩执行视频 inpainting
底层节点模式:首帧/尾帧图生视频(fl2va)通过 MiniMaxH3ImageToVideo 节点实现;参考驱动的生成(ref2va)通过 MiniMaxH3ReferenceToVideo 节点实现,可使用图像、视频和音频作为参考。 提示词编写资源(官方指南、通用技巧与提示词嵌入)请参见提示词指南

设置输出分辨率

每个工作流都使用一个 Resolution Selector(分辨率选择器) 节点来控制总体输出尺寸。该节点根据三个设置计算 widthheight,其输出直接连接到 MiniMax H3 节点的 widthheight 输入:
  • 宽高比:选择一个预设,例如 16:9 (Widescreen)9:16 (Portrait Widescreen)1:1 (Square)
  • 百万像素:输出的目标总像素数。数值越大画面越大,数值越小生成越快
  • 取整倍数:计算结果会取整到该数值的最近倍数。保持为 32,与 H3 的分辨率网格一致
模板默认使用一个较快的预览尺寸。要获得全质量输出,请在 16:9 下将分辨率选择器的百万像素设为 0.98,即 H3 的原生画布(短边 768px,16:9 下为 1344x768);或在 MiniMax H3 节点的 widthheight 中直接输入 1344 x 768(默认值)。请跳过 1.0 百万像素档:它得到 1376x768,超出模型 768x1344 像素的面积上限。

使用 Sage Attention 加速生成

示例工作流默认使用标准注意力实现。使用 Sage Attention 可以将生成速度大约提升一倍,质量损失极小。Sage Attention 是可选依赖,需要你自行安装:
  1. 安装 sageattention Python 包。从 SageAttention releases 页面下载与你 PyTorch 和 CUDA 版本匹配的 wheel 文件,然后用 pip install <wheel-file> 安装。
  2. 安装 KJNodes 自定义节点,它提供了 Patch Sage Attention KJ 节点。可以使用 ComfyUI Manager 安装,或将仓库克隆到 ComfyUI/custom_nodes/ 后重启 ComfyUI。
  3. 在工作流中添加 Patch Sage Attention KJ 节点,并将其连接在 UNETLoaderBasicGuider 节点之间:它的 model 输入接收来自 UNETLoader 的模型,model 输出连接到 BasicGuidermodel 输入。将 sage_attention 设置为 auto
  4. 照常运行工作流。只需要给 guider 打补丁;scheduler 只负责生成 sigmas,可以保持不变。
注意:
  • Sage Attention 要求 float16 或 bfloat16 张量。MiniMax H3 的部分层使用其他数据类型,因此你可能会在控制台看到 “Input tensors must be in dtype of torch.float16 or torch.bfloat16, using pytorch attention instead” 消息。这是正常现象;受影响的层会回退到标准注意力,生成仍然可以正常工作。
  • 另一种方式是使用 --use-sage-attention 启动参数启动 ComfyUI 来全局启用 Sage Attention,无需添加节点。