> ## Documentation Index
> Fetch the complete documentation index at: https://dripart-docs-verified-partner-providers.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# ComfyUI MiniMax H3 视频生成指南

> 如何在 ComfyUI 中使用开放权重的 MiniMax H3：文生视频、图生视频、参考生视频工作流，支持原生立体声音频，附提示词编写技巧与 Sage Attention 加速方法。

[MiniMax H3](https://www.minimax.io/blog/minimax-h3) 是 MiniMax 推出的通用全模态生成模型，现已以开放权重形式提供。它能在单一上下文中联合理解文本、图像、视频和音频，并生成带**原生立体声音频**的视频：语音、音效和音乐在单次前向传播中一并建模，而非事后叠加。输出最高支持 2K 分辨率、24fps，时长约 15 秒。

ComfyUI 原生支持 MiniMax H3。文档分为五个页面：

* **概述**（本页）：模型能力、工作流索引、输出分辨率与加速技巧
* **[原生工作流](/zh/tutorials/video/minimax/minimax-h3-native)**：文生视频、图生视频、参考生视频，以及高级原生节点技巧
* **[多帧参考](/zh/tutorials/video/minimax/minimax-h3-multiframe)**：将参考帧锚定在输出时间线上的特定位置
* **[Fun ControlNet Union](/zh/tutorials/video/minimax/minimax-h3-fun-controlnet)**：使用控制视频驱动 H3，或使用遮罩进行视频修补
* **[提示词指南](/zh/tutorials/video/minimax/minimax-h3-prompt-guide)**：MiniMax 官方提示词编写指南、通用技巧与提示词嵌入

<UpdateReminder />

<Note>
  H3 的开放权重让你可以在本地运行该模型。对本地生成的输出进行商业使用需要 [MiniMax 商业许可证](https://comfy.org/minimax/license)，该许可证可通过 Comfy（唯一官方经销商）获取。在 Comfy Cloud 上生成的输出已包含商业使用权。
</Note>

## 主要功能

* **原生立体声音频**：对话、音效和音乐可与视频一同生成，并在同一个 MP4 文件中同步
* **多模态上下文**：文本、图像、视频和音频参考可在单次生成中组合使用
* **参考驱动生成**：从参考素材中锁定角色身份、风格、动作、相机运镜或声音
* **指令遵循**：使用自然语言描述参考素材与目标镜头之间的关系
* **准确的文本渲染**：拼写文本和品牌元素渲染清晰
* **开放权重**：在 ComfyUI 中本地运行，可完全控制每个参数

## 入门

ComfyUI 支持开放权重的 MiniMax H3。开始使用：

1. 将 ComfyUI 更新到 0.30.0 或更高版本
2. 前往**模板库** > **视频**，选择任意一个 MiniMax H3 工作流
3. 按照弹出窗口的提示下载模型并运行工作流

模型文件托管在 Hugging Face 的 [Comfy-Org/MiniMax-H3](https://huggingface.co/Comfy-Org/MiniMax-H3) 仓库中。

## 工作流索引

模板库目前附带五个示例工作流。它们只是示例模板，并非完整列表：通过原生 MiniMax H3 节点，该模型支持更多生成模式，您可以使用这些节点构建更多工作流。

<CardGroup cols={2}>
  <Card title="文生视频（T2V）" icon="type" href="/zh/tutorials/video/minimax/minimax-h3-native#minimax-h3-文生视频（t2v）">
    根据文本提示词生成视频，并带有原生立体声音频
  </Card>

  <Card title="图生视频（I2V）" icon="image" href="/zh/tutorials/video/minimax/minimax-h3-native#minimax-h3-图生视频（i2v）">
    根据输入图像生成视频，并支持可选的首帧/尾帧控制
  </Card>

  <Card title="参考生视频（R2V）" icon="link" href="/zh/tutorials/video/minimax/minimax-h3-native#minimax-h3-参考转视频（r2v）">
    通过参考图像、视频和音频，锁定角色、风格、动作、相机运动或声音
  </Card>

  <Card title="多帧参考" icon="film" href="/zh/tutorials/video/minimax/minimax-h3-multiframe">
    使用链式连接的 Add Guide 节点，将参考帧锚定在输出时间线上的指定位置
  </Card>

  <Card title="Fun ControlNet Union" icon="person" href="/zh/tutorials/video/minimax/minimax-h3-fun-controlnet">
    使用 Canny、Depth、HED、MLSD 或 Pose 控制视频驱动 H3，或使用遮罩执行视频 inpainting
  </Card>
</CardGroup>

底层节点模式：首帧/尾帧图生视频（fl2va）通过 `MiniMaxH3ImageToVideo` 节点实现；参考驱动的生成（ref2va）通过 `MiniMaxH3ReferenceToVideo` 节点实现，可使用图像、视频和音频作为参考。

提示词编写资源(官方指南、通用技巧与提示词嵌入)请参见[提示词指南](/zh/tutorials/video/minimax/minimax-h3-prompt-guide)。

## 设置输出分辨率

每个工作流都使用一个 **Resolution Selector（分辨率选择器）** 节点来控制总体输出尺寸。该节点根据三个设置计算 `width` 和 `height`，其输出直接连接到 MiniMax H3 节点的 `width` 和 `height` 输入：

* **宽高比**：选择一个预设，例如 `16:9 (Widescreen)`、`9:16 (Portrait Widescreen)` 或 `1:1 (Square)`
* **百万像素**：输出的目标总像素数。数值越大画面越大，数值越小生成越快
* **取整倍数**：计算结果会取整到该数值的最近倍数。保持为 `32`，与 H3 的分辨率网格一致

模板默认使用一个较快的预览尺寸。要获得全质量输出，请在 16:9 下将分辨率选择器的百万像素设为 `0.98`，即 H3 的原生画布（短边 768px，16:9 下为 1344x768）；或在 MiniMax H3 节点的 `width` 和 `height` 中直接输入 `1344 x 768`（默认值）。请跳过 `1.0` 百万像素档：它得到 1376x768，超出模型 768x1344 像素的面积上限。

## 使用 Sage Attention 加速生成

示例工作流默认使用标准注意力实现。使用 [Sage Attention](https://github.com/woct0rdho/SageAttention) 可以将生成速度大约提升一倍，质量损失极小。Sage Attention 是可选依赖，需要你自行安装：

1. 安装 `sageattention` Python 包。从 [SageAttention releases](https://github.com/woct0rdho/SageAttention/releases) 页面下载与你 PyTorch 和 CUDA 版本匹配的 wheel 文件，然后用 `pip install <wheel-file>` 安装。
2. 安装 [KJNodes 自定义节点](https://github.com/kijai/ComfyUI-KJNodes)，它提供了 `Patch Sage Attention KJ` 节点。可以使用 ComfyUI Manager 安装，或将仓库克隆到 `ComfyUI/custom_nodes/` 后重启 ComfyUI。
3. 在工作流中添加 `Patch Sage Attention KJ` 节点，并将其连接在 `UNETLoader` 和 `BasicGuider` 节点之间：它的 `model` 输入接收来自 `UNETLoader` 的模型，`model` 输出连接到 `BasicGuider` 的 `model` 输入。将 `sage_attention` 设置为 `auto`。
4. 照常运行工作流。只需要给 guider 打补丁；scheduler 只负责生成 sigmas，可以保持不变。

注意：

* Sage Attention 要求 float16 或 bfloat16 张量。MiniMax H3 的部分层使用其他数据类型，因此你可能会在控制台看到 "Input tensors must be in dtype of torch.float16 or torch.bfloat16, using pytorch attention instead" 消息。这是正常现象；受影响的层会回退到标准注意力，生成仍然可以正常工作。
* 另一种方式是使用 `--use-sage-attention` 启动参数启动 ComfyUI 来全局启用 Sage Attention，无需添加节点。
