> ## Documentation Index
> Fetch the complete documentation index at: https://dripart-docs-verified-partner-providers.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# ComfyUI MiniMax H3 動画生成ガイド

> ComfyUI でオープンウェイトの MiniMax H3 を使う方法: テキストから動画、画像から動画、参照から動画のワークフローとネイティブステレオオーディオ、プロンプト作成のコツ、Sage Attention による高速化。

[MiniMax H3](https://www.minimax.io/blog/minimax-h3) は、MiniMaxの汎用オムニモーダル生成モデルで、現在はオープンウェイトとして公開されています。テキスト、画像、ビデオ、オーディオを単一のコンテキストで統合的に理解し、**ネイティブステレオオーディオ**付きのビデオを生成します。つまり、音声、サウンドエフェクト、音楽は、後から重ね合わせるのではなく、単一のフォワードパスでまとめてモデル化されます。出力は最大2K解像度、24fps、約15秒です。

ComfyUIは MiniMax H3をネイティブにサポートしています。ドキュメントは5つのページに分かれています：

* **概要**（このページ）: モデルの機能、ワークフローの一覧、出力解像度、高速化
* **[ネイティブワークフロー](/ja/tutorials/video/minimax/minimax-h3-native)**: テキストから動画へ、画像から動画へ、参照から動画、および高度なネイティブノードテクニック
* **[マルチフレーム参照](/ja/tutorials/video/minimax/minimax-h3-multiframe)**: 出力タイムライン上の特定のポイントに参照フレームを固定
* **[Fun ControlNet Union](/ja/tutorials/video/minimax/minimax-h3-fun-controlnet)**: コントロールビデオで H3 を駆動する、またはマスクによるビデオインペイント
* **[プロンプトガイド](/ja/tutorials/video/minimax/minimax-h3-prompt-guide)**: MiniMax の公式プロンプト作成ガイド、一般的なヒント、プロンプト埋め込み

<UpdateReminder />

<Note>
  H3 のオープンウェイトを使用すると、モデルをローカルで実行できます。ローカルで生成した出力の商用利用には、[MiniMax 商用ライセンス](https://comfy.org/minimax/license) が必要です。これは唯一の公式リセラーである Comfy から入手できます。Comfy Cloud での生成には商用利用権がすでに含まれています。
</Note>

## 主な機能

* **ネイティブステレオオーディオ**: 会話、効果音、音楽がビデオと一緒に生成され、1つのMP4に同期されます
* **マルチモーダルコンテキスト**: テキスト、画像、ビデオ、オーディオリファレンスを1回の生成で組み合わせることができます
* **リファレンス駆動の生成**: リファレンス素材からキャラクターのアイデンティティ、スタイル、モーション、カメラの動き、または音声を固定できます
* **指示への追従**: リファレンスと目的のショットの関係を自然言語で記述します
* **正確なテキストレンダリング**: スペルアウトされたテキストとブランド要素がきれいにレンダリングされます
* **オープンウェイト**: ComfyUIでローカルに実行でき、すべてのパラメータを完全に制御できます

## はじめに

MiniMax H3はオープンウェイトで、ComfyUIでサポートされています。はじめるには：

1. ComfyUI を 0.30.0 以降に更新します
2. **テンプレートライブラリ** > **ビデオ** の順に移動し、任意のMiniMax H3ワークフローを選択します
3. ポップアップに従ってモデルをダウンロードし、ワークフローを実行します

モデルファイルは Hugging Face の [Comfy-Org/MiniMax-H3](https://huggingface.co/Comfy-Org/MiniMax-H3) リポジトリでホストされています。

## ワークフローインデックス

テンプレートライブラリには現在、5つのサンプルワークフローが同梱されています。これらはサンプルテンプレートであり、網羅的なリストではありません。モデルはネイティブのMiniMax H3ノードを通じて、さらに多くの生成モードをサポートしているため、追加のワークフローを構築できます。

<CardGroup cols={2}>
  <Card title="テキストから動画へ（T2V）" icon="type" href="/ja/tutorials/video/minimax/minimax-h3-native#minimax-h3-テキストからビデオ-t2v">
    テキストプロンプトから、ネイティブのステレオオーディオ付きビデオを生成します。
  </Card>

  <Card title="画像から動画へ（I2V）" icon="image" href="/ja/tutorials/video/minimax/minimax-h3-native#minimax-h3-画像からビデオ（i2v）">
    入力画像からビデオを生成します。先頭・末尾フレームの制御もオプションで指定できます。
  </Card>

  <Card title="参照から動画へ（R2V）" icon="link" href="/ja/tutorials/video/minimax/minimax-h3-native#minimax-h3-リファレンスからビデオ-r2v">
    参照画像、ビデオ、オーディオから、キャラクター、スタイル、モーション、カメラワーク、または音声を固定します。
  </Card>

  <Card title="マルチフレーム参照" icon="film" href="/ja/tutorials/video/minimax/minimax-h3-multiframe">
    Add Guideノードを連結して、出力タイムライン上の特定のポイントに参照フレームを固定します。
  </Card>

  <Card title="Fun ControlNet Union" icon="person" href="/ja/tutorials/video/minimax/minimax-h3-fun-controlnet">
    Canny、Depth、HED、MLSD、またはPoseのコントロールビデオでH3を駆動するか、マスクを使用してビデオインペインティングを実行できます。
  </Card>
</CardGroup>

基盤となるノードモードは、`MiniMaxH3ImageToVideo`ノードによる先頭・末尾フレームを使用した画像から動画への生成（fl2va）と、`MiniMaxH3ReferenceToVideo`ノードによる画像・ビデオ・オーディオを使用した参照駆動生成（ref2va）です。

プロンプト作成リソース(公式ガイド、一般的なヒント、プロンプト埋め込み)については、[プロンプトガイド](/ja/tutorials/video/minimax/minimax-h3-prompt-guide)を参照してください。

## 出力解像度の設定

各ワークフローでは、**Resolution Selector（解像度セレクタ）** ノードを使って全体の出力サイズを制御します。このノードは3つの設定から `width` と `height` を計算し、その出力は MiniMax H3 ノードの `width` と `height` 入力に直接接続されます：

* **アスペクト比**：`16:9 (Widescreen)`、`9:16 (Portrait Widescreen)`、`1:1 (Square)` などのプリセットを選択します
* **メガピクセル**：出力の目標総ピクセル数。値が大きいほど大きなフレームになり、小さいほど高速に生成されます
* **倍数**：計算された解像度はこの数値の最も近い倍数に丸められます。H3 の解像度グリッドに合わせて `32` のままにします

テンプレートは高速なプレビューサイズになっています。フル品質で出力するには、16:9 で Resolution Selector のメガピクセルを `0.98` に設定します。これは H3 のネイティブキャンバス（短辺 768px、16:9 では 1344x768）です。あるいは、MiniMax H3 ノードの `width` と `height` に直接 `1344 x 768` を入力します（デフォルト値）。`1.0` メガピクセルは 1376x768 になり、モデルの 768x1344 ピクセルの面積上限を超えるため、使用しないでください。

## Sage Attention で生成を高速化

サンプルワークフローはデフォルトで標準のアテンション実装を使用します。[Sage Attention](https://github.com/woct0rdho/SageAttention) を使用すると、品質の低下を最小限に抑えながら生成速度をおよそ2倍にできます。Sage Attention はオプションの依存関係のため、自分でインストールする必要があります：

1. `sageattention` Python パッケージをインストールします。[SageAttention releases](https://github.com/woct0rdho/SageAttention/releases) ページから自分の PyTorch と CUDA のバージョンに合った wheel ファイルをダウンロードし、`pip install <wheel-file>` でインストールします。
2. [KJNodes カスタムノード](https://github.com/kijai/ComfyUI-KJNodes) をインストールします。これにより `Patch Sage Attention KJ` ノードが提供されます。ComfyUI Manager を使用するか、リポジトリを `ComfyUI/custom_nodes/` にクローンして ComfyUI を再起動してください。
3. ワークフローに `Patch Sage Attention KJ` ノードを追加し、`UNETLoader` と `BasicGuider` ノードの間に接続します：`model` 入力は `UNETLoader` からモデルを受け取り、`model` 出力は `BasicGuider` の `model` 入力に接続します。`sage_attention` は `auto` に設定します。
4. 通常どおりワークフローを実行します。パッチを適用する必要があるのは guider だけです。scheduler は sigmas を生成するだけで、そのままにしておけます。

注意：

* Sage Attention は float16 または bfloat16 テンソルを必要とします。MiniMax H3 の一部のレイヤーは他の dtype で実行されるため、コンソールに "Input tensors must be in dtype of torch.float16 or torch.bfloat16, using pytorch attention instead" というメッセージが表示されることがあります。これは正常です。影響を受けるレイヤーは標準アテンションにフォールバックし、生成は正常に動作します。
* 別の方法として、ノードを追加せずに `--use-sage-attention` フラグ付きで ComfyUI を起動して、Sage Attention をグローバルに有効にすることもできます。
