MiniMax H3とは?
MiniMax H3は、映像・セリフ・音を1回の処理でまとめて生成する新しいオープンウェイトの動画モデルです。このページでは、MiniMax H3が何をするのか、各モードの仕組み、そして仕様が実際に何を意味するのかを解説します。
1つのモデル、1つの文脈
多くのAI動画ツールは、実際には別々のモデルをつなぎ合わせた連鎖です。あるシステムが脚本を書き、別のシステムがテキストを画像に変え、3つ目がその画像をアニメーション化し、4つ目がサウンドトラックを生成し、5つ目が声を口の動きに同期させます。受け渡しのたびに情報が失われ、各段階には独自の癖、独自の失敗パターン、独自のプロンプト構文があります。MiniMax H3モデルはこれとは異なるアプローチを取ります。テキスト、画像、動画リファレンス、音声はすべて1つの統合された文脈の中に置かれ、タスクごとのエンドポイントに振り分けられるのではなく、単一のモデルによって処理されます。MiniMax H3とは何かを突き詰めて問われたとき、正直な答えはこうです。監督がそうするように、被写体、カメラワーク、照明、サウンドトラックを同時に頭の中に保ちながらカットについて考える、オムニモーダルなシステムであり、それぞれを個別に解決するのではありません。この統合された文脈こそが、MiniMax H3のクリップが寄せ集めではなく、まとまった一つの作品として感じられる理由です。セリフはカットのタイミングに乗り、スコアは照明のムードに合い、キャラクターの声はリファレンスと新しい演技の間で一貫性を保ちます。何一つ、別々のサイロで生成されたものはないからです。
カットを始める4つの方法
MiniMax H3は4つのモードに対応しており、それぞれがカットの始まり方についての異なる問いに答えます。テキストから動画は、書かれたプロンプトだけから始まり、説明文だけからフレーミング・モーション・音をモデルに考案させます。最初と最後のフレームモードは、カットが始まる場所と終わる場所という2枚のスチルを受け取り、それらをつなぐモーション、照明の変化、音声を生成します。これはアクションの始まりと終わりがすでに存在していて、中間だけを構築すればよい場合に便利です。参照から動画は、モデルのオムニモーダルな文脈を直接活用します。被写体やスタイル用の画像、モーションパターン用のクリップ、声やスコア用の音声を渡すと、それらのリファレンスを新しくより長いカットへと拡張します。自然言語編集は、既存のクリップを完成品ではなく下書きとして扱い、平易な言葉での指示だけで、棚の上の商品を差し替えたり、看板の文字を書き換えたり、シーンを昼から夜へライティングし直したり、オブジェクトを追加・削除したりできます。変更は説明した部分だけに反映され、それ以外のカットは安定したまま保たれます。
解像度、長さ、フレームレート
MiniMax H3のすべての生成は、デフォルトで2Kでレンダリングされます。これは実際には、16:9〜9:16の対応するすべての比率で短辺が1440ピクセルになることを意味し、最も横長の21:9では、およそ370万画素、つまり2976x1248に達します。これは、高速な動画生成ツールにありがちなソフトでアップスケールされたような見た目にならず、大画面でも通用するだけの精細さです。クリップは5〜15秒で、荒かったり不自然に滑らかにされたりしたフレームレートではなく、映画的な24フレーム毎秒でレンダリングされます。21:9、16:9、4:3、1:1、3:4、9:16の7種類のアスペクト比に加え、プロンプトやリファレンスから示唆される構図に合わせて比率を自動的に選ぶアダプティブモードもあり、カットが横長と縦長のどちらで見栄えがするか事前にわからない場合に便利です。これらの数字が合わさって表しているのは、長尺の映像で長さそのものが1フレームごとの精細さより重視されるようなケースではなく、ソーシャルプラットフォーム、商品ショット、ショートフォームのストーリーテリングに適した、短く高解像度でテンポの良いクリップを軸に構築されたモデルだということです。
サウンドは後付けではない
MiniMax H3のすべての生成には、別途サウンドパスを待つ無音のクリップではなく、ネイティブなステレオ音声が付いてきます。モデルはオリジナルのスコア、セリフ、フォーリー、ルームトーンを映像と一緒に生成し、後から重ねるのではなくカットに合わせてタイミングを取ります。ドアが閉まる音は、実際にドアが閉まって見える瞬間に鳴り、音楽の高まりは、それが支えているビジュアルのビートと同時に訪れます。これが重要なのは、ほとんどのワークフローでサウンドデザインはピクチャーロック後に行われ、そのギャップからタイミングのずれが生まれるからです。MiniMax H3は音声転写にも対応しています。参照録音を与えると、そのトーン、間合い、キャラクター性を含む声を、生成されたシーンの中の演技に乗せることができ、汎用的な合成ナレーターに頼ることはありません。これにより、同じキャラクターの複数の生成にわたって一貫した声を保ったり、1本の録音済みセリフだけで新しいシーン全体を駆動したりすることが可能になります。結果として得られるのは、後から吹き替えられたのではなく、単一の生成の中で最初からデザインされたように聞こえるクリップです。
リファレンス予算の使い方
MiniMax H3は、1回の生成につき最大12個の参照ファイルを受け付けます。被写体やスタイル用に最大9枚の画像、モーション用に合計15秒までの動画クリップ最大3本、声やスコア用に合計15秒までの音声トラック最大3つで、これらすべてが上述の同じ統合された文脈の中に収まります。画像は最も柔軟に使えるスロットです。キャラクターの顔、商品の正確な形状、ロケーションの色調に使い、複数を組み合わせることで被写体とスタイルを同時に固定できます。動画リファレンスは、特定のカメラワーク、歩行のサイクル、身振りなど、言葉で簡単には説明しきれないモーションに使うのが最適です。モデルはそれらを見た目ではなく動きとして読み取るためです。音声リファレンスは、声や音楽的なアイデンティティを新しいカットへと引き継ぎます。この予算は抑制を報います。顔用に1つ、カメラワーク用に1つ、声用に1つといった、それぞれ明確な役割を持つ厳選されたリファレンスの方が、12枠すべてを冗長な素材で埋めてモデルに矛盾した信号を調停させるよりも良い結果を生みます。
オープンウェイトが実際に変えること
MiniMax H3はオープンウェイトとして発表されました。つまり、前面のAPIだけでなくモデル自体が、誰でも検証し、実行し、その上に構築できる形で公開されているということです。これは、動作が予告なく変わりうる有料エンドポイント経由でしかアクセスできない閉じたモデルとは、明確に異なる立ち位置です。MiniMax H3のオープンウェイトとは、研究者がオムニモーダルな文脈が実際にどう組み立てられているかを正確に研究でき、開発者が特定ベンダーの稼働状況に依存する代わりに自分のインフラ上でモデルをホストでき、より広いコミュニティが元のリリースが想定していなかった専門的なユースケース向けにファインチューニングできることを意味します。また、改善のペースが一社のロードマップだけに縛られないことも意味します。誰でも修正、アダプター、最適化を提供できるからです。これほど高性能なモデルにとって、オープンウェイトであることは、単一の製品発表を、1つの会社が将来を独占する閉ざされた庭ではなく、ツール・チュートリアル・派生モデルの一大エコシステムがその周りで育つ共有インフラへと変える決め手となる点です。
MiniMax H3が動けるプロンプトを書く
MiniMax H3は最大7,000文字のプロンプトを受け付けます。これは、単なるキャプションを打ち込むのではなく、小さなクルーに指示を出すようにカットを演出するのに十分な余地です。まずは被写体から始めましょう。誰が、あるいは何がフレームの中にいて、何をしているのか。次にカメラを加えます。ゆっくりとしたプッシュインなのか、静止した引きの画なのか、ハンドヘルドで追う動きなのか。動きに名前を付けることで、モデルは推測に頼るのではなく、具体的に実行すべきものを手にします。照明と時間帯を説明しましょう。この詳細はビジュアルのムードを左右するだけでなく、間接的にモデルがカットのペースをどう取るかにも影響します。音声は映像と一緒に生成されるため、静かなルームトーン、特定のセリフの一行、特定のビートでのスコアの高まりなど、サウンドスケープについても説明し、テキストの中で音を後回しにしないようにしましょう。最後に、編集のリズムの感覚を伝えます。カットは安定を保つのか、それともカットへと盛り上がっていくのか。被写体、カメラ、照明、サウンドスケープ、リズムという5つすべてをカバーするプロンプトは、MiniMax H3にモデル自身が埋めなければならない断片ではなく、完全なブリーフを与えることになります。
仕様
MiniMax H3の概要
| 項目 | MiniMax H3 |
|---|---|
| 解像度 | 2K(21:9で2976x1248) |
| 長さ | 24 FPSで5〜15秒 |
| 音声 | すべての生成にネイティブステレオ |
| アスペクト比 | 7種類の比率+アダプティブ |
| リファレンス | 画像9・クリップ3・音声3(最大12) |
| プロンプトの長さ | 最大7,000文字 |
| モード | テキスト、最初/最後のフレーム、参照、編集 |
| ウェイト | オープン |
試してみる
ここでMiniMax H3を試す
この最初のステップでは、カットの冒頭フレームがスチル画像としてレンダリングされるので、音声付きの2Kクリップ本編に進む前にフレーミングと照明を確認できます。本生成の前に構図をプレビューできる、手軽で無料の方法です。
無料・匿名でご利用いただけます。Cloudflare Turnstileで保護されており、アカウントもカード情報も不要です。
よくある質問
MiniMax H3に関する質問への回答
MiniMax H3は、2026年7月31日にリリースされたオープンウェイトのオムニモーダルAI動画モデルです。テキスト・画像・動画・音声のリクエストを別々のタスク専用システムに振り分ける代わりに、MiniMax H3はそのすべてを1つの統合された文脈の中で処理し、単一のリクエストから映像・モーション・セリフ・スコアを含む完全なカットを生成します。24 FPSで5〜15秒の2Kクリップを7種類のアスペクト比で出力し、ネイティブなステレオ音声と音声転写がすべての生成に組み込まれており、後から別ステップとして追加されるものではありません。
オープンウェイトとは、ホスト型のAPIだけでなく、MiniMax H3の基盤モデル自体がダウンロード・検証・実行のために公開されていることを意味します。これにより、開発者は1社のサーバーに依存する代わりにモデルを自前でホストでき、研究者はオムニモーダルな文脈が実際にどう機能するかを研究でき、コミュニティは元のリリースがカバーしていなかったユースケース向けにファインチューニングや拡張ができます。これは、借りることしかできない閉じた製品と、エコシステム全体がその上に構築できる共有インフラとの違いです。
MiniMax H3の1回の生成は、24 FPSで5〜15秒、2Kでレンダリングされ、短辺は1440ピクセル、最も横長の21:9比率では最大2976x1248に達します。すべてのクリップにはデフォルトでネイティブなステレオ音声が含まれます。オリジナルのスコア、セリフ、フォーリー、ルームトーンが映像と一緒に生成され、後から別パスで追加されるのではなくカットに合わせてタイミングが取られます。音声転写により、参照録音の声を新しいシーンのキャラクターに乗せることもできます。
MiniMax H3は1回の生成につき最大12個の参照ファイルを受け付けます。被写体やビジュアルスタイル用に最大9枚の画像、モーションパターン用に合計15秒までの動画クリップ最大3本、声やスコア用に合計15秒までの音声トラック最大3つです。これらすべてがモデルが推論する同じオムニモーダルな文脈の中に置かれるため、1枚の画像からの顔、1本のクリップからのカメラワーク、1つのトラックからの声を組み合わせて、単一の新しいカットにすることができます。
探る
MiniMax H3が何を生成できるか見てみましょう
MiniMax H3の生成例は、このモデルが実際に何を作り出すのかを理解する最も早い方法です。実際のクリップと、それを作った実際のMiniMax H3プロンプトがそのまま再利用できる形で並んでいます。ギャラリーを見て4つのモード、ネイティブ音声、リファレンスワークフローの実際の動きを確認し、その後上のツールで自分のカットを試してみてください。