オープンウェイト

MiniMax H3

あらゆるモダリティを1つのモデルで。テキスト・画像・動画・音声を1つの文脈にまとめて渡すだけで、ネイティブなステレオ音声付きの2K動画を最大15秒まで生成します。

  • クリエイター32,000人以上から評価4.9/5
  • 120万本以上のクリップを生成
  • 無料 — アカウント登録不要

無料・匿名でご利用いただけます。Cloudflare Turnstileで保護されており、アカウントもカード情報も不要です。

MiniMax H3で制作

1つの文脈に、あらゆるモダリティを。精密なコントロールはそのままに。

参照から動画へ

1つの文脈にテキスト・画像・動画・音声を

最大9枚の画像、3本の動画クリップ、3つの音声トラックを1回の生成にまとめて渡せます。与えられた素材から、被写体、演技、カメラワーク、構図、サウンドスケープ、編集のリズムを読み取り、そのすべてを1つのまとまった結果に反映します。

精密な編集

1点だけ変えて、あとはそのまま

商品を差し替える、看板の文字を書き換える、セリフを一行差し替える、シーンを昼から夜へライティングし直す、あるいはオブジェクトを追加・削除する。局所的な編集は指定した箇所だけに反映され、それ以外のカットは安定したまま保たれるので、すでに気に入っている映像に手を加え続けられます。

テキストとインターフェース

崩れないタイポグラフィ、UI、グラフィック

H3は読みやすい文字、クレジット、字幕、ブランドロゴをレンダリングでき、実際のインターフェース素材——プロダクトのランディングページ、ゲームのメニューやHUD、モーションポスター、ダイナミックなタイポグラフィ——もアニメーション化します。プロンプトは最大7,000文字まで受け付けるので、ショットリスト全体を1回のリクエストにまとめられます。

ネイティブ音声

映像に合わせて作曲されたサウンド

すべての生成にネイティブなステレオ音声が付いてきます。オリジナルスコア、セリフ、フォーリー、ルームトーンがカットのタイミングに合わせて生成されます。参照音声を渡せば、演技を保ったままMiniMax H3がその声をキャラクターに転写・クローンします。

使い方

カットの内容を平易な言葉で説明し、手元にある参照素材を何でも添付して、本編をレンダリングする前に冒頭フレームを確認しましょう。まずスチルを確認するのが、フレーミングや照明の問題を見つける最も安上がりな方法です。修正に必要なのはもう一文だけで、もう1本クリップを作り直す必要はありません。

  1. 1

    カットを説明する

    被写体、カメラ、照明、サウンドスケープ、編集のリズムを説明する文章を最大7,000文字まで入力します。

  2. 2

    参照素材を追加する

    最大9枚の画像、3本の動画クリップ、3つの音声トラックを渡して、スタイル・アイデンティティ・モーションを思い通りに設定します。

  3. 3

    冒頭フレームを生成する

    生成された冒頭フレームを確認し、構図と照明がイメージ通りかどうかチェックします。

  4. 4

    ステレオ音声付き2Kにアニメーション化

    生成内容を確定し、同期したネイティブ音声とともにシーンが2K解像度で動き出す様子を確認します。

生成例

クリエイターがMiniMax H3で作っているもの

ブランドフィルム、キャラクター表現、スタイライズされたアニメーション、ゲームプレイ、動画編集まで、すべて同じモデルから。

最初と最後のフレーム

ヴィンテージ双眼鏡ブランドフィルム

画像1〜4を連続するキーフレームとして使用し、MINIMAXの設置物を探すヴィンテージ双眼鏡のファインダー越しに見た映像にしてください。かすかな手ブレのあるピンボケから始まり、素早くズームインして画像1にピントを合わせます。キーフレームの間は、高速な双眼鏡スキャン風のトランジションを使い、勢いのある動き、モーションブラー、光学的なにじみ、一瞬の露出フリッカーを加えてください。二重の円形レンズマスクは常に完全に固定してください。ビジュアルの方向性は、細かい粒子感、柔らかいハイライトのハレーション、抑えた色彩、赤いタイポグラフィのアクセントを持つ、覗き見的でウェス・アンダーソン風の35mmフィルム調にしてください。
参照から動画へ

ファンタジー武侠キャラクターフィルム

画像2を固定されたキャラクターリファレンスとして使用してください。ハーフアップの黒い長髪、透かし彫りの銀の冠、藍色のリボン、重ね着した淡色の漢服、透け感のある青の外衣、濃紺の帯、銀の花飾りの留め具、長い房飾りを維持してください。画像1はストーリーボードの順序とペース配分に使用してください。高品質な4K、16:9の中国風3Dで、映画のような仙侠作品としてのクオリティ——張り詰め、荘厳で、運命に導かれるような雰囲気——でレンダリングしてください。自然なカメラワークとシームレスなトランジションで、ストーリーボードをビートごとに忠実に再現してください。
動画参照

実写からボクセルへの変換

動画1の中の建物、歩行者、全体の環境はフォトリアルな実写のまま維持してください。木と車だけを、画像1をビジュアルリファレンスとして、Minecraft風の3Dピクセルアート/ボクセルブロックのオブジェクトに変換してください。それらの動きは物理的に正しいまま維持し、実際の環境の影と透過光は保持してください。動画2は全体のターゲットとして使用してください。
テキストから動画へ

ネオン輝くコインランドリーでの遭遇

15秒、16:9の横長。深夜のコインランドリーの実写と、手描きの発光アニメーションを組み合わせてください。小さなセルフサービスのコインランドリーには、かすかにちらつく蛍光灯、稼働中の洗濯機、プラスチックのカゴ、使い古されたベンチ、そして床に落ちた片方の靴下があります。静かで、どこか懐かしい空気感を保ってください。片手持ちのスマホカメラのような質感で、目に見える手ブレ、白い蛍光灯下での露出の揺らぎ、ガラスへの環境の映り込み、近距離での遅延するオートフォーカスを表現してください。洗練された商業的な構図は避け、奇妙な現象を追いながら撮影した、深夜の本物の遭遇のような雰囲気にしてください。
モーション参照

カピバラによる動きの再現

動画1の動きを、固定された広角カメラから再現してください。スーツを着た3人の男性を、極めてフォトリアルな3匹のカピバラに置き換えてください。元の動きの軌跡は正確に維持してください。3匹全員が素早く床に伏せ、左のカピバラが中央にジャンプし、中央のカピバラが一番左に転がり、新しく中央にいるカピバラが一番右に転がり、右のカピバラが中央にジャンプし、最後に中央のカピバラが他の2匹の上に乗ってピラミッドを形成します。カメラは固定したまま、毛並み・照明・影をシーンにリアルに馴染ませてください。
動画編集

グリーンスクリーンのおとぎ話合成

動画1のグリーンスクリーン背景を削除し、動画2に似たおとぎ話のような背景に置き換えてください。背景の要素は、動画1のキャラクターの動きに完全に一致させる必要があります。動画1のキャラクターの照明を、背景と完全に一致するように調整してください。

すべての生成を支える数字

出力はデフォルトで2K。16:9〜9:16の比率では短辺が1440ピクセルになり、より横長のフォーマットではおよそ370万画素、21:9では2976x1248に達します。クリップは24フレーム毎秒で5〜15秒。しかも後から音を付ける必要のある無音映像ではなく、すべてのクリップが同期済みのステレオミックス付きで返ってきます。

解像度(2976x1248)
2K解像度(2976x1248)
24 FPSでの長さ
5–15s24 FPSでの長さ
ステレオ音声
ネイティブステレオ音声
最大参照ファイル数
12最大参照ファイル数
アスペクト比
7アスペクト比
画像参照
9画像参照
プロンプト文字数
7,000プロンプト文字数
オープンウェイト
Yesオープンウェイト

MiniMax H3はどう違うのか

解像度、長さ、ネイティブ音声、参照予算、オープンウェイトの観点で、MiniMax H3をSora 2、Veo 3.1、Kling 3、Hailuo 02と比較します。
項目MiniMax H3Sora 2Veo 3.1Kling 3Hailuo 02
解像度2K(2976x1248)1080p1080p1080p720p
長さ5–15s最大60秒5秒5–10秒5秒
ネイティブ音声あり(ステレオ)なしなしなしなし
参照予算12ファイル(画像9・動画3・音声3)画像1枚画像1枚画像1枚画像1枚
オープンウェイトありなしなしなしなし

重要なのは単純な解像度の差ではありません——これらのモデルの一部は同程度のピクセル数に達しています。本質的な違いは、競合がテキストから動画、画像から動画、モーション参照、音声をそれぞれ別のエンドポイントとして扱っている点です。そのため、この3つが必要なカットを作るには3回のやり取りと、結果を統合するための合成作業が必要になります。単一の統合された文脈を渡すだけで、映像とともにスコア済みのステレオミックスが返ってくることが、その手間を取り除きます。

第一線のクリエイターに支持されています

MiniMax H3は私たちのポスト制作パイプラインを完全に変えました。動画リファレンスと音声を同時に理解する1つの文脈があることで、手作業での合成作業が何日分も省けます。
サラ・ジェンキンスVFXスーパーバイザー、Studio North
ネイティブなステレオ音声の生成は、まるで魔法としか思えません。単に音を作るだけでなく、プロンプトで指定したカットの物理的な空間そのものを理解しているんです。
デビッド・チェンサウンドデザイナー、Waveform
ようやく、タイポグラフィをきれいにレンダリングできるモデルが登場しました。私たちはUI/UXモーション機能を使って、Figmaのフレームからそのままアプリ全体のフローをプロトタイピングしています。
エレナ・ロストヴァクリエイティブディレクター、Form and Function

MiniMax H3についてよくある質問

MiniMax H3は、オープンウェイトの汎用マルチモーダル動画モデルです。タスクごとに別々のモデルを使う代わりに、MiniMax H3はテキスト・画像・動画・音声を1つの統合された文脈で読み取り、それらのどんな組み合わせからでも一貫した音声付き映像を生成します。テキストから動画、最初と最後のフレーム、参照から動画、そして精密な動画編集に対応しています。

2K動画を生成する準備はできましたか?

MiniMax H3が実現する統合された文脈、ネイティブ音声、そしてオープンウェイトならではの自由を、今日体験してください。

無料で試す