Poids ouverts

MiniMax H3

Un seul modèle pour toutes les modalités. Combinez texte, images, vidéo et audio dans un même contexte pour générer une vidéo 2K en son stéréo natif, jusqu'à 15 secondes.

  • 4,9/5 pour plus de 32 000 créateurs
  • Plus de 1,2 M de clips générés
  • Gratuit — aucun compte requis

Gratuit et anonyme. Protégé par Cloudflare Turnstile — sans compte, sans carte.

Réalisé avec MiniMax H3

Un seul contexte. Toutes les modalités. Un contrôle précis de bout en bout.

Référence vers vidéo

Texte, images, vidéo et audio dans un seul contexte

Transmettez jusqu'à 9 images, 3 clips vidéo et 3 pistes audio ensemble en une seule génération. Le modèle en tire l'identité, la performance, le mouvement de caméra, la composition, l'ambiance sonore et le rythme de montage, puis reporte le tout dans un résultat cohérent.

Retouche précise

Changez un élément, gardez tout le reste

Remplacez un produit, réécrivez une enseigne, changez une réplique, refaites l'éclairage d'une scène du jour à la nuit, ou ajoutez et supprimez des objets. Les retouches localisées se placent exactement là où vous le demandez, pendant que le reste du plan reste stable, pour continuer à affiner un plan que vous aimez déjà.

Texte et interfaces

Typographie, interfaces et graphismes qui tiennent la route

H3 restitue un texte lisible, des génériques, des sous-titres et des logos, et il anime de véritables éléments d'interface : pages produit, menus et HUD de jeu, affiches animées et typographie dynamique. Les prompts vont jusqu'à 7 000 caractères, de quoi tenir tout un plan de tournage en une seule requête.

Son natif

Un son composé pour l'image

Chaque génération renvoie un son stéréo natif : musique originale, dialogues, bruitages et ambiance sonore calés sur le montage. Fournissez à MiniMax H3 un enregistrement de référence, et il transférera ou clonera cette voix sur votre personnage tout en préservant l'intégrité de la performance.

Comment ça marche

Décrivez le plan en langage courant, ajoutez les références dont vous disposez déjà, et vérifiez l'image d'ouverture avant de valider le rendu complet. Examiner d'abord une image fixe est le moyen le plus économique de repérer un problème de cadrage ou de lumière, car le corriger ne coûte qu'une phrase de plus, et non un second clip.

  1. 1

    Décrivez le plan

    Saisissez jusqu'à 7 000 caractères pour décrire le sujet, la caméra, la lumière, l'ambiance sonore et le rythme de montage.

  2. 2

    Ajoutez des références

    Transmettez jusqu'à 9 images, 3 clips vidéo et 3 pistes audio pour fixer le style, l'identité et le mouvement exactement comme vous le souhaitez.

  3. 3

    Générez l'image d'ouverture

    Vérifiez l'image d'ouverture générée pour vous assurer que la composition et la lumière correspondent parfaitement à votre vision.

  4. 4

    Animez en 2K avec son stéréo

    Validez la génération et regardez la scène prendre vie en résolution 2K avec un son natif parfaitement synchronisé.

Exemples

Ce que les créateurs réalisent avec MiniMax H3

Films de marque, travail de personnages, animation stylisée, jeu vidéo et montage vidéo, tout cela avec le même modèle.

Première et dernière image

Film de marque aux jumelles vintage

Utilisez les Images 1 à 4 comme images clés séquentielles, vues à travers le viseur de jumelles vintage à la recherche de l'installation MINIMAX. Ouvrez sur un flou artistique avec un léger tremblement caméra à l'épaule, puis effectuez un zoom avant rapide avec un point de mise au net sur l'Image 1. Entre les images clés, utilisez des transitions rapides façon balayage de jumelles avec mouvement de fouet, flou de mouvement, effet de traînée optique et un bref scintillement d'exposition. Gardez le double cache circulaire des lentilles parfaitement fixe tout du long. Langage visuel : une esthétique voyeuriste en pellicule 35 mm inspirée de Wes Anderson, avec un grain fin, un halo doux sur les hautes lumières, une colorimétrie sobre et des accents typographiques rouges.
Référence vers vidéo

Film de personnage wuxia fantastique

Utilisez l'Image 2 comme référence de personnage verrouillée. Préservez les cheveux longs noirs mi-relevés, la couronne d'argent ajourée, le ruban indigo, le hanfu pâle superposé, la robe extérieure bleue translucide, l'écharpe bleu profond, l'agrafe florale en argent et les longs pompons. Utilisez l'Image 1 pour l'ordre du storyboard et le rythme. Rendu en 4K haute qualité, format 16:9, esthétique chinoise en 3D avec une valeur de production xianxia cinématographique : intense, solennelle et façonnée par le destin. Suivez le storyboard plan par plan, avec un mouvement de caméra naturel et des transitions fluides.
Référence vidéo

Transformation en voxels d'une image réelle

Préservez les bâtiments, les piétons et l'environnement général de la Vidéo 1 en prise de vue réelle photoréaliste. Transformez uniquement les arbres et les voitures en objets 3D façon pixel art ou blocs voxel dans le style de Minecraft, en utilisant l'Image 1 comme référence visuelle. Conservez un mouvement physiquement cohérent, et préservez les ombres et la lumière transmise de l'environnement réel. Utilisez la Vidéo 2 comme cible d'ensemble.
Texte vers vidéo

Rencontre néon dans une laverie

15 secondes, format paysage 16:9. Associez une prise de vue réelle d'une laverie automatique en pleine nuit à une animation lumineuse dessinée à la main. La petite laverie libre-service a des néons vacillant doucement, des machines à laver en marche, des paniers en plastique, un banc usé et une chaussette esseulée sur le sol. Gardez l'espace calme et légèrement nostalgique. Adoptez le rendu d'une caméra de téléphone tenue à une main avec un tremblement visible, des fluctuations d'exposition sous la lumière blanche des néons, des reflets de l'environnement dans le verre et une mise au point automatique retardée en gros plan. Évitez une composition trop léchée façon publicité ; cela doit ressembler à une rencontre nocturne authentique, filmée en suivant une étrange apparition.
Référence de mouvement

Recréation du mouvement d'un capybara

Reproduisez l'action de la Vidéo 1 depuis une caméra large fixe. Remplacez les trois hommes en costume par trois capybaras hautement photoréalistes. Préservez exactement la trajectoire de mouvement d'origine : tous les trois se laissent tomber rapidement au sol ; le capybara de gauche saute au centre ; celui du centre roule tout à gauche ; le nouveau capybara du centre roule tout à droite ; celui de droite saute au centre ; enfin, celui du centre saute sur les deux autres, formant une pyramide. Gardez la caméra fixe et intégrez la fourrure, la lumière et les ombres de façon réaliste dans la scène.
Montage vidéo

Composite conte de fées sur fond vert

Retirez le fond vert de la Vidéo 1 et remplacez-le par un décor de conte de fées similaire à la Vidéo 2. Les éléments d'arrière-plan doivent correspondre parfaitement aux actions des personnages de la Vidéo 1. Modifiez l'éclairage des personnages de la Vidéo 1 pour qu'il corresponde parfaitement au nouvel arrière-plan.

Les chiffres derrière chaque génération

Le rendu est en 2K par défaut, ce qui place 1440 pixels sur le côté court pour les formats compris entre 16:9 et 9:16, et atteint environ 3,7 mégapixels pour les formats les plus larges — 2976x1248 en 21:9. Les clips durent de 5 à 15 secondes à 24 images par seconde, et chacun d'eux revient avec un mixage stéréo synchronisé, plutôt qu'une image muette qu'il faudrait sonoriser après coup.

Résolution (2976x1248)
2KRésolution (2976x1248)
Durée à 24 FPS
5–15sDurée à 24 FPS
Son stéréo
NatifSon stéréo
Références max.
12Références max.
Formats d'image
7Formats d'image
Réf. images
9Réf. images
Caractères de prompt
7 000Caractères de prompt
Poids ouverts
OuiPoids ouverts

MiniMax H3 face à la concurrence

MiniMax H3 comparé à Sora 2, Veo 3.1, Kling 3 et Hailuo 02 sur la résolution, la durée, l'audio natif, le budget de références et l'ouverture des poids.
CritèreMiniMax H3Sora 2Veo 3.1Kling 3Hailuo 02
Résolution2K (2976x1248)1080p1080p1080p720p
Durée5–15 sJusqu'à 60 s5 s5–10 s5 s
Audio natifOui (stéréo)NonNonNonNon
Budget de références12 fichiers (9 img, 3 vid, 3 aud)1 image1 image1 image1 image
Poids ouvertsOuiNonNonNonNon

L'écart qui compte n'est pas la résolution brute — plusieurs de ces modèles atteignent un nombre de pixels comparable. C'est que les modèles concurrents traitent le texte-vers-vidéo, l'image-vers-vidéo, la référence de mouvement et l'audio comme des points d'accès distincts, si bien qu'un plan qui a besoin des trois nécessite trois allers-retours et un compositing pour réconcilier les résultats. Transmettre un contexte unifié unique, et récupérer un mixage stéréo déjà composé avec l'image, c'est précisément ce qui supprime cette étape.

La confiance des meilleurs créateurs

MiniMax H3 a complètement transformé notre pipeline de post-production. Disposer d'un seul contexte qui comprend à la fois les références vidéo et l'audio nous fait gagner des jours de compositing manuel.
Sarah JenkinsSuperviseure VFX, Studio North
La génération audio stéréo native est indiscernable de la magie. Elle ne se contente pas de produire du son, elle comprend l'espace physique du plan que nous décrivons.
David ChenConcepteur sonore, Waveform
Enfin, un modèle qui rend la typographie proprement. Nous utilisons la fonction d'animation UI/UX pour prototyper des parcours d'application entiers directement à partir de nos maquettes Figma.
Elena RostovaDirectrice de création, Form and Function

Questions fréquentes sur MiniMax H3

MiniMax H3 est un modèle vidéo multimodal généraliste à poids ouverts. Plutôt qu'un modèle distinct pour chaque tâche, MiniMax H3 lit le texte, l'image, la vidéo et l'audio dans un seul contexte unifié et génère des résultats audiovisuels cohérents à partir de n'importe quelle combinaison de ces éléments. Il prend en charge le texte-vers-vidéo, la première et dernière image, la référence-vers-vidéo et l'édition vidéo de précision.

Prêt à générer de la vidéo en 2K ?

Découvrez dès aujourd'hui le contexte unifié, l'audio natif et la liberté des poids ouverts de MiniMax H3.

Essayer gratuitement