Qu'est-ce que MiniMax H3 ?
MiniMax H3 est un nouveau modèle vidéo en poids ouverts qui génère l'image, les dialogues et le son en une seule passe. Cette page explique ce que fait MiniMax H3, comment fonctionnent ses modes, et ce que ses caractéristiques techniques signifient concrètement.
Un seul modèle, un seul contexte
La plupart des outils vidéo IA sont en réalité une chaîne de modèles distincts assemblés tant bien que mal : un système rédige un script, un autre transforme le texte en image, un troisième anime cette image, un quatrième génère une bande sonore, et un cinquième synchronise la voix sur les lèvres. Chaque transfert fait perdre de l'information, et chaque étape a ses propres particularités, ses propres modes d'échec, sa propre syntaxe de prompt. Le modèle MiniMax H3 adopte une approche différente. Texte, images, références vidéo et audio cohabitent tous dans un seul contexte unifié, traité par un modèle unique plutôt que réparti entre des points d'accès spécialisés par tâche. Si l'on se demande ce qu'est vraiment MiniMax H3 dans son principe, voici la réponse honnête : c'est un système omnimodal qui raisonne sur un plan comme le ferait un réalisateur, en gardant à l'esprit simultanément le sujet, le mouvement de caméra, la lumière et la bande sonore, au lieu de résoudre chaque élément isolément. Ce contexte unifié est la raison pour laquelle un clip MiniMax H3 paraît cohérent plutôt qu'assemblé : le dialogue tombe juste sur le montage, la musique correspond à l'ambiance de la lumière, et la voix d'un personnage reste identique entre une référence et une nouvelle performance, car rien n'a été généré dans un silo séparé.
Quatre façons de démarrer un plan
MiniMax H3 propose quatre modes, chacun répondant à une question différente sur la manière dont un plan commence. Le mode texte vers vidéo part uniquement d'un prompt écrit, laissant le modèle inventer le cadrage, le mouvement et le son à partir de la seule description. Le mode première et dernière image prend deux images fixes, celle où le plan s'ouvre et celle où il se termine, et génère le mouvement, le changement de lumière et l'audio qui les relient, ce qui est utile lorsque le début et la fin d'une action existent déjà et qu'il ne reste qu'à construire le milieu. Le mode référence vers vidéo s'appuie directement sur le contexte omnimodal du modèle : fournissez-lui des images pour un sujet ou un style, des extraits pour un schéma de mouvement, ou de l'audio pour une voix ou une musique, et il prolonge ces références en un plan nouveau et plus long. Le montage en langage naturel traite un clip existant comme un brouillon plutôt qu'un montage final, permettant de remplacer un produit sur une étagère, de réécrire le texte d'une enseigne, de rééclairer une scène du jour à la nuit, ou d'ajouter et de supprimer un objet, le tout via une instruction en langage courant qui ne modifie que la partie décrite et laisse le reste du plan stable.
Résolution, durée et fréquence d'images
Par défaut, chaque génération MiniMax H3 s'affiche en 2K, ce qui correspond en pratique à 1440 pixels sur le petit côté pour tous les formats pris en charge entre 16:9 et 9:16, et à l'extrémité la plus large, en 21:9, cela représente environ 3.7 mégapixels, soit 2976x1248. C'est suffisamment de détail pour tenir la route sur un grand écran, sans l'aspect flou et suréchantillonné habituel des générateurs vidéo rapides. Les clips durent entre 5 et 15 secondes, rendus à 24 images par seconde de qualité cinéma plutôt qu'à une cadence saccadée ou artificiellement lissée. Sept formats d'image sont disponibles, 21:9, 16:9, 4:3, 1:1, 3:4 et 9:16, plus un mode adaptatif qui choisit un format correspondant à la composition suggérée par le prompt ou les références, utile lorsqu'on ne sait pas à l'avance si un plan rendra mieux en format large ou vertical. Ensemble, ces chiffres décrivent un modèle conçu pour un type de rendu précis : des clips courts, en haute résolution, bien rythmés, adaptés aux plateformes sociales, aux spots produits et au storytelling court, plutôt que des séquences longues où la durée compte plus que la fidélité image par image.
Le son n'est pas une réflexion après coup
Chaque génération MiniMax H3 est livrée avec un audio stéréo natif, et non un clip muet en attente d'une passe sonore séparée. Le modèle génère une musique originale, des dialogues, des bruitages et une ambiance sonore en même temps que l'image, calés sur le montage plutôt qu'ajoutés après coup, si bien qu'une porte qui se ferme tombe pile sur l'image où elle se ferme visiblement, et qu'une montée musicale arrive avec le temps fort visuel qu'elle accompagne. C'est important, car la conception sonore intervient habituellement après le verrouillage de l'image dans la plupart des flux de travail, et c'est dans cet écart que se glissent les décalages de timing. MiniMax H3 prend aussi en charge le transfert de voix : fournissez-lui un enregistrement de référence, et il peut reporter cette voix, son ton, son rythme et son caractère, sur une performance dans la scène générée, plutôt que de recourir par défaut à un narrateur synthétique générique. Cela permet de conserver une voix cohérente à travers plusieurs générations d'un même personnage, ou de faire porter une seule réplique enregistrée sur une scène entièrement nouvelle. Le résultat est un clip qui sonne comme conçu, pas doublé, dès une seule génération.
Répartir son budget de références
MiniMax H3 accepte jusqu'à 12 fichiers de référence dans une seule génération : jusqu'à 9 images pour le sujet ou le style, jusqu'à 3 clips vidéo totalisant 15 secondes pour le mouvement, et jusqu'à 3 pistes audio totalisant 15 secondes pour la voix ou la musique, le tout à l'intérieur du même contexte unifié décrit plus haut. Les images constituent l'emplacement le plus polyvalent : utilisez-les pour le visage d'un personnage, la forme exacte d'un produit, ou la palette de couleurs d'un lieu, et combinez-en plusieurs pour verrouiller à la fois un sujet et un style. Les références vidéo se dépensent le mieux sur un mouvement difficile à décrire avec des mots, un mouvement de caméra précis, un cycle de marche, un geste, puisque le modèle les lit pour le mouvement plutôt que pour l'apparence. Les références audio transmettent une voix ou une identité musicale vers un nouveau plan. Ce budget récompense la retenue : une poignée de références bien choisies, chacune remplissant une seule tâche claire, une pour le visage, une pour le mouvement de caméra, une pour la voix, donne de meilleurs résultats que de remplir les 12 emplacements avec du matériel redondant qui envoie au modèle des signaux contradictoires à concilier.
Ce que les poids ouverts changent vraiment
MiniMax H3 a été lancé en poids ouverts, ce qui signifie que le modèle lui-même, et pas seulement une API placée devant lui, est accessible à tous pour être inspecté, exécuté et développé. C'est une posture radicalement différente de celle d'un modèle fermé, accessible uniquement via un point d'accès payant dont le comportement peut changer sans préavis. Les poids ouverts de MiniMax H3 signifient que les chercheurs peuvent étudier précisément la manière dont le contexte omnimodal est construit, que les développeurs peuvent héberger le modèle sur leur propre infrastructure au lieu de dépendre de la disponibilité d'un seul fournisseur, et que l'ensemble de la communauté peut l'affiner pour des cas d'usage spécialisés que la version originale n'avait jamais anticipés. Cela signifie aussi que le rythme des améliorations n'est pas verrouillé derrière la feuille de route d'une seule entreprise, puisque n'importe qui peut contribuer des correctifs, des adaptateurs ou des optimisations. Pour un modèle aussi capable, les poids ouverts sont le détail qui transforme un simple lancement de produit en une infrastructure partagée, autour de laquelle tout un écosystème d'outils, de tutoriels et de modèles dérivés peut se développer, plutôt qu'un jardin clos dont une seule entreprise contrôlerait l'avenir.
Écrire un prompt que MiniMax H3 peut exploiter
MiniMax H3 accepte des prompts allant jusqu'à 7,000 caractères, ce qui laisse assez de place pour diriger un plan comme on briefe une petite équipe de tournage, plutôt que pour taper une simple légende. Commencez par le sujet : qui ou quoi est dans le cadre, et que fait-il. Ajoutez la caméra : un lent travelling avant, un plan large statique, un suivi caméra à l'épaule, car nommer le mouvement donne au modèle quelque chose de concret à exécuter plutôt que de le laisser deviner. Décrivez la lumière et le moment de la journée, car ce détail détermine à la fois l'ambiance visuelle et, indirectement, la façon dont le modèle rythme le plan. Comme l'audio se génère en même temps que l'image, décrivez aussi le paysage sonore, une ambiance de pièce silencieuse, une réplique précise, une montée de musique à un moment donné, plutôt que de laisser le son comme une réflexion après coup dans le texte. Enfin, donnez une idée du rythme de montage : le plan reste-t-il stable, ou monte-t-il vers une coupe. Un prompt qui couvre les cinq éléments, sujet, caméra, lumière, paysage sonore et rythme, donne à MiniMax H3 un brief complet plutôt qu'un fragment qu'il doit compléter seul.
Spécifications
MiniMax H3 en un coup d'œil
| Critère | MiniMax H3 |
|---|---|
| Résolution | 2K (2976x1248 en 21:9) |
| Durée | 5-15 secondes à 24 FPS |
| Audio | Stéréo native, à chaque génération |
| Formats d'image | 7 formats plus adaptatif |
| Références | 9 images, 3 clips, 3 audio (12 max) |
| Longueur du prompt | Jusqu'à 7,000 caractères |
| Modes | Texte, première/dernière image, référence, montage |
| Poids | Ouverts |
Essayer
Essayez MiniMax H3 ici même
Cette première étape génère l'image d'ouverture de votre plan sous forme d'image fixe, afin que vous puissiez vérifier le cadrage et la lumière avant de lancer le clip 2K complet avec audio, un moyen rapide et gratuit de prévisualiser la composition avant que la génération complète ne s'exécute.
Gratuit et anonyme. Protégé par Cloudflare Turnstile — sans compte, sans carte.
FAQ
Vos questions sur MiniMax H3
MiniMax H3 est un modèle vidéo IA omnimodal en poids ouverts, sorti le 31 juillet 2026. Au lieu de faire transiter les requêtes de texte, d'image, de vidéo et d'audio par des systèmes distincts spécialisés par tâche, MiniMax H3 les traite toutes à l'intérieur d'un seul contexte unifié, générant un plan complet, image, mouvement, dialogue et musique, à partir d'une seule requête. Il produit des clips 2K de 5 à 15 secondes à 24 FPS sur sept formats d'image, avec audio stéréo natif et transfert de voix intégrés à chaque génération, et non ajoutés comme étape séparée par la suite.
Les poids ouverts signifient que le modèle MiniMax H3 lui-même, et pas seulement une API hébergée, est publiquement disponible au téléchargement, à l'inspection et à l'exécution. Cela permet aux développeurs d'auto-héberger le modèle au lieu de dépendre des serveurs d'une seule entreprise, permet aux chercheurs d'étudier le fonctionnement réel de son contexte omnimodal, et permet à la communauté de l'affiner ou de l'étendre pour des cas d'usage que la version originale n'avait jamais couverts. C'est la différence entre un produit fermé que l'on ne peut que louer et une infrastructure partagée sur laquelle tout un écosystème peut se construire.
Une seule génération MiniMax H3 dure de 5 à 15 secondes à 24 FPS, rendue en 2K, soit 1440 pixels sur le petit côté, jusqu'à 2976x1248 pour le format le plus large en 21:9. Chaque clip inclut par défaut un audio stéréo natif : une musique originale, des dialogues, des bruitages et une ambiance de pièce générés en même temps que l'image et calés sur le montage, plutôt qu'ajoutés lors d'une passe séparée par la suite. Le transfert de voix peut aussi reporter la voix d'un enregistrement de référence sur un personnage dans la nouvelle scène.
MiniMax H3 accepte jusqu'à 12 fichiers de référence par génération : jusqu'à 9 images pour un sujet ou un style visuel, jusqu'à 3 clips vidéo totalisant 15 secondes pour un schéma de mouvement, et jusqu'à 3 pistes audio totalisant 15 secondes pour une voix ou une musique. Tous se trouvent à l'intérieur du même contexte omnimodal sur lequel le modèle raisonne, de sorte qu'un visage tiré d'une image, un mouvement de caméra tiré d'un clip, et une voix tirée d'une piste peuvent se combiner en un seul nouveau plan.
Explorer
Découvrez ce que MiniMax H3 peut générer
Les exemples MiniMax H3 sont le moyen le plus rapide de comprendre ce que ce modèle produit réellement, de vrais clips accompagnés des prompts MiniMax H3 exacts qui les ont générés, prêts à être réutilisés. Parcourez la galerie pour voir les quatre modes, l'audio natif et le flux de travail par référence en action, puis essayez l'outil ci-dessus sur votre propre plan.
Prêt à générer de la vidéo en 2K ?
Découvrez dès aujourd'hui le contexte unifié, l'audio natif et la liberté des poids ouverts de MiniMax H3.