¿Qué es MiniMax H3?
MiniMax H3 es un nuevo modelo de vídeo de pesos abiertos que genera metraje, diálogo y sonido juntos en una sola pasada. Esta página explica qué hace MiniMax H3, cómo funcionan sus modos, y qué significan sus especificaciones en la práctica.
Un modelo, un contexto
La mayoría de las herramientas de vídeo IA son en realidad una cadena de modelos separados cosidos entre sí: un sistema escribe un guion, otro convierte texto en imagen, un tercero anima esa imagen, un cuarto genera una banda sonora, y un quinto sincroniza la voz con los labios. Cada traspaso pierde información, y cada etapa tiene sus propias peculiaridades, sus propios modos de fallo, su propia sintaxis de prompt. El modelo MiniMax H3 adopta un enfoque distinto. El texto, las imágenes, las referencias de vídeo y el audio conviven todos dentro de un contexto unificado, procesados por un único modelo en lugar de encaminarse entre endpoints específicos por tarea. Cuando preguntas qué es MiniMax H3 en su esencia, esta es la respuesta honesta: es un sistema omni-modal que razona sobre una escena de la forma en que lo haría un director, teniendo en mente el sujeto, el movimiento de cámara, la iluminación y la banda sonora al mismo tiempo, en lugar de resolver cada pieza de forma aislada. Ese contexto unificado es la razón por la que un clip de MiniMax H3 se siente coherente en lugar de ensamblado, ya que el diálogo cae justo en el corte, la banda sonora coincide con el ánimo de la iluminación, y la voz de un personaje se mantiene consistente entre una referencia y una nueva actuación, porque nada se generó en un silo separado.
Cuatro formas de empezar una escena
MiniMax H3 admite cuatro modos, y cada uno responde a una pregunta distinta sobre cómo empieza una escena. Texto a vídeo parte de nada más que un prompt escrito, dejando que el modelo invente el encuadre, el movimiento y el sonido a partir de una simple descripción. El modo primer y último fotograma toma dos imágenes fijas, dónde se abre la escena y dónde termina, y genera el movimiento, el cambio de iluminación y el audio que las conecta, lo cual es útil cuando el principio y el final de una acción ya existen y solo hay que construir el medio. Referencia a vídeo se apoya directamente en el contexto omni-modal del modelo: aporta imágenes para un sujeto o estilo, clips para un patrón de movimiento, o audio para una voz o banda sonora, y extiende esas referencias en una escena nueva y más larga. La edición en lenguaje natural trata un clip existente como un borrador en lugar de un corte final, permitiéndote cambiar un producto en una estantería, reescribir el texto de un cartel, reiluminar una escena de día a noche, o añadir y quitar un objeto, todo mediante una instrucción en lenguaje sencillo que cambia solo la parte descrita y deja estable el resto de la escena.
Resolución, duración y velocidad de fotogramas
Cada generación de MiniMax H3 se renderiza en 2K por defecto, lo que en la práctica significa 1440 píxeles en el lado corto en cada relación admitida entre 16:9 y 9:16, y en el extremo más panorámico, 21:9, eso equivale a aproximadamente 3.7 megapíxeles, o 2976x1248. Ese es suficiente detalle para resistir en una pantalla grande sin el aspecto suave y escalado tan común en los generadores de vídeo rápidos. Los clips duran entre 5 y 15 segundos, renderizados a unos cinematográficos 24 fotogramas por segundo en lugar de una velocidad más entrecortada o suavizada artificialmente. Hay siete relaciones de aspecto disponibles, 21:9, 16:9, 4:3, 1:1, 3:4 y 9:16, más un modo adaptativo que elige una relación para igualar la composición implícita en el prompt o las referencias, útil cuando no estás seguro de antemano de si una escena se ve mejor en horizontal o en vertical. En conjunto, estas cifras describen un modelo construido en torno a un tipo específico de salida: clips cortos, de alta resolución y bien ritmados, adecuados para plataformas sociales, spots de producto y narrativa de formato corto, en lugar de metraje de formato largo donde la duración importa más que la fidelidad por fotograma.
El sonido no es un añadido de última hora
Cada generación de MiniMax H3 llega con audio estéreo nativo, no un clip mudo a la espera de un pase de sonido aparte. El modelo genera una banda sonora original, diálogo, foley y ambiente junto con la imagen, sincronizados con el montaje en lugar de añadidos en capas después, así que una puerta que se cierra cae en el fotograma donde visiblemente se cierra, y un crescendo musical llega con el compás visual que está apoyando. Esto importa porque el diseño de sonido suele ocurrir después del bloqueo de imagen en la mayoría de los flujos de trabajo, y ese hueco es donde se cuela la desincronización. MiniMax H3 también admite la transferencia de voz: dale una grabación de referencia, y podrá trasladar esa voz, su tono, ritmo y carácter, a una actuación en la escena generada, en lugar de recurrir por defecto a un narrador sintético genérico. Eso hace posible mantener una voz consistente a lo largo de varias generaciones del mismo personaje, o hacer que una sola línea de diálogo grabada impulse por completo una escena nueva. El resultado es un clip que suena diseñado, no doblado, directamente desde una sola generación.
Cómo invertir el presupuesto de referencias
MiniMax H3 acepta hasta 12 archivos de referencia en una sola generación: hasta 9 imágenes para el sujeto o el estilo, hasta 3 clips de vídeo que suman 15 segundos para el movimiento, y hasta 3 pistas de audio que suman 15 segundos para la voz o la banda sonora, todo dentro del mismo contexto unificado descrito arriba. Las imágenes son el espacio más flexible: úsalas para el rostro de un personaje, la forma exacta de un producto, o la paleta de color de una localización, y combina varias para fijar a la vez un sujeto y un estilo. Las referencias de vídeo se aprovechan mejor para movimiento que no puedes describir fácilmente con palabras, un movimiento de cámara específico, un ciclo de caminata, un gesto, ya que el modelo las interpreta por el movimiento y no por la apariencia. Las referencias de audio trasladan una voz o una identidad musical a una escena nueva. El presupuesto premia la contención: un puñado de referencias bien elegidas que cada una cumple una función clara, una para el rostro, una para el movimiento de cámara, una para la voz, rinde mejor que llenar los 12 espacios con material redundante que le da al modelo señales contradictorias que reconciliar.
Qué cambia realmente tener pesos abiertos
MiniMax H3 se lanzó con pesos abiertos, lo que significa que el propio modelo, no solo una API delante de él, está disponible para que cualquiera lo inspeccione, lo ejecute y construya sobre él. Esa es una postura significativamente distinta a la de un modelo cerrado accesible solo a través de un endpoint de pago cuyo comportamiento puede cambiar sin previo aviso. Que MiniMax H3 tenga pesos abiertos significa que los investigadores pueden estudiar exactamente cómo está construido el contexto omni-modal, los desarrolladores pueden alojar el modelo en su propia infraestructura en lugar de depender del uptime de un solo proveedor, y la comunidad en general puede ajustarlo finamente para casos de uso especializados que el lanzamiento original nunca anticipó. También significa que el ritmo de mejora no está limitado por la hoja de ruta de una sola empresa, ya que cualquiera puede contribuir con correcciones, adaptadores u optimizaciones. Para un modelo tan capaz, los pesos abiertos son el detalle que convierte un simple lanzamiento de producto en una pieza de infraestructura compartida sobre la que puede crecer todo un ecosistema de herramientas, tutoriales y modelos derivados, en lugar de un jardín amurallado cuyo futuro controla una sola empresa.
Escribir un prompt sobre el que MiniMax H3 pueda actuar
MiniMax H3 admite prompts de hasta 7000 caracteres, suficiente margen para dirigir una escena de la forma en que informarías a un pequeño equipo de rodaje, en lugar de escribir un pie de foto. Empieza con el sujeto: quién o qué está en el encuadre, y qué está haciendo. Añade la cámara: es un acercamiento lento, un plano general estático, un seguimiento en mano, ya que nombrar el movimiento le da al modelo algo concreto que ejecutar en lugar de adivinar. Describe la iluminación y la hora del día, ya que ese detalle define tanto el ánimo visual como, indirectamente, el ritmo con el que el modelo construye la escena. Como el audio se genera junto a la imagen, describe también el paisaje sonoro, un ambiente de sala tranquilo, una línea de diálogo específica, un crescendo de banda sonora en un compás concreto, en lugar de dejar el sonido como un añadido de última hora en el texto. Por último, da una idea del ritmo de montaje: la escena se mantiene estable, o construye hacia un corte. Un prompt que cubra los cinco elementos, sujeto, cámara, iluminación, paisaje sonoro y ritmo, le da a MiniMax H3 un brief completo en lugar de un fragmento que tiene que completar por su cuenta.
Especificaciones
MiniMax H3 de un vistazo
| Característica | MiniMax H3 |
|---|---|
| Resolución | 2K (2976x1248 en 21:9) |
| Duración | 5-15 segundos a 24 FPS |
| Audio | Estéreo nativo, en cada generación |
| Relaciones de aspecto | 7 relaciones más modo adaptativo |
| Referencias | 9 imágenes, 3 clips, 3 audio (12 máx.) |
| Longitud del prompt | Hasta 7,000 caracteres |
| Modos | Texto, primer/último fotograma, referencia, edición |
| Pesos | Abiertos |
Pruébalo
Prueba MiniMax H3 aquí mismo
Este primer paso renderiza el fotograma inicial de tu escena como una imagen fija, para que puedas revisar el encuadre y la iluminación antes de comprometerte con el clip 2K completo con audio, una forma rápida y gratuita de previsualizar la composición antes de que se ejecute la generación completa.
Gratis y anónimo. Protegido por Cloudflare Turnstile — sin cuenta, sin tarjeta.
Preguntas frecuentes
Preguntas sobre MiniMax H3 respondidas
MiniMax H3 es un modelo de vídeo IA omni-modal de pesos abiertos, lanzado el 31 de julio de 2026. En lugar de encaminar las solicitudes de texto, imagen, vídeo y audio a través de sistemas separados y específicos por tarea, MiniMax H3 procesa todas ellas dentro de un contexto unificado, generando una escena completa, imagen, movimiento, diálogo y banda sonora, a partir de una sola solicitud. Produce clips 2K de 5 a 15 segundos a 24 FPS en siete relaciones de aspecto, con audio estéreo nativo y transferencia de voz integrados en cada generación, no añadidos como un paso aparte después.
Los pesos abiertos significan que el modelo MiniMax H3 subyacente, no solo una API alojada, está disponible públicamente para descargar, inspeccionar y ejecutar. Eso permite a los desarrolladores autoalojar el modelo en lugar de depender de los servidores de una sola empresa, permite a los investigadores estudiar cómo funciona realmente su contexto omni-modal, y permite a la comunidad ajustarlo finamente o extenderlo para casos de uso que el lanzamiento original nunca cubrió. Es la diferencia entre un producto cerrado que solo puedes alquilar y una infraestructura compartida sobre la que puede construir todo un ecosistema.
Una sola generación de MiniMax H3 dura de 5 a 15 segundos a 24 FPS, renderizada en 2K, 1440 píxeles en el lado corto, hasta 2976x1248 en la relación más panorámica, 21:9. Cada clip incluye audio estéreo nativo por defecto: una banda sonora original, diálogo, foley y ambiente generados junto con la imagen y sincronizados con el montaje, en lugar de añadidos en un pase aparte después. La transferencia de voz también puede trasladar la voz de una grabación de referencia a un personaje en la nueva escena.
MiniMax H3 acepta hasta 12 archivos de referencia por generación: hasta 9 imágenes para un sujeto o estilo visual, hasta 3 clips de vídeo que suman 15 segundos para un patrón de movimiento, y hasta 3 pistas de audio que suman 15 segundos para una voz o banda sonora. Todos conviven dentro del mismo contexto omni-modal sobre el que razona el modelo, así que un rostro de una imagen, un movimiento de cámara de un clip, y una voz de una pista se pueden combinar en una sola escena nueva.
Explorar
Descubre qué puede generar MiniMax H3
Los ejemplos de MiniMax H3 son la forma más rápida de entender qué produce realmente este modelo, clips reales con los prompts exactos de MiniMax H3 que los crearon, listos para reutilizar. Explora la galería para ver los cuatro modos, el audio nativo y el flujo de trabajo de referencias en acción, y luego prueba la herramienta de arriba con una escena propia.
¿Listo para generar vídeo 2K?
Descubre hoy mismo el contexto unificado, el audio nativo y la libertad de los pesos abiertos de MiniMax H3.