O que é o MiniMax H3?
O MiniMax H3 é um novo modelo de vídeo de pesos abertos que gera imagem, diálogo e som em conjunto, numa única passagem. Esta página explica o que o MiniMax H3 faz, como funcionam os seus modos, e o que as suas especificações significam na prática.
Um modelo, um contexto
A maioria das ferramentas de vídeo IA é, na realidade, uma cadeia de modelos separados costurados entre si: um sistema escreve um guião, outro transforma texto em imagem, um terceiro anima essa imagem, um quarto gera uma banda sonora, e um quinto sincroniza a voz com os lábios. Cada transição perde informação, e cada etapa tem as suas próprias particularidades, os seus próprios modos de falha, a sua própria sintaxe de pedido. O modelo MiniMax H3 segue uma abordagem diferente. Texto, imagens, referências de vídeo e áudio residem todos dentro de um único contexto unificado, processado por um único modelo em vez de encaminhado entre endpoints específicos para cada tarefa. Quando se pergunta o que é o MiniMax H3 na sua essência, esta é a resposta honesta: é um sistema omnimodal que raciocina sobre um plano da forma como um realizador o faria, mantendo em mente ao mesmo tempo o sujeito, o movimento de câmara, a iluminação e a banda sonora, em vez de resolver cada parte isoladamente. É esse contexto unificado que faz um vídeo do MiniMax H3 parecer coerente em vez de montado, já que o diálogo cai no corte certo, a banda sonora corresponde ao clima da iluminação, e a voz de uma personagem se mantém consistente entre uma referência e uma nova performance, porque nada foi gerado num silo separado.
Quatro formas de iniciar um plano
O MiniMax H3 suporta quatro modos, e cada um responde a uma questão diferente sobre como um plano começa. O modo texto para vídeo parte apenas de um pedido escrito, deixando o modelo inventar o enquadramento, o movimento e o som só a partir de uma descrição. O modo primeiro e último fotograma parte de duas imagens fixas — onde o plano começa e onde termina — e gera o movimento, a mudança de iluminação e o áudio que os liga, o que é útil quando o início e o fim de uma ação já existem e só é preciso construir o meio. O modo referência para vídeo apoia-se diretamente no contexto omnimodal do modelo: forneça-lhe imagens para um sujeito ou estilo, vídeos para um padrão de movimento, ou áudio para uma voz ou banda sonora, e ele estende essas referências para um plano novo e mais longo. A edição em linguagem natural trata um vídeo existente como um rascunho e não como um corte final, permitindo substituir um produto numa prateleira, reescrever o texto de um letreiro, mudar a iluminação de uma cena de dia para noite, ou adicionar e remover um objeto, tudo através de uma instrução em linguagem simples que altera apenas a parte descrita e mantém o resto do plano estável.
Resolução, duração e taxa de fotogramas
Por predefinição, cada geração do MiniMax H3 é renderizada em 2K, o que na prática significa 1440 pixels no lado mais curto em todas as proporções suportadas entre 16:9 e 9:16, e no extremo mais largo, 21:9, isso equivale a cerca de 3,7 megapixels, ou 2976x1248. É detalhe suficiente para se manter nítido num ecrã grande, sem o aspeto suave e ampliado comum aos geradores de vídeo rápidos. Os vídeos duram entre 5 e 15 segundos, renderizados a uns cinematográficos 24 fotogramas por segundo, em vez de uma taxa mais irregular ou artificialmente suavizada. Estão disponíveis sete proporções de imagem — 21:9, 16:9, 4:3, 1:1, 3:4 e 9:16 — além de um modo adaptativo que escolhe uma proporção que corresponda à composição implícita no pedido ou nas referências, útil quando não se sabe à partida se um plano resulta melhor em formato largo ou vertical. Em conjunto, estes números descrevem um modelo construído em torno de um tipo específico de resultado: vídeos curtos, de alta resolução e bem ritmados, adequados a plataformas sociais, anúncios de produto e narrativas de curta duração, e não a imagens longas em que a duração pesa mais do que a fidelidade de cada fotograma.
O som não é um pormenor secundário
Cada geração do MiniMax H3 chega com áudio estéreo nativo, e não como um vídeo mudo à espera de uma sessão de som à parte. O modelo gera uma banda sonora original, diálogo, foley e ambiente sonoro em conjunto com a imagem, sincronizados com o corte em vez de sobrepostos depois, pelo que uma porta a fechar-se cai exatamente no fotograma em que se fecha visivelmente, e um crescendo musical chega com a batida visual que está a acompanhar. Isto importa porque, na maioria dos fluxos de trabalho, o desenho de som costuma acontecer depois de a imagem estar fechada, e é nessa lacuna que surgem desfasamentos de tempo. O MiniMax H3 também suporta transferência de voz: dê-lhe uma gravação de referência, e ele consegue transportar essa voz, o seu tom, ritmo e carácter, para uma performance na cena gerada, em vez de recorrer por defeito a um narrador sintético genérico. Isso torna possível manter uma voz consistente ao longo de várias gerações da mesma personagem, ou fazer com que uma única fala gravada conduza inteiramente uma cena nova. O resultado é um vídeo que soa desenhado, não dobrado, logo à saída de uma única geração.
Como gastar o orçamento de referências
O MiniMax H3 aceita até 12 ficheiros de referência numa única geração: até 9 imagens para sujeito ou estilo, até 3 vídeos totalizando 15 segundos para movimento, e até 3 faixas de áudio totalizando 15 segundos para voz ou banda sonora, tudo dentro do mesmo contexto unificado descrito acima. As imagens são a vaga mais flexível: use-as para o rosto de uma personagem, a forma exata de um produto, ou a paleta de cores de um local, e combine várias para fixar ao mesmo tempo um sujeito e um estilo. As referências de vídeo são mais bem aproveitadas em movimentos difíceis de descrever por palavras — um movimento de câmara específico, um ciclo de caminhada, um gesto — já que o modelo as lê pelo movimento e não pela aparência. As referências de áudio transportam uma voz ou uma identidade musical para um novo plano. O orçamento recompensa a contenção: um punhado de referências bem escolhidas, cada uma com uma função clara — uma para o rosto, uma para o movimento de câmara, uma para a voz — supera encher todas as 12 vagas com material redundante que dá ao modelo sinais contraditórios para conciliar.
O que os pesos abertos realmente mudam
O MiniMax H3 foi lançado com pesos abertos, o que significa que o próprio modelo, e não apenas uma API à sua frente, está disponível para qualquer pessoa inspecionar, executar e construir a partir dele. Esta é uma postura significativamente diferente da de um modelo fechado, acessível apenas através de um endpoint pago cujo comportamento pode mudar sem aviso. Os pesos abertos do MiniMax H3 significam que os investigadores podem estudar exatamente como o contexto omnimodal é construído, os programadores podem alojar o modelo na sua própria infraestrutura em vez de depender da disponibilidade de um único fornecedor, e a comunidade em geral pode afiná-lo para casos de uso especializados que o lançamento original nunca previu. Também significa que o ritmo de evolução não fica preso ao roteiro de uma única empresa, já que qualquer pessoa pode contribuir com correções, adaptadores ou otimizações. Para um modelo com esta capacidade, os pesos abertos são o pormenor que transforma o lançamento de um único produto numa peça de infraestrutura partilhada, à volta da qual todo um ecossistema de ferramentas, tutoriais e modelos derivados pode crescer, em vez de um jardim murado cujo futuro só uma empresa controla.
Escrever um pedido sobre o qual o MiniMax H3 pode atuar
O MiniMax H3 aceita pedidos até 7000 caracteres, o que dá espaço suficiente para dirigir um plano da forma como se orientaria uma pequena equipa, e não apenas escrever uma legenda. Comece pelo sujeito: quem ou o que está em cena, e o que está a fazer. Acrescente a câmara: é um avanço lento, um plano geral estático, um seguimento com câmara ao ombro, já que nomear o movimento dá ao modelo algo concreto para executar em vez de adivinhar. Descreva a iluminação e a hora do dia, já que esse pormenor determina tanto o clima visual como, indiretamente, o ritmo que o modelo dá ao plano. Como o áudio é gerado a par da imagem, descreva também a paisagem sonora — um ambiente sonoro discreto, uma fala específica de diálogo, um crescendo da banda sonora numa determinada batida — em vez de deixar o som como um pormenor secundário no texto. Por fim, dê uma noção do ritmo de edição: se o plano se mantém estável, ou se constrói até um corte. Um pedido que cubra os cinco elementos — sujeito, câmara, iluminação, paisagem sonora e ritmo — dá ao MiniMax H3 um briefing completo, em vez de um fragmento que ele tem de preencher sozinho.
Especificações
O MiniMax H3 em síntese
| Funcionalidade | MiniMax H3 |
|---|---|
| Resolução | 2K (2976x1248 em 21:9) |
| Duração | 5-15 segundos a 24 FPS |
| Áudio | Estéreo nativo, em cada geração |
| Proporções de imagem | 7 proporções, mais adaptativa |
| Referências | 9 imagens, 3 vídeos, 3 áudios (máx. 12) |
| Comprimento do pedido | Até 7000 caracteres |
| Modos | Texto, primeiro/último fotograma, referência, edição |
| Pesos | Abertos |
Experimente
Experimente o MiniMax H3 aqui mesmo
Este primeiro passo renderiza o fotograma inicial do seu plano como uma imagem fixa, para que possa verificar o enquadramento e a iluminação antes de avançar para o vídeo completo em 2K com áudio — uma forma rápida e gratuita de pré-visualizar a composição antes de a geração completa ser executada.
Grátis e anónimo. Protegido pelo Cloudflare Turnstile — sem conta, sem cartão.
FAQ
Perguntas sobre o MiniMax H3 respondidas
O MiniMax H3 é um modelo de vídeo IA omnimodal, de pesos abertos, lançado a 31 de julho de 2026. Em vez de encaminhar pedidos de texto, imagem, vídeo e áudio através de sistemas separados e específicos para cada tarefa, o MiniMax H3 processa todos eles dentro de um único contexto unificado, gerando um plano completo — imagem, movimento, diálogo e banda sonora — a partir de um único pedido. Produz vídeos em 2K de 5 a 15 segundos a 24 FPS em sete proporções de imagem, com áudio estéreo nativo e transferência de voz incorporados em cada geração, e não adicionados depois como um passo à parte.
Pesos abertos significa que o modelo subjacente do MiniMax H3, e não apenas uma API alojada, está publicamente disponível para descarregar, inspecionar e executar. Isso permite que os programadores alojem o modelo eles próprios, em vez de dependerem dos servidores de uma única empresa, permite que os investigadores estudem como o seu contexto omnimodal realmente funciona, e permite que a comunidade o afine ou estenda para casos de uso que o lançamento original nunca cobriu. É a diferença entre um produto fechado que só se pode alugar e uma infraestrutura partilhada sobre a qual todo um ecossistema pode construir.
Uma única geração do MiniMax H3 dura entre 5 e 15 segundos a 24 FPS, renderizada em 2K, 1440 pixels no lado mais curto, até 2976x1248 na proporção mais larga, 21:9. Todos os vídeos incluem áudio estéreo nativo por predefinição: uma banda sonora original, diálogo, foley e ambiente sonoro gerados em conjunto com a imagem e sincronizados com o corte, em vez de adicionados depois numa sessão à parte. A transferência de voz também pode transportar a voz de uma gravação de referência para uma personagem na nova cena.
O MiniMax H3 aceita até 12 ficheiros de referência por geração: até 9 imagens para um sujeito ou estilo visual, até 3 vídeos totalizando 15 segundos para um padrão de movimento, e até 3 faixas de áudio totalizando 15 segundos para uma voz ou banda sonora. Todos eles residem dentro do mesmo contexto omnimodal sobre o qual o modelo raciocina, pelo que um rosto de uma imagem, um movimento de câmara de um vídeo e uma voz de uma faixa se podem combinar num único plano novo.
Explorar
Veja o que o MiniMax H3 consegue gerar
Os exemplos do MiniMax H3 são a forma mais rápida de perceber o que este modelo realmente produz: vídeos reais com os pedidos exatos do MiniMax H3 que os geraram, prontos a reutilizar. Explore a galeria para ver os quatro modos, o áudio nativo e o fluxo de trabalho de referências em ação, e depois experimente a ferramenta acima com um plano seu.
Pronto para gerar vídeo 2K?
Experimente hoje o contexto unificado, o áudio nativo e a liberdade dos pesos abertos do MiniMax H3.