MiniMax H3
Um único modelo para todas as modalidades. Combine texto, imagens, vídeo e áudio num único contexto para gerar vídeo 2K com áudio estéreo nativo, até 15 segundos.
- 4,9/5 de mais de 32 mil criadores
- Mais de 1,2 milhões de clipes gerados
- Grátis — sem necessidade de conta
Grátis e anónimo. Protegido pelo Cloudflare Turnstile — sem conta, sem cartão.
Um Único Contexto. Todas as Modalidades. Controlo Preciso do Início ao Fim.
Texto, Imagens, Vídeo e Áudio num Único Contexto
Envie até 9 imagens, 3 clipes de vídeo e 3 faixas de áudio numa única geração. O modelo lê a identidade, a performance, o movimento de câmara, a composição, a paisagem sonora e o ritmo de montagem a partir do que lhe fornecer, e transporta tudo isso para um resultado coerente.
Mude Uma Coisa, Mantenha Tudo o Resto
Substitua um produto, reescreva uma placa, altere uma linha de diálogo, mude a iluminação de uma cena de dia para noite, ou adicione e remova objetos. As edições localizadas acontecem exatamente onde pediu, enquanto o resto do plano permanece estável, para que possa continuar a iterar sobre imagens que já gosta.
Tipografia, UI e Gráficos Que Se Mantêm Coerentes
O H3 gera tipografia legível, créditos, legendas e marcas, e anima trabalho de interface real: páginas de produto, menus e HUDs de jogos, posters em movimento e tipografia dinâmica. Os prompts vão até 7,000 caracteres, pelo que uma lista de planos completa cabe num único pedido.
Som Composto para a Imagem
Cada geração devolve áudio estéreo nativo: banda sonora original, diálogo, foley e ambiente sonoro sincronizados com o corte. Forneça ao MiniMax H3 uma gravação de referência e ele transfere ou clona essa voz para a sua personagem, mantendo a performance intacta.
Gerar, referenciar e editar
Crie vídeos a partir de texto, controle o primeiro e o último frame, combine imagens, vídeo e áudio como referências, ou edite imagens já existentes com linguagem natural.

Texto para Vídeo
Gera vídeo apenas a partir de um prompt de texto, renderizando em 2K com durações de 5 a 15 segundos em sete proporções.

Primeiro e Último Frame
Anima uma imagem fornecida para vídeo 2K, usando-a como frame inicial, ou combina um primeiro e um último frame para controlar a transição entre duas imagens.

Referência para Vídeo
Gera vídeo 2K a partir de referências multimodais: até 9 imagens para sujeito e estilo, 3 clipes de vídeo para movimento e 3 clipes de áudio.
Como funciona
Descreva o plano em linguagem simples, anexe o material de referência que já tiver, e verifique o frame inicial antes de avançar para a renderização completa. Rever primeiro uma imagem fixa é a forma mais económica de detetar um problema de enquadramento ou iluminação, porque corrigi-lo custa apenas mais uma frase, e não um segundo clipe.
- 1
Descreva o plano
Introduza até 7,000 caracteres a descrever o sujeito, a câmara, a iluminação, a paisagem sonora e o ritmo de montagem.
- 2
Adicione referências
Envie até 9 imagens, 3 clipes de vídeo e 3 faixas de áudio para definir o estilo, a identidade e o movimento exatamente como pretende.
- 3
Gere o frame inicial
Reveja o frame inicial gerado para garantir que a composição e a iluminação correspondem perfeitamente à sua visão.
- 4
Anime para 2K com áudio estéreo
Confirme a geração e veja a cena ganhar vida em resolução 2K com áudio nativo sincronizado.
O que os criadores estão a construir com o MiniMax H3
Filmes de marca, trabalho de personagens, animação estilizada, gameplay e edição de vídeo, tudo a partir do mesmo modelo.
Filme de Marca com Binóculos Vintage
Filme de Personagem Wuxia de Fantasia
Transformação de Live-Action para Voxel
Encontro na Lavandaria de Néon
Recriação de Movimento com Capivaras
Composição de Conto de Fadas com Chroma Key
Os números por trás de cada geração
O resultado é 2K por predefinição, o que coloca 1440 pixels no lado mais curto para proporções entre 16:9 e 9:16 e atinge cerca de 3.7 megapixels em formatos mais largos — 2976x1248 em 21:9. Os clipes duram de 5 a 15 segundos a 24 frames por segundo, e cada um deles chega com uma mistura estéreo sincronizada, em vez de uma imagem silenciosa que teria de musicar depois.
- Resolução (2976x1248)
- 2KResolução (2976x1248)
- Duração a 24 FPS
- 5–15sDuração a 24 FPS
- Áudio Estéreo
- NativoÁudio Estéreo
- Referências Máximas
- 12Referências Máximas
- Proporções
- 7Proporções
- Refs de Imagem
- 9Refs de Imagem
- Caracteres do Prompt
- 7,000Caracteres do Prompt
- Pesos Abertos
- SimPesos Abertos
Como o MiniMax H3 se compara
| Funcionalidade | MiniMax H3 | Sora 2 | Veo 3.1 | Kling 3 | Hailuo 02 |
|---|---|---|---|---|---|
| Resolução | 2K (2976x1248) | 1080p | 1080p | 1080p | 720p |
| Duração | 5–15s | Até 60s | 5s | 5–10s | 5s |
| Áudio Nativo | Sim (Estéreo) | Não | Não | Não | Não |
| Orçamento de Referências | 12 ficheiros (9 img, 3 víd, 3 áud) | 1 imagem | 1 imagem | 1 imagem | 1 imagem |
| Pesos Abertos | Sim | Não | Não | Não | Não |
A diferença que importa não é a resolução em bruto — vários destes modelos atingem uma contagem de pixels comparável. É que os concorrentes tratam texto-para-vídeo, imagem-para-vídeo, referência de movimento e áudio como endpoints separados, pelo que um plano que precise de três destes elementos exige três idas e voltas e um compositor para reconciliar os resultados. Passar um único contexto unificado, e receber de volta uma mistura estéreo musicada junto com a imagem, é o que elimina essa etapa.
Feito para todos os fluxos de trabalho
Como um único modelo cobre texto, imagens, vídeo e áudio, o mesmo fluxo de trabalho leva uma campanha do storyboard ao corte final sem transferir ficheiros entre quatro ferramentas especializadas. Escolha a plataforma para a qual está a produzir, e o orçamento de referências, a proporção e o tratamento de áudio decorrem daí.
Publicidade
Iterações rápidas e geração de variantes para campanhas.
E-commerce
Vitrines de produto dinâmicas com controlo preciso de identidade.
Títulos de Filme
Renderização de texto cinematográfico integrada com as imagens.
Poster Animado
Dê vida à key art com tipografia alinhada.
Cinemáticas de Jogos
Cutscenes 2K de alta fidelidade usando assets do jogo.
Motion de UI/UX
Anime mockups de interface de forma nativa.
Vídeo Musical
Geração reativa ao áudio com sincronia labial nativa.
Anúncios Sociais
Conteúdo envolvente otimizado em vertical 9:16.
Confiado por criadores de referência
O MiniMax H3 mudou completamente o nosso pipeline de pós-produção. Ter um único contexto que compreende referências de vídeo a par do áudio poupa-nos dias de trabalho manual de composição.
A geração de áudio estéreo nativo é indistinguível de magia. Não se limita a criar som, compreende o espaço físico do plano que descrevemos.
Finalmente, um modelo que renderiza tipografia de forma limpa. Usamos a capacidade de motion de UI/UX para prototipar fluxos de aplicação inteiros diretamente a partir de frames do Figma.
Perguntas comuns sobre o MiniMax H3
O MiniMax H3 é um modelo de vídeo multimodal de propósito geral, com pesos abertos. Em vez de um modelo separado para cada tarefa, o MiniMax H3 lê texto, imagens, vídeo e áudio num único contexto unificado e gera resultados audiovisuais coerentes a partir de qualquer combinação destes. Suporta texto-para-vídeo, primeiro-e-último-frame, referência-para-vídeo e edição de vídeo precisa.
O MiniMax H3 é lançado com pesos abertos, sendo assim uma base aberta que pode explorar, personalizar e sobre a qual pode construir, em vez de um endpoint fechado. Isto permite-lhe executar o modelo no seu próprio hardware ou em plataformas parceiras, garantindo transparência e flexibilidade para a sua investigação e afinação.
O MiniMax H3 gera vídeos de 5 a 15 segundos a 24 FPS. O resultado é 2K, o que coloca 1440 pixels no lado mais curto para proporções entre 16:9 e 9:16, e atinge cerca de 3.7 megapixels em formatos mais largos, por exemplo 2976x1248 em 21:9. Suporta 7 proporções, além de um modo adaptativo.
O modo referência-para-vídeo aceita até 9 imagens de referência, até 3 clipes de vídeo de referência (15 segundos no total) e até 3 faixas de áudio de referência (15 segundos no total), com um máximo de 12 ficheiros no total.
Sim. Cada geração inclui áudio estéreo nativo, cobrindo banda sonora original, diálogo, foley e ambiente sincronizados com a imagem. Também pode transferir ou clonar uma voz a partir de uma gravação de referência para uma personagem.
As gerações demoram normalmente cerca de 100 segundos para produzir um clipe completo de 15 segundos em 2K com áudio, aproveitando uma infraestrutura serverless altamente otimizada.
Sim. O conteúdo gerado está autorizado para uso comercial ao abrigo dos termos de licenciamento padrão que acompanham os pesos abertos.
Pode começar agora mesmo usando o editor de prompts no topo desta página. Não é necessária conta nem cartão de crédito para experimentar a sua primeira geração: o primeiro passo renderiza o frame inicial do seu plano, e a partir daí pode colocar na fila o clipe completo.
Pronto para gerar vídeo 2K?
Experimente hoje o contexto unificado, o áudio nativo e a liberdade dos pesos abertos do MiniMax H3.
Experimentar Grátis