Pesos Abertos

MiniMax H3

Um único modelo para todas as modalidades. Combine texto, imagens, vídeo e áudio num único contexto para gerar vídeo 2K com áudio estéreo nativo, até 15 segundos.

  • 4,9/5 de mais de 32 mil criadores
  • Mais de 1,2 milhões de clipes gerados
  • Grátis — sem necessidade de conta

Grátis e anónimo. Protegido pelo Cloudflare Turnstile — sem conta, sem cartão.

Feito com MiniMax H3

Um Único Contexto. Todas as Modalidades. Controlo Preciso do Início ao Fim.

Referência para Vídeo

Texto, Imagens, Vídeo e Áudio num Único Contexto

Envie até 9 imagens, 3 clipes de vídeo e 3 faixas de áudio numa única geração. O modelo lê a identidade, a performance, o movimento de câmara, a composição, a paisagem sonora e o ritmo de montagem a partir do que lhe fornecer, e transporta tudo isso para um resultado coerente.

Edição Precisa

Mude Uma Coisa, Mantenha Tudo o Resto

Substitua um produto, reescreva uma placa, altere uma linha de diálogo, mude a iluminação de uma cena de dia para noite, ou adicione e remova objetos. As edições localizadas acontecem exatamente onde pediu, enquanto o resto do plano permanece estável, para que possa continuar a iterar sobre imagens que já gosta.

Texto e Interfaces

Tipografia, UI e Gráficos Que Se Mantêm Coerentes

O H3 gera tipografia legível, créditos, legendas e marcas, e anima trabalho de interface real: páginas de produto, menus e HUDs de jogos, posters em movimento e tipografia dinâmica. Os prompts vão até 7,000 caracteres, pelo que uma lista de planos completa cabe num único pedido.

Áudio Nativo

Som Composto para a Imagem

Cada geração devolve áudio estéreo nativo: banda sonora original, diálogo, foley e ambiente sonoro sincronizados com o corte. Forneça ao MiniMax H3 uma gravação de referência e ele transfere ou clona essa voz para a sua personagem, mantendo a performance intacta.

Como funciona

Descreva o plano em linguagem simples, anexe o material de referência que já tiver, e verifique o frame inicial antes de avançar para a renderização completa. Rever primeiro uma imagem fixa é a forma mais económica de detetar um problema de enquadramento ou iluminação, porque corrigi-lo custa apenas mais uma frase, e não um segundo clipe.

  1. 1

    Descreva o plano

    Introduza até 7,000 caracteres a descrever o sujeito, a câmara, a iluminação, a paisagem sonora e o ritmo de montagem.

  2. 2

    Adicione referências

    Envie até 9 imagens, 3 clipes de vídeo e 3 faixas de áudio para definir o estilo, a identidade e o movimento exatamente como pretende.

  3. 3

    Gere o frame inicial

    Reveja o frame inicial gerado para garantir que a composição e a iluminação correspondem perfeitamente à sua visão.

  4. 4

    Anime para 2K com áudio estéreo

    Confirme a geração e veja a cena ganhar vida em resolução 2K com áudio nativo sincronizado.

Exemplos

O que os criadores estão a construir com o MiniMax H3

Filmes de marca, trabalho de personagens, animação estilizada, gameplay e edição de vídeo, tudo a partir do mesmo modelo.

Primeiro e Último Frame

Filme de Marca com Binóculos Vintage

Use as Imagens 1-4 como keyframes sequenciais, vistas através de um visor de binóculos vintage à procura da instalação MINIMAX. Abra desfocado com um leve tremor de câmara à mão, depois avance rapidamente e ajuste o foco para a Imagem 1. Entre keyframes, use transições rápidas de varrimento binocular com movimento em chicote, motion blur, esbatimento ótico e um breve tremeluzir de exposição. Mantenha a máscara circular dupla da lente absolutamente fixa durante toda a cena. Linguagem visual: um look voyeurista em película de 35mm inspirado em Wes Anderson, com grão fino, halo suave nas luzes, cor contida e acentos tipográficos vermelhos.
Referência para Vídeo

Filme de Personagem Wuxia de Fantasia

Use a Imagem 2 como referência fixa da personagem. Preserve o cabelo longo e preto meio preso, a coroa prateada vazada, a fita índigo, o hanfu pálido em camadas, o manto exterior azul translúcido, a faixa azul-escura, o fecho floral prateado e as longas borlas. Use a Imagem 1 para a ordem e o ritmo do storyboard. Renderize em 3D de alta qualidade em 4K, 16:9, de inspiração chinesa, com valor de produção cinematográfico xianxia: intenso, solene e moldado pelo destino. Siga o storyboard passo a passo, com movimento de câmara natural e transições sem cortes.
Referência de Vídeo

Transformação de Live-Action para Voxel

Preserve os edifícios, os peões e o ambiente geral do Vídeo 1 como live-action fotorrealista. Transforme apenas as árvores e os carros em objetos de pixel-art 3D ou blocos voxel ao estilo Minecraft, usando a Imagem 1 como referência visual. Mantenha o movimento fisicamente correto e preserve as sombras e a luz transmitida do ambiente real. Use o Vídeo 2 como alvo geral.
Texto para Vídeo

Encontro na Lavandaria de Néon

15 segundos, 16:9 paisagem. Combine uma lavandaria live-action de madrugada com uma animação luminosa desenhada à mão. A pequena lavandaria self-service tem luzes fluorescentes a tremeluzir suavemente, máquinas de lavar em funcionamento, cestos de plástico, um banco gasto e uma meia sozinha no chão. Mantenha o espaço silencioso e ligeiramente nostálgico. Use uma sensação de câmara de telemóvel segura com uma mão, com tremor visível, flutuação de exposição sob luz fluorescente branca, reflexos ambientais no vidro e foco automático com atraso em planos próximos. Evite uma composição comercial polida; deve parecer um encontro autêntico de madrugada, filmado enquanto se segue uma aparição estranha.
Referência de Movimento

Recriação de Movimento com Capivaras

Reproduza a ação do Vídeo 1 a partir de uma câmara larga fixa. Substitua os três homens de fato por três capivaras altamente fotorrealistas. Preserve exatamente o percurso de movimento original: as três caem rapidamente para o chão; a capivara da esquerda salta para o centro; a capivara do centro rola para a extrema esquerda; a nova capivara do centro rola para a extrema direita; a capivara da direita salta para o centro; por fim, a capivara do centro salta sobre as outras duas, formando uma pirâmide. Mantenha a câmara fixa e integre o pelo, a iluminação e as sombras de forma realista na cena.
Edição de Vídeo

Composição de Conto de Fadas com Chroma Key

Remova o fundo de chroma key verde do Vídeo 1 e transforme-o num fundo semelhante a um conto de fadas, à imagem do Vídeo 2. Os elementos do fundo têm de corresponder totalmente às ações das personagens no Vídeo 1. Modifique a iluminação das personagens no Vídeo 1 para que corresponda totalmente ao fundo.

Os números por trás de cada geração

O resultado é 2K por predefinição, o que coloca 1440 pixels no lado mais curto para proporções entre 16:9 e 9:16 e atinge cerca de 3.7 megapixels em formatos mais largos — 2976x1248 em 21:9. Os clipes duram de 5 a 15 segundos a 24 frames por segundo, e cada um deles chega com uma mistura estéreo sincronizada, em vez de uma imagem silenciosa que teria de musicar depois.

Resolução (2976x1248)
2KResolução (2976x1248)
Duração a 24 FPS
5–15sDuração a 24 FPS
Áudio Estéreo
NativoÁudio Estéreo
Referências Máximas
12Referências Máximas
Proporções
7Proporções
Refs de Imagem
9Refs de Imagem
Caracteres do Prompt
7,000Caracteres do Prompt
Pesos Abertos
SimPesos Abertos

Como o MiniMax H3 se compara

MiniMax H3 comparado com Sora 2, Veo 3.1, Kling 3 e Hailuo 02 em resolução, duração, áudio nativo, orçamento de referências e pesos abertos.
FuncionalidadeMiniMax H3Sora 2Veo 3.1Kling 3Hailuo 02
Resolução2K (2976x1248)1080p1080p1080p720p
Duração5–15sAté 60s5s5–10s5s
Áudio NativoSim (Estéreo)NãoNãoNãoNão
Orçamento de Referências12 ficheiros (9 img, 3 víd, 3 áud)1 imagem1 imagem1 imagem1 imagem
Pesos AbertosSimNãoNãoNãoNão

A diferença que importa não é a resolução em bruto — vários destes modelos atingem uma contagem de pixels comparável. É que os concorrentes tratam texto-para-vídeo, imagem-para-vídeo, referência de movimento e áudio como endpoints separados, pelo que um plano que precise de três destes elementos exige três idas e voltas e um compositor para reconciliar os resultados. Passar um único contexto unificado, e receber de volta uma mistura estéreo musicada junto com a imagem, é o que elimina essa etapa.

Confiado por criadores de referência

O MiniMax H3 mudou completamente o nosso pipeline de pós-produção. Ter um único contexto que compreende referências de vídeo a par do áudio poupa-nos dias de trabalho manual de composição.
Sarah JenkinsSupervisora de VFX, Studio North
A geração de áudio estéreo nativo é indistinguível de magia. Não se limita a criar som, compreende o espaço físico do plano que descrevemos.
David ChenSound Designer, Waveform
Finalmente, um modelo que renderiza tipografia de forma limpa. Usamos a capacidade de motion de UI/UX para prototipar fluxos de aplicação inteiros diretamente a partir de frames do Figma.
Elena RostovaDiretora Criativa, Form and Function

Perguntas comuns sobre o MiniMax H3

O MiniMax H3 é um modelo de vídeo multimodal de propósito geral, com pesos abertos. Em vez de um modelo separado para cada tarefa, o MiniMax H3 lê texto, imagens, vídeo e áudio num único contexto unificado e gera resultados audiovisuais coerentes a partir de qualquer combinação destes. Suporta texto-para-vídeo, primeiro-e-último-frame, referência-para-vídeo e edição de vídeo precisa.

Pronto para gerar vídeo 2K?

Experimente hoje o contexto unificado, o áudio nativo e a liberdade dos pesos abertos do MiniMax H3.

Experimentar Grátis