Referências de imagem, vídeo e áudio num só prompt
O MiniMax H3 aceita até 9 imagens de referência, 3 vídeos de referência e 3 clipes de áudio numa geração, e lê tudo junto em vez de um por vez. No exemplo da própria MiniMax, o modelo precisa copiar o movimento de câmera de um vídeo, fazer o personagem de uma imagem cantar e ajustar a voz a um clipe de áudio, tudo numa frase só. É no prompt que você diz para que serve cada referência: "mantenha o rosto e o suéter azul-marinho do retrato, siga o travelling do vídeo de referência e faça ele cantar a melodia do clipe de áudio no porto ao entardecer". Sem essa frase, o modelo tem que adivinhar qual entrada controla o quê. Referências e um primeiro ou último quadro não podem ser combinados numa mesma geração, então escolha uma abordagem por clipe e selecione o H3 no menu de modelos para clipes feitos com referências. Use material seu, ou material que você tem permissão para usar, principalmente no caso de rostos e vozes.

Quadro-chave de vídeo cinematográfico em 16:9, um tríptico de três painéis separados por faixas escuras finas: à esquerda, um retrato de estúdio simples de um jovem de suéter de tricô azul-marinho diante de um fundo cinza; no centro, um storyboard a lápis de uma câmera em travelling pelo cais de um porto; à direita, o mesmo jovem com o mesmo suéter azul-marinho cantando no cais ao entardecer enquanto a câmera se move ao lado dele, com barcos atracados e postes de luz atrás. Mesmo rosto e mesma roupa em todos os painéis, paleta azul-profundo e coral, sem texto, sem logotipos.






