Referencias de imagen, video y audio en un solo prompt
MiniMax H3 admite hasta 9 imágenes de referencia, 3 videos de referencia y 3 clips de audio en una generación, y los lee juntos en lugar de uno por uno. En el ejemplo de la propia MiniMax, se pide al modelo que copie el movimiento de cámara de un video, que haga cantar al personaje de una imagen y que ajuste la voz a un clip de audio, todo en una sola frase. En el prompt dices para qué sirve cada referencia: «mantén la cara y el suéter azul marino del retrato, sigue el travelling del video de referencia y haz que cante la melodía del clip de audio en el puerto al atardecer». Sin esa frase, el modelo tiene que adivinar qué entrada controla qué. Las referencias y un primer o último fotograma no se pueden combinar en una misma generación, así que elige un enfoque por clip, y selecciona H3 en el menú de modelos para los clips basados en referencias. Usa tu propio material, o material que tengas permiso para usar, sobre todo con caras y voces.

Fotograma clave de video cinematográfico en 16:9, un tríptico de tres paneles separados por finas franjas oscuras: a la izquierda, un retrato de estudio sencillo de un joven con un suéter de punto azul marino sobre un fondo gris; en el centro, un storyboard a lápiz de una cámara que avanza en travelling por el muelle de un puerto; a la derecha, el mismo joven con el mismo suéter azul marino cantando en el muelle al atardecer mientras la cámara se mueve a su lado, con barcos amarrados y farolas detrás. Misma cara y misma ropa en todos los paneles, paleta azul intenso y coral, sin texto, sin logotipos.






