Riferimenti di immagini, video e audio in un solo prompt
MiniMax H3 accetta fino a 9 immagini di riferimento, 3 video di riferimento e 3 clip audio in una generazione, e li legge insieme invece che uno alla volta. Nell'esempio della stessa MiniMax, al modello si chiede in un'unica frase di copiare il movimento di camera di un video, far cantare il personaggio di un'immagine e accordare la voce a una clip audio. Nel prompt dici a cosa serve ogni riferimento: «mantieni il viso e il maglione blu navy del ritratto, segui la carrellata del video di riferimento e fagli cantare la melodia della clip audio sul porto al tramonto». Senza questa frase il modello deve indovinare quale input controlla cosa. I riferimenti e un primo o ultimo fotogramma non si possono combinare nella stessa generazione, quindi scegli un approccio per clip, e seleziona H3 nel menu dei modelli per le clip costruite sui riferimenti. Usa materiale tuo, o materiale che hai il permesso di usare, soprattutto per volti e voci.

Fotogramma chiave video cinematografico in 16:9, un trittico di tre pannelli separati da sottili bordi scuri: a sinistra, un semplice ritratto in studio di un giovane con un maglione di maglia blu navy su sfondo grigio; al centro, uno storyboard a matita di una camera che si muove in carrellata lungo una banchina del porto; a destra, lo stesso giovane con lo stesso maglione blu navy che canta sulla banchina al tramonto mentre la camera si muove accanto a lui, con barche ormeggiate e lampioni alle spalle. Stesso viso e stessi vestiti in tutti i pannelli, palette blu intenso e corallo, niente testo, niente loghi.






