Referencje z obrazów, wideo i audio w jednym prompcie
MiniMax H3 przyjmuje w jednym generowaniu do 9 obrazów referencyjnych, 3 filmów referencyjnych i 3 klipów audio i odczytuje je łącznie, a nie po kolei. We własnym przykładzie MiniMax prosi model w jednym zdaniu, by skopiował ruch kamery z filmu, kazał postaci z obrazu zaśpiewać i dopasował wokal do klipu audio. To w prompcie mówisz, do czego służy każda referencja: „zachowaj twarz i granatowy sweter z portretu, powtórz jazdę kamery z filmu referencyjnego i niech zaśpiewa melodię z klipu audio w porcie o zmierzchu”. Bez takiego zdania model musi zgadywać, które wejście za co odpowiada. Referencji nie da się połączyć z pierwszą lub ostatnią klatką w jednym generowaniu, więc przy każdym klipie wybierz jedno podejście, a do klipów opartych na referencjach wybierz w menu modeli H3. Używaj własnych materiałów albo takich, na które masz zgodę, zwłaszcza gdy chodzi o twarze i głosy.

Filmowa klatka kluczowa wideo 16:9, tryptyk z trzech paneli rozdzielonych cienkimi ciemnymi pasami: po lewej prosty studyjny portret młodego mężczyzny w granatowym swetrze z dzianiny na szarym tle; pośrodku ołówkowy szkic scenorysu z kamerą jadącą wzdłuż portowego nabrzeża; po prawej ten sam młody mężczyzna w tym samym granatowym swetrze śpiewa na nabrzeżu o zmierzchu, a kamera przesuwa się obok niego, w tle zacumowane łodzie i latarnie. Ta sama twarz i ubranie na wszystkich panelach, paleta głębokiego granatu i koralu, bez tekstu i logo.






