Bilde-, video- og lydreferanser i én prompt
MiniMax H3 tar imot opptil 9 referansebilder, 3 referansevideoer og 3 lydklipp i én generering og leser dem samlet i stedet for én om gangen. I et eksempel fra MiniMax selv blir modellen i én setning bedt om å kopiere kamerabevegelsen fra en video, la karakteren fra et bilde synge og tilpasse vokalen til et lydklipp. Det er i prompten du sier hva hver referanse skal brukes til: «behold ansiktet og den marineblå genseren fra portrettet, følg kamerakjøringen i referansevideoen, og la ham synge melodien fra lydklippet på havna i skumringen». Uten den setningen må modellen gjette hvilken inndata som styrer hva. Referanser og et første eller siste bilde kan ikke kombineres i én generering, så velg én fremgangsmåte per klipp, og velg H3 i modellmenyen for klipp som bygger på referanser. Bruk ditt eget materiale eller materiale du har tillatelse til å bruke, særlig når det gjelder ansikter og stemmer.

Filmatisk nøkkelbilde for video i 16:9, et triptyk med tre felt skilt av tynne mørke striper: til venstre et enkelt studioportrett av en ung mann i en marineblå strikkegenser mot en grå bakgrunn; i midten en storyboardskisse i blyant av et kamera som kjører langs en havnekai; til høyre den samme unge mannen i den samme marineblå genseren som synger på havnekaia i skumringen mens kameraet beveger seg ved siden av ham, fortøyde båter og lamper bak. Samme ansikt og klær i alle feltene, palett i dyp blå og korall, ingen tekst, ingen logoer.






