Billed-, video- og lydreferencer i én prompt
MiniMax H3 tager imod op til 9 referencebilleder, 3 referencevideoer og 3 lydklip i én generering og læser dem samlet i stedet for én ad gangen. I et eksempel fra MiniMax selv bliver modellen i én sætning bedt om at kopiere kamerabevægelsen fra en video, lade figuren fra et billede synge og tilpasse vokalen til et lydklip. Det er i prompten, du fortæller, hvad hver reference skal bruges til: „behold ansigtet og den marineblå sweater fra portrættet, følg kamerakørslen i referencevideoen, og lad ham synge melodien fra lydklippet på havnen i skumringen“. Uden den sætning må modellen gætte, hvilket input der styrer hvad. Referencer og et første eller sidste billede kan ikke kombineres i én generering, så vælg én tilgang pr. klip, og vælg H3 i modelmenuen til klip, der bygger på referencer. Brug dit eget materiale eller materiale, du har tilladelse til at bruge, især når det gælder ansigter og stemmer.

Filmisk 16:9-videonøglebillede, et triptykon med tre felter adskilt af tynde mørke streger: til venstre et enkelt studieportræt af en ung mand i en marineblå strikket sweater mod en grå baggrund; i midten en storyboard-skitse i blyant af et kamera, der kører langs en havnekaj; til højre den samme unge mand i den samme marineblå sweater, der synger på havnekajen i skumringen, mens kameraet bevæger sig ved siden af ham, fortøjede både og lamper bagved. Samme ansigt og tøj i alle felter, palet i dyb blå og koral, ingen tekst, ingen logoer.






