ใช้ภาพ วิดีโอ และเสียงอ้างอิงในพรอมต์เดียว
MiniMax H3 รับภาพอ้างอิงได้สูงสุด 9 ภาพ วิดีโออ้างอิง 3 คลิป และคลิปเสียง 3 คลิปในการสร้างครั้งเดียว และอ่านทั้งหมดไปพร้อมกัน ไม่ใช่ทีละอย่าง ในตัวอย่างของ MiniMax เอง โมเดลถูกสั่งในประโยคเดียวให้เลียนแบบการเคลื่อนกล้องจากวิดีโอ ให้ตัวละครจากภาพร้องเพลง และให้เสียงร้องตรงกับคลิปเสียง พรอมต์คือที่ที่คุณบอกว่าข้อมูลอ้างอิงแต่ละชิ้นมีไว้ทำอะไร เช่น "คงใบหน้าและเสื้อสเวตเตอร์สีกรมท่าจากภาพพอร์เทรต ตามการเคลื่อนกล้องแบบดอลลี่ในวิดีโออ้างอิง และให้เขาร้องทำนองจากคลิปเสียงที่ท่าเรือยามพลบค่ำ" ถ้าไม่มีประโยคนี้ โมเดลต้องเดาเองว่าอินพุตไหนควบคุมอะไร ข้อมูลอ้างอิงใช้ร่วมกับเฟรมแรกหรือเฟรมสุดท้ายในการสร้างครั้งเดียวไม่ได้ จึงต้องเลือกวิธีเดียวต่อคลิป และสำหรับคลิปที่สร้างจากข้อมูลอ้างอิงให้เลือก H3 ในเมนูโมเดล ใช้ฟุตเทจของคุณเองหรือฟุตเทจที่ได้รับอนุญาตแล้ว โดยเฉพาะเมื่อเป็นใบหน้าและเสียงพูด

คีย์เฟรมวิดีโอสไตล์ภาพยนตร์ 16:9 ภาพสามส่วนคั่นด้วยแถบมืดบาง ๆ ซ้าย ภาพพอร์เทรตในสตูดิโอเรียบ ๆ ของชายหนุ่มในเสื้อสเวตเตอร์ถักสีกรมท่าบนฉากหลังสีเทา กลาง ภาพร่างสตอรีบอร์ดด้วยดินสอของกล้องที่เคลื่อนแบบดอลลี่เลียบท่าเทียบเรือ ขวา ชายหนุ่มคนเดิมในเสื้อสเวตเตอร์สีกรมท่าตัวเดิมกำลังร้องเพลงบนท่าเทียบเรือยามพลบค่ำ ขณะกล้องเคลื่อนไปข้าง ๆ เขา มีเรือที่จอดผูกไว้และโคมไฟอยู่ด้านหลัง ใบหน้าและเสื้อผ้าเหมือนกันทุกส่วน โทนสีน้ำเงินเข้มและคอรัล ไม่มีข้อความ ไม่มีโลโก้






