Ảnh, video và âm thanh tham chiếu trong một prompt
MiniMax H3 nhận tới 9 ảnh tham chiếu, 3 video tham chiếu và 3 đoạn âm thanh trong một lần tạo, và đọc chúng cùng lúc chứ không lần lượt từng cái. Trong ví dụ của chính MiniMax, mô hình được yêu cầu trong một câu duy nhất: sao chép chuyển động máy quay từ một video, cho nhân vật trong một bức ảnh cất tiếng hát và khớp giọng hát với một đoạn âm thanh. Prompt là nơi bạn nói rõ mỗi tham chiếu dùng để làm gì: "giữ khuôn mặt và chiếc áo len xanh navy từ ảnh chân dung, đi theo chuyển động dolly trong video tham chiếu, và để anh ấy hát giai điệu trong đoạn âm thanh trên bến cảng lúc chạng vạng". Thiếu câu đó, mô hình phải tự đoán đầu vào nào điều khiển yếu tố nào. Không thể kết hợp tham chiếu với khung hình đầu hoặc khung hình cuối trong một lần tạo, nên mỗi clip hãy chọn một cách làm, và chọn H3 trong menu mô hình cho những clip dựa trên tham chiếu. Hãy dùng tư liệu của chính bạn hoặc tư liệu bạn được phép sử dụng, nhất là với khuôn mặt và giọng nói.

Khung hình chính của video điện ảnh 16:9, bộ ba khung tranh ngăn cách bởi những dải tối mảnh: bên trái, ảnh chân dung studio đơn giản của một chàng trai trẻ mặc áo len dệt kim xanh navy trên nền xám; ở giữa, bản phác thảo storyboard bằng bút chì về một máy quay chạy dọc cầu cảng; bên phải, cũng chàng trai đó trong chiếc áo len xanh navy ấy đang hát trên cầu cảng lúc chạng vạng khi máy quay di chuyển song song bên cạnh, phía sau là thuyền neo và những ngọn đèn. Khuôn mặt và trang phục nhất quán ở cả ba khung, bảng màu xanh thẫm và san hô, không chữ, không logo.






