Референсы из изображений, видео и аудио в одном промпте
MiniMax H3 принимает в одной генерации до 9 референсных изображений, 3 референсных видео и 3 аудиоклипов и воспринимает их вместе, а не по очереди. В собственном примере MiniMax модель одной фразой просят повторить движение камеры из видео, заставить петь персонажа с изображения и подогнать вокал под аудиоклип. Именно в промпте вы говорите, для чего нужен каждый референс: «сохрани лицо и тёмно-синий свитер с портрета, повтори проезд камеры из референсного видео, и пусть он поёт мелодию из аудиоклипа в гавани в сумерках». Без такой фразы модели приходится угадывать, какой вход за что отвечает. Референсы нельзя сочетать с первым или последним кадром в одной генерации, так что для каждого ролика выбирайте один подход, а для роликов на референсах выбирайте в меню моделей H3. Используйте свои материалы или те, на которые у вас есть разрешение, особенно когда речь о лицах и голосах.

Кинематографичный ключевой кадр видео 16:9: триптих из трёх панелей, разделённых тонкими тёмными полосами: слева — простой студийный портрет молодого человека в тёмно-синем вязаном свитере на сером фоне; в центре — карандашная раскадровка, где камера проезжает вдоль причала в гавани; справа — тот же молодой человек в том же тёмно-синем свитере поёт на причале в сумерках, а камера движется рядом с ним, позади пришвартованные лодки и фонари. Одно и то же лицо и одежда на всех панелях, палитра глубокого синего и кораллового, без текста и логотипов.






