画像・動画・音声の参照を1つのプロンプトで
MiniMax H3 は1回の生成で最大 9 枚の参照画像、3 本の参照動画、3 本の音声クリップを受け付け、1つずつではなくまとめて読み取ります。MiniMax 自身の例では、動画のカメラワークをまね、画像のキャラクターに歌わせ、歌声を音声クリップに合わせるという指示を、1つの文で出しています。それぞれの参照を何に使うかは、プロンプトで伝えます。たとえば「ポートレートの顔と紺のセーターはそのままに、参照動画のドリー移動をなぞり、夕暮れの港で音声クリップのメロディーを歌わせる」のように書きます。この一文がないと、どの入力が何を決めるのかをモデルが推測するしかありません。参照素材と最初・最後のフレームは1回の生成で併用できないので、クリップごとにどちらかを選び、参照素材を使うクリップではモデルメニューで H3 を選んでください。素材は自分のものか使用許可を得たものを使い、特に顔と声には注意しましょう。

映画的な16:9の動画キーフレーム。細い暗色の区切りで分けた3枚の三連画。左は、グレーの背景の前に立つ紺のニットセーターの若い男性を撮った、飾り気のないスタジオポートレート。中央は、港の岸壁に沿ってカメラがドリー移動する様子を描いた鉛筆の絵コンテ。右は、同じ紺のセーターを着た同じ若い男性が夕暮れの港の岸壁で歌い、カメラが横に並んで動き、背後には係留された船と街灯がある。3つのコマで顔と服装は統一、深い青とコーラルの配色、文字なし、ロゴなし。






