MiniMax H3 は、4〜15 秒のクリップ、2K 出力、複合参照入力、精密編集という 4 つを中心に構築された汎用マルチモーダル動画モデルです。
画像、動画、音声は 1 回のリクエストにまとめて入力します。H3 は各参照内のキャラクター、動き、感情、カメラ言語、スタイル、創作意図を読み取り、後で自分で組み立てる必要のある生素材ではなく、ひとつの一貫した映像音声シーンとして融合します。
編集はこのモデルのもう半分です。キャラクター、オブジェクト、シーン、音、あるいはテンポそのものを指し示すと、H3 は詳細な指示に従ってその部分だけを正確に変更し、他の要素はすべて維持します。つまり、ショット全体を作り直すのではなく、既存の映像を反復改善していくことができます。
この組み合わせは、広告、ブランド映像、Eコマース、短編ドラマ、ゲームコンテンツなど、実際の商用制作に適しています。H3 は字幕、ブランドマーク、UI 要素を後付けではなくデザインの一部として構成するため、他のモデルに対して最も強みを発揮します。