MiniMax H3 是一款通用的多模態影片模型,圍繞四個重點構建:4 到 15 秒片段、2K 輸出、混合參考輸入與精準編輯。
圖像、影片與音訊會一起放入同一個請求中。H3 會讀取每個參考中的角色、動作、情緒、鏡頭語言、風格與創作意圖,然後將它們融合為一個連貫的視聽場景,而不是仍需你自行拼接的原始素材。
編輯是這個模型的另一半。指向角色、物件、場景、聲音或節奏本身,H3 就會精準修改該部分,按照詳細指令執行,同時保持其他一切不變——因此你是在既有素材上反覆迭代,而不是整個鏡頭重做。
這種組合非常適合真實商業製作:廣告、品牌影片、電商、短劇與遊戲內容。H3 會將字幕、品牌標記與 UI 元素作為設計的一部分來構成,而不是事後貼上去,這也是它相較其他模型最強的地方。