MiniMax H3 ist ein allgemeines multimodales Videomodell, das auf vier Dingen aufbaut: 4- bis 15-sekündigen Clips, 2K-Ausgabe, gemischte Referenzeingaben und präzise Bearbeitung.
Bilder, Videos und Audio werden zusammen in einer einzigen Anfrage übergeben. H3 liest die Figuren, Bewegung, Emotionen, die Kamerasprache, den Stil und die kreative Absicht in jeder Referenz und verschmilzt sie dann zu einer kohärenten audiovisuellen Szene statt zu Rohmaterial, das du erst noch zusammensetzen musst.
Bearbeitung ist die andere Hälfte des Modells. Zeige auf eine Figur, ein Objekt, eine Szene, einen Ton oder sogar das Tempo selbst, und H3 ändert genau das, folgt detaillierten Anweisungen und lässt alles andere intakt — so iterierst du auf vorhandenem Material statt die ganze Aufnahme neu zu erstellen.
Diese Kombination eignet sich für echte kommerzielle Produktionen: Werbung, Brand-Filme, E-Commerce, Kurzdramen und Gaming-Content. H3 komponiert Untertitel, Markenzeichen und UI-Elemente als Teil des Designs statt sie nur darüberzulegen, und genau dort ist es im Vergleich zu anderen Modellen am stärksten.