- Multimodale Eingaben aus Bild, Video, Audio und Text
- Unterstützung für bis zu neun Bilder, drei Videos und drei Audiodateien
- @-Referenzsystem zur Zuweisung von Asset-Rollen
- Konsistenz von Figur, Produkt, Stil und Szene
- Replikation von Figurenbewegungen und Kamerabewegungen
- Videoverlängerung und Long-Take-Generierung
- Charakteraustausch und gezielte Videobearbeitung
- Handlungsvervollständigung aus minimalen Eingaben
- Lip-Sync, Soundeffekte und Audio-Treue
- Automatische Synchronisation von Musik und visuellen Beats