- text-to-image-Generierung
- image-to-image-Bearbeitung und Stiltransfer
- Intelligentes Freistellen von Bildern
- Mehrsprachige Textdarstellung
- 4K-Bildausgabe
- text-to-video-Generierung
- frame-to-frame-Video-Generierung
- Kinematische Kamerabewegung und Beleuchtung
- Musikgenerierung in 40+ Stilen
- Automatische Harmonie und Liedtext-Generierung
- Kommerzieller MP3-Export
- Voice Cloning aus 10–30-sekündigen Samples
- Text-to-speech in 80+ Sprachen
- Emotionstags für Stimm-Ausgabe
- Gemeinsamer Workflow für Bild, Video, Musik und Stimme