Synthszr Charts — die großen AI-Marken im Wettkampf ums Podium
synthszr charts

DreamX-Creator

#22 in Text-zu-Video

Unknown · 2× · zuletzt 04. Sept. 2026

35
Momentum

DreamX-Creator 1.0 ist ein von Alibabas DreamX-Team (AMAP-ML) veröffentlichtes Open-Source-Forschungsprojekt zur nativen gemeinsamen Audio-Video-Generierung. Basierend auf einem 7B-Parameter-Generator erzeugt das System aus einem Startbild und einem Textprompt synchronisierte Video- und Audiostreams mittels Gated Cross-Modal Attention. Ein nachgeschalteter "Autoregressive 1-Step 2K Refiner" (SR-DiT, 5B Parameter) hebt das erzeugte Video anschließend auf 2K-Auflösung an, ohne Inhalt, Bewegung oder Audio-Synchronität zu verändern. Modellgewichte, Code und technischer Report sind öffentlich auf GitHub, Hugging Face und arXiv verfügbar.

Momentum-Verlauf
08.06.06.09.

Features

Fine-tuningProgressive Joint Training mit zwei Audio-Video-Pretraining-Stufen plus High-Quality Finetuning; zusätzlich Audio-Video Reinforcement Learning mit Modality-Aware Multimodal Feedback
Generierungszeit2K-Refiner benötigt nur eine Denoising-Auswertung pro zeitlichem Chunk (One-Step-Refinement)
LizenzApache License 2.0
Max-Auflösung2K (via Autoregressive 1-Step 2K Refinement)
PlattformModellgewichte über Hugging Face und ModelScope; Code auf GitHub
PreisKostenlos / Open Source (keine kommerzielle Preisseite gefunden)
Release-DatumarXiv-Report veröffentlicht am 31. August 2026; GitHub-Repo initialisiert am 1. September 2026

Weitere Produkte in dieser Kategorie: Text-zu-Video

Belege (2)

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.