

DreamX-Creator
#22 in Text-zu-VideoUnknown · 2× · zuletzt 04. Sept. 2026
35
Momentum
DreamX-Creator 1.0 ist ein von Alibabas DreamX-Team (AMAP-ML) veröffentlichtes Open-Source-Forschungsprojekt zur nativen gemeinsamen Audio-Video-Generierung. Basierend auf einem 7B-Parameter-Generator erzeugt das System aus einem Startbild und einem Textprompt synchronisierte Video- und Audiostreams mittels Gated Cross-Modal Attention. Ein nachgeschalteter "Autoregressive 1-Step 2K Refiner" (SR-DiT, 5B Parameter) hebt das erzeugte Video anschließend auf 2K-Auflösung an, ohne Inhalt, Bewegung oder Audio-Synchronität zu verändern. Modellgewichte, Code und technischer Report sind öffentlich auf GitHub, Hugging Face und arXiv verfügbar.
Momentum-Verlauf
08.06.06.09.
Features
| Fine-tuning | Progressive Joint Training mit zwei Audio-Video-Pretraining-Stufen plus High-Quality Finetuning; zusätzlich Audio-Video Reinforcement Learning mit Modality-Aware Multimodal Feedback |
| Generierungszeit | 2K-Refiner benötigt nur eine Denoising-Auswertung pro zeitlichem Chunk (One-Step-Refinement) |
| Lizenz | Apache License 2.0 |
| Max-Auflösung | 2K (via Autoregressive 1-Step 2K Refinement) |
| Plattform | Modellgewichte über Hugging Face und ModelScope; Code auf GitHub |
| Preis | Kostenlos / Open Source (keine kommerzielle Preisseite gefunden) |
| Release-Datum | arXiv-Report veröffentlicht am 31. August 2026; GitHub-Repo initialisiert am 1. September 2026 |