

FastH3 v1
#36 in Open-Source-SprachmodelleHao Ai Lab · v3 · v1 · seit 27. August 2026 (Blog-Announcement "FastH3 Preview v1"), vorherige Preview-Version v0.2 am 23. August 2026 · 3× · zuletzt 31. Aug. 2026
FastH3 v1 (auch "FastH3 Preview v1") ist ein von Hao AI Lab (UC San Diego) im Rahmen des FastVideo-Frameworks in Zusammenarbeit mit Nuva Lab und dem NVIDIA-FastGen-Team veröffentlichtes, offen gewichtetes Text-zu-Video-und-Audio-Modell. Es handelt sich um eine 4-Schritt-DMD2-Destillation des MiniMax-H3-Basismodells (33B Parameter, dual-modal Video+Audio Diffusion Transformer) mit 90% sparsamer Aufmerksamkeit (VSA), die die ursprünglich 49-50 Transformer-Durchläufe auf 4 reduziert. Auf einer einzelnen NVIDIA-Blackwell-GPU (B200) erreicht es bis zu 14-fache Beschleunigung gegenüber dem dichten Basismodell und erzeugt 15s 768p-Video mit synchronisiertem Audio in unter 13-47 Sekunden. Das Modell erbt die MiniMax H3 Community License, die die Nutzung in den USA, der EU, UK und Südkorea einschrä
Features
| Key-Benchmark (%) | 14,38x schneller als dichtes Basismodell (15s-Clip auf 1x B200, 1344x768, 24 FPS); 45% Präferenz/Neutralität ggü. MiniMax H3 in Nutzerstudie |
| Lizenz | MiniMax H3 Community License (geerbt vom Basismodell; Nutzung in USA, EU, UK, Südkorea lokal eingeschränkt) |
| Multimodalität | Text-zu-Video-und-Audio (T2VA): erzeugt synchronisiertes Video und Audio aus Text in einem Schritt |
| Plattform | Läuft über FastVideo-Framework auf NVIDIA-GPUs (u.a. B200/Blackwell), Checkpoints auf Hugging Face, Code auf GitHub |
| Release-Datum | 27. August 2026 (Preview v1); v0.2 am 23. August 2026 |