

Stable Audio Open
#22 in KI-MusikgenerierungStability Ai · seit 2024-06-05 · 2× · zuletzt 30. Juni 2026
Stable Audio Open ist ein Open-Source-Text-zu-Audio-Modell von Stability AI, das im Juni 2024 veröffentlicht wurde. Es erzeugt variable-length Stereo-Audioclips von bis zu 47 Sekunden Länge bei 44,1 kHz, spezialisiert auf Sound-Effekte, Drumbeats, Instrument-Riffs und Produktionselemente statt vollständige Songs oder Gesang. Das Modell basiert auf einer latenten Diffusionsarchitektur mit Transformer-Komponenten und T5-Textkonditionierung und wurde ausschließlich mit Creative-Commons-lizenzierten Aufnahmen von Freesound und Free Music Archive trainiert. Die Modellgewichte sind auf Hugging Face verfügbar und stehen unter der Stability AI Community License für Forschung, nicht-kommerzielle sowie limitierte kommerzielle Nutzung.
Features
| Echtzeit-Streaming | Kein Echtzeit-Streaming; Generierung erfolgt offline/batch (max. 47s Ausgabe) |
| Latenz | Autoencoder-Latent-Rate von 21,5 Hz für Musik- und Audiogenerierung |
| Lizenz | Stability AI Community License (Forschung, nicht-kommerziell, limitiert kommerziell) |
| Max. Musikdauer (Sekunden) | 47 Sekunden (variables Stereo-Audio bei 44,1 kHz) |
| Plattform | Modellgewichte auf Hugging Face; Code/Training über stable-audio-tools auf GitHub |
| Preis | Modellgewichte kostenlos; kommerzielle Nutzung frei bis 1 Mio. USD Jahresumsatz, darüber Enterprise-Lizenz nötig |
| Release-Datum | 5. Juni 2024 (Ankündigung); Forschungspaper am 19./22. Juli 2024 |
| Sprachen | Nur Englisch (Prompt-Verständnis), andere Sprachen mit schlechterer Performance |
| Unterstützte Eingabeformate | Texteingabe (Text-Prompts auf Englisch) mit optionaler Zeitkonditionierung (seconds_start, seconds_total); Audio-Variationen und Style-Transfer von Audio-Samples ebenfalls möglich |
| Voice-Cloning | Nicht unterstützt – Modell kann keine realistischen Vocals/Gesang erzeugen |
| Vokal-/Gesang-Qualität | Nicht unterstützt – das Modell ist nicht in der Lage, realistische Vokale oder verständliche Sprache/Gesang zu erzeugen |