

MOSS-TTS
#28 in Sprachsynthese (TTS)Moss · seit 10. Februar 2026 (MOSS-TTS Family); MOSS-TTS-Nano: 10. April 2026 · 3× · zuletzt 29. Juni 2026
MOSS-TTS ist eine Open-Source-Familie von Sprach- und Klangsynthese-Modellen von MOSI.AI und dem OpenMOSS-Team (Shanghai Innovation Institution, Fudan-NLP-Lab). Die Familie umfasst mehrere spezialisierte Modelle für hochwertige Langform-Sprachgenerierung, Mehrsprecher-Dialoge, Stimm-Design, Umgebungsgeräusche sowie Echtzeit-Streaming-TTS. Ergänzend existiert mit MOSS-TTS-Nano ein sehr kleines Modell (0,1 Mrd. Parameter) für CPU-basierte Echtzeit-Sprachgenerierung mit 48-kHz-Stereo-Ausgabe in bis zu 20 Sprachen. Alle Modelle stehen unter der Apache-2.0-Lizenz und sind für kommerzielle Nutzung freigegeben.
Features
| Echtzeit-Streaming | Ja, Streaming-Ausgabe mit niedriger First-Token-Latenz, inkl. automatischem Chunking langer Texte |
| Latenz | MOSS-TTS-Realtime: ca. 180 ms First-Byte-Latenz; Nano: Echtzeitfaktor < 1.0 auf 4 CPU-Kernen |
| Lizenz | Apache License 2.0 |
| Plattform | Open-Source auf GitHub/Hugging Face; läuft lokal (GPU für Flagship 8B, CPU für Nano); Unterstützung für vLLM-Omni, SGLang, ComfyUI, mlx-audio, ONNX, llama.cpp |
| Preis | Kostenlos, Open-Source-Modellgewichte (Apache-2.0) zum Selbst-Hosten |
| Release-Datum | MOSS-TTS Family: 10. Februar 2026; MOSS-TTS-Nano: 10. April 2026 |
| Sprachen | 20 Sprachen (u.a. Chinesisch, Englisch, Deutsch, Spanisch, Französisch, Japanisch, Koreanisch, Arabisch, Persisch) |
| Voice-Cloning | Zero-Shot Voice Cloning aus kurzer Referenzaudio (3-15 Sekunden), keine Feinabstimmung nötig |