

Confucius4-TTS
#2 in Sprachsynthese (TTS)Unknown · v4 · tts · 2× · zuletzt 24. Aug. 2026
36
Momentum
Confucius4-TTS ist ein Open-Source-Sprachsynthesemodell von NetEase Youdao, das auf einer Kombination aus Sprach-Encoder und großem Sprachmodell (LLM) basiert. Das System ermöglicht Zero-Shot-Voice-Cloning ohne Referenztext und überträgt eine geklonte Stimme akzentfrei über 14 Sprachen hinweg, wobei auch die emotionale Färbung erhalten bleibt. Es wurde am 23. Juni 2026 als Teil des "Zi Yue 4.0"-Modellsystems veröffentlicht und unter der Apache-2.0-Lizenz mit vollständigen Modellgewichten frei verfügbar gemacht.
Momentum-Verlauf
26.05.24.08.
Features
| Echtzeit-Streaming | Unterstützt Streaming- und Non-Streaming-Inferenz (PCM-Audio-Stream via API) |
| Latenz | First-Packet-Latenz von 85 ms (Output-Streaming) bzw. 54 ms (Dual-Streaming) |
| Lizenz | Apache 2.0, keine Einschränkungen für kommerzielle Nutzung |
| Plattform | GitHub, Hugging Face, Online-Demo (Gradio) unter confucius4-tts.youdao.com |
| Preis | Kostenlos (Open Source, Modellgewichte frei zum Download) |
| Release-Datum | 23. Juni 2026 |
| Sprachen | 14 Sprachen: Chinesisch, Englisch, Japanisch, Koreanisch, Deutsch, Französisch, Spanisch, Indonesisch, Italienisch, Thai, Portugiesisch, Russisch, Malaiisch, Vietnamesisch |
| Voice-Cloning | Zero-Shot-Voice-Cloning ohne Referenztext, ab ca. 3 Sekunden Referenzaudio |