Synthszr Charts — die großen AI-Marken im Wettkampf ums Podium
synthszr charts

Unknown · v4 · tts · 2× · zuletzt 24. Aug. 2026

36
Momentum

Confucius4-TTS ist ein Open-Source-Sprachsynthesemodell von NetEase Youdao, das auf einer Kombination aus Sprach-Encoder und großem Sprachmodell (LLM) basiert. Das System ermöglicht Zero-Shot-Voice-Cloning ohne Referenztext und überträgt eine geklonte Stimme akzentfrei über 14 Sprachen hinweg, wobei auch die emotionale Färbung erhalten bleibt. Es wurde am 23. Juni 2026 als Teil des "Zi Yue 4.0"-Modellsystems veröffentlicht und unter der Apache-2.0-Lizenz mit vollständigen Modellgewichten frei verfügbar gemacht.

Momentum-Verlauf
26.05.24.08.

Features

Echtzeit-StreamingUnterstützt Streaming- und Non-Streaming-Inferenz (PCM-Audio-Stream via API)
LatenzFirst-Packet-Latenz von 85 ms (Output-Streaming) bzw. 54 ms (Dual-Streaming)
LizenzApache 2.0, keine Einschränkungen für kommerzielle Nutzung
PlattformGitHub, Hugging Face, Online-Demo (Gradio) unter confucius4-tts.youdao.com
PreisKostenlos (Open Source, Modellgewichte frei zum Download)
Release-Datum23. Juni 2026
Sprachen14 Sprachen: Chinesisch, Englisch, Japanisch, Koreanisch, Deutsch, Französisch, Spanisch, Indonesisch, Italienisch, Thai, Portugiesisch, Russisch, Malaiisch, Vietnamesisch
Voice-CloningZero-Shot-Voice-Cloning ohne Referenztext, ab ca. 3 Sekunden Referenzaudio

Weitere Produkte in dieser Kategorie: Sprachsynthese (TTS)

Belege (2)

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.