

Sonic 3.6
#2 in Sprachsynthese (TTS)Cartesia · v3.6 · seit 17. August 2026 · 2× · zuletzt 20. Aug. 2026
36
Momentum
Sonic-3.6 ist das aktuelle Echtzeit-Text-to-Speech-Modell von Cartesia, veröffentlicht am 17. August 2026 als Nachfolger von Sonic-3.5. Das Modell basiert auf State-Space-Modellen statt Transformern und erreicht laut Anbieter eine Sprachlatenz von unter 90ms bis zum ersten Audio-Output. Es unterstützt 44 Sprachen, bietet Instant- und Professional-Voice-Cloning und führt aktuell beide Artificial-Analysis-Speech-Arena-Leaderboards (Provider Voice und Controlled Voice) an. Das Modell ist als gehostete API in der Beta-Phase verfügbar, nicht als selbst-hostbare Gewichte.
Momentum-Verlauf
22.05.20.08.
Features
| Echtzeit-Streaming | Ja, Streaming-TTS-Modell auf Basis von State Space Models statt Transformern |
| Latenz | Unter 90ms Time-to-First-Audio (Herstellerangabe) |
| Lizenz | Kommerzielle Nutzung ab Pro-Plan ($5/Monat) enthalten; Free-Tier ohne Kommerzlizenz |
| Plattform | Gehostete API (Beta), kein Self-Hosting der Modellgewichte |
| Preis | Ab $5/Monat (Pro-Plan, Commercial License); Free-Tier $0 (20.000 Credits/Monat, nicht kommerziell); Startup $49/Monat; Scale $299/Monat |
| Release-Datum | 17. August 2026 |
| Sprachen | 44 Sprachen |
| Voice-Cloning | Instant Voice Cloning (ab Pro-Plan) und Professional Voice Cloning (ab Startup-Plan) verfügbar |