

Sonic-3.5
#13 in Sprachsynthese (TTS)Cartesia · v3.5 · seit 2026-06-16 · 9× · zuletzt 30. Juni 2026
12
Momentum
Sonic-3.5 ist das Text-to-Speech-Modell von Cartesia für Echtzeit-Sprachsynthese in Voice-Agents. Es wurde am 16. Juni 2026 zusammen mit dem Transkriptions-Modell Ink-2 als gemeinsamer Voice-Stack veröffentlicht. Das Modell erreicht laut Hersteller eine Sprachausgabe-Latenz von unter 90ms, unterstützt nativ 42 Sprachen und wird auf Benchmark-Plattformen wie Artificial Analysis als führendes TTS-Modell gelistet. Es bietet Instant-Voice-Cloning, Voice-Changer- und Lokalisierungsfunktionen und ist über die Cartesia-API sowie Partner wie LiveKit nutzbar.
Momentum-Verlauf
19.05.17.08.
Features
| Echtzeit-Streaming | Ja, für Echtzeit-Sprachagenten mit bidirektionalem Streaming ausgelegt |
| Latenz | Unter 90ms Sprachausgabe-Latenz (Time-to-first-audio); laut Artificial Analysis ca. 82ms |
| Lizenz | Kommerzielle Nutzungslizenz ab Pro-Plan (kostenpflichtig); Free-Tier nicht für kommerzielle Nutzung vorgesehen |
| Plattform | Cloud-API von Cartesia (Modell-ID sonic-3.5), zusätzlich verfügbar über Partner wie LiveKit; Deployment in Cloud, On-Premise und On-Device möglich |
| Preis | Ab $5/Monat (Pro-Plan, ~133 Minuten TTS/Monat); Free-Tier $0/Monat (20.000 Credits); Startup $49/Monat; Scale $299/Monat; API-Nutzung u.a. $0,03/Min bzw. $50 pro 1 Mio. Zeichen (LiveKit) |
| Release-Datum | 16. Juni 2026 |
| Sprachen | 42 Sprachen nativ, u.a. Englisch, Hindi, Spanisch, Französisch, Deutsch, Japanisch, Hebräisch |
| Voice-Cloning | Instant Voice Cloning mit nur 10 Sekunden Audio; zudem Professional Voice Cloning für höhere Qualität verfügbar |