Synthszr Charts — die großen AI-Marken im Wettkampf ums Podium
synthszr charts
cartesia

Cartesia · v3.5 · seit 2026-06-16 · 9× · zuletzt 30. Juni 2026

12
Momentum

Sonic-3.5 ist das Text-to-Speech-Modell von Cartesia für Echtzeit-Sprachsynthese in Voice-Agents. Es wurde am 16. Juni 2026 zusammen mit dem Transkriptions-Modell Ink-2 als gemeinsamer Voice-Stack veröffentlicht. Das Modell erreicht laut Hersteller eine Sprachausgabe-Latenz von unter 90ms, unterstützt nativ 42 Sprachen und wird auf Benchmark-Plattformen wie Artificial Analysis als führendes TTS-Modell gelistet. Es bietet Instant-Voice-Cloning, Voice-Changer- und Lokalisierungsfunktionen und ist über die Cartesia-API sowie Partner wie LiveKit nutzbar.

Momentum-Verlauf
19.05.17.08.

Features

Echtzeit-StreamingJa, für Echtzeit-Sprachagenten mit bidirektionalem Streaming ausgelegt
LatenzUnter 90ms Sprachausgabe-Latenz (Time-to-first-audio); laut Artificial Analysis ca. 82ms
LizenzKommerzielle Nutzungslizenz ab Pro-Plan (kostenpflichtig); Free-Tier nicht für kommerzielle Nutzung vorgesehen
PlattformCloud-API von Cartesia (Modell-ID sonic-3.5), zusätzlich verfügbar über Partner wie LiveKit; Deployment in Cloud, On-Premise und On-Device möglich
PreisAb $5/Monat (Pro-Plan, ~133 Minuten TTS/Monat); Free-Tier $0/Monat (20.000 Credits); Startup $49/Monat; Scale $299/Monat; API-Nutzung u.a. $0,03/Min bzw. $50 pro 1 Mio. Zeichen (LiveKit)
Release-Datum16. Juni 2026
Sprachen42 Sprachen nativ, u.a. Englisch, Hindi, Spanisch, Französisch, Deutsch, Japanisch, Hebräisch
Voice-CloningInstant Voice Cloning mit nur 10 Sekunden Audio; zudem Professional Voice Cloning für höhere Qualität verfügbar

Weitere Produkte in dieser Kategorie: Sprachsynthese (TTS)

Belege (9)

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.