Synthszr Charts — die großen AI-Marken im Wettkampf ums Podium
synthszr charts
cartesia

Cartesia · v2 · seit 16. Juni 2026 · 6× · zuletzt 29. Juni 2026

10
Momentum

Ink-2 ist das Speech-to-Text-Modell (STT) von Cartesia, entwickelt speziell für Echtzeit-Sprachagenten. Es basiert auf einer State-Space-Model-Architektur und bietet laut Herstellerangaben die niedrigste Wortfehlerrate sowie die genaueste eingebaute Turn-Detection unter den Streaming-STT-Modellen. Das Modell erkennt strukturierte Daten wie Telefonnummern, Daten und E-Mail-Adressen zuverlässig und signalisiert über Turn-Events, wann ein Sprecher beginnt und endet, ohne separate Voice-Activity-Detection. Aktuell unterstützt Ink-2 nur Englisch, weitere Sprachen sind angekündigt.

Momentum-Verlauf
19.05.17.08.

Features

Echtzeit-StreamingJa – Streaming-STT mit Verarbeitung von Teilaudio in Echtzeit, inkl. Turn-Events (turn.start, turn.update, turn.eager_end, turn.resume, turn.end)
LatenzTime-to-Final-Transcript (TTFT) von 0,1 Sekunden; Transkript-Latenz ca. 100 ms im Gesamtstack
PlattformVerfügbar via API, Cartesia Playground (play.cartesia.ai) sowie Integrationen mit LiveKit, Vapi und Pipecat
PreisSTT-Nutzung wird mit 1 Credit pro Sekunde Audio abgerechnet; im Startup-Plan ca. $0,06/Min. Call-Dauer bzw. $0,014/Min. im Scale-Plan
Release-Datum16. Juni 2026 (gemeinsam mit Sonic-3.5 vorgestellt)
SprachenAktuell nur Englisch unterstützt; multilinguale Version angekündigt

Weitere Produkte in dieser Kategorie: Sprachsynthese (TTS)

Belege (6)

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.