

Cartesia · v2 · seit 16. Juni 2026 · 6× · zuletzt 29. Juni 2026
10
Momentum
Ink-2 ist das Speech-to-Text-Modell (STT) von Cartesia, entwickelt speziell für Echtzeit-Sprachagenten. Es basiert auf einer State-Space-Model-Architektur und bietet laut Herstellerangaben die niedrigste Wortfehlerrate sowie die genaueste eingebaute Turn-Detection unter den Streaming-STT-Modellen. Das Modell erkennt strukturierte Daten wie Telefonnummern, Daten und E-Mail-Adressen zuverlässig und signalisiert über Turn-Events, wann ein Sprecher beginnt und endet, ohne separate Voice-Activity-Detection. Aktuell unterstützt Ink-2 nur Englisch, weitere Sprachen sind angekündigt.
Momentum-Verlauf
19.05.17.08.
Features
| Echtzeit-Streaming | Ja – Streaming-STT mit Verarbeitung von Teilaudio in Echtzeit, inkl. Turn-Events (turn.start, turn.update, turn.eager_end, turn.resume, turn.end) |
| Latenz | Time-to-Final-Transcript (TTFT) von 0,1 Sekunden; Transkript-Latenz ca. 100 ms im Gesamtstack |
| Plattform | Verfügbar via API, Cartesia Playground (play.cartesia.ai) sowie Integrationen mit LiveKit, Vapi und Pipecat |
| Preis | STT-Nutzung wird mit 1 Credit pro Sekunde Audio abgerechnet; im Startup-Plan ca. $0,06/Min. Call-Dauer bzw. $0,014/Min. im Scale-Plan |
| Release-Datum | 16. Juni 2026 (gemeinsam mit Sonic-3.5 vorgestellt) |
| Sprachen | Aktuell nur Englisch unterstützt; multilinguale Version angekündigt |