

StepAudio 3 ASR
#10 in Transkription (STT)Stepaudio · v3 · asr · 2× · zuletzt 24. Sept. 2026
StepAudio 3 ASR ist ein von StepFun entwickeltes, cloud-basiertes Spracherkennungsmodell (Speech-to-Text) auf LLM-Basis, das am 15. September 2026 als Teil der fünfteiligen StepAudio-3-Modellfamilie veröffentlicht wurde. Es erreichte mit 1,7% WER Platz 1 im nicht-streamenden AA-WER-Index von Artificial Analysis und verbessert die Genauigkeit gegenüber dem Vorgänger StepAudio 2.5 ASR (4,7% WER) deutlich. Das Modell unterstützt Chinesisch, Englisch sowie (in Vorschau) Japanisch, Koreanisch, Französisch und Spanisch, erkennt Fachvokabular in über 20 Branchen und verarbeitet auch schwierige Audioinhalte wie Flüstern, Gesang oder Hintergrundgeräusche. Es ist ausschließlich über die gehostete StepFun-API zugänglich; es gibt keine offenen Gewichte oder On-Premise-Option.