

Fish Audio S2.1 Pro
#2 in Sprachsynthese (TTS)Fish Audio · pro · 3× · zuletzt 30. Juli 2026
Fish Audio S2.1 Pro ist ein produktionsreifes Text-to-Speech-Modell (Sprachsynthese) von Fish Audio, das im Juni/Juli 2026 als Nachfolger von S2-Pro veröffentlicht wurde. Das Modell unterstützt 83 Sprachen, bietet Voice-Cloning aus kurzen Referenzaufnahmen sowie wortgenaue Steuerung von Emotion und Prosodie über natürlichsprachliche Tags, und ist auf niedrige Latenz für Echtzeit-Dialoganwendungen ausgelegt. Der Zugang erfolgt über die Fish Audio Cloud-API, wobei eine kostenlose Entwicklerstufe mit gleicher Modellqualität ohne SLA-Garantien und eine kostenpflichtige Produktionsstufe mit Latenz- und Verfügbarkeitsgarantien angeboten werden.
Features
| Echtzeit-Streaming | Ja, WebSocket-Streaming für Echtzeit-Konversations-Sprachausgabe konzipiert |
| Latenz | ~70–100 ms Time-to-First-Audio (TTFA) bei Einzelanfrage |
| Lizenz | Proprietäres, gehostetes Modell über API; offene Vorgängermodelle (S2) unter Fish Audio Research License mit separater kommerzieller Lizenz für Eigen-Hosting |
| Plattform | Fish Audio Cloud-API (REST/WebSocket, msgpack), Python- & TypeScript-SDKs, Web-Playground unter fish.audio |
| Preis | Kostenlose API bis 24. Juli 2026 (bzw. laut anderer Quelle bis 31. August 2026); danach Pay-as-you-go ab $15 / 1M Zeichen; Abo-Pläne $0–$749/Monat |
| Release-Datum | Öffentlicher Launch 28. Juli 2026; freie API-Verfügbarkeit ab Juni 2026 angekündigt |
| Sprachen | 83 Sprachen |
| Voice-Cloning | Ja, Voice-Cloning aus 5 Sekunden Referenzaudio über API |