

VoiceStudio
#5 in Sprachsynthese (TTS)Unknown · 2× · zuletzt 29. Sept. 2026
VoiceStudio (vormals OmniVoice-Studio) ist eine quelloffene, vollständig lokal laufende Desktop-Anwendung für Sprachklonen, Voice-Design, Video-Dubbing, Diktat, Transkription und Hörbucherstellung, entwickelt als kostenlose Alternative zu Cloud-Diensten wie ElevenLabs. Die Software unterstützt 16 TTS- und 11 ASR-Engines sowie ein Sprachkatalog von 646 Sprachen und läuft auf macOS, Windows und Linux (inkl. Docker-Image), ohne Konto, API-Key oder Nutzungslimit im lokalen Workflow. Sie steht unter der AGPL-3.0-Lizenz, wobei die verwendeten Sprachmodelle eigene, separate Lizenzbedingungen mitbringen. Voice-Cloning funktioniert per Zero-Shot-Verfahren bereits ab einer 3-Sekunden-Referenzaufnahme, und die App bietet eine OpenAI-kompatible lokale API sowie WebSocket-Streaming mit gemessener Laten
Features
| Echtzeit-Streaming | Ja, über WebSocket-Endpunkt /ws/tts mit Zeitangaben zu erstem Audio-Frame und Generierungsdauer |
| Latenz | Gemessene Time-to-First-Audio (ttfa_ms) und Real-Time-Factor (rtf) werden pro Streaming-Anfrage im /ws/tts-Endpunkt zurückgegeben; ca. 28s Ladezeit-Untergrenze pro Aufruf bei Subprocess-Engines |
| Lizenz | AGPL-3.0 (Anwendungslizenz); genutzte Sprachmodelle unterliegen eigenen, separaten Lizenzen |
| Plattform | Desktop-App für macOS (Apple Silicon, ab 13.3), Windows 10/11 x64, Linux x86_64, sowie Docker-Image |
| Preis | Kostenlos (Open Source); kommerzielle/Closed-Source-Nutzung nur auf Anfrage (Pro, enquiry-only, kein Online-Checkout) |
| Release-Datum | Umbenennung von OmniVoice-Studio zu VoiceStudio mit Release v0.5.0 |
| Sprachen | 646 Sprachen (TTS-Katalog), abhängig von der gewählten Engine; 16 TTS- und 11 ASR-Engines |
| Voice-Cloning | Zero-Shot-Klonen bereits ab 3 Sekunden Referenzaudio möglich, 5-15 Sekunden empfohlen für bessere Qualität |