

Tavus · 12× · zuletzt 03. Okt. 2026
Griffin ist das erste "Human Interaction Model" (HIM) von Tavus, vorgestellt am 1. Oktober 2026. Es handelt sich um ein Full-Duplex-Video-zu-Video-Modell, das gleichzeitig sieht, hört, spricht und reagiert und so Mimik, Tonfall und Timing in Echtzeit an den Gesprächsverlauf anpasst – anstatt separate Module für Spracherkennung, Sprachmodell, Sprachsynthese und Avatar-Animation hintereinanderzuschalten. In einer eigenen Studie von Tavus hielten 48 % der Testpersonen das Modell nach einem einminütigen Videoanruf für einen echten Menschen; auf NVIDIAs VideoFDB-Benchmark erzielte Griffin-Lite einen Spitzenwert von 3,83 von 5 Punkten (menschlicher Referenzwert: 3,92). Aktuell ist nur eine Vorabversion namens "Griffin-Lite" als Research Preview für ausgewählte Tester verfügbar; es gibt keine öff
Features
| Echtzeit-Streaming | Full-Duplex Video-zu-Video-Streaming; generiert 720p-Video in Echtzeit in 320-ms-Chunks (25 fps) |
| Latenz | Audio-zu-Video-Latenz von durchschnittlich 0,43 Sekunden auf H100-GPUs |
| Lizenz | Geschlossenes Research-Preview-Programm nur für ausgewählte, vertrauenswürdige Tester (Zugang per Anfrageformular) |
| Plattform | Noch nicht auf der Tavus-Plattform integriert; kein öffentliches Modell-ID, keine API oder Endpoint verfügbar |
| Preis | Nicht veröffentlicht; Griffin-Lite ist nur als kostenlose Research Preview für ausgewählte Tester verfügbar |
| Release-Datum | 1. Oktober 2026 (Ankündigung); nur Vorabversion "Griffin-Lite" verfügbar, kein Termin für volle Verfügbarkeit |
| Voice-Cloning | Klonung einer Stimme aus ca. 10 Sekunden Referenzaudio möglich |