

Griffin-Lite
#10 in Echtzeit-Sprach & Voice-AgentenTavus · lite · seit 1. Oktober 2026 (Research Preview) · 2× · zuletzt 05. Okt. 2026
Griffin-Lite ist eine am 1. Oktober 2026 von Tavus vorgestellte Forschungsvorschau eines "Human Interaction Models" (HIM) für Echtzeit-Video-/Sprachkonversation. Das Modell verarbeitet Audio und Video in einem einheitlichen Video-zu-Video-System, erkennt Sprechpausen, Gestik und Mimik und reagiert in Echtzeit mit synthetisierter Sprache, Mimik und Gestik. In einer firmeneigenen Studie hielten 48% der Testpersonen (26 von 54) ihren Gesprächspartner nach einem einminütigen Videoanruf für einen Menschen; auf NVIDIAs VideoFDB-Benchmark erreichte Griffin-Lite Bestwerte unter den getesteten KI-Systemen. Der Zugang ist aktuell auf ausgewählte, geprüfte Tester beschränkt; ein offizieller Preis sowie ein öffentliches Erscheinungsdatum für die breite Freigabe wurden bislang nicht veröffentlicht.
Features
| Echtzeit-Streaming | Generiert 720p-Video in Echtzeit in 320-ms-Chunks ausgehend von einem einzigen Referenzbild, voll-duplexe Video-zu-Video-Architektur |
| Latenz | Audio-zu-Video-Latenz durchschnittlich 0,43 Sekunden auf H100-GPUs, ca. halb so hoch wie die schnellste publizierte Streaming-Diffusionsmethode |
| Plattform | Noch nicht auf der Tavus-Plattform integriert; Zugang nur über Anfrageformular für geprüfte Tester |
| Preis | Nicht veröffentlicht – Griffin-Lite ist nur als kostenlose Research Preview für ausgewählte Tester verfügbar, kein öffentlicher Tarif |
| Release-Datum | 1. Oktober 2026 (Research Preview, limitiert auf ausgewählte Tester) |
| Voice-Cloning | Sprachmodell kann eine Stimme aus ca. 10 Sekunden Referenzaudio klonen; Audio-Pakete so klein wie 10 ms |