Speech-to-Speech

Speech-to-Speech

Speech-to-Speech bezeichnet KI-Systeme, die gesprochene Sprache direkt in gesprochene Sprache einer anderen Sprache oder Stimme umwandeln — ohne den Umweg über geschriebenen Text. Das Ergebnis klingt natürlicher und schneller als klassische Übersetzungssysteme.

Wer früher mit einer KI sprechen wollte, musste einen langen Umweg in Kauf nehmen. Das System wandelte die Sprache zuerst in Text um, übersetzte diesen Text, und las den Ergebnis-Text dann wieder vor. Drei Schritte, drei mögliche Fehlerquellen. Speech-to-Speech macht daraus einen einzigen Schritt: Gesprochenes kommt rein, Gesprochenes kommt raus. Die Zwischenstufe Text fällt weg. Dabei kann das Ausgabe-Audio in einer anderen Sprache sein, mit einer anderen Stimme klingen oder sogar den Tonfall des Originals imitieren.

Warum der direkte Weg einen Unterschied macht

Sprache enthält mehr Information als Text. Wenn jemand eine Frage stellt, hört man, ob er unsicher klingt. Wenn jemand einen Witz macht, hört man das Augenzwinkern in seiner Stimme. Schreibt man diesen Satz auf, geht das alles verloren. Der klassische Drei-Schritte-Ansatz — Sprache zu Text, Text übersetzen, Text vorlesen — schmeißt diese Informationen also zwangsläufig weg.

Speech-to-Speech kann diese Zwischentöne erhalten, weil es direkt auf dem Audiosignal arbeitet. Das ist besonders in Echtzeit-Gesprächen entscheidend. Verzögerungen von mehreren Sekunden — typisch für den Drei-Schritte-Ansatz — unterbrechen den natürlichen Gesprächsfluss. Ein Speech-to-Speech-System kann dagegen deutlich schneller antworten. Das ist der Unterschied zwischen einem holprigen Dolmetscher-Telefonat und einem fast normalen Gespräch.

Wie ein Speech-to-Speech-Modell aufgebaut ist

Das Herzstück ist ein neuronales Netz — ein System aus vielen miteinander verbundenen Recheneinheiten, das aus riesigen Mengen an Audiodaten lernt. Es lernt nicht, was ein Wort bedeutet, sondern wie Laute, Betonung und Pausen zusammengehören. Die Eingabe wird in eine kompakte Darstellung umgewandelt, die man sich wie eine Art akustischen Fingerabdruck vorstellen kann. Aus diesem Fingerabdruck erzeugt ein zweiter Teil des Netzes dann das Ausgabe-Audio.

Damit das Modell Sprache nicht nur kopiert, sondern sinnvoll verarbeitet, wird es auf Millionen von Stunden Audiomaterial trainiert. Es lernt dabei, welche Lautfolgen in einer Sprache typischerweise auf welche in einer anderen Sprache folgen. Manche Systeme lernen zusätzlich, Stimmen zu klonen: Sie analysieren wenige Sekunden einer Stimme und erzeugen die Ausgabe dann in genau diesem Klang. Andere lernen, Emotionen zu erkennen und in der Zielsprache beizubehalten.

Ein wichtiger Unterschied zu klassischen Übersetzungssystemen: Speech-to-Speech-Modelle müssen nicht verstehen, was ein Wort bedeutet — zumindest nicht auf dieselbe Weise wie ein Mensch. Sie erkennen Muster. Das ist eine Stärke bei Geschwindigkeit und Natürlichkeit, kann aber zur Schwäche werden, wenn Fachjargon oder stark abweichende Dialekte vorkommen.

Speech-to-Speech in Produkten und News

OpenAI hat im Mai 2024 mit GPT-4o ein Modell vorgestellt, das Sprache direkt verarbeiten und direkt antworten kann — ohne den beschriebenen Textzwischenschritt. In der Live-Demo reagierte das System in unter 300 Millisekunden, was in etwa der Reaktionszeit eines Menschen in einem Gespräch entspricht. Das war der bisher bekannteste öffentliche Auftritt der Technologie.

Im Alltag begegnet man Speech-to-Speech vor allem in Echtzeit-Übersetzungs-Apps und Konferenz-Tools, die simultan dolmetschen sollen. Kopfhörer-Hersteller wie Google arbeiten daran, Simultanübersetzung direkt ins Ohr zu liefern — der Sprecher redet Englisch, der Hörer hört Deutsch, ohne spürbare Pause. Auch im Kundenservice werden Speech-to-Speech-Systeme eingesetzt, die Anrufe auf Knopfdruck in andere Sprachen übertragen.

Ein Thema, das dabei immer wieder auftaucht, ist Missbrauch. Weil manche Systeme Stimmen täuschend echt klonen können, lassen sich damit gefälschte Audio-Aufnahmen erstellen. Deshalb beschäftigt sich ein eigenes Forschungsfeld damit, zu erkennen, ob ein Audio-Clip echt oder KI-generiert ist. Speech-to-Speech ist also nicht nur eine Kommunikationstechnologie — sie hat auch eine Sicherheitsdimension.

Související produkty

Aktuální zprávy

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.