Wie Live-Text entsteht
Statt eine fertige Aufnahme zu verarbeiten, bekommt die Spracherkennung den Ton in kleinen Stücken, laufend, während gesprochen wird. Nach jedem Stück liefert sie ein Zwischenergebnis: ihre aktuelle beste Vermutung.
Mit jedem weiteren Wort weiß das Modell mehr über den Zusammenhang und korrigiert seine Vermutung. Deshalb springen Wörter im Live-Text: Aus „Wir sollten die Miete“ wird Sekunden später „Wir sollten die Mitte des Jahres abwarten“, sobald die nächsten Wörter den Sinn klären. Erkennt das System eine Pause oder ein Satzende – oft mithilfe der Sprachaktivitätserkennung –, wird der Abschnitt endgültig und ändert sich nicht mehr.
Technisch läuft das meist über eine dauerhaft offene Verbindung zum Erkennungsdienst: Der Ton geht in kurzen Abständen hin, der erkannte Text kommt laufend zurück.
Echtzeit oder nachträglich?
Neben der Echtzeit-Transkription gibt es die nachträgliche (Batch-)Transkription einer fertigen Aufnahme. Beide haben ihre Stärken:
| Echtzeit | Nachträglich | |
|---|---|---|
| Text verfügbar | sofort, während des Gesprächs | nach dem Gespräch, mit Wartezeit |
| Kontext für das Modell | nur das bisher Gesagte und ein kurzes Stück danach | die ganze Aufnahme, auch spätere Stellen |
| Genauigkeit | oft etwas niedriger, Fehler bleiben eher stehen | meist höher, Satzzeichen und Sprecher einheitlicher |
| Typischer Einsatz | Live-Untertitel, Barrierefreiheit, Live-Notizen | Protokolle, Interviews, Forschung |
| Technische Voraussetzung | stabile Verbindung während des ganzen Gesprächs | Upload oder Verarbeitung danach |
Welche Variante besser ist, hängt vom Zweck ab. Wer im Moment mitlesen muss, braucht Echtzeit. Wer danach ein sauberes Protokoll will, verliert mit einer nachträglichen Transkription nichts außer ein paar Minuten Wartezeit.
Wofür Echtzeit-Transkription gebraucht wird
Der wichtigste Einsatz ist die Barrierefreiheit: Menschen mit Hörbeeinträchtigung können einem Gespräch über Live-Untertitel folgen. Für Vorlesungen, Veranstaltungen und wichtige Gespräche gibt es dafür auch menschliche Schriftdolmetscher:innen, die in Echtzeit mitschreiben – bei hohen Anforderungen an die Genauigkeit nach wie vor eine wichtige Alternative.
Daneben hilft Live-Text, wenn die Verbindung schlecht ist, jemand in einer Fremdsprache zuhört oder in einem lauten Umfeld sitzt. Sprachassistenten und Sprachsteuerung arbeiten ebenfalls mit Echtzeit-Erkennung, weil sie sofort reagieren sollen.
Wer ein Meeting moderiert, kann mit einem Blick auf den Live-Text außerdem prüfen, ob ein wichtiger Satz verständlich angekommen ist.
Grenzen
Zwischen Schnelligkeit und Genauigkeit gibt es einen festen Zielkonflikt: Je früher ein Wort angezeigt wird, desto weniger Kontext stand zur Verfügung. Die Latenz lässt sich also nicht beliebig senken, ohne Fehler in Kauf zu nehmen.
Auch die Zuordnung, wer spricht, ist live schwieriger, weil das System die Stimmen noch nicht lange gehört hat. Bricht die Verbindung kurz ab, fehlt im Live-Text ein Stück. Und der Ton wird während des ganzen Gesprächs laufend an den Dienst übertragen, der die Erkennung übernimmt – das sollte man bei vertraulichen Gesprächen bedenken.
Für ein Protokoll ist ein Live-Transkript deshalb eher ein Notbehelf: Fehler, die im Moment entstanden sind, bleiben oft im Text, weil das System endgültig gesetzte Abschnitte nicht mehr anfasst.
Im Weekly von Teamleiterin Hofer arbeitet ein Kollege mit, der schwer hört. Das Team schaltet in der Videokonferenz die Live-Untertitel ein; er liest mit und kann sich jederzeit einbringen.
Für das Protokoll verlässt sich Hofer nicht auf den Live-Text, sondern auf eine nachträgliche Transkription der Besprechung, die sie danach in Ruhe gegenliest.
Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.