Wie VAD funktioniert
Die Aufnahme wird in sehr kurze Stücke zerlegt, typischerweise einige Hundertstelsekunden lang. Für jedes Stück fällt eine Entscheidung: Sprache oder keine Sprache. Einfache Verfahren schauen vor allem auf die Energie – was laut genug ist, gilt als Sprache. Das ist schnell, verwechselt aber jedes laute Geräusch mit einer Stimme.
Bessere Verfahren werten zusätzlich typische Merkmale von Sprache aus, etwa wie sich die Energie über die Frequenzen verteilt. Moderne VAD-Modelle sind kleine neuronale Netze, die mit vielen Beispielen trainiert wurden und Sprache auch neben Musik oder Tastaturklappern erkennen.
Danach wird geglättet. Eine Nachlaufzeit sorgt dafür, dass die kurzen Pausen zwischen Wörtern nicht als Ende gelten. Ein kleiner Vorlauf verhindert, dass der erste Laut eines Satzes abgeschnitten wird.
Wo VAD überall steckt
Die meisten Menschen nutzen Sprachaktivitätserkennung täglich, ohne es zu merken:
- Videokonferenzen: Der Hinweis „Du bist stummgeschaltet“, wenn du bei ausgeschaltetem Mikrofon zu reden beginnst, und die Hervorhebung der Person, die gerade spricht.
- Audio-Codecs: Sprachcodecs wie Opus können in Pausen kaum Daten übertragen und so Bandbreite sparen.
- Echtzeit-Spracherkennung: VAD hilft zu erkennen, wann ein Satz zu Ende ist – dann wird ein Zwischenergebnis in der Echtzeit-Transkription endgültig.
- Vorverarbeitung vor der Transkription: Lange Pausen werden herausgeschnitten, bevor die Aufnahme transkribiert wird. Das spart Rechenzeit und vermeidet ein bekanntes Problem: Manche Spracherkennungsmodelle neigen dazu, in langer Stille oder bei Rauschen Wörter zu „erkennen“, die nie gesagt wurden.
- Sprachassistenten: Sie merken daran, wann du mit deiner Frage fertig bist.
Typische Fehler
VAD kann in zwei Richtungen danebenliegen. Bei einem Fehlalarm gilt etwas als Sprache, das keine ist: Husten, Tippen, ein Fernseher im Hintergrund. Bei einem Aussetzer wird echte Sprache übersehen – leise oder weit entfernte Sprechende, Flüstern, ein zögerlicher Satzanfang („… eine Frage hätte ich noch“).
Wie streng eine VAD eingestellt ist, ist immer ein Kompromiss. Für Transkription ist eine eher großzügige Einstellung meist die bessere Wahl: Ein Stück Stille zu viel kostet nur ein wenig Rechenzeit, ein abgeschnittener Satz ist verloren.
Auch Hintergrundstimmen sind ein Problem: Für eine VAD ist die Unterhaltung am Nebentisch genauso Sprache wie die eigene. Sie unterscheidet nur zwischen Sprache und Nicht-Sprache, nicht zwischen wichtiger und unwichtiger Sprache. Ist sie zu streng eingestellt, merkt man das im Transkript an fehlenden Satzanfängen oder an kurzen Wortmeldungen, die einfach nicht auftauchen.
Drei Fragen, drei Verfahren
Sprachaktivitätserkennung wird oft mit verwandten Verfahren verwechselt. Am einfachsten lassen sie sich über die Frage unterscheiden, die sie beantworten: VAD klärt, ob jemand spricht. Die Spracherkennung klärt, was gesagt wird. Die Sprechererkennung klärt, wer spricht. In einer Transkriptionskette läuft VAD meist als erster Schritt, die anderen bauen darauf auf.
Auch die Erkennung eines Aktivierungsworts („Hey …“) ist etwas anderes: Dort wird nach einem bestimmten Wort gesucht, nicht nach Sprache überhaupt.
Bei einem Strategie-Workshop von Studio Berger läuft die Aufnahme drei Stunden lang. Dazwischen liegen 40 Minuten Gruppenarbeit, in denen am Aufnahmegerät kaum jemand spricht, und eine Kaffeepause.
Die VAD markiert diese Phasen als Stille, transkribiert werden nur die Abschnitte mit Sprache. Damit die Zeitstempel im Transkript trotzdem zur Originalaufnahme passen, merkt sich die Software, wo sie geschnitten hat.
Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.