Lexikon · Transkription & Audio

Was ist Sprachaktivitätserkennung (VAD)?

Kurz erklärt

Sprachaktivitätserkennung (Voice Activity Detection, VAD) entscheidet für jeden kurzen Abschnitt einer Aufnahme, ob gerade jemand spricht. Sie beantwortet nicht, was oder wer gesprochen wird, sondern nur: Sprache ja oder nein.

Auch genannt: Voice Activity Detection · VAD · Speech Activity Detection · Sprachdetektion

Wie VAD funktioniert

Die Aufnahme wird in sehr kurze Stücke zerlegt, typischerweise einige Hundertstelsekunden lang. Für jedes Stück fällt eine Entscheidung: Sprache oder keine Sprache. Einfache Verfahren schauen vor allem auf die Energie – was laut genug ist, gilt als Sprache. Das ist schnell, verwechselt aber jedes laute Geräusch mit einer Stimme.

Bessere Verfahren werten zusätzlich typische Merkmale von Sprache aus, etwa wie sich die Energie über die Frequenzen verteilt. Moderne VAD-Modelle sind kleine neuronale Netze, die mit vielen Beispielen trainiert wurden und Sprache auch neben Musik oder Tastaturklappern erkennen.

Danach wird geglättet. Eine Nachlaufzeit sorgt dafür, dass die kurzen Pausen zwischen Wörtern nicht als Ende gelten. Ein kleiner Vorlauf verhindert, dass der erste Laut eines Satzes abgeschnitten wird.

Wo VAD überall steckt

Die meisten Menschen nutzen Sprachaktivitätserkennung täglich, ohne es zu merken:

  • Videokonferenzen: Der Hinweis „Du bist stummgeschaltet“, wenn du bei ausgeschaltetem Mikrofon zu reden beginnst, und die Hervorhebung der Person, die gerade spricht.
  • Audio-Codecs: Sprachcodecs wie Opus können in Pausen kaum Daten übertragen und so Bandbreite sparen.
  • Echtzeit-Spracherkennung: VAD hilft zu erkennen, wann ein Satz zu Ende ist – dann wird ein Zwischenergebnis in der Echtzeit-Transkription endgültig.
  • Vorverarbeitung vor der Transkription: Lange Pausen werden herausgeschnitten, bevor die Aufnahme transkribiert wird. Das spart Rechenzeit und vermeidet ein bekanntes Problem: Manche Spracherkennungsmodelle neigen dazu, in langer Stille oder bei Rauschen Wörter zu „erkennen“, die nie gesagt wurden.
  • Sprachassistenten: Sie merken daran, wann du mit deiner Frage fertig bist.

Typische Fehler

VAD kann in zwei Richtungen danebenliegen. Bei einem Fehlalarm gilt etwas als Sprache, das keine ist: Husten, Tippen, ein Fernseher im Hintergrund. Bei einem Aussetzer wird echte Sprache übersehen – leise oder weit entfernte Sprechende, Flüstern, ein zögerlicher Satzanfang („… eine Frage hätte ich noch“).

Wie streng eine VAD eingestellt ist, ist immer ein Kompromiss. Für Transkription ist eine eher großzügige Einstellung meist die bessere Wahl: Ein Stück Stille zu viel kostet nur ein wenig Rechenzeit, ein abgeschnittener Satz ist verloren.

Auch Hintergrundstimmen sind ein Problem: Für eine VAD ist die Unterhaltung am Nebentisch genauso Sprache wie die eigene. Sie unterscheidet nur zwischen Sprache und Nicht-Sprache, nicht zwischen wichtiger und unwichtiger Sprache. Ist sie zu streng eingestellt, merkt man das im Transkript an fehlenden Satzanfängen oder an kurzen Wortmeldungen, die einfach nicht auftauchen.

Drei Fragen, drei Verfahren

Sprachaktivitätserkennung wird oft mit verwandten Verfahren verwechselt. Am einfachsten lassen sie sich über die Frage unterscheiden, die sie beantworten: VAD klärt, ob jemand spricht. Die Spracherkennung klärt, was gesagt wird. Die Sprechererkennung klärt, wer spricht. In einer Transkriptionskette läuft VAD meist als erster Schritt, die anderen bauen darauf auf.

Auch die Erkennung eines Aktivierungsworts („Hey …“) ist etwas anderes: Dort wird nach einem bestimmten Wort gesucht, nicht nach Sprache überhaupt.

Beispiel
Ein Workshop mit viel Stille

Bei einem Strategie-Workshop von Studio Berger läuft die Aufnahme drei Stunden lang. Dazwischen liegen 40 Minuten Gruppenarbeit, in denen am Aufnahmegerät kaum jemand spricht, und eine Kaffeepause.

Die VAD markiert diese Phasen als Stille, transkribiert werden nur die Abschnitte mit Sprache. Damit die Zeitstempel im Transkript trotzdem zur Originalaufnahme passen, merkt sich die Software, wo sie geschnitten hat.

Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.

Häufige Fragen
Was bedeutet VAD?

VAD steht für Voice Activity Detection, auf Deutsch Sprachaktivitätserkennung. Gemeint ist ein Verfahren, das in einer Aufnahme Abschnitte mit Sprache von Stille und Geräuschen trennt.

Warum fehlen im Transkript manchmal die ersten Wörter eines Satzes?

Oft hat die Sprachaktivitätserkennung den leisen Satzanfang als Stille eingestuft. Ein Mikrofon näher am Mund oder eine großzügigere Einstellung hilft.

Ist VAD dasselbe wie Spracherkennung?

Nein. VAD erkennt nur, ob gesprochen wird. Spracherkennung wandelt das Gesprochene in Text um.

Erkennt VAD auch Flüstern?

Nicht zuverlässig. Flüstern hat wenig Energie und andere Klangmerkmale als normale Sprache und wird deshalb leicht übersehen.

Dein nächster Call
schreibt sich selbst mit.

7 Tage alles aus Pro gratis – ohne Kreditkarte.

Jetzt kostenlos testen