Lexikon · Transkription & Audio

Was ist Spracherkennung (ASR)?

Kurz erklärt

Spracherkennung, englisch Automatic Speech Recognition (ASR), ist die Technik, mit der ein Computer gesprochene Sprache aus einem Audiosignal erkennt und als Text ausgibt. Sie steckt hinter Diktierfunktionen, Sprachassistenten und automatischen Transkripten.

Auch genannt: ASR (Automatic Speech Recognition) · automatische Spracherkennung · Speech Recognition

Wie Spracherkennung funktioniert

Ein Mikrofon liefert zunächst nur Schwankungen des Schalldrucks, also eine Folge von Messwerten. Die Software zerlegt dieses Signal in sehr kurze Abschnitte und berechnet daraus Merkmale, die beschreiben, welche Frequenzen gerade wie stark vorkommen – vereinfacht ein Bild des Klangs über die Zeit.

Früher bestanden Erkennungssysteme aus mehreren getrennten Bausteinen: einem akustischen Modell, das Laute erkennt, einem Aussprachewörterbuch und einem Sprachmodell, das abschätzt, welche Wortfolge plausibel ist. Heutige Systeme sind meist große neuronale Netze, die direkt von Audio auf Text schließen und mit sehr vielen Stunden gesprochener Sprache samt Abschrift trainiert wurden. Das Prinzip bleibt: Das Modell wählt die Wortfolge, die zum Klang und zum Zusammenhang am wahrscheinlichsten passt.

Genau deshalb macht Spracherkennung andere Fehler als ein Mensch. Sie verhört sich selten bei Allerweltswörtern, greift aber bei einem unbekannten Firmennamen zu einem ähnlich klingenden, häufigeren Wort.

Was die Erkennung schwer macht

Moderne Systeme sind bei klarer Aufnahme erstaunlich treffsicher. Die Fehler häufen sich an bestimmten Stellen:

  • Dialekt und regionale Aussprache, vor allem wenn wenig Trainingsmaterial dazu existiert
  • Namen, Abkürzungen und Fachbegriffe, die im Training selten oder nie vorkamen
  • Gleichzeitiges Sprechen, Zwischenrufe und schnelles Durcheinander
  • Raumhall, Störgeräusche und weit entfernte Mikrofone
  • Schmalbandiger Ton, etwa aus dem klassischen Telefonnetz mit niedriger Abtastrate
  • Sprachwechsel mitten im Satz, wenn das Modell auf eine Sprache eingestellt ist

Viele Anbieter erlauben deshalb ein Benutzerwörterbuch: Begriffe, die häufig vorkommen, werden vorab eingetragen und dann bevorzugt erkannt. Wie gut ein System insgesamt arbeitet, misst man mit der Wortfehlerrate.

Spracherkennung, Sprechererkennung, Sprachsteuerung

Mehrere ähnlich klingende Begriffe meinen ganz unterschiedliche Aufgaben:

BegriffFrage, die beantwortet wird
Spracherkennung (ASR)Welche Wörter wurden gesagt?
Sprechererkennung (Diarisierung)Wer hat wann gesprochen?
Spracherkennung im Sinn von SprachidentifikationIn welcher Sprache wird gesprochen?
Sprachsteuerung, SprachassistentWas will die Person – und was soll das Gerät tun?

Ein Sprachassistent nutzt ASR also nur als ersten Schritt; danach muss eine weitere Komponente den Sinn verstehen. Für ein Meeting-Transkript braucht es dagegen ASR und Sprechererkennung zusammen.

Lokal oder in der Cloud

Spracherkennung kann auf dem eigenen Gerät laufen oder auf Servern eines Anbieters. Lokal bleibt das Audio auf dem Rechner, dafür braucht ein leistungsfähiges Modell entsprechend Rechenleistung. In der Cloud stehen meist größere Modelle zur Verfügung, das Audio verlässt aber das Gerät.

Für die Wahl zählt deshalb nicht nur die Genauigkeit, sondern auch, wo der Anbieter verarbeitet, ob er Audio speichert oder zum Training nutzt und ob es einen Auftragsverarbeitungsvertrag gibt. Bei Gesprächen mit Kund:innen oder Patient:innen ist das oft die wichtigere Frage.

Unabhängig vom Ort gilt: Die Qualität der Aufnahme entscheidet mehr als die Wahl des Modells. Ein Headset im ruhigen Raum liefert jedem System bessere Voraussetzungen als ein Laptop-Mikrofon am anderen Ende eines halligen Besprechungszimmers.

Beispiel
Ein typischer Erkennungsfehler

Gesagt: „Die Firma Brandstätter liefert die Steckdosenleisten bis Freitag.“

Erkannt: „Die Firma Brand Stetter liefert die Steckdosen leisten bis Freitag.“

Akustisch fast richtig, aber ein Name ist zerlegt und ein zusammengesetztes Wort getrennt. Mit einem Wörterbucheintrag für „Brandstätter“ wäre zumindest der Name sicher.

Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.

Häufige Fragen
Was bedeutet ASR?

ASR steht für Automatic Speech Recognition, also automatische Spracherkennung: das Umwandeln von gesprochener Sprache in Text durch eine Software.

Wie genau ist Spracherkennung?

Das hängt stark von Aufnahme, Sprache, Dialekt und Fachvokabular ab. Gemessen wird die Genauigkeit meist mit der Wortfehlerrate.

Erkennt Spracherkennung österreichischen Dialekt?

Viele moderne Systeme kommen mit regionaler Aussprache gut zurecht, bei starkem Dialekt steigt die Fehlerquote. Ein nahes Mikrofon und ein Wörterbuch für Namen helfen.

Ist Spracherkennung dasselbe wie Sprechererkennung?

Nein. Spracherkennung erkennt die Wörter, Sprechererkennung unterscheidet, welche Stimme spricht. Für Transkripte von Gesprächen braucht man beides.

Dein nächster Call
schreibt sich selbst mit.

7 Tage alles aus Pro gratis – ohne Kreditkarte.

Jetzt kostenlos testen