Wie Spracherkennung funktioniert
Ein Mikrofon liefert zunächst nur Schwankungen des Schalldrucks, also eine Folge von Messwerten. Die Software zerlegt dieses Signal in sehr kurze Abschnitte und berechnet daraus Merkmale, die beschreiben, welche Frequenzen gerade wie stark vorkommen – vereinfacht ein Bild des Klangs über die Zeit.
Früher bestanden Erkennungssysteme aus mehreren getrennten Bausteinen: einem akustischen Modell, das Laute erkennt, einem Aussprachewörterbuch und einem Sprachmodell, das abschätzt, welche Wortfolge plausibel ist. Heutige Systeme sind meist große neuronale Netze, die direkt von Audio auf Text schließen und mit sehr vielen Stunden gesprochener Sprache samt Abschrift trainiert wurden. Das Prinzip bleibt: Das Modell wählt die Wortfolge, die zum Klang und zum Zusammenhang am wahrscheinlichsten passt.
Genau deshalb macht Spracherkennung andere Fehler als ein Mensch. Sie verhört sich selten bei Allerweltswörtern, greift aber bei einem unbekannten Firmennamen zu einem ähnlich klingenden, häufigeren Wort.
Was die Erkennung schwer macht
Moderne Systeme sind bei klarer Aufnahme erstaunlich treffsicher. Die Fehler häufen sich an bestimmten Stellen:
- Dialekt und regionale Aussprache, vor allem wenn wenig Trainingsmaterial dazu existiert
- Namen, Abkürzungen und Fachbegriffe, die im Training selten oder nie vorkamen
- Gleichzeitiges Sprechen, Zwischenrufe und schnelles Durcheinander
- Raumhall, Störgeräusche und weit entfernte Mikrofone
- Schmalbandiger Ton, etwa aus dem klassischen Telefonnetz mit niedriger Abtastrate
- Sprachwechsel mitten im Satz, wenn das Modell auf eine Sprache eingestellt ist
Viele Anbieter erlauben deshalb ein Benutzerwörterbuch: Begriffe, die häufig vorkommen, werden vorab eingetragen und dann bevorzugt erkannt. Wie gut ein System insgesamt arbeitet, misst man mit der Wortfehlerrate.
Spracherkennung, Sprechererkennung, Sprachsteuerung
Mehrere ähnlich klingende Begriffe meinen ganz unterschiedliche Aufgaben:
| Begriff | Frage, die beantwortet wird |
|---|---|
| Spracherkennung (ASR) | Welche Wörter wurden gesagt? |
| Sprechererkennung (Diarisierung) | Wer hat wann gesprochen? |
| Spracherkennung im Sinn von Sprachidentifikation | In welcher Sprache wird gesprochen? |
| Sprachsteuerung, Sprachassistent | Was will die Person – und was soll das Gerät tun? |
Ein Sprachassistent nutzt ASR also nur als ersten Schritt; danach muss eine weitere Komponente den Sinn verstehen. Für ein Meeting-Transkript braucht es dagegen ASR und Sprechererkennung zusammen.
Lokal oder in der Cloud
Spracherkennung kann auf dem eigenen Gerät laufen oder auf Servern eines Anbieters. Lokal bleibt das Audio auf dem Rechner, dafür braucht ein leistungsfähiges Modell entsprechend Rechenleistung. In der Cloud stehen meist größere Modelle zur Verfügung, das Audio verlässt aber das Gerät.
Für die Wahl zählt deshalb nicht nur die Genauigkeit, sondern auch, wo der Anbieter verarbeitet, ob er Audio speichert oder zum Training nutzt und ob es einen Auftragsverarbeitungsvertrag gibt. Bei Gesprächen mit Kund:innen oder Patient:innen ist das oft die wichtigere Frage.
Unabhängig vom Ort gilt: Die Qualität der Aufnahme entscheidet mehr als die Wahl des Modells. Ein Headset im ruhigen Raum liefert jedem System bessere Voraussetzungen als ein Laptop-Mikrofon am anderen Ende eines halligen Besprechungszimmers.
Gesagt: „Die Firma Brandstätter liefert die Steckdosenleisten bis Freitag.“
Erkannt: „Die Firma Brand Stetter liefert die Steckdosen leisten bis Freitag.“
Akustisch fast richtig, aber ein Name ist zerlegt und ein zusammengesetztes Wort getrennt. Mit einem Wörterbucheintrag für „Brandstätter“ wäre zumindest der Name sicher.
Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.