So wird die Wortfehlerrate berechnet
Man braucht zwei Texte: eine sorgfältig von Menschen geprüfte Abschrift (die Referenz) und das Ergebnis der Software (die Hypothese). Beide werden Wort für Wort so gegeneinandergelegt, dass möglichst wenige Änderungen nötig sind. Dann zählt man drei Fehlerarten:
- Ersetzungen (S): ein Wort wurde falsch erkannt – „Mai“ statt „bei“
- Auslassungen (D): ein gesprochenes Wort fehlt im Ergebnis
- Einfügungen (I): im Ergebnis steht ein Wort, das nie gesagt wurde
Die Formel lautet: WER = (S + D + I) / N, wobei N die Zahl der Wörter in der Referenz ist. Das Ergebnis wird meist in Prozent angegeben. Je niedriger, desto besser. Manchmal liest man auch die Wortgenauigkeit (Word Accuracy), das ist vereinfacht 100 % minus WER.
Warum die WER über 100 % liegen kann
Weil Einfügungen mitzählen, ist die Wortfehlerrate keine echte Prozentquote. Erfindet ein System bei einem kurzen Satz mit Hintergrundgeräusch viele zusätzliche Wörter, können die Fehler zahlreicher sein als die Wörter der Referenz. Das kommt in der Praxis selten vor, zeigt aber, dass WER eine Fehlerzählung ist und kein Anteil richtiger Wörter.
Aus demselben Grund ist „WER von 10 %“ nicht gleichbedeutend mit „90 % der Wörter stimmen“. Bei vielen Auslassungen kann das Ergebnis sogar kürzer sein als die Referenz und trotzdem eine ähnliche Fehlerrate haben wie ein Text mit vielen Einfügungen.
Was die Wortfehlerrate nicht verrät
Eine einzelne Zahl ist praktisch, aber sie verdeckt einiges, was im Alltag wichtig ist:
- Alle Fehler zählen gleich. Ein falsches „und“ wiegt so viel wie ein falscher Firmenname oder „fünfzehn“ statt „fünfzig“ – inhaltlich ein riesiger Unterschied.
- Normalisierung beeinflusst das Ergebnis. Ob „13,50 €“ und „dreizehn Euro fünfzig“ als gleich gelten, ob Groß- und Kleinschreibung und Satzzeichen zählen, wird vor der Berechnung festgelegt. Zwei Messungen mit anderen Regeln sind nicht vergleichbar.
- Die Testdaten entscheiden. Vorgelesene Nachrichtentexte sind leichter als ein Teamcall mit Dialekt und Unterbrechungen. Eine Angabe ohne Testmaterial sagt wenig.
- Sprecherzuordnung fehlt. Ob die Sätze der richtigen Person zugeordnet sind, misst die WER nicht. Dafür gibt es eigene Maße für die Sprechererkennung.
WER richtig einordnen
Für Sprachen wie Chinesisch oder Japanisch, die ohne Leerzeichen zwischen Wörtern geschrieben werden, nutzt man oft die Zeichenfehlerrate (CER), die nach demselben Prinzip auf Zeichen statt Wörtern rechnet. Im Deutschen kann sie bei langen Komposita ein zusätzlicher Blickwinkel sein: „Steckdosen leisten“ statt „Steckdosenleisten“ ist für die WER ein Doppelfehler, obwohl nur ein Leerzeichen zu viel ist.
Wenn du Anbieter vergleichst, ist ein eigener kleiner Test aussagekräftiger als veröffentlichte Werte: zehn Minuten typisches Material, sauber von Hand abgeschrieben, und dann zählen – oder einfach markieren, wo Namen, Zahlen und Fachbegriffe danebenliegen. Diese Fehler kosten dich später die meiste Zeit.
Referenz (10 Wörter): „Wir liefern die restlichen Paletten am Montag nach dem Mittag“
Erkannt: „Wir liefern die Paletten am Mittag nach dem dem Mittag“
Fehler: „restlichen“ fehlt (1 Auslassung), „Montag“ wurde zu „Mittag“ (1 Ersetzung), „dem“ steht doppelt (1 Einfügung).
Rechnung: (1 + 1 + 1) / 10 = 0,3 – also eine Wortfehlerrate von 30 %. Inhaltlich wiegt die Ersetzung am schwersten: Geliefert wird am Montag, nicht zu Mittag.
Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.