Woher der Wert kommt
Eine Spracherkennung wägt an jeder Stelle mehrere Möglichkeiten ab: War es „fünfzehn“ oder „fünfzig“, „Huber“ oder „Gruber“? Für jede Möglichkeit berechnet sie, wie gut sie zum Klang und zum Zusammenhang passt. Der Konfidenzwert drückt aus, wie deutlich die gewählte Variante gegen die Alternativen gewonnen hat.
Viele Systeme liefern den Wert pro Wort, manche zusätzlich pro Satz oder für das ganze Transkript. In der Oberfläche erscheint er oft nicht als Zahl, sondern als Farbe: Unsichere Wörter sind hervorgehoben oder blasser dargestellt.
Konfidenzwerte gibt es nicht nur bei der Worterkennung. Auch die Sprechererkennung kann angeben, wie sicher ein Abschnitt einer Stimme zugeordnet ist, und eine automatische Spracherkennung, wie sicher sie die gesprochene Sprache bestimmt hat.
Wie man Konfidenzwerte liest
Ein Wert von 0,9 klingt nach „zu 90 Prozent richtig“, so einfach ist es aber nicht. Ob ein Konfidenzwert tatsächlich der Trefferwahrscheinlichkeit entspricht, hängt davon ab, wie das System abgestimmt ist. Zwei Anbieter können für dieselbe Stelle sehr unterschiedliche Werte ausgeben – Konfidenzwerte sind deshalb nur innerhalb desselben Systems vergleichbar.
Am nützlichsten sind sie als Rangfolge: Die Stellen mit den niedrigsten Werten zuerst ansehen. Einen festen Schwellenwert, ab dem ein Wort als unsicher gilt, legt man am besten aus eigener Erfahrung fest – nach ein paar korrigierten Transkripten zeigt sich, ab welchem Wert sich ein Blick lohnt. Ein zu hoch gesetzter Schwellenwert markiert halbe Absätze, ein zu niedriger lässt echte Fehler durch.
Wo Konfidenzwerte täuschen
Der Wert sagt, wie sicher sich die Software ist – nicht, ob sie recht hat. Vier typische Fälle:
- Sicher, aber falsch: Klingen zwei Wörter gleich, etwa Meier und Mayer, kann die Software mit hohem Wert die falsche Schreibweise wählen.
- Unsicher, aber richtig: Seltene Namen erhalten oft niedrige Werte, obwohl sie korrekt erkannt sind.
- Zahlen: „Fünfzehn“ und „fünfzig“ liegen klanglich nah beieinander. Ein Fehler hier ist inhaltlich gravierend, auch wenn der Wert nur mittelmäßig niedrig ist.
- Füllwörter: „Äh“, „also“, „ja“ bekommen häufig niedrige Werte, sind aber selten wichtig.
Für die Korrektur heißt das: Niedrige Werte sind ein guter Wegweiser, ersetzen aber nicht den Blick auf die Stellen, die inhaltlich zählen – Zusagen, Beträge, Termine, Verneinungen.
Konfidenzwert und Wortfehlerrate
Beide Begriffe haben mit Genauigkeit zu tun, entstehen aber völlig unterschiedlich. Die Wortfehlerrate wird im Nachhinein gemessen: Man vergleicht das Transkript mit einer von Menschen geprüften Fassung und zählt die Abweichungen. Dafür braucht es diese Referenz.
Der Konfidenzwert dagegen ist eine Selbsteinschätzung des Systems, die ohne Referenz sofort vorliegt. Er sagt nichts darüber, wie viele Fehler ein Transkript tatsächlich enthält, hilft aber bei der Transkriptkorrektur, die Zeit dort einzusetzen, wo Fehler am wahrscheinlichsten sind. Viele niedrige Werte in einem Transkript sind meist ein Hinweis auf schwierige Tonqualität.
Im Transkript steht: „Wir schicken das Angebot (0,98) an Frau Hörtenhuber (0,41) bis Freitag (0,97), über fünfzehn (0,63) Prozent Rabatt reden wir noch.“
Beim Nachhören zeigt sich: Der Name mit dem niedrigsten Wert ist richtig erkannt, er ist nur selten. Die Zahl dagegen ist falsch – gesagt wurde „fünfzig“. Beide Markierungen haben zur richtigen Stelle geführt, aber nur eine davon war ein Fehler.
Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.