Warum Spracherkennung Namen falsch schreibt
Eine Spracherkennung wählt die Wortfolge, die zum Klang passt und gleichzeitig am wahrscheinlichsten ist. Häufige Wörter gewinnen deshalb im Zweifel gegen seltene. Ein Nachname wie Hörtenhuber, ein neuer Produktname, eine Abkürzung aus der Branche – all das kommt in den Trainingsdaten kaum vor.
Bei manchen Namen hilft auch die beste Tonqualität nicht: Meier, Meyer, Maier und Mayer klingen identisch. Ohne Zusatzinformation kann die Software nur raten, welche Schreibweise gemeint ist. Genau diese Zusatzinformation liefert ein Benutzerwörterbuch.
Ähnlich geht es Abkürzungen, die buchstabiert werden („U-G-B“), englischen Produktnamen mitten in deutschen Sätzen und Wortschöpfungen aus dem eigenen Unternehmen. Die Spracherkennung kennt sie nicht und ersetzt sie durch etwas, das ähnlich klingt und ihr vertraut ist. Das Ergebnis sieht oft plausibel aus und fällt beim Überfliegen nicht auf – gerade das macht diese Fehler tückisch.
Wie ein Benutzerwörterbuch wirkt
Je nach Software steckt hinter dem Begriff einer von drei Ansätzen, manchmal auch eine Kombination:
- Gewichtung während der Erkennung: Eingetragene Begriffe bekommen eine höhere Wahrscheinlichkeit. Passt der Klang einigermaßen, setzt sich das eingetragene Wort durch.
- Ersetzungsregeln danach: Bekannte Fehlschreibungen werden im fertigen Text automatisch ausgetauscht, etwa „Hube Bau“ durch „Huber Bau“.
- Korrektur mit Kontext: Ein Sprachmodell gleicht das Transkript mit der Liste ab und korrigiert Stellen, an denen ein eingetragener Begriff offensichtlich gemeint war.
Davon zu unterscheiden ist das Nachtrainieren eines Modells mit eigenen Daten (Fine-Tuning). Das ist deutlich aufwendiger und für einzelne Namen und Fachbegriffe kaum nötig.
Was hineingehört – und was nicht
Ein gutes Benutzerwörterbuch ist kurz und gezielt. Hinein gehören:
- Namen von Kund:innen, Kolleg:innen und Ansprechpersonen in der richtigen Schreibweise
- Firmen-, Marken- und Produktnamen
- Fachbegriffe und Abkürzungen der eigenen Branche
- Orts- und Straßennamen, die regelmäßig fallen
Nicht hinein gehören Allerweltswörter, die ohnehin richtig erkannt werden. Werden sie zusätzlich gewichtet, tauchen sie an Stellen auf, an denen etwas Ähnliches gesagt wurde – das Wörterbuch erzeugt dann neue Fehler, statt alte zu beheben. Auch lange Listen „auf Vorrat“ und viele ähnlich klingende Einträge machen die Erkennung eher unsicherer.
Bewährt hat sich, das Wörterbuch aus echten Fehlern aufzubauen: Was beim Korrigieren zum zweiten Mal falsch auftaucht, kommt hinein.
Wörterbuch, Korrektur, Training im Vergleich
Alle drei verbessern Transkripte, wirken aber an unterschiedlichen Stellen:
| Ansatz | Wirkt auf | Aufwand |
|---|---|---|
| Benutzerwörterbuch | alle künftigen Transkripte | gering, einmal eintragen |
| Transkriptkorrektur | genau ein Transkript | bei jedem Transkript neu |
| Fine-Tuning | das Modell selbst | hoch, braucht viele Beispieldaten |
In der Praxis ergänzen sich die drei: Das Wörterbuch fängt wiederkehrende Begriffe ab, die Korrektur kümmert sich um den Rest eines einzelnen Gesprächs. Ein eigenes Training lohnt sich erst, wenn eine ganze Fachsprache mit sehr vielen Spezialbegriffen betroffen ist und genug geprüftes Material vorliegt.
In den Transkripten von Kanzlei Berger wird aus der Mandantin Hörtenhuber regelmäßig „Herten Huber“, aus dem Unternehmensgesetzbuch „UGB“ ein „U-Gebe“ und aus dem Kunden Leitner Logistik „Leitner Logik“.
Frau Berger trägt Hörtenhuber, UGB und Leitner Logistik ins Wörterbuch ein. „Jahresabschluss“ und „Bilanz“ lässt sie weg – die werden ohnehin richtig erkannt. Ab dem nächsten Gespräch stimmen die drei Begriffe.
Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.