Wie Sprechererkennung funktioniert
Die Software zerlegt die Aufnahme in kurze Stücke und berechnet für jedes einen „Stimmabdruck“ – Merkmale wie Tonhöhe, Klangfarbe und Sprechweise. Stücke mit ähnlichem Abdruck werden zu einer Stimme zusammengefasst und durchnummeriert: Stimme 1, Stimme 2, Stimme 3.
Wichtig: Die Software weiß dabei nicht, wie die Personen heißen. Namen kommen erst dazu, wenn jemand sie zuordnet oder wenn sie im Gespräch eindeutig fallen („Danke, Frau Gruber“).
Sprechererkennung ist nicht Spracherkennung
Die Begriffe werden oft verwechselt. Spracherkennung macht aus gesprochenen Wörtern Text. Sprechererkennung beantwortet die Frage, wer gesprochen hat. Gute Transkripte brauchen beides.
Davon zu unterscheiden ist außerdem die Sprecher-Identifikation, wie sie etwa beim Entsperren per Stimme verwendet wird: Dort wird eine bekannte Person wiedererkannt. Bei der Diarisierung in Meetings geht es nur darum, Stimmen auseinanderzuhalten.
Wo sie an Grenzen stößt
Unter guten Bedingungen trennt moderne Software Stimmen zuverlässig. Schwierig wird es in diesen Situationen:
- Mehrere Personen reden gleichzeitig oder fallen sich ins Wort
- Sehr ähnliche Stimmen, etwa zwei Personen mit ähnlicher Stimmlage
- Kurze Einwürfe wie „ja“ oder „genau“, die zu wenig Klang für eine Zuordnung liefern
- Viele Personen in einem Raum, die ein gemeinsames Mikrofon teilen
- Hall, Störgeräusche oder starke Komprimierung der Aufnahme
Getrennte Tonspuren: die zuverlässigste Abkürzung
Am sichersten ist die Zuordnung, wenn Stimmen gar nicht erst vermischt werden. Bei einem Online-Call lässt sich das eigene Mikrofon getrennt vom Ton der Gegenseite aufnehmen – eine Mehrspuraufnahme. Dann steht fest, welche Sätze von dir stammen und welche von der Gegenseite.
Sitzen auf der Gegenseite mehrere Personen, kommt deren Ton trotzdem gemischt an. Für diese Spur braucht es wieder Diarisierung.
So bekommst du bessere Ergebnisse
Ein paar einfache Gewohnheiten verbessern die Sprecherzuordnung spürbar – unabhängig davon, welche Software du nutzt:
- Headset statt Laptop-Mikrofon: Deine Stimme kommt klar an, und der Ton der Gegenseite landet nicht als Echo auf deiner Spur.
- Ausreden lassen: Je seltener zwei Personen gleichzeitig sprechen, desto sauberer die Trennung.
- Vorstellungsrunde bei neuen Gesprächspartnern: Ein kurzer Satz pro Person liefert genug Stimmmaterial und gleich den Namen dazu.
- Gemeinsame Raummikrofone meiden: Wenn mehrere Personen an einem Konferenztelefon sitzen, verschwimmen die Stimmen am stärksten.
Und wenn die Zuordnung doch einmal danebenliegt: Prüfe die Stellen, an denen es wirklich darauf ankommt – Zusagen, Zahlen, Termine. Dort lohnt sich ein kurzer Blick ins Transkript.
Du (00:04:12): Wie weit seid ihr mit der Freigabe?
Stimme 1 (00:04:15): Die Rechtsabteilung hat noch zwei Anmerkungen.
Stimme 2 (00:04:19): Die schicke ich dir heute bis Mittag.
Wird Stimme 2 später als „Herr Leitner“ benannt, ändert sich die Bezeichnung im ganzen Transkript.
Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.