Lexikon · Transkription & Audio

Was ist Sprechererkennung?

Kurz erklärt

Sprechererkennung (Fachbegriff: Diarisierung) teilt eine Aufnahme in Abschnitte auf und ordnet jeden davon einer Stimme zu. Das Transkript zeigt dann nicht nur, was gesagt wurde, sondern auch, wer es gesagt hat.

Auch genannt: Diarisierung · Speaker Diarization · Sprecherzuordnung

Wie Sprechererkennung funktioniert

Die Software zerlegt die Aufnahme in kurze Stücke und berechnet für jedes einen „Stimmabdruck“ – Merkmale wie Tonhöhe, Klangfarbe und Sprechweise. Stücke mit ähnlichem Abdruck werden zu einer Stimme zusammengefasst und durchnummeriert: Stimme 1, Stimme 2, Stimme 3.

Wichtig: Die Software weiß dabei nicht, wie die Personen heißen. Namen kommen erst dazu, wenn jemand sie zuordnet oder wenn sie im Gespräch eindeutig fallen („Danke, Frau Gruber“).

Sprechererkennung ist nicht Spracherkennung

Die Begriffe werden oft verwechselt. Spracherkennung macht aus gesprochenen Wörtern Text. Sprechererkennung beantwortet die Frage, wer gesprochen hat. Gute Transkripte brauchen beides.

Davon zu unterscheiden ist außerdem die Sprecher-Identifikation, wie sie etwa beim Entsperren per Stimme verwendet wird: Dort wird eine bekannte Person wiedererkannt. Bei der Diarisierung in Meetings geht es nur darum, Stimmen auseinanderzuhalten.

Wo sie an Grenzen stößt

Unter guten Bedingungen trennt moderne Software Stimmen zuverlässig. Schwierig wird es in diesen Situationen:

  • Mehrere Personen reden gleichzeitig oder fallen sich ins Wort
  • Sehr ähnliche Stimmen, etwa zwei Personen mit ähnlicher Stimmlage
  • Kurze Einwürfe wie „ja“ oder „genau“, die zu wenig Klang für eine Zuordnung liefern
  • Viele Personen in einem Raum, die ein gemeinsames Mikrofon teilen
  • Hall, Störgeräusche oder starke Komprimierung der Aufnahme

Getrennte Tonspuren: die zuverlässigste Abkürzung

Am sichersten ist die Zuordnung, wenn Stimmen gar nicht erst vermischt werden. Bei einem Online-Call lässt sich das eigene Mikrofon getrennt vom Ton der Gegenseite aufnehmen – eine Mehrspuraufnahme. Dann steht fest, welche Sätze von dir stammen und welche von der Gegenseite.

Sitzen auf der Gegenseite mehrere Personen, kommt deren Ton trotzdem gemischt an. Für diese Spur braucht es wieder Diarisierung.

So bekommst du bessere Ergebnisse

Ein paar einfache Gewohnheiten verbessern die Sprecherzuordnung spürbar – unabhängig davon, welche Software du nutzt:

  • Headset statt Laptop-Mikrofon: Deine Stimme kommt klar an, und der Ton der Gegenseite landet nicht als Echo auf deiner Spur.
  • Ausreden lassen: Je seltener zwei Personen gleichzeitig sprechen, desto sauberer die Trennung.
  • Vorstellungsrunde bei neuen Gesprächspartnern: Ein kurzer Satz pro Person liefert genug Stimmmaterial und gleich den Namen dazu.
  • Gemeinsame Raummikrofone meiden: Wenn mehrere Personen an einem Konferenztelefon sitzen, verschwimmen die Stimmen am stärksten.

Und wenn die Zuordnung doch einmal danebenliegt: Prüfe die Stellen, an denen es wirklich darauf ankommt – Zusagen, Zahlen, Termine. Dort lohnt sich ein kurzer Blick ins Transkript.

Beispiel
So sieht das im Transkript aus

Du (00:04:12): Wie weit seid ihr mit der Freigabe?

Stimme 1 (00:04:15): Die Rechtsabteilung hat noch zwei Anmerkungen.

Stimme 2 (00:04:19): Die schicke ich dir heute bis Mittag.

Wird Stimme 2 später als „Herr Leitner“ benannt, ändert sich die Bezeichnung im ganzen Transkript.

Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.

Häufige Fragen
Wie viele Sprecher kann Sprechererkennung unterscheiden?

Technisch oft zehn und mehr. In der Praxis sinkt die Zuverlässigkeit, je mehr Personen sprechen und je öfter sie sich unterbrechen.

Erkennt die Software automatisch die Namen der Sprecher?

Nein. Sie nummeriert Stimmen durch. Namen werden danach zugeordnet – von Hand oder per KI, wenn sie im Gespräch eindeutig fallen.

Warum werden manchmal zwei Personen als eine Stimme erkannt?

Meist bei ähnlichen Stimmen, wenn jemand nur kurz spricht oder viel durcheinandergeredet wird. Bessere Mikrofone und klare Redebeiträge helfen.

Was bedeutet Diarisierung?

Diarisierung ist der Fachbegriff für Sprechererkennung. Er kommt vom englischen „diarization“, abgeleitet von „diary“ – also wer wann gesprochen hat.

Dein nächster Call
schreibt sich selbst mit.

7 Tage alles aus Pro gratis – ohne Kreditkarte.

Jetzt kostenlos testen