Speech-to-Text und Spracherkennung
Die beiden Begriffe werden oft gleichbedeutend verwendet. Eine sinnvolle Unterscheidung: Spracherkennung (ASR) ist die zugrunde liegende Technik, Speech-to-Text das, was man als Nutzer:in davon bekommt – eine Diktierfunktion, eine Transkriptions-App oder eine Programmierschnittstelle, an die man Audio schickt und Text zurückerhält.
Das Gegenstück heißt Text-to-Speech (TTS): Ein Programm liest geschriebenen Text mit synthetischer Stimme vor. Beide Richtungen kommen oft zusammen vor, etwa in Sprachassistenten oder Telefon-Hotlines mit Sprachmenü.
Live oder aus der Datei
Speech-to-Text-Dienste arbeiten in zwei Betriebsarten, die sich technisch und im Ergebnis unterscheiden:
| Echtzeit (Streaming) | Nachträglich (Datei) | |
|---|---|---|
| Ablauf | Audio wird laufend gesendet, Text erscheint während des Sprechens | Aufnahme wird nach dem Gespräch als Ganzes verarbeitet |
| Stärke | sofortige Anzeige, z. B. für Live-Untertitel oder Diktat | Modell kennt den ganzen Zusammenhang, meist genauer |
| Schwäche | Wörter werden während des Sprechens noch korrigiert | Ergebnis erst nach der Verarbeitung |
| Typischer Einsatz | Diktieren, Live-Untertitel, Sprachsteuerung | Interviews, Meetings, Sprachmemos |
Mehr zur Live-Variante unter Echtzeit-Transkription.
Mehr als nur Text
Ein guter Speech-to-Text-Dienst liefert neben den Wörtern eine Reihe von Zusatzinformationen, die für die Weiterverarbeitung wichtig sind:
- Zeitstempel pro Wort oder Satz – Grundlage für Untertitel und für das Nachhören einer Stelle
- Sprecherwechsel durch Sprechererkennung
- Konfidenzwerte, die angeben, wie sicher sich das Modell bei einem Wort war
- Automatische Zeichensetzung und Großschreibung
- Formatierung von Zahlen, Datum und Beträgen („dreizehn Euro fünfzig“ wird zu „13,50 €“)
Ohne diese Angaben hast du einen langen Textblock. Mit ihnen lässt sich daraus ein durchsuchbares Transkript, eine SRT-Datei oder ein Protokoll bauen.
Wo Speech-to-Text im Alltag steckt
Die gleiche Technik begegnet dir in sehr unterschiedlichen Werkzeugen – mit jeweils anderen Anforderungen:
- Diktieren: Briefe, E-Mails oder Befunde direkt in ein Dokument sprechen; wichtig sind Sprachbefehle für Satzzeichen und Korrekturen, siehe Diktiersoftware.
- Sprachnachrichten und Memos: kurze Aufnahmen, meist nur eine Stimme, oft unterwegs mit Nebengeräuschen aufgenommen.
- Interviews und Meetings: lange Aufnahmen mit mehreren Personen; hier zählen Sprechertrennung und Zeitstempel mehr als jedes einzelne Wort.
- Untertitel: der Text muss zeitlich exakt zum Bild passen und in kurze, lesbare Zeilen umbrochen werden.
- Telefon-Hotlines und Sprachmenüs: wenige erwartete Antworten, dafür schlechter Telefonton und kaum Zeit zum Nachdenken.
Ein Dienst, der beim Diktieren glänzt, ist deshalb nicht automatisch die beste Wahl für ein zweistündiges Projektmeeting – und umgekehrt.
Worauf du bei der Auswahl achtest
Erstens die Sprache: Ein Dienst, der Englisch hervorragend beherrscht, kann bei österreichischem Deutsch oder Schweizerdeutsch deutlich schwächer sein. Teste mit eigenen, typischen Aufnahmen statt mit Werbebeispielen. Zweitens das Vokabular: Lassen sich Namen und Fachbegriffe vorgeben?
Drittens der Datenschutz: Wo wird verarbeitet, wird das Audio gespeichert oder zum Training verwendet, gibt es einen Auftragsverarbeitungsvertrag? Und viertens der Aufwand danach: Ein Dienst, der Sprecher trennt und Zeitstempel liefert, spart später mehr Zeit als ein paar Prozentpunkte Genauigkeit.
Audio: eine Sprachnachricht von Elisabeth Wimmer, 14 Sekunden
Ergebnis: Sprecher 1 · 00:00,4 – 00:05,1 · „Hallo, ich bin am Dienstag erst ab zehn Uhr im Büro.“ · Sprecher 1 · 00:05,6 – 00:13,2 · „Können wir die Abstimmung zum Angebot auf elf Uhr verschieben?“
Dazu kommen pro Wort Start- und Endzeit sowie ein Konfidenzwert – unsichtbar für dich, aber nützlich für jede Software, die damit weiterarbeitet.
Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.