Lexikon · Transkription & Audio

Was ist Speech-to-Text?

Kurz erklärt

Speech-to-Text (STT, deutsch: Sprache zu Text) bezeichnet Funktionen und Dienste, die gesprochene Sprache automatisch in geschriebenen Text umwandeln – live beim Sprechen oder nachträglich aus einer Aufnahme.

Auch genannt: STT · Sprache zu Text · Sprache-in-Text · Voice-to-Text

Speech-to-Text und Spracherkennung

Die beiden Begriffe werden oft gleichbedeutend verwendet. Eine sinnvolle Unterscheidung: Spracherkennung (ASR) ist die zugrunde liegende Technik, Speech-to-Text das, was man als Nutzer:in davon bekommt – eine Diktierfunktion, eine Transkriptions-App oder eine Programmierschnittstelle, an die man Audio schickt und Text zurückerhält.

Das Gegenstück heißt Text-to-Speech (TTS): Ein Programm liest geschriebenen Text mit synthetischer Stimme vor. Beide Richtungen kommen oft zusammen vor, etwa in Sprachassistenten oder Telefon-Hotlines mit Sprachmenü.

Live oder aus der Datei

Speech-to-Text-Dienste arbeiten in zwei Betriebsarten, die sich technisch und im Ergebnis unterscheiden:

Echtzeit (Streaming)Nachträglich (Datei)
AblaufAudio wird laufend gesendet, Text erscheint während des SprechensAufnahme wird nach dem Gespräch als Ganzes verarbeitet
Stärkesofortige Anzeige, z. B. für Live-Untertitel oder DiktatModell kennt den ganzen Zusammenhang, meist genauer
SchwächeWörter werden während des Sprechens noch korrigiertErgebnis erst nach der Verarbeitung
Typischer EinsatzDiktieren, Live-Untertitel, SprachsteuerungInterviews, Meetings, Sprachmemos

Mehr zur Live-Variante unter Echtzeit-Transkription.

Mehr als nur Text

Ein guter Speech-to-Text-Dienst liefert neben den Wörtern eine Reihe von Zusatzinformationen, die für die Weiterverarbeitung wichtig sind:

  • Zeitstempel pro Wort oder Satz – Grundlage für Untertitel und für das Nachhören einer Stelle
  • Sprecherwechsel durch Sprechererkennung
  • Konfidenzwerte, die angeben, wie sicher sich das Modell bei einem Wort war
  • Automatische Zeichensetzung und Großschreibung
  • Formatierung von Zahlen, Datum und Beträgen („dreizehn Euro fünfzig“ wird zu „13,50 €“)

Ohne diese Angaben hast du einen langen Textblock. Mit ihnen lässt sich daraus ein durchsuchbares Transkript, eine SRT-Datei oder ein Protokoll bauen.

Wo Speech-to-Text im Alltag steckt

Die gleiche Technik begegnet dir in sehr unterschiedlichen Werkzeugen – mit jeweils anderen Anforderungen:

  • Diktieren: Briefe, E-Mails oder Befunde direkt in ein Dokument sprechen; wichtig sind Sprachbefehle für Satzzeichen und Korrekturen, siehe Diktiersoftware.
  • Sprachnachrichten und Memos: kurze Aufnahmen, meist nur eine Stimme, oft unterwegs mit Nebengeräuschen aufgenommen.
  • Interviews und Meetings: lange Aufnahmen mit mehreren Personen; hier zählen Sprechertrennung und Zeitstempel mehr als jedes einzelne Wort.
  • Untertitel: der Text muss zeitlich exakt zum Bild passen und in kurze, lesbare Zeilen umbrochen werden.
  • Telefon-Hotlines und Sprachmenüs: wenige erwartete Antworten, dafür schlechter Telefonton und kaum Zeit zum Nachdenken.

Ein Dienst, der beim Diktieren glänzt, ist deshalb nicht automatisch die beste Wahl für ein zweistündiges Projektmeeting – und umgekehrt.

Worauf du bei der Auswahl achtest

Erstens die Sprache: Ein Dienst, der Englisch hervorragend beherrscht, kann bei österreichischem Deutsch oder Schweizerdeutsch deutlich schwächer sein. Teste mit eigenen, typischen Aufnahmen statt mit Werbebeispielen. Zweitens das Vokabular: Lassen sich Namen und Fachbegriffe vorgeben?

Drittens der Datenschutz: Wo wird verarbeitet, wird das Audio gespeichert oder zum Training verwendet, gibt es einen Auftragsverarbeitungsvertrag? Und viertens der Aufwand danach: Ein Dienst, der Sprecher trennt und Zeitstempel liefert, spart später mehr Zeit als ein paar Prozentpunkte Genauigkeit.

Beispiel
Was ein Speech-to-Text-Dienst zurückgibt (vereinfacht)

Audio: eine Sprachnachricht von Elisabeth Wimmer, 14 Sekunden

Ergebnis: Sprecher 1 · 00:00,4 – 00:05,1 · „Hallo, ich bin am Dienstag erst ab zehn Uhr im Büro.“ · Sprecher 1 · 00:05,6 – 00:13,2 · „Können wir die Abstimmung zum Angebot auf elf Uhr verschieben?“

Dazu kommen pro Wort Start- und Endzeit sowie ein Konfidenzwert – unsichtbar für dich, aber nützlich für jede Software, die damit weiterarbeitet.

Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.

Häufige Fragen
Was bedeutet Speech-to-Text?

Sprache zu Text: Gesprochenes wird automatisch in geschriebenen Text umgewandelt, live oder aus einer Aufnahme.

Was ist der Unterschied zwischen Speech-to-Text und Text-to-Speech?

Speech-to-Text macht aus Sprache Text, Text-to-Speech liest Text mit einer synthetischen Stimme vor.

Gibt es Speech-to-Text kostenlos?

Ja, etwa die Diktierfunktionen in Windows und macOS. Für lange Aufnahmen mit mehreren Sprechern sind spezialisierte Dienste meist besser geeignet.

Funktioniert Speech-to-Text offline?

Es gibt Modelle, die lokal auf dem Rechner laufen. Sie brauchen entsprechend Rechenleistung; viele Dienste arbeiten dagegen in der Cloud.

Dein nächster Call
schreibt sich selbst mit.

7 Tage alles aus Pro gratis – ohne Kreditkarte.

Jetzt kostenlos testen