Warum es Codecs braucht
Unkomprimierter Ton ist datenhungrig: Eine Minute Stereo in CD-Qualität belegt rund 10 MB. Für einen Videocall müsste diese Datenmenge in Echtzeit in beide Richtungen fließen, für einen Musikstreamingdienst millionenfach. Ein Codec verkleinert die Daten so, dass sie in die verfügbare Leitung oder den Speicher passen, und stellt beim Abspielen einen Ton her, der dem Original möglichst nahekommt.
Wichtig ist die Abgrenzung zum Audioformat: Der Codec ist das Rechenverfahren für den Ton, das Format beziehungsweise der Container die Verpackung der Datei. Ein Container kann verschiedene Codecs enthalten.
Wie verlustbehaftete Codecs sparen
Verlustbehaftete Codecs nutzen Eigenheiten des Gehörs. Ein lauter Ton überdeckt leisere Töne in benachbarten Frequenzen, sehr hohe und sehr leise Anteile nehmen wir schlecht wahr. Was nach einem solchen psychoakustischen Modell kaum hörbar ist, wird gröber gespeichert oder weggelassen. Musik-Codecs wie MP3 oder AAC zerlegen das Signal dazu in Frequenzbänder.
Sprach-Codecs gehen oft anders vor: Sie beschreiben, vereinfacht gesagt, wie der menschliche Stimmapparat den Klang formt, und übertragen nur die Parameter dieses Modells. Das ist bei Sprache sehr effizient, bei Musik klingt es dagegen schnell künstlich. Moderne Codecs wie Opus kombinieren beide Ansätze.
Die wichtigsten Arten
Codecs lassen sich nach Zweck und Arbeitsweise einordnen:
| Art | Beispiele | Typischer Einsatz |
|---|---|---|
| Unkomprimiert (PCM) | in WAV, AIFF | Aufnahme, Schnitt, Studio |
| Verlustfrei | FLAC, ALAC | Archiv, hochwertige Musiksammlungen |
| Verlustbehaftet, allgemein | MP3, AAC, Vorbis | Musik, Podcasts, Videos |
| Sprach-Codecs | G.711 (klassisches Festnetz), AMR-WB (Mobilfunk) | Telefonie |
| Universell für Echtzeit | Opus | Videocalls, Internettelefonie, Sprachchat |
Codecs in Videocalls
Bei Calls zählt neben Klang und Datenmenge vor allem die Verzögerung. Ein Codec, der erst eine halbe Sekunde Ton sammeln muss, bevor er ihn verschicken kann, macht Gespräche zäh. Echtzeit-Codecs arbeiten deshalb mit sehr kurzen Abschnitten von wenigen Millisekunden und können verlorene Datenpakete überbrücken, ohne dass das Gespräch abreißt.
Welcher Codec verwendet wird, handeln die beteiligten Programme beim Verbindungsaufbau aus und passen ihn laufend an die Leitung an. Für den Standard WebRTC, auf dem viele Videocalls im Browser beruhen, sind Opus und G.711 als Pflicht-Codecs festgelegt.
Was Codecs fürs Transkript bedeuten
Spracherkennung kommt mit komprimiertem Ton gut zurecht, solange die Sprache verständlich bleibt. Schwierig wird es bei sehr niedriger Bitrate, bei schmalbandigen Telefon-Codecs, die die oberen Frequenzen abschneiden, und bei mehrfach umcodierten Dateien. Ein Call, der als Opus übertragen, als MP3 gespeichert und dann noch einmal komprimiert verschickt wurde, hat drei Runden Verlust hinter sich.
Faustregel: so früh wie möglich in guter Qualität aufnehmen und so selten wie möglich neu codieren. Wenn ein Dienst die Originaldatei annimmt, schick sie so, wie sie ist – auch wenn die Endung ungewohnt wirkt. Die Umwandlung in ein „bekannteres“ Format verbessert nichts, sie kostet nur eine weitere Runde Qualität.
Ein Sonderfall sind Aufnahmen von Telefonaten über das klassische Netz: Hier ist die Bandbreite schon durch den Telefon-Codec begrenzt, bevor die Aufnahme überhaupt beginnt. Daran ändert auch die beste Aufnahmesoftware nichts mehr.
Frau Pichler ruft über das Festnetz an und sagt: „Die Lieferung kommt am Fünfzehnten.“ Der Telefon-Codec überträgt nur einen schmalen Frequenzbereich, das „f“ und das „s“ klingen verwaschen.
Dieselbe Aussage im Videocall mit Opus ist deutlich klarer – für das menschliche Ohr ein Komfortgewinn, für die Spracherkennung oft der Unterschied zwischen „Fünfzehnten“ und „fünften“.
Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.