Lexikon · Transkription & Audio

Was ist MP3 und wie funktioniert es?

Kurz erklärt

MP3 ist ein verlustbehaftetes Audioformat: Es verkleinert Tonaufnahmen stark, indem es Anteile weglässt, die das Gehör kaum wahrnimmt. Bei üblichen Einstellungen ist eine MP3 rund ein Zehntel so groß wie dieselbe Aufnahme als unkomprimierte WAV-Datei.

Auch genannt: MPEG-1 Audio Layer III · MPEG Audio Layer 3 · .mp3

Wie MP3 Dateien klein macht

MP3 wurde maßgeblich am Fraunhofer-Institut für Integrierte Schaltungen in Erlangen entwickelt und Anfang der 1990er-Jahre als Teil des MPEG-Standards festgelegt. Der Kern ist ein psychoakustisches Modell: eine Beschreibung dessen, was Menschen tatsächlich hören.

Ein Beispiel ist die Verdeckung. Ein lauter Ton überdeckt leisere Töne mit ähnlicher Frequenz, die gleichzeitig oder kurz danach erklingen. MP3 speichert solche Anteile ungenauer oder gar nicht. Das Ergebnis wird anschließend platzsparend codiert. Was dabei weggefallen ist, lässt sich nicht wiederherstellen – deshalb „verlustbehaftet“.

Die wesentlichen Patente sind inzwischen abgelaufen. MP3 kann heute frei verwendet werden und wird von praktisch jedem Gerät abgespielt.

Die Bitrate entscheidet über Größe und Klang

Wie viel weggelassen wird, steuert die Bitrate – die Datenmenge pro Sekunde in kbit/s. MP3 erlaubt Werte von 32 bis 320 kbit/s, entweder konstant (CBR) oder schwankend je nach Komplexität der Stelle (VBR). Eine Stunde mit 64 kbit/s belegt rund 29 MB, mit 128 kbit/s rund 58 MB, mit 320 kbit/s rund 144 MB. Bei CBR lässt sich die Dateigröße genau vorhersagen, bei VBR fällt sie je nach Inhalt kleiner oder größer aus – bei gleicher Qualität meist etwas kleiner.

Sprache braucht deutlich weniger als Musik: Die Stimme nutzt einen schmaleren Frequenzbereich, und für ein Gespräch genügt ein Kanal. Für reine Sprachaufnahmen ist Mono mit 64 kbit/s ein verbreiteter Kompromiss. Wird die Bitrate sehr niedrig, entstehen hörbare Artefakte – zischelnde S-Laute, ein blubbernder, metallischer Klang. Genau diese Stellen machen auch der Spracherkennung zu schaffen, etwa bei Namen und Zahlen.

Warum man MP3 nicht mehrfach speichert

Jedes erneute Komprimieren wirft wieder Information weg, auch wenn die Datei vorher schon eine MP3 war. Wer eine MP3 schneidet, als MP3 speichert und das ein paar Mal wiederholt, hört die Verluste irgendwann deutlich. Man spricht von Generationsverlust.

Der saubere Weg: unkomprimiert aufnehmen und bearbeiten, etwa als WAV, und erst ganz am Ende eine MP3 erzeugen. Umgekehrt bringt es nichts, eine MP3 in WAV umzuwandeln – die Datei wird größer, aber nicht besser.

Dasselbe gilt für Aufnahmen, die schon komprimiert ankommen: Smartphones, Messenger und Videocall-Programme verkleinern Sprache bereits beim Aufnehmen oder Übertragen. Wer eine solche Datei erneut als MP3 speichert, stapelt zwei verlustbehaftete Verfahren. Besser ist es, die Datei im Originalformat weiterzugeben, wenn das Zielprogramm sie annimmt.

MP3 und die anderen Formate

MP3 ist das bekannteste, aber nicht mehr das effizienteste Format. Ein Überblick über das, was heute daneben verwendet wird:

FormatKompressionTypischer Einsatz
MP3verlustbehaftetPodcasts, Diktiergeräte, universelle Weitergabe
AAC (.m4a)verlustbehaftet, bei gleicher Bitrate meist effizienterSmartphone-Sprachmemos, Streaming
Opusverlustbehaftet, auf Sprache und Echtzeit ausgelegtVideocalls, Browser-Aufnahmen
FLACverlustfrei komprimiertArchiv, Musik
WAVmeist unkomprimiertAufnahme, Schnitt, Master

Mehr zu den Unterschieden zwischen Dateiformat und Komprimierungsverfahren erklären die Einträge Audioformat, Audio-Codec und Opus.

Beispiel
Das Diktiergerät im Langzeitmodus

Sachbearbeiter Gruber nimmt Kundengespräche mit einem Diktiergerät auf, das im Langzeitmodus MP3 mit 32 kbit/s speichert. Die Dateien sind winzig, aber im Transkript sind Namen und Beträge oft falsch – S- und F-Laute klingen verwaschen.

Er stellt auf die nächsthöhere Qualitätsstufe um. Die Dateien werden größer, passen aber immer noch problemlos auf die Speicherkarte, und die Zahl der Fehler im Transkript sinkt spürbar.

Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.

Häufige Fragen
Welche MP3-Bitrate reicht für Sprachaufnahmen?

Für reine Sprache in Mono sind 64 kbit/s ein verbreiteter Wert. Deutlich darunter leiden Zischlaute und Namen, deutlich darüber wird die Datei größer, ohne dass das Transkript besser wird.

Ist MP3 für die Transkription geeignet?

Ja, solange die Bitrate nicht zu niedrig ist. Mikrofon, Abstand und Störgeräusche wirken sich in der Regel stärker auf das Ergebnis aus als das Dateiformat.

Was ist der Unterschied zwischen MP3 und M4A?

M4A ist ein Container, der meist AAC-Audio enthält. AAC ist wie MP3 verlustbehaftet, erreicht bei gleicher Bitrate aber meist eine bessere Qualität.

Wird eine MP3 besser, wenn ich sie in WAV umwandle?

Nein. Die bei der Kompression verlorene Information kommt nicht zurück, die Datei wird nur größer.

Dein nächster Call
schreibt sich selbst mit.

7 Tage alles aus Pro gratis – ohne Kreditkarte.

Jetzt kostenlos testen