Wie eine WAV-Datei aufgebaut ist
WAV wurde Anfang der 1990er-Jahre von Microsoft und IBM eingeführt und baut auf dem Containerformat RIFF auf. Am Anfang der Datei steht ein kurzer Kopfbereich mit den technischen Eckdaten: Anzahl der Kanäle, Abtastrate und Bittiefe. Danach folgen die eigentlichen Audiodaten.
Meist sind das PCM-Daten: Das Signal wird in festen Abständen gemessen, und jeder Messwert wird als Zahl mit fester Genauigkeit gespeichert – bei 16 Bit sind 65.536 Stufen möglich. Streng genommen ist WAV nur der Behälter. Er kann auch komprimierte Daten aufnehmen, das kommt in der Praxis aber selten vor. Wer „WAV“ sagt, meint fast immer unkomprimiertes Audio.
Eine Variante ist das Broadcast Wave Format (BWF) aus dem Rundfunk. Es ergänzt Metadaten wie Aufnahmezeitpunkt und Beschreibung und wird von vielen professionellen Recordern verwendet.
Wie groß WAV-Dateien werden
Weil nichts weggelassen wird, lässt sich die Größe exakt ausrechnen: Abtastrate × Bittiefe × Kanäle ergibt die Datenmenge pro Sekunde. Drei typische Einstellungen:
| Einstellung | Datenrate | pro Minute | pro Stunde |
|---|---|---|---|
| 16 kHz, 16 Bit, Mono (Sprache) | 256 kbit/s | ca. 1,9 MB | ca. 115 MB |
| 44,1 kHz, 16 Bit, Stereo (CD-Qualität) | 1.411 kbit/s | ca. 10,6 MB | ca. 635 MB |
| 48 kHz, 24 Bit, Stereo (Video, Studio) | 2.304 kbit/s | ca. 17,3 MB | ca. 1 GB |
Eine technische Grenze gibt es auch: Der Kopfbereich speichert die Dateigröße als 32-Bit-Zahl, deshalb ist bei etwa 4 GB Schluss. Bei 48 kHz, 24 Bit und Stereo ist das nach gut vier Stunden erreicht. Für längere Aufnahmen gibt es Erweiterungen wie RF64; manche Recorder teilen lange Aufnahmen stattdessen in mehrere Dateien.
WAV im Vergleich zu MP3, FLAC und Opus
Der entscheidende Unterschied ist, ob Information verloren geht. WAV speichert alles. FLAC ist ebenfalls verlustfrei, packt die Daten aber wie eine ZIP-Datei zusammen – der Inhalt bleibt identisch, die Datei wird kleiner. MP3, AAC und Opus sind verlustbehaftet: Sie lassen Anteile weg, die man kaum hört, und sind dadurch um ein Vielfaches kleiner.
WAV ist deshalb das Format für Aufnahme und Bearbeitung. Wer schneidet, Lautstärke anpasst und mehrfach speichert, verliert bei WAV nichts, bei MP3 dagegen mit jedem neuen Speichern ein wenig. Zum Verschicken oder Hochladen ist eine komprimierte Kopie meist praktischer. Mehr zu den Grundlagen steht unter Audioformat und Audio-Codec.
WAV und Transkription
Für die Spracherkennung ist WAV ein sicheres Ausgangsmaterial, weil keine Kompressionsartefakte stören. Mehr Bits und höhere Abtastraten bringen aber ab einem gewissen Punkt nichts mehr: Viele Spracherkennungsmodelle rechnen intern mit 16 kHz. Eine Aufnahme mit 96 kHz und 24 Bit wird dadurch nicht besser transkribiert, sie dauert nur länger beim Hochladen.
Und eine WAV-Datei, die aus einer MP3 umgewandelt wurde, ist nicht besser als die MP3 – was beim Komprimieren verloren ging, kommt nicht zurück. Viel mehr Einfluss auf das Transkript haben Mikrofon, Abstand zum Mund, Pegel und Raumakustik.
Lena Huber nimmt für ihre Masterarbeit ein 90-minütiges Experteninterview mit einem Handrecorder auf – eingestellt auf WAV mit 48 kHz, 24 Bit, Stereo. Die Datei ist rund 1,6 GB groß.
Fürs Transkribieren exportiert sie eine Kopie als Mono-WAV mit 16 kHz und 16 Bit: rund 170 MB, für die Spracherkennung gleichwertig, aber in einem Bruchteil der Zeit hochgeladen.
Die Originaldatei bleibt als Master auf ihrer externen Festplatte – falls sie später eine Stelle genauer anhören oder ein Zitat prüfen muss.
Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.