Ein Kanal oder zwei
Bei Mono gibt es genau ein Signal. Beim Abspielen kommt es aus beiden Lautsprechern gleich, die Stimme klingt deshalb „in der Mitte“. Bei Stereo werden zwei getrennte Signale gespeichert. Aus kleinen Unterschieden in Lautstärke und Zeitpunkt zwischen links und rechts entsteht ein räumlicher Eindruck – man hört, wo ein Instrument auf der Bühne steht.
Unkomprimiert braucht Stereo doppelt so viel Platz wie Mono. Neben diesen beiden gibt es Mehrkanalton wie 5.1 für Film und Heimkino; für Gespräche spielt er keine Rolle.
Wichtig ist der Unterschied zwischen Aufnahme und Wiedergabe: Eine Mono-Datei klingt auf Stereo-Kopfhörern völlig normal. Man verliert nur den räumlichen Eindruck, der bei einem Gespräch ohnehin kaum eine Rolle spielt.
Warum Sprache meist in Mono aufgenommen wird
Ein einzelnes Mikrofon liefert ein einzelnes Signal. Wird es trotzdem als Stereo gespeichert, enthalten beide Kanäle dasselbe – man nennt das Dual-Mono. Die Datei ist doppelt so groß, ohne dass sie mehr Information enthält.
Viele Spracherkennungssysteme mischen Stereo ohnehin zu Mono zusammen, bevor sie transkribieren. Dabei kann in seltenen Fällen etwas schiefgehen: Ist ein Kanal durch einen Verkabelungs- oder Einstellungsfehler phasenverdreht, löschen sich die beiden Signale beim Zusammenmischen teilweise aus, und die Stimme klingt plötzlich dünn und leise. Wer eine Stereodatei vor dem Hochladen in Mono umwandelt, sollte kurz reinhören.
Wenn Stereo wirklich nützt: ein Sprecher pro Kanal
Interessant wird Stereo, wenn die beiden Kanäle nicht links und rechts im Raum bedeuten, sondern zwei verschiedene Quellen. Bei Callcentern ist das verbreitet: links die eigene Stimme, rechts die Gegenseite. Auch Recorder mit zwei Ansteckmikrofonen können jede Person auf einen eigenen Kanal legen.
Für die Transkription ist das ein großer Vorteil. Manche Dienste werten jeden Kanal getrennt aus. Dann steht fest, wer gesprochen hat, und auch Stellen, an denen beide gleichzeitig reden, gehen nicht verloren. Die Sprechererkennung muss nur noch dort raten, wo sich mehrere Personen einen Kanal teilen.
Abzugrenzen ist das von der Mehrspuraufnahme: Dort liegen die Quellen auf getrennten Tonspuren, oft in eigenen Dateien und auch mehr als zwei. Ein Stereo-File mit einer Person pro Kanal ist im Grunde eine Mehrspuraufnahme mit genau zwei Spuren in einer Datei.
Kurze Entscheidungshilfe
Welche Variante passt, hängt davon ab, wie viele Mikrofone im Spiel sind und wofür die Aufnahme gebraucht wird:
| Situation | Sinnvoll |
|---|---|
| Diktat, Sprachnotiz, Telefonnotiz | Mono |
| Interview mit einem gemeinsamen Mikrofon | Mono |
| Zwei Ansteckmikrofone an einem Recorder | Stereo mit je einer Person pro Kanal |
| Online-Call mitschneiden | eigene Stimme und Gegenseite getrennt (zwei Kanäle oder Spuren) |
| Musik, Raumklang, Atmosphäre | Stereo |
Im Zweifel gilt: lieber getrennt aufnehmen und später mischen als umgekehrt. Aus zwei Kanälen lässt sich jederzeit eine Mono-Fassung machen, aus einer Mischung aber nie wieder zwei saubere Einzelstimmen.
Beraterin Hofer führt Kundeninterviews mit zwei Ansteckmikrofonen. Ihr Recorder speichert Stereo: links ihre Stimme, rechts die des Gastes.
Mit Kopfhörern klingt das ungewohnt – jede Stimme kommt nur aus einem Ohr. Für die Auswertung ist es ideal: Im Transkript ist eindeutig, welche Frage von ihr kam und welche Antwort vom Gast, auch wenn beide kurz gleichzeitig sprechen.
Zum bloßen Anhören erstellt sie bei Bedarf eine Mono-Mischung; das Original mit zwei Kanälen behält sie.
Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.