Das Prinzip: nicht mischen, bevor es nötig ist
Bei einer gewöhnlichen Aufnahme landet alles, was die Mikrofone hören, in einer gemeinsamen Mischung. Was einmal gemischt ist, lässt sich nur noch mühsam trennen. Bei einer Mehrspuraufnahme bleibt jede Quelle auf ihrer eigenen Tonspur: die Gesangsstimme getrennt von der Gitarre, die Moderatorin getrennt vom Gast.
Daraus ergeben sich die Vorteile: Jede Spur bekommt ihre eigene Lautstärke, ein Husten auf Spur zwei lässt sich entfernen, ohne Spur eins zu berühren, und ein Störgeräusch bei einer Person verdirbt nicht die ganze Aufnahme. In Musikstudios und bei Podcasts ist das seit Langem Standard.
Mehrspur ist nicht dasselbe wie Stereo
Eine Stereo-Aufnahme hat zwei Kanäle, links und rechts. Normalerweise bilden sie gemeinsam einen räumlichen Klang ab – beide Mikrofone hören dieselbe Szene aus leicht unterschiedlicher Richtung. Das ist keine Trennung der Quellen.
Man kann eine Stereodatei aber als einfache Zweispur-Aufnahme nutzen, indem auf den linken Kanal nur Quelle A und auf den rechten nur Quelle B gelegt wird. Viele Aufnahmegeräte und Programme machen genau das, wenn man zwei Mikrofone anschließt. Entscheidend ist also nicht die Zahl der Kanäle, sondern ob jede Spur nur eine Quelle enthält. Mehr dazu unter Mono und Stereo.
Mehrspur bei Online-Calls
Bei einem Videocall am Computer gibt es von Natur aus zwei getrennte Tonquellen: dein Mikrofon und das, was aus dem Lautsprecher kommt – der Ton der Gegenseite, technisch das Systemaudio. Nimmt eine Software beide getrennt auf, steht für jeden Satz fest, ob er von dir stammt oder von der anderen Seite. Eine Sprechererkennung muss für diese Unterscheidung nicht raten.
Bei Podcasts über das Internet nutzt man eine ähnliche Idee in größerem Maßstab: Jede Person nimmt ihre eigene Stimme lokal in hoher Qualität auf, die Spuren werden danach zusammengeführt. So stören Verbindungsprobleme die Aufnahme nicht.
Wo die Trennung an Grenzen stößt
Getrennte Spuren lösen nicht jedes Problem:
- Mehrere Personen auf einer Seite: Sitzen drei Leute an einem Konferenzmikrofon, kommen sie gemischt auf einer Spur an. Für diese Spur braucht es wieder Sprechererkennung.
- Übersprechen: Ohne Kopfhörer gelangt der Ton der Gegenseite aus dem Lautsprecher wieder ins Mikrofon. Die Echounterdrückung dämpft das meist, ein Headset verhindert es.
- Synchronität: Werden Spuren auf verschiedenen Geräten aufgenommen, müssen sie später zeitlich exakt zusammengeführt werden.
Trotzdem lohnt sich die Trennung fast immer: Selbst wenn auf einer Spur mehrere Stimmen liegen, ist die Aufgabe für die Software kleiner, weil sie eine Seite des Gesprächs schon sicher kennt. Und wenn zwei Personen gleichzeitig reden – was bei Mischaufnahmen oft zu Wortsalat führt –, bleibt bei getrennten Spuren jede Stimme verständlich.
Spur 1 – eigenes Mikrofon: Stefan Huber, Vertrieb, mit Headset
Spur 2 – Ton der Gegenseite: Frau Gruber und Herr Pichler vom Kunden, gemeinsam an einem Laptop
Im Transkript ist jeder Satz von Herrn Huber sicher als „Du“ markiert. Auf Spur 2 trennt die Sprechererkennung die beiden Stimmen der Kundenseite und nummeriert sie – Namen ordnet man danach zu.
Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.