Gleichmäßiges und wechselndes Rauschen
Für die Technik macht es einen großen Unterschied, welche Art Geräusch stört. Gleichmäßiges (stationäres) Rauschen klingt immer ähnlich: der Laptop-Lüfter, die Klimaanlage, das Brummen einer Leitung, das Grundrauschen eines billigen Mikrofons. Es lässt sich gut beschreiben und deshalb gut herausrechnen.
Wechselndes (nicht-stationäres) Rauschen kommt und geht: Tastenanschläge, ein bellender Hund, Geschirr, eine Baustelle, Stimmen im Großraumbüro. Es überlappt zeitlich und im Frequenzbereich mit der Sprache und ist viel schwerer zu trennen. Am schwierigsten sind andere Stimmen – für ein Filter ist Sprache eben Sprache.
Ein Sonderfall ist Hall. Er ist kein Geräusch von außen, sondern die eigene Stimme, die von Wänden zurückkommt. Klassische Rauschunterdrückung erfasst ihn kaum; dafür gibt es eigene Verfahren zur Enthallung.
Wie die Verfahren arbeiten
Klassische Verfahren messen das Rauschen in Sprechpausen, erstellen daraus ein Geräuschprofil und ziehen dieses Profil in jedem Frequenzbereich vom Signal ab (spektrale Subtraktion). Bei stationärem Rauschen funktioniert das gut. Ein Noise Gate ist noch einfacher: Es schaltet das Signal stumm, solange es unter einer Schwelle liegt. Damit verschwindet Rauschen in den Pausen, unter der Stimme bleibt es aber erhalten.
Moderne Verfahren nutzen neuronale Netze, die mit sehr vielen Beispielen von Sprache und Störgeräuschen trainiert wurden. Sie lernen, was zur Stimme gehört, und entfernen den Rest – auch Tastaturklappern oder ein Kinderlachen. Solche KI-Rauschunterdrückung steckt heute in Teams, Zoom und Google Meet, in Betriebssystemen und in vielen Headsets.
Viele Programme bieten mehrere Stufen an, von schwach bis stark. Je stärker die Stufe, desto mehr Geräusche verschwinden – und desto größer wird das Risiko von Nebenwirkungen auf die Stimme.
Nebenwirkungen auf Stimme und Transkript
Rauschunterdrückung nimmt immer auch ein wenig Stimme mit. Typisch sind ein blecherner Klang oder ein Effekt wie unter Wasser, verschluckte Silbenanfänge und -enden und leise Sprechende, die als Störung behandelt und weggefiltert werden.
Für die Spracherkennung ist das ein zweischneidiges Schwert. Moderne Modelle sind mit natürlicher, auch leicht verrauschter Sprache trainiert und kommen mit mäßigem Hintergrundgeräusch oft gut zurecht. Starke Artefakte durch aggressive Nachbearbeitung können dagegen mehr schaden als das ursprüngliche Rauschen. Wer eine Aufnahme nachträglich entrauscht, sollte deshalb vorsichtig dosieren und das Original behalten.
Abgrenzung zu ähnlichen Verfahren
Mehrere Techniken klingen ähnlich, lösen aber unterschiedliche Probleme:
| Verfahren | Was es entfernt | Wo es wirkt |
|---|---|---|
| Rauschunterdrückung | Störgeräusche im Mikrofonsignal | beim Senden oder bei der Bearbeitung |
| Echounterdrückung | den eigenen Lautsprecherton im Mikrofon | im Call, beim Senden |
| Aktive Geräuschunterdrückung (ANC) | Umgebungslärm am Ohr, durch Gegenschall | beim Hören, nicht in der Aufnahme |
| Noise Gate | alles unter einer Schwelle, nur in Pausen | beim Senden oder bei der Bearbeitung |
Die wirksamste Rauschunterdrückung passiert vor jeder Software: ein Mikrofon nah am Mund, etwa ein Headset, eine passende Richtcharakteristik, geschlossene Fenster. Je besser das Verhältnis von Stimme zu Geräusch schon bei der Aufnahme ist, desto weniger muss gefiltert werden. Gegen das Echo im Call hilft dagegen die Echounterdrückung.
Steuerberater Huber telefoniert per Teams aus dem Großraumbüro und dreht die Rauschunterdrückung auf die höchste Stufe. Die Stimmen der Kolleg:innen sind weg – aber auch seine leisen Einwürfe wie „hm“ und „genau“ und oft das Ende seiner Sätze. Die Mandantin fragt mehrmals nach.
Mit einem Headset mit Mikrofonarm und der automatischen Einstellung klingt er natürlicher, die Kolleg:innen sind kaum zu hören, und auch das Transkript des Gesprächs hat weniger Lücken.
Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.