Warum „natürliche“ Sprache so schwierig ist
„Natürlich“ grenzt Deutsch, Englisch oder Türkisch von formalen Sprachen wie Programmiercode ab. Code ist eindeutig, menschliche Sprache selten. „Ich habe die Kollegin mit dem Fernglas gesehen“ – wer hatte das Fernglas? Menschen lösen solche Mehrdeutigkeiten nebenbei über Kontext und Weltwissen, Computer müssen es mühsam lernen.
Dazu kommen Ironie, Andeutungen, Fachjargon, Tippfehler, Dialekt und unvollständige Sätze. Ein „Passt eh“ kann Zustimmung, Resignation oder höfliche Ablehnung bedeuten. Genau mit solchen Problemen beschäftigt sich NLP.
Typische Aufgaben der Sprachverarbeitung
NLP ist ein Sammelbecken vieler Teilaufgaben. Einige davon begegnen dir im Alltag ständig:
- Tokenisierung und Grammatikanalyse: Text in Wörter und Sätze zerlegen, Wortarten und Satzbau bestimmen
- Named Entity Recognition: Namen, Firmen, Orte und Datumsangaben finden
- Sentiment-Analyse: einschätzen, ob ein Text positiv oder negativ gemeint ist
- Klassifizierung: E-Mails nach Thema oder Dringlichkeit sortieren
- Maschinelle Übersetzung von einer Sprache in eine andere
- Zusammenfassung: extraktiv durch Auswahl von Sätzen oder abstraktiv in eigenen Worten
- Frage-Antwort-Systeme: zu einer Frage die passende Stelle oder Antwort liefern
Von Grammatikregeln zu Sprachmodellen
Die ersten NLP-Systeme arbeiteten mit handgeschriebenen Regeln und Wörterbüchern. Ab den 1990er-Jahren setzten sich statistische Verfahren durch, die aus großen Textsammlungen Wahrscheinlichkeiten ableiteten – etwa, welches Wort typischerweise auf ein anderes folgt.
Mit neuronalen Netzen kamen Embeddings, die Wortbedeutungen als Zahlenvektoren abbilden. Seit der Transformer-Architektur von 2017 dominieren große Sprachmodelle. Sie haben das Fach verändert: Früher brauchte jede Aufgabe ein eigenes, eigens trainiertes Modell, heute löst ein einziges LLM viele davon nach einer kurzen Anweisung.
Warum spezialisierte NLP-Modelle trotzdem bleiben
Ein großes Sprachmodell kann fast jede Sprachaufgabe übernehmen – aber nicht immer ist es die beste Wahl. Kleine, spezialisierte Modelle für eine einzige Aufgabe, etwa das Erkennen von Namen oder das Sortieren von Support-Tickets, sind schneller und günstiger im Betrieb. Sie lassen sich oft auf dem eigenen Server oder Rechner betreiben, was beim Datenschutz hilft, und sie liefern bei gleicher Eingabe zuverlässig dasselbe Ergebnis.
In der Praxis werden beide Welten deshalb häufig kombiniert: Ein schlankes Verfahren übernimmt die Massenarbeit, etwa das Vorsortieren von tausenden Dokumenten, und ein großes Sprachmodell kümmert sich um die Fälle, in denen echtes Formulieren, Zusammenfassen oder Abwägen gefragt ist.
Gesprochene Sprache: erst Text, dann Verarbeitung
Bei Meetings, Telefonaten oder Interviews kommt ein Schritt davor: Die Spracherkennung wandelt Audio in Text um. Sie gilt meist als eigenes Nachbarfeld (Speech Processing), ist aber eng mit NLP verbunden.
Gesprochene Sprache ist für die Weiterverarbeitung besonders sperrig: Füllwörter, abgebrochene Sätze, Wiederholungen, Durcheinanderreden und fehlende Satzzeichen. Fehler aus der Spracherkennung wandern außerdem in jeden folgenden Schritt weiter – ein falsch erkannter Name wird auch in der Zusammenfassung falsch stehen. Deshalb lohnt es sich, bei Transkripten zuerst auf die Erkennungsqualität zu achten.
Satz im Transkript: „Frau Gruber schickt das Angebot bis Donnerstag an Studio Leitner, die waren beim letzten Termin ja eher skeptisch.“
Named Entity Recognition: Gruber (Person), Donnerstag (Datum), Studio Leitner (Organisation). Klassifizierung: enthält eine Aufgabe. Sentiment: Haltung von Studio Leitner eher negativ. Zusammenfassung: „Angebot an Studio Leitner – Gruber – Donnerstag.“
Vier NLP-Aufgaben, ein Satz – heute oft von einem einzigen Sprachmodell in einem Durchgang erledigt.
Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.