Programmieren oder lernen lassen
Angenommen, ein Büro will eingehende E-Mails automatisch in „Rechnung“, „Terminanfrage“ und „Sonstiges“ sortieren. Klassisch würde man Regeln schreiben: Steht „Rechnung“ im Betreff, ab in den Rechnungsordner. Das klappt, bis jemand „Faktura“, „Zahlungsaufforderung“ oder gar nichts in den Betreff schreibt.
Beim maschinellen Lernen geht man umgekehrt vor: Man sammelt einige tausend bereits richtig einsortierte Mails und lässt ein Verfahren daraus selbst ableiten, woran man die Kategorien erkennt – Wörter, Absender, Anhänge, Formulierungen. Das Ergebnis ist ein Modell: eine gelernte Zuordnungsvorschrift, die auch Mails einordnen kann, die so noch nie vorgekommen sind.
Die drei Grundformen des Lernens
Je nachdem, welche Daten zur Verfügung stehen, unterscheidet man drei klassische Lernarten:
| Lernart | Wie gelernt wird | Beispiel |
|---|---|---|
| Überwachtes Lernen | aus Beispielen mit richtiger Antwort („Label“) | Mails mit bekannter Kategorie, Audio mit fertigem Transkript |
| Unüberwachtes Lernen | Muster in Daten ohne vorgegebene Antworten finden | Kundenfeedback automatisch in Themengruppen bündeln |
| Bestärkendes Lernen | durch Ausprobieren und Belohnung für gute Ergebnisse | Spielstrategien, Feinschliff von Chat-Assistenten mit menschlichem Feedback |
Eine wichtige Mischform ist das selbstüberwachte Lernen: Die „richtigen Antworten“ stecken in den Daten selbst. Große Sprachmodelle lernen so im Vortraining, indem sie in riesigen Textmengen immer wieder das nächste Wort vorhersagen.
Training und Anwendung
Maschinelles Lernen hat zwei klar getrennte Phasen. Im Training passt das Verfahren die internen Zahlenwerte des Modells so lange an, bis seine Vorhersagen auf den Trainingsdaten möglichst gut stimmen. Das ist rechenintensiv und passiert einmal oder in größeren Abständen. In der Anwendung, der Inferenz, wird das fertige Modell nur noch genutzt – es lernt dabei nichts mehr dazu.
Damit ein Modell nicht bloß auswendig lernt, hält man einen Teil der Daten zurück und prüft damit, wie gut es mit Unbekanntem zurechtkommt. Ein Modell, das die Trainingsbeispiele perfekt beherrscht, an neuen Fällen aber scheitert, ist überangepasst (englisch „Overfitting“) – wie jemand, der die Prüfungsfragen des Vorjahres auswendig kann, aber den Stoff nicht verstanden hat.
Neuronale Netze und Deep Learning
Die leistungsfähigsten Verfahren sind heute künstliche neuronale Netze: viele Schichten einfacher Recheneinheiten, deren Verbindungen beim Training gewichtet werden. Sind es viele Schichten, spricht man von Deep Learning. Darauf beruhen moderne Spracherkennung, Bilderkennung und Sprachmodelle.
Der Preis dafür: Solche Modelle brauchen große Datenmengen und viel Rechenleistung, und es ist schwer nachzuvollziehen, warum sie im Einzelfall so entscheiden, wie sie entscheiden.
Wo maschinelles Lernen an Grenzen stößt
Ein Modell kann nur so gut sein wie seine Daten. Was darin fehlt, kennt es nicht: Wurde eine Spracherkennung kaum mit österreichischem Dialekt trainiert, erkennt sie ihn schlechter. Verzerrungen in den Daten – etwa wenn eine Gruppe über- oder unterrepräsentiert ist – übernimmt das Modell ungefragt.
Außerdem lernt ein Modell Zusammenhänge, keine Ursachen. Es merkt sich, was oft gemeinsam auftritt, nicht warum. Für Entscheidungen mit Folgen für Menschen braucht es deshalb immer jemanden, der die Ergebnisse einordnet.
Kanzlei Berger lässt ein Modell mit den sortierten Mails der letzten zwei Jahre trainieren. Danach kommt eine neue Nachricht: „Wir bräuchten bitte noch etwas mehr Zeit für die Unterlagen, ginge Ende des Monats?“
Das Wort „Frist“ kommt nicht vor – trotzdem ordnet das Modell die Mail mit hoher Wahrscheinlichkeit der Kategorie „Fristverlängerung“ zu, weil ähnliche Formulierungen in den Trainingsdaten genau dort gelandet sind. Eine feste Stichwortregel hätte sie übersehen.
Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.