Was an einem Sprachmodell „large“ ist
Groß sind bei einem LLM drei Dinge: die Zahl der Parameter – das sind die einstellbaren Zahlenwerte im neuronalen Netz, bei aktuellen Modellen Milliarden davon –, die Menge der Trainingsdaten aus Büchern, Websites, Code und anderen Texten, und der Rechenaufwand, mit dem das Training über Wochen auf großen Rechenzentren läuft.
Diese Größe ist der Grund, warum LLMs so vielseitig sind: Dasselbe Modell kann übersetzen, zusammenfassen, Code schreiben und Fragen beantworten, ohne für jede Aufgabe eigens gebaut zu sein.
Es gibt geschlossene Modelle, die nur über die Dienste ihres Anbieters nutzbar sind, und offene Modelle, deren Gewichte veröffentlicht werden und die sich auf eigener Hardware betreiben lassen – siehe lokale KI. Offene Modelle bieten mehr Kontrolle über die Daten, brauchen aber leistungsfähige Rechner und eigenes Know-how für Betrieb und Aktualisierung.
Wie ein LLM eine Antwort erzeugt
Zuerst wird der Eingabetext in Tokens zerlegt – Wörter oder Wortteile. Das Modell berechnet dann für jedes mögliche nächste Token eine Wahrscheinlichkeit, wählt eines aus, hängt es an und beginnt von vorn. So entsteht die Antwort Stück für Stück; das Anwenden des fertigen Modells heißt Inferenz.
Technische Grundlage fast aller heutigen LLMs ist die Transformer-Architektur, 2017 von Forschenden bei Google vorgestellt. Ihr Kern ist der Aufmerksamkeitsmechanismus („Attention“): Für jedes Wort wird gewichtet, welche anderen Wörter im Text dafür gerade wichtig sind. So weiß das Modell, worauf sich „sie“ in einem langen Satz bezieht.
Trainiert wird in zwei Stufen. Im Vortraining lernt das Modell an riesigen Textmengen, das nächste Token vorherzusagen. Danach folgt ein Fine-Tuning, unter anderem mit menschlichem Feedback, damit aus dem Textfortsetzer ein hilfreicher Assistent wird, der Anweisungen befolgt.
Was ein LLM weiß – und was nicht
Ein LLM „weiß“ nur, was sich in seinen Trainingsdaten als Muster niedergeschlagen hat – und zwar nur bis zu einem bestimmten Stichtag. Es schlägt nichts in einer Datenbank nach. Fehlt Wissen, füllt es die Lücke mit Plausiblem; daraus entstehen Halluzinationen.
Deine eigenen Daten – das gestrige Meeting, die Kundenhistorie, die interne Preisliste – kennt das Modell nicht. Es kann nur damit arbeiten, wenn sie im Kontextfenster stehen: weil du sie einfügst, weil ein System sie per RAG dazuholt oder weil das Modell über das Model Context Protocol auf eine Quelle zugreift.
LLM, Chatbot, generative KI: die Abgrenzung
Die Begriffe hängen zusammen, meinen aber verschiedene Ebenen:
| Begriff | Ebene | Beispiel |
|---|---|---|
| Generative KI | Oberbegriff für KI, die Inhalte erzeugt | Text-, Bild-, Audiogeneratoren |
| Large Language Model | das trainierte Modell für Sprache | ein Modell der Claude-Familie |
| Chatbot / Assistent | die Anwendung, über die Menschen mit dem Modell sprechen | die Claude-App oder ChatGPT |
Ein und dasselbe LLM kann in vielen Anwendungen stecken: im Chatfenster, in einem Schreibprogramm oder im Hintergrund eines Meeting-Tools, das Transkripte zusammenfasst.
Eingabe: „Das Protokoll der Vorstandssitzung geht bis Freitag an alle …“
Das Modell bewertet mögliche Fortsetzungen: „Mitglieder“ ist sehr wahrscheinlich, „Vorstandsmitglieder“ ebenfalls, „Kunden“ eher nicht, „Bananen“ praktisch gar nicht. Es wählt „Mitglieder“, hängt einen Punkt an – und hätte bei einem anderen Durchlauf vielleicht „Vorstandsmitglieder“ geschrieben.
Genau dieses Prinzip, milliardenfach verfeinert, steckt hinter jeder Antwort eines Chat-Assistenten.
Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.