Das Arbeitsgedächtnis des Modells
Ein Sprachmodell hat zwei Arten von „Wissen“. Das eine steckt fest in seinen Parametern, gelernt aus den Trainingsdaten – vergleichbar mit allem, was jemand im Laufe seiner Ausbildung gelernt hat. Das andere ist das, was gerade auf dem Schreibtisch liegt: der Text im Kontextfenster.
Nur auf diesen Schreibtisch hat das Modell bei einer Antwort direkten Zugriff. Was nicht im Kontextfenster steht und nicht im Training vorkam, existiert für das Modell nicht. Das erklärt, warum ein Chat-Assistent dein gestriges Meeting nicht kennt, solange du es ihm nicht gibst – und warum er in einem neuen Chat nicht mehr weiß, was ihr im alten besprochen habt.
Was alles ins Kontextfenster zählt
Das Fenster füllt sich schneller, als man denkt, denn es enthält mehr als nur deine Frage:
- den Systemprompt der Anwendung
- den gesamten bisherigen Chatverlauf mit allen Fragen und Antworten
- eingefügte oder hochgeladene Dokumente, Transkripte und Tabellen
- Ergebnisse von Werkzeugen, etwa Suchtreffer oder Daten aus einer angebundenen Quelle
- die Antwort, die das Modell gerade schreibt
Wie groß ein Kontextfenster ist
Gemessen wird in Tokens, also Wörtern und Wortteilen, nicht in Seiten. Die Größe hängt vom Modell ab und ist in den letzten Jahren stark gewachsen. Bei aktuellen großen Modellen passen ohne Weiteres mehrere Stunden Meeting-Transkript oder ein umfangreicher Vertrag hinein.
Ein ganzes Archiv aus Hunderten Besprechungen passt trotzdem nicht – und selbst wenn es passen würde, wäre es selten sinnvoll. Je mehr im Fenster steht, desto länger dauert die Antwort und desto teurer wird sie, weil Anbieter nach verarbeiteten Tokens abrechnen.
Wenn es eng wird
Ist das Fenster voll, reagieren Anwendungen unterschiedlich: Manche melden einen Fehler, manche kürzen oder verdichten ältere Teile des Chatverlaufs automatisch. In beiden Fällen gehen Informationen verloren – oft unbemerkt.
Auch innerhalb des Fensters ist die Aufmerksamkeit nicht immer gleich verteilt. Untersuchungen haben gezeigt, dass Modelle Informationen am Anfang und am Ende langer Texte teils zuverlässiger nutzen als solche in der Mitte. Bei sehr langen Eingaben lohnt es sich deshalb, die Frage ans Ende zu stellen und wichtige Abschnitte klar zu kennzeichnen.
Großes Fenster oder gezielte Suche?
Statt alles ins Kontextfenster zu laden, können Systeme gezielt nur das Passende hineinholen. Das ist das Prinzip von Retrieval-Augmented Generation: erst suchen, dann die besten Treffer ins Fenster legen. Über das Model Context Protocol kann ein Modell solche Suchen auch selbst anstoßen, wenn es merkt, dass ihm Informationen fehlen.
Faustregel: Geht es um ein einzelnes Dokument, gehört es komplett ins Fenster. Geht es um eine Frage quer über viele Dokumente, ist Suchen besser als Stapeln.
Projektleiterin Hofer will wissen, wie sich das Budget im Projekt Leitner über das Quartal entwickelt hat. Sie kopiert zwölf Transkripte in einen Chat – nach dem neunten meldet die Anwendung, dass die Nachricht zu lang ist.
Der bessere Weg: Ein angebundener Assistent sucht in allen Meetings nach Stellen zu „Budget“ und „Kosten“, legt nur diese Ausschnitte mit Datum ins Kontextfenster und beantwortet die Frage daraus – schneller, günstiger und mit Quellenangabe.
Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.