Lexikon · KI & Technik

Was ist ein Kontextfenster?

Kurz erklärt

Das Kontextfenster ist die Menge an Text, die ein Sprachmodell bei einer Antwort gleichzeitig berücksichtigen kann – gemessen in Tokens. Dazu zählen Systemprompt, bisheriger Chatverlauf, eingefügte Dokumente und die Antwort selbst.

Auch genannt: Context Window · Kontextlänge

Das Arbeitsgedächtnis des Modells

Ein Sprachmodell hat zwei Arten von „Wissen“. Das eine steckt fest in seinen Parametern, gelernt aus den Trainingsdaten – vergleichbar mit allem, was jemand im Laufe seiner Ausbildung gelernt hat. Das andere ist das, was gerade auf dem Schreibtisch liegt: der Text im Kontextfenster.

Nur auf diesen Schreibtisch hat das Modell bei einer Antwort direkten Zugriff. Was nicht im Kontextfenster steht und nicht im Training vorkam, existiert für das Modell nicht. Das erklärt, warum ein Chat-Assistent dein gestriges Meeting nicht kennt, solange du es ihm nicht gibst – und warum er in einem neuen Chat nicht mehr weiß, was ihr im alten besprochen habt.

Was alles ins Kontextfenster zählt

Das Fenster füllt sich schneller, als man denkt, denn es enthält mehr als nur deine Frage:

  • den Systemprompt der Anwendung
  • den gesamten bisherigen Chatverlauf mit allen Fragen und Antworten
  • eingefügte oder hochgeladene Dokumente, Transkripte und Tabellen
  • Ergebnisse von Werkzeugen, etwa Suchtreffer oder Daten aus einer angebundenen Quelle
  • die Antwort, die das Modell gerade schreibt

Wie groß ein Kontextfenster ist

Gemessen wird in Tokens, also Wörtern und Wortteilen, nicht in Seiten. Die Größe hängt vom Modell ab und ist in den letzten Jahren stark gewachsen. Bei aktuellen großen Modellen passen ohne Weiteres mehrere Stunden Meeting-Transkript oder ein umfangreicher Vertrag hinein.

Ein ganzes Archiv aus Hunderten Besprechungen passt trotzdem nicht – und selbst wenn es passen würde, wäre es selten sinnvoll. Je mehr im Fenster steht, desto länger dauert die Antwort und desto teurer wird sie, weil Anbieter nach verarbeiteten Tokens abrechnen.

Wenn es eng wird

Ist das Fenster voll, reagieren Anwendungen unterschiedlich: Manche melden einen Fehler, manche kürzen oder verdichten ältere Teile des Chatverlaufs automatisch. In beiden Fällen gehen Informationen verloren – oft unbemerkt.

Auch innerhalb des Fensters ist die Aufmerksamkeit nicht immer gleich verteilt. Untersuchungen haben gezeigt, dass Modelle Informationen am Anfang und am Ende langer Texte teils zuverlässiger nutzen als solche in der Mitte. Bei sehr langen Eingaben lohnt es sich deshalb, die Frage ans Ende zu stellen und wichtige Abschnitte klar zu kennzeichnen.

Großes Fenster oder gezielte Suche?

Statt alles ins Kontextfenster zu laden, können Systeme gezielt nur das Passende hineinholen. Das ist das Prinzip von Retrieval-Augmented Generation: erst suchen, dann die besten Treffer ins Fenster legen. Über das Model Context Protocol kann ein Modell solche Suchen auch selbst anstoßen, wenn es merkt, dass ihm Informationen fehlen.

Faustregel: Geht es um ein einzelnes Dokument, gehört es komplett ins Fenster. Geht es um eine Frage quer über viele Dokumente, ist Suchen besser als Stapeln.

Beispiel
Zwölf Meetings, eine Frage

Projektleiterin Hofer will wissen, wie sich das Budget im Projekt Leitner über das Quartal entwickelt hat. Sie kopiert zwölf Transkripte in einen Chat – nach dem neunten meldet die Anwendung, dass die Nachricht zu lang ist.

Der bessere Weg: Ein angebundener Assistent sucht in allen Meetings nach Stellen zu „Budget“ und „Kosten“, legt nur diese Ausschnitte mit Datum ins Kontextfenster und beantwortet die Frage daraus – schneller, günstiger und mit Quellenangabe.

Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.

Häufige Fragen
Was passiert, wenn das Kontextfenster voll ist?

Je nach Anwendung kommt eine Fehlermeldung, oder ältere Teile des Chats werden gekürzt bzw. zusammengefasst. Dabei können Details verloren gehen.

Ist ein größeres Kontextfenster immer besser?

Nicht unbedingt. Es erlaubt längere Dokumente, macht Antworten aber langsamer und teurer. Für Fragen über viele Dokumente ist gezielte Suche oft besser.

Erinnert sich ein Chatbot an frühere Gespräche?

Nur, wenn der Verlauf erneut ins Kontextfenster geladen wird – etwa durch eine Gedächtnis- oder Projektfunktion der Anwendung. Das Modell selbst merkt sich nichts.

Wie viele Wörter passen in ein Kontextfenster?

Das hängt vom Modell und von der Sprache ab, weil in Tokens gerechnet wird. Deutsche Texte brauchen meist mehr Tokens pro Wort als englische.

Dein nächster Call
schreibt sich selbst mit.

7 Tage alles aus Pro gratis – ohne Kreditkarte.

Jetzt kostenlos testen