Das Prinzip: erst nachschlagen, dann antworten
Ein Large Language Model antwortet normalerweise aus dem, was es im Training gelernt hat – vergleichbar mit einer Prüfung ohne Unterlagen. RAG macht daraus eine Prüfung mit offenem Buch: Bevor das Modell antwortet, sucht ein System die passenden Stellen aus einer Dokumentensammlung heraus und legt sie dem Modell vor. Das Modell formuliert die Antwort dann auf Basis dieser Unterlagen.
Der Begriff stammt aus einem Forschungsartikel von Patrick Lewis und Kolleg:innen aus dem Jahr 2020. Seitdem ist RAG zum Standardmuster geworden, wenn KI-Assistenten Fragen zu Firmenwissen, Handbüchern, Verträgen oder Meeting-Archiven beantworten sollen.
Die drei Schritte
Ein typisches RAG-System arbeitet in drei Stufen:
- Indexieren (einmalig und bei Änderungen): Dokumente werden in handliche Abschnitte zerlegt, sogenannte Chunks. Für jeden Abschnitt wird ein Embedding berechnet und in einer Vektordatenbank gespeichert, oft zusätzlich ein klassischer Suchindex.
- Abrufen (bei jeder Frage): Die Frage wird ebenfalls in ein Embedding umgewandelt, und das System sucht die ähnlichsten Abschnitte – per semantischer Suche, häufig kombiniert mit Volltextsuche für exakte Begriffe wie Namen oder Nummern.
- Generieren: Die besten Treffer werden zusammen mit der Frage ins Kontextfenster des Modells gelegt, verbunden mit der Anweisung, nur auf dieser Grundlage zu antworten und die Quellen zu nennen.
Warum RAG – und nicht einfach mehr Training
RAG hat gegenüber Fine-Tuning mehrere praktische Vorteile. Neues Wissen ist sofort verfügbar, sobald ein Dokument im Index liegt – ohne erneutes Training. Antworten lassen sich mit Quellen belegen, weil klar ist, welche Abschnitte verwendet wurden. Zugriffsrechte lassen sich berücksichtigen: Das System holt nur Dokumente, die die fragende Person sehen darf. Und das Modell erfindet seltener Details, weil es mit echtem Material arbeitet.
Seltener heißt allerdings nicht nie. Auch mit passenden Unterlagen kann ein Modell Inhalte falsch wiedergeben oder Lücken mit Plausiblem füllen – siehe Halluzination.
Wo RAG scheitert
Die meisten Fehler entstehen nicht beim Generieren, sondern beim Suchen:
- Falscher Treffer: Die Suche findet ähnlich klingende, aber unpassende Abschnitte.
- Abschnitt ohne Zusammenhang: Ein Chunk enthält „Das gilt ab dem 1. Mai“, aber nicht, was „das“ ist.
- Überblicksfragen: „Wie oft haben wir dieses Jahr über das Budget gesprochen?“ lässt sich mit wenigen Treffern nicht beantworten.
- Veraltete Dokumente: Liegen alte und neue Fassungen im Index, kann die alte gewinnen.
- Ignorierte Quelle: Das Modell verlässt sich trotz Unterlagen auf sein Trainingswissen.
RAG, Agenten und MCP
Klassisches RAG läuft starr ab: Bei jeder Frage wird einmal gesucht, dann geantwortet. Neuere Systeme lassen das Modell selbst entscheiden, ob und wonach es sucht – es kann mehrmals nachschlagen, Suchbegriffe anpassen und Ergebnisse kombinieren. Die Suche wird dabei zu einem Werkzeug, das ein KI-Agent aufrufen kann. Das Model Context Protocol standardisiert, wie solche Werkzeuge und Datenquellen an ein Modell angebunden werden.
Frage: „Was haben wir mit Studio Leitner zum Liefertermin vereinbart?“
Abrufen: Die Suche findet zwei Abschnitte – aus dem Call am 4. März („Liefertermin Ende April, sofern die Freigabe bis 20. März kommt“) und vom 2. April („Freigabe kam verspätet, neuer Termin 15. Mai“).
Generieren: „Ursprünglich war Ende April vereinbart, abhängig von der Freigabe bis 20. März. Weil sie sich verzögert hat, gilt seit dem Call am 2. April der 15. Mai.“ – mit Verweis auf beide Meetings.
Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.