Öffnet in einem neuen Tab

Digitale Begriffe einfach erklärt

RAG (Retrieval-Augmented Generation)

Alle Wikis anzeigen

Retrieval-Augmented Generation (RAG), deutsch etwa abrufgestützte Generierung, ist ein Verfahren, bei dem ein großes Sprachmodell (LLM) seine Antwort nicht allein aus dem Trainingswissen erzeugt, sondern zur Laufzeit passende Dokumente aus einer externen Datenquelle abruft und in die Antwort einbezieht. RAG ist die technische Grundlage praktisch aller KI-Systeme, die aktuelle Informationen liefern und ihre Quellen zitieren – darunter Google AI Overviews, Perplexity sowie Chatbots mit Websuche.

Hintergrund

Reine Sprachmodelle haben zwei strukturelle Schwächen: Ihr Wissen endet mit dem Stichtag der Trainingsdaten (Knowledge Cutoff), und sie formulieren sachlich falsche Aussagen sprachlich überzeugend (Halluzinationen). Zudem lässt sich nicht nachvollziehen, worauf eine Aussage beruht.

RAG setzt genau hier an: Statt das Modell neu zu trainieren, wird ihm die benötigte Information zum Zeitpunkt der Anfrage als Kontext mitgegeben. Das Verfahren wurde 2020 in einer Forschungsarbeit bei Meta AI beschrieben und hat sich seitdem zum Standardansatz für wissensbasierte KI-Anwendungen entwickelt.

Funktionsweise

Ein RAG-System kombiniert eine Abrufkomponente (Retrieval) mit einer Generierungskomponente (Generation). Der Ablauf umfasst typischerweise folgende Schritte:

  • Indexierung – die Wissensbasis wird in Textabschnitte (Chunks) zerlegt, in Embeddings umgewandelt und in einer Vektordatenbank abgelegt
  • Anfrage – die Nutzerfrage wird ebenfalls in ein Embedding überführt
  • Retrieval – aus der Datenbank werden die Abschnitte mit der größten semantischen Ähnlichkeit zur Anfrage ermittelt
  • Reranking – die Treffer werden nach Relevanz neu sortiert und auf eine handhabbare Menge reduziert
  • Augmentation – die ausgewählten Abschnitte werden gemeinsam mit der ursprünglichen Frage als Kontext an das Sprachmodell übergeben
  • Generation – das Modell formuliert die Antwort auf Basis dieses Kontexts und weist die verwendeten Quellen aus

Entscheidend ist, dass das Modell selbst unverändert bleibt. Aktualisiert wird die Wissensbasis, nicht das Modell – ein wesentlicher Kosten- und Geschwindigkeitsvorteil gegenüber erneutem Training oder Fine-Tuning.

Varianten

  • Klassisches RAG – einmaliger Abruf, anschließend Generierung
  • Hybrides Retrieval – Kombination aus semantischer Vektorsuche und klassischer Stichwortsuche, um auch exakte Begriffe und Eigennamen zuverlässig zu finden
  • Agentisches RAG – das Modell entscheidet selbst, ob, wie oft und mit welchen Suchanfragen es abruft, und kann mehrere Abrufe verketten
  • Graph-RAG – die Wissensbasis wird als Wissensgraph strukturiert, sodass auch Beziehungen zwischen Entitäten berücksichtigt werden
  • Web-RAG – die Datenquelle ist das offene Web statt einer internen Datenbank; dies ist die Variante, die in KI-Suchsystemen zum Einsatz kommt

Anwendungsbereiche

  • KI-Suchsysteme – AI Overviews, AI Mode, Perplexity und Chatbots mit Websuchfunktion
  • Unternehmensinterne Wissensdatenbanken – Zugriff auf Handbücher, Richtlinien, Verträge oder Projektdokumentation über natürliche Sprache
  • Kundenservice – Chatbots, die auf Produktdaten, FAQ und Preislisten zugreifen, statt frei zu formulieren
  • Recherche und Analyse – Auswertung großer Dokumentbestände mit Quellennachweis
  • Compliance und Recht – Anwendungen, in denen jede Aussage belegbar sein muss

Bedeutung für Sichtbarkeit und Reputation

Für die Sichtbarkeit von Marken ist RAG der zentrale Mechanismus: Der Abrufzeitpunkt ist der Moment, in dem Inhalte einer Website tatsächlich zur Quelle einer KI-Antwort werden können. Anders als beim Trainingswissen, das mit dem Knowledge Cutoff eingefroren ist, wirken Optimierungen hier unmittelbar.

Daraus ergeben sich konkrete Anforderungen an Inhalte:

  • Abschnittsweise Verständlichkeit – da nicht ganze Seiten, sondern einzelne Chunks abgerufen werden, muss jeder Abschnitt für sich verständlich sein
  • Klare Kernaussagen – eine Frage pro Abschnitt, eine Hauptaussage pro Absatz
  • Eindeutige Benennungen – Marke, Produkte und Leistungen konsistent ausschreiben, statt auf Pronomen oder vorherige Absätze zu verweisen
  • Strukturierung – Zwischenüberschriften, Listen und Definitionen erleichtern die saubere Zerlegung in Chunks
  • Technische Zugänglichkeit – Inhalte müssen für KI-Crawler abrufbar sein; Inhalte hinter Logins, Paywalls oder ausschließlich clientseitig gerenderte Bereiche werden häufig nicht erfasst

Für das Online Reputation Management ist zudem relevant, dass RAG-Systeme aus dem gesamten verfügbaren Quellenbestand schöpfen. Ein veralteter Presseartikel oder eine negative Bewertung kann dadurch unmittelbar in eine KI-Antwort einfließen – ebenso wie aktuelle, korrigierende Inhalte, sofern sie auffindbar und gut strukturiert sind.

Grenzen

  • Qualität der Wissensbasis – ein RAG-System ist nur so gut wie die Quellen, auf die es zugreift
  • Abruffehler – werden die falschen Abschnitte gefunden, entsteht eine plausibel formulierte, aber unpassende Antwort
  • Unbelegte Aussagen – Untersuchungen zeigen, dass ein Teil der generierten Aussagen durch die zitierten Quellen nicht gedeckt ist; RAG reduziert Halluzinationen, beseitigt sie aber nicht
  • Kontextgrenzen – die abgerufene Textmenge muss in das Kontextfenster des Modells passen
  • Datenschutz – bei internen Wissensbasen müssen Zugriffsrechte auch im RAG-System durchgesetzt werden, damit Nutzer keine Inhalte erhalten, für die sie keine Berechtigung haben