Blog · RAG · 09.10.2026
Blog
RAG

Was ist RAG?Eine KI, die erstnachschlägt

Retrieval Augmented Generation lässt ein Sprachmodell vor der Antwort in Ihren eigenen Unterlagen suchen. Wie das grundsätzlich funktioniert, wann es sich rechnet und was es nicht kann.

Direkt zur Anfrage
Anfrage
Nikolai Schöbel und Jeremias Burger, Co-Founder Scalableloops

Sprechen wir über Ihr Projekt.

Erst prüfen wir, ob das Vorhaben zu Ihrem Geschäftsmodell passt. Dann folgt ein Vorschlag mit Phasen und Aufwand.

RAG-Vorhaben besprechen oder anrufen: +49 151 1576 5566
Blog · RAG

RAG heißt ausgeschrieben Retrieval Augmented Generation, und gemeint ist eine KI, die vor dem Antworten erst nachschlägt. Ehe das Sprachmodell einen Satz schreibt, kramt ein vorgeschaltetes Programm in einem Bestand, den Sie bestimmen (Wartungsanleitungen etwa, Preislisten, Verträge, das Wiki der Kundenbetreuung), die paar Absätze heraus, die zur Frage passen, und legt sie dem Modell hin. Der Name stammt von einem Team um Patrick Lewis, dessen Arbeit 2020 auf der NeurIPS angenommen wurde. Für einen Betrieb ist das reizvoll, weil die KI so mit Wissen arbeiten kann, das sie im Training nie gesehen hat, ohne dass jemand das Modell neu trainieren muss, und weil sich an der Fundstelle nachprüfen lässt, was sie behauptet. Unfehlbar wird sie dadurch freilich nicht.

In Kürze
  • Bei RAG sucht ein Programm zuerst passende Textstellen in Ihren Unterlagen heraus, und erst dann formuliert das Sprachmodell seine Antwort.
  • Den Begriff hat 2020 eine Gruppe von Facebook AI Research, dem University College London und der New York University geprägt.
  • Geänderte Dokumente wirken, sobald sie eingelesen sind, ein neues Training braucht es dafür nicht, und die Antwort kann ihren Absatz nennen.
  • Perfekt ist das nicht: Spezialisierte RAG-Werkzeuge für Juristen lagen in einer Stanford-Studie bei 17 Prozent der Testfragen oder mehr daneben.
Veröffentlicht 09.10.2026Nikolai Schöbel und Jeremias BurgerLesezeit 9 min
Nikolai SchöbelJeremias Burger

Nikolai Schöbel und Jeremias Burger

Co-Founder der Scalableloops GmbH. Nikolai Schöbel verantwortet Online-Marketing und KI-Strategie, Jeremias Burger die KI-Architektur. Beide bauen und schulen KI-Systeme im eigenen Agenturalltag.

Auf dieser Seite
  1. Was ist RAG, und was hat Ihre KI im Betrieb davon?
  2. Retrieval Augmented Generation: warum der Ansatz Antworten belegbar machen sollte
  3. Wie funktioniert RAG, damit die KI die richtige Stelle findet?
  4. RAG oder Fine-Tuning: Welcher Weg bringt Unternehmenswissen in die KI?
  5. Wann lohnt sich RAG für Ihr Unternehmenswissen?
  6. Wo Sie trotz RAG Halluzinationen nachprüfen sollten
  7. Worauf Sie bei RAG und Datenschutz mit vertraulichen Unterlagen achten
  8. Häufige Fragen
  9. So prüfen Sie, ob RAG zu Ihrem Unternehmenswissen passt
  10. Woher die Angaben auf dieser Seite stammen
Grundlagen

Was ist RAG, und was hat Ihre KI im Betrieb davon?

Was ist RAG, wenn man das Fachchinesisch weglässt? Ein großes Sprachmodell (englisch Large Language Model, kurz LLM) kennt nur, was in seinen Trainingsdaten stand. Ihre Stückliste vom letzten Quartal gehört da sicher nicht dazu, und fragt jemand danach, muss das Modell entweder passen oder, was leider öfter vorkommt, eine Antwort zusammenreimen, die plausibel klingt und trotzdem falsch ist.

RAG baut deshalb einen Umweg ein. Nehmen wir an, ein Servicetechniker tippt am Tablet: „Welches Anzugsmoment gilt für die Lagerschrauben an Baureihe B?“ Bevor das Modell antwortet, durchsucht ein zweites Programm die Wartungsanleitungen, findet zwei oder drei passende Absätze und gibt sie zusammen mit der Frage weiter. Das Modell schreibt dann aus diesen Absätzen, ungefähr so, wie man in einer Klausur mit erlaubten Unterlagen ins Buch schaut, bevor man den Stift ansetzt.

Zwei Dinge ändern sich dadurch im Alltag. Die KI kann mit Inhalten arbeiten, die sie nie gelernt hat. Und sie kann sagen, auf welchen Abschnitt sie sich stützt, sodass der Techniker im Zweifel selbst nachliest (was er bei einem Anzugsmoment ohnehin tun sollte).

Herkunft

Retrieval Augmented Generation: warum der Ansatz Antworten belegbar machen sollte

Retrieval Augmented Generation ist ein Begriff aus der Forschung, und man kann ziemlich genau sagen, wann er aufkam. Am 22. Mai 2020 stellten Patrick Lewis und elf Mitautoren die Arbeit „Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks“ auf arXiv, später wurde sie auf der NeurIPS 2020 angenommen, einer der großen Tagungen zum maschinellen Lernen. Die Gruppe kam von Facebook AI Research (heute gehört das zu Meta), vom University College London und von der New York University.

Was die Forschenden störte, steht gleich im ersten Absatz der Arbeit: Sprachmodelle speichern zwar erstaunlich viel Faktenwissen, kommen aber schlecht gezielt daran, können nicht belegen, woher eine Aussage stammt, und lassen sich kaum auf neuen Stand bringen. Ihre Lösung verband ein vortrainiertes Modell, das Text erzeugt, mit einem durchsuchbaren Index aus Wikipedia, abgefragt über ein eigenes Suchmodell. Heraus kamen nach ihren Messungen Texte, die konkreter, abwechslungsreicher und sachlich genauer waren als bei einem vergleichbaren Modell ohne Suche.

Meta hat im September 2020 in einem Blogbeitrag einen Vorteil betont, der für Firmen wohl bis heute der wichtigste ist. Was so ein System weiß, ändert man, indem man den Textbestand austauscht oder ergänzt, und das Modell selbst bleibt, wie es ist.

2020

wurde die Arbeit von Patrick Lewis und Kollegen veröffentlicht, die den Begriff Retrieval Augmented Generation geprägt hat.

arXiv 2005.11401; NeurIPS 2020
Ablauf

Wie funktioniert RAG, damit die KI die richtige Stelle findet?

Wie funktioniert RAG unter der Haube? Ob Sie bei AWS, IBM, Google Cloud oder in der Wikipedia nachlesen, der Ablauf wird fast überall gleich beschrieben, mit einer Vorbereitung und einer Abfrage. Vorbereitet wird, indem man die Dokumente in Häppchen von einigen Absätzen zerlegt (im Jargon Chunking) und jedes Häppchen von einem Einbettungsmodell in eine lange Zahlenreihe übersetzen lässt, die grob seine Bedeutung abbildet. Diese Zahlenreihen wandern in eine Vektordatenbank.

Kommt eine Frage, wird sie genauso übersetzt, und die Datenbank sucht die Häppchen heraus, deren Zahlenreihen der Frage am nächsten liegen. Viele Systeme nehmen zusätzlich eine gewöhnliche Stichwortsuche dazu, die Hersteller sprechen dann von hybrider Suche, denn eine Artikelnummer wie 4711-B findet man mit Stichworten oft zuverlässiger als über Bedeutung. Was dabei herauskommt, wird der Frage beigelegt und geht ans Sprachmodell.

Das klingt überschaubar, und im Prinzip ist es das auch. Nur steckt die meiste Mühe eben nicht im Sprachmodell, sie steckt in der Suche: Findet sie den Absatz mit dem richtigen Anzugsmoment, oder den aus der alten Anleitung von 2019? Was hier nicht ankommt, kann das Modell beim besten Willen nicht verwenden.

SchrittWas passiertWoran es scheitern kann
AufteilenDokumente werden in Abschnitte zerlegtZu kleine Abschnitte reißen Zusammenhänge auseinander, zu große verwässern die Suche
EinbettenJeder Abschnitt wird in eine Zahlenfolge übersetzt und gespeichertGeänderte Dokumente müssen neu eingelesen werden
SuchenDie Frage wird übersetzt, passende Abschnitte werden gesuchtFachbegriffe und Nummern gehen bei reiner Bedeutungssuche leicht unter
ErgänzenGefundene Abschnitte werden der Frage beigelegtUnpassende Treffer lenken das Modell in die falsche Richtung
AntwortenDas Sprachmodell formuliert aus den AbschnittenDas Modell kann trotzdem Angaben hinzufügen, die nirgends stehen
Abgrenzung

RAG oder Fine-Tuning: Welcher Weg bringt Unternehmenswissen in die KI?

Neben RAG gibt es einen zweiten Weg, einem Modell eigenes Wissen mitzugeben, nämlich das Fine-Tuning. Dabei trainiert man das Modell mit den eigenen Daten nach, es verändert sich also selbst, während es bei RAG unangetastet bleibt und nur bei jeder Frage passende Unterlagen dazubekommt. Welcher Weg Fakten besser verankert, hat ein Team von Microsoft in Israel um Oded Ovadia verglichen, veröffentlicht auf der Konferenz EMNLP 2024. Das Nachtrainieren ohne Anleitung brachte etwas, RAG lag aber in ihren Tests durchweg vorn, bei schon bekanntem Wissen genauso wie bei völlig neuem.

Ganz abschreiben würden wir Fine-Tuning deshalb nicht. Es taugt eher dazu, einem Modell einen Tonfall, ein festes Ausgabeformat oder eine Fachsprache beizubringen, während RAG dort gefragt ist, wo Fakten sich ändern und belegbar sein müssen. Für Unternehmenswissen würden wir in den allermeisten Fällen mit RAG anfangen und Fine-Tuning erst angehen, wenn sich dafür ein handfester Grund zeigt.

RAGFine-Tuning
Was sich ändertDer Textbestand, auf den das Modell zugreiftDas Modell selbst
Neue DokumenteNach dem Einlesen nutzbarErst nach erneutem Training
QuellenangabeMöglich, weil die Fundstellen bekannt sindNicht vorgesehen
StärkeAktuelle, belegbare FaktenStil, Format, Fachsprache
Faktenwissen laut Ovadia und KollegenDurchgängig besserLeichte Verbesserung
Entscheidung

Wann lohnt sich RAG für Ihr Unternehmenswissen?

RAG für Unternehmenswissen rechnet sich vor allem dort, wo viele Leute immer wieder in denselben Ordnern suchen und die Antwort hinterher belegbar sein soll: im Vertrieb, der zu dreihundert Artikeln die richtigen Maße braucht, im Kundenservice mit seinen Wissensartikeln, im Qualitätsmanagement mit Regelwerken, die jedes Jahr eine neue Fassung bekommen. Ob dafür ein fertiger Assistent reicht oder ein eigenes System sinnvoll ist, hängt von Menge und Schutzbedarf ab; das haben wir im Beitrag über den KI-Assistenten im Unternehmen genauer auseinandergenommen.

Wenig Sinn ergibt RAG, wenn der ganze Bestand aus fünf Dokumenten besteht, die locker in das Kontextfenster eines Modells passen, also in die Textmenge, die es auf einmal lesen kann. Dann gibt man die Dokumente einfach mit. Ein Vorbehalt bleibt allerdings, und der kommt aus Stanford: In der Studie „Lost in the Middle“ fanden Nelson Liu und Kollegen, dass Modelle Informationen am Anfang und am Ende langer Eingaben deutlich besser nutzen als in der Mitte. Wer viel Text auf einmal hineinkippt, verlässt sich also darauf, dass das Wichtige zufällig nicht in der Mitte steht. Wie wir RAG-Vorhaben mit Unternehmen angehen und wann zusätzlich ein Wissensgraph nötig wird, steht auf unserer Seite RAG: KI mit Ihrem Unternehmenswissen verbinden.

  1. 01

    Kundenservice und Vertrieb

    Lohnt sich häufig

    Viele wiederkehrende Fragen zu Produkten und Abläufen, Antworten müssen zum aktuellen Stand passen.

  2. 02

    Wenn sich Handbücher und Regelwerke laufend ändern

    Lohnt sich häufig

    Umfangreiche Unterlagen, die sich ändern und bei denen die Fundstelle zählt.

  3. 03

    Wenige kurze Dokumente

    Oft unnötig

    Passt der Bestand komplett in eine Anfrage, ist der zusätzliche Aufbau selten gerechtfertigt.

Grenzen

Wo Sie trotz RAG Halluzinationen nachprüfen sollten

RAG drückt Halluzinationen, also frei erfundene Angaben, es schafft sie aber nicht aus der Welt. Am klarsten belegt das eine Untersuchung von Stanford RegLab und dem Stanford-Institut HAI aus dem Jahr 2024, die vorab registriert wurde, damit niemand das Ergebnis im Nachhinein zurechtbiegen kann. Getestet wurden Rechercheprogramme für Juristen, deren Anbieter mit RAG geworben und teils von „halluzinationsfreien“ Zitaten gesprochen hatten. Die Programme schnitten besser ab als GPT-4 ohne Suche, lagen aber je nach Werkzeug in einem Sechstel bis einem Drittel der Testanfragen daneben.

Die zweite Grenze sitzt in den Unterlagen selbst. Ein RAG-System gibt wieder, was es findet, und liegt im Bestand die Preisliste von 2024 neben der von 2026, oder widersprechen sich zwei Fassungen einer Arbeitsanweisung, dann kann die Antwort eben auf der falschen beruhen. Wer RAG einführt, muss deshalb auch klären, wer den Bestand pflegt und wie geänderte Dateien neu eingelesen werden, und zwar dauerhaft.

Und drittens ist eine Antwort mit Quellenangabe zwar nachprüfbar, aber noch lange nicht richtig. Bei Verträgen, Gesundheit oder Geld sollte ein Mensch die Fundstelle ansehen, bevor er handelt. Manche Fragen lassen sich zudem gar nicht aus einzelnen Absätzen beantworten, etwa wenn ein Nachtrag einen Vertrag ändert; für solche Fälle haben Forschende von Microsoft 2024 GraphRAG vorgestellt, das den Bestand zusätzlich als Netz aus Begriffen und ihren Beziehungen aufbereitet.

17 %

der Testanfragen oder mehr beantworteten spezialisierte RAG-Werkzeuge für Juristen in einer Stanford-Studie falsch oder irreführend, je nach Werkzeug bis zu einem Drittel.

Magesh u. a., Stanford RegLab und HAI, 2024
Datenschutz

Worauf Sie bei RAG und Datenschutz mit vertraulichen Unterlagen achten

Bei RAG und Datenschutz werden gern zwei Fragen in einen Topf geworfen. Die erste: Wohin wandern Ihre Unterlagen? Läuft das System bei einem Cloud-Anbieter, verarbeitet der die Daten in Ihrem Auftrag, und die Datenschutzkonferenz von Bund und Ländern schreibt in ihrer Orientierungshilfe zu KI vom 6. Mai 2024, dass dann häufig eine Vereinbarung zur Auftragsverarbeitung nach Art. 28 Abs. 3 DSGVO fällig ist. Wer das nicht will oder nicht darf, kann RAG auch auf eigenen Servern betreiben; was „lokal“ dabei technisch heißt, steht in unserem Beitrag zur lokalen KI im Unternehmen.

Die zweite Frage wird seltener gestellt und ist im Alltag mindestens so heikel: Wer darf was sehen? Ein RAG-System sucht über alles, was man ihm gibt. Das OWASP-Projekt, das Sicherheitsrisiken von KI-Anwendungen sammelt, führt mangelhafte Zugriffskontrollen bei Vektordatenbanken unter der Nummer LLM08:2025 ausdrücklich auf, weil die KI sonst Inhalte ausplaudern kann, die der Fragende gar nicht sehen dürfte. Gehaltslisten haben deshalb im selben Suchbestand wie das Produkthandbuch nichts verloren, es sei denn, die Suche prüft die Berechtigungen jedes Dokuments mit.

Einen Vorteil hat RAG hier übrigens gegenüber einem Modell, in das man Daten hineintrainiert, und den hebt auch die Datenschutzkonferenz hervor. In ihrer Orientierungshilfe zu KI-Systemen mit RAG vom Oktober 2025 schreibt sie, dass sich für die Vektordatenbank und die hinterlegten Dokumente ein Rechte- und Rollenkonzept umsetzen lässt, während man im Sprachmodell selbst nicht steuern kann, wer welche Information bekommt. Außerdem erlaube RAG in vielen Fällen, ein kleineres Modell auf eigenen Servern zu betreiben, sodass personenbezogene Daten gar nicht erst bei den Anbietern großer Sprachmodelle landen.

Bleibt ein technisches Detail, auf das auch IBM in seiner Erklärung hinweist. Aus den gespeicherten Zahlenreihen kann man unter Umständen auf den Originaltext zurückschließen, die Vektordatenbank braucht also genau den Schutz, den Sie den Dokumenten selbst zugestehen würden, und keinen Deut weniger.

Häufige Fragen

Häufige Fragen

Was ist RAG in einfachen Worten?

Eine KI, die nachschlägt, bevor sie antwortet. Sie sucht in Unterlagen, die Sie festgelegt haben, und stützt sich auf die Absätze, die sie dort findet; die Abkürzung steht für Retrieval Augmented Generation.

Was ist der Unterschied zwischen einem LLM und RAG?

Das LLM ist das Sprachmodell, das schreibt. RAG ist das Drumherum, das ihm vor jeder Antwort ein paar passende Textstellen aus einer Suche auf den Tisch legt, damit es nicht nur aus dem Gedächtnis schöpfen muss.

Ist ChatGPT ein RAG-System?

Nicht von Haus aus, ChatGPT ist erst einmal ein Sprachmodell-Dienst. Sobald er aber in hochgeladenen Dateien oder angebundenen Quellen sucht und die Treffer verarbeitet, arbeitet er nach dem RAG-Prinzip (OpenAI beschreibt für Entwickler eine Dateisuche mit Vektorspeichern, die genau so funktioniert).

Lernt mein Modell durch RAG dazu?

Nein. Das Modell bleibt unverändert und bekommt bei jeder Frage nur Lesestoff dazu, weshalb eine geänderte Datei auch neu eingelesen werden muss, sonst findet die Suche weiter die alte.

Verhindert RAG Halluzinationen?

Leider nein, es macht sie bloß seltener. In der Stanford-Studie von 2024 lagen spezialisierte RAG-Werkzeuge für Juristen bei 17 Prozent der Testanfragen oder mehr daneben.

Welche Arten von RAG gibt es?

Grob gesagt drei: die Grundform mit Suche nach Bedeutungsähnlichkeit, die hybride Suche, die zusätzlich Stichworte abgleicht, und Varianten wie GraphRAG, die Begriffe und ihre Beziehungen auswerten, wenn eine Frage über viele Dokumente geht.

Ist RAG mit der DSGVO vereinbar?

Das hängt am Aufbau. Läuft es bei einem Cloud-Anbieter, braucht es oft eine Vereinbarung zur Auftragsverarbeitung, und die Suche darf nur zeigen, was der jeweilige Nutzer sehen darf. Wer ganz sichergehen will, betreibt es auf eigenen Servern.

Was jetzt

So prüfen Sie, ob RAG zu Ihrem Unternehmenswissen passt

  1. 01

    Fragen mitschreiben

    Legen Sie für zwei Wochen eine Liste an, in die das Team jede Frage einträgt, für die jemand in Ordnern oder alten Mails suchen musste, samt dem Ort, an dem die Antwort am Ende stand. Nach vierzehn Tagen sehen Sie ziemlich genau, wo sich RAG lohnen würde.

  2. 02

    Ordner aufräumen

    Schauen Sie sich die Fundorte aus der Liste an. Gibt es dort drei Fassungen desselben Formulars, eine Preisliste ohne Datum, ein Handbuch, das seit Jahren keiner angefasst hat? Was Sie hier nicht bereinigen, gibt die KI später getreu wieder.

  3. 03

    Vertrauliches markieren

    Klären Sie, welche Dokumente nur bestimmte Leute sehen dürfen, und ob die Daten in eine Cloud dürfen oder im Haus bleiben müssen. Das entscheidet über den Aufbau mehr als jede Modellfrage.

  4. 04

    Mit einer Abteilung anfangen

    Ein überschaubarer Bereich, etwa die Wissensartikel des Kundenservice, reicht für den Anfang völlig. Lassen Sie die Leute aus dem Fach ein paar Wochen lang Antworten und Fundstellen gegenlesen, bevor Sie den nächsten Bereich anschließen.

RAG macht aus einem Sprachmodell keinen Kenner Ihres Betriebs, aber einen, der nachschlagen kann. Wie gut das klappt, entscheidet sich weniger am Modell als an Ihren Unterlagen und daran, wer sie sehen darf.

oder anrufen: +49 151 1576 5566

Weiterlesen
Quellen

Woher die Angaben auf dieser Seite stammen

Projekt-Detail

    Eigenes Projekt im Kopf?

    Wir antworten persönlich. Erst Use-Case-Prüfung, dann Architektur-Vorschlag.

    Eigene Anfrage starten