Retrieval Augmented Generation (RAG) bezeichnet ein Verfahren, bei dem ein Sprachmodell vor der Antwort in einer eigenen Dokumentensammlung nachschlägt und nur die gefundenen Stellen als Grundlage nutzt. Statt allein aus dem Trainingswissen zu antworten, arbeitet das Modell mit Ihren tatsächlichen Inhalten — Handbüchern, Richtlinien, Verträgen. RAG ist damit die gängigste Technik hinter unternehmensinternen Wissensassistenten.
Wie es abläuft
- Ihre Dokumente werden in Abschnitte zerlegt und in eine durchsuchbare Form gebracht — meist eine Vektordatenbank, die nach inhaltlicher Ähnlichkeit statt nach exakten Stichworten sucht.
- Bei einer Frage werden die passendsten Abschnitte herausgesucht.
- Diese Abschnitte werden dem LLM zusammen mit der Frage übergeben.
- Das Modell antwortet auf Basis dieser Stellen und nennt idealerweise die Quelle.
Abgrenzung zum Fine-Tuning
| Merkmal | RAG | Fine-Tuning |
|---|---|---|
| Was wird geändert | Nur die Eingabe zur Laufzeit | Das Modell selbst |
| Aufwand | Gering bis mittel | Hoch |
| Wissen aktualisieren | Dokument austauschen | Neu trainieren |
| Belegbarkeit | Quelle wird mitgeliefert | Nicht nachvollziehbar |
Für Unternehmenswissen ist RAG fast immer der bessere Weg: Es lässt das Modell unverändert und gibt ihm das Wissen erst im Moment der Frage mit. Reicht schon ein kurzer Hinweis im Prompt, genügt oft einfaches Prompt Engineering; Fine-Tuning lohnt sich erst bei sehr speziellen Anforderungen.
Warum das der übliche Weg ist
RAG löst drei Probleme auf einmal: Das Modell kennt Ihre internen Informationen, die Antworten sind belegbar, und neue Dokumente lassen sich hinzufügen, ohne das Modell neu zu trainieren. Für einen nützlichen Assistenten reichen häufig schon 50 bis 200 gut gepflegte Dokumente — die Qualität des Bestands zählt mehr als die Menge.
Wo es scheitert
Nicht an der Technik, sondern am Dokumentenbestand. Widersprüchliche Versionen, veraltete Stände und schlecht strukturierte Dateien führen zu Antworten, die falsch und trotzdem überzeugend klingen. Ein kleiner, gepflegter Bestand schlägt einen großen ungepflegten.
Einordnung für den Mittelstand
RAG ist der pragmatische Einstieg, um vorhandenes Firmenwissen nutzbar zu machen — etwa im Wissensmanagement oder im internen Support. Die laufenden Kosten hängen an der Menge der verarbeiteten Token: Je mehr Dokumentabschnitte pro Frage mitgegeben werden, desto teurer die einzelne Antwort. Ein sauber abgegrenzter Anwendungsfall hält beides — Kosten und Fehlerquote — niedrig.
