Auch genannt: Retrieval-Augmented Generation, Retrieval Augmented Generation
Wie RAG funktioniert
Statt das Modell mit Ihrem Wissen neu zu trainieren, wird zur Laufzeit das passende Wissen herangeholt:
- Ihre Dokumente werden in Abschnitte zerlegt (Chunking) und als Embeddings in einer Vektordatenbank abgelegt.
- Zu einer Frage werden die inhaltlich passendsten Abschnitte gesucht.
- Diese Abschnitte gibt das Harness dem Modell als Kontext mit – erst dann antwortet es.
Stärken und Grenzen
RAG glänzt, weil das Wissen aktuell bleibt (neues Dokument rein, fertig) und Antworten belegbar sind. Die Qualität hängt aber stark an der Aufbereitung: schlechtes Chunking oder fehlendes Reranking liefern unpassende Stellen, und das Modell kann nur so gut antworten wie der mitgegebene Kontext. RAG ist damit ein Teilgebiet des umfassenderen Context Engineering.
Aktualisiert