Retrieval hilft; es garantiert keine korrekte Antwort
Retrieval-augmented Generation (RAG) stellt einem Sprachmodell ausgewählte Dokumente bereit, bevor es antwortet. Das kann eine Antwort relevanter für die Informationen eines Unternehmens machen, aber das System kann dennoch die falsche Passage abrufen, eine Ausnahme übersehen oder eine Behauptung erzeugen, die die Quelle nicht belegt.
Beginnen Sie mit einer definierten Aufgabe: zum Beispiel, Support-Mitarbeitenden dabei zu helfen, eine aktuelle Rückgaberichtlinie zu finden. Entscheiden Sie, welche Quellen maßgeblich sind, wer sie pflegt und wann eine Antwort eine menschliche Prüfung benötigt. Eine allgemeine Anweisung, „unsere Dokumente zu verwenden“, ist kein Abnahmekriterium.
Verwendbare Belege vorbereiten und abrufen
Bewahren Sie Überschriften, Dokumentidentität, Version und Quelllinks, wenn Sie Dokumente in Passagen aufteilen. Behalten Sie Ausnahmen zusammen mit der Regel, die sie einschränken. Vergleichen Sie Keyword-, Vektor- und kombiniertes Retrieval anhand repräsentativer Fragen, anstatt anzunehmen, dass eine Methode oder eine feste Chunk-Größe immer am besten ist. Testen Sie, ob der erforderliche Beleg in den abgerufenen Ergebnissen erscheint, getrennt davon, ob die endgültige Antwort ihn korrekt verwendet. Siehe Microsofts RAG-Architekturüberblick.
Wenden Sie Berechtigungen an, bevor Text das Modell erreicht
Beschränken Sie das Retrieval anhand des Mandanten und der Dokumentberechtigungen des authentifizierten Benutzers. Ein Prompt, der dem Modell sagt, vertrauliches Material zu verbergen, ist keine Autorisierungsgrenze. Auch Quelllinks, generierte Zusammenfassungen, der Gesprächsverlauf und zwischengespeicherte Antworten benötigen Zugriffsprüfungen. Berechtigungsänderungen und das Löschen von Dokumenten müssen sich auf den Index und jeden abgeleiteten Speicher auswirken.
Für ein Implementierungsbeispiel dokumentiert Azure AI Search die Berechtigungsfilterung zur Abfragezeit. Seine plattformspezifischen Fähigkeiten und Preview-Einschränkungen müssen für das beabsichtigte Deployment geprüft werden.
Machen Sie nicht belegbare Fragen zu einem expliziten Ergebnis
Zeigen Sie die Passage hinter einer wesentlichen Behauptung und lassen Sie den Benutzer sie prüfen. Eine Quellenangabe ist nur dann nützlich, wenn sie die Antwort tatsächlich belegt. Wenn die Quellen fehlen, widersprüchlich oder veraltet sind, sagen Sie, was nicht festgestellt werden konnte, und bieten Sie ein relevantes Suchergebnis oder eine Übergabe an. Verwandeln Sie einen schwachen Retrieval-Score nicht in eine erfundene Konfidenz-Prozentzahl.
Beispiel: Eine Richtlinie besagt, dass ungeöffnete Artikel innerhalb von 30 Tagen zurückgegeben werden können, sagt aber nichts über internationale Rücksendekosten. Für „Erstatten Sie mein Auslandsporto?“ identifiziert eine passende Antwort diese fehlende Information und verweist auf die Richtlinie oder das Support-Team. Das Wiederholen der 30-Tage-Regel beantwortet die Frage nicht.
Bewerten Sie das gesamte Verhalten
- Beziehen Sie beantwortbare, mehrdeutige, veraltete und bewusst nicht belegbare Fragen ein.
- Halten Sie für jeden Fall den erwarteten Beleg, die zulässige Benutzerrolle und die akzeptable Antwort oder Enthaltung fest.
- Prüfen Sie Abrufabdeckung, Belege für einzelne Aussagen, Zitiergenauigkeit, Berechtigungslecks, Latenz und Kosten getrennt.
- Wiederholen Sie die Reihe nach Änderungen an Dokumenten, Abrufeinstellungen, Prompts oder Modellen. Fügen Sie echte Fehlerfälle hinzu, nachdem Sie unnötige personenbezogene Daten entfernt haben.
Dies ist ein vorgeschlagener Bewertungsansatz, keine Aussage über einen historischen Kundendatensatz. Keine endliche Testmenge beweist, dass künftige Antworten immer korrekt sein werden. Aktionen mit hoher Auswirkung erfordern zusätzliche Kontrollen, Freigaben oder eine menschliche Prüfung, die zum Arbeitsablauf passt.
Entdecken LLM-Integration für eine KI-Funktion innerhalb einer Anwendung, oder Workflow-Automatisierung wenn die Aufgabe mehrere Systeme übergreift. Die Umgebung des Entwicklungstools und der Datenfluss des bereitgestellten Produkts sind getrennte Entscheidungen.


