QA & Release-Absicherung

KI-Evaluierung & Tests

Testen Sie die KI in Ihrem Produkt, nicht nur die App drumherum. Wir evaluieren Antwortqualität, Fundierung, Berechtigungen und Fehlerbehandlung in Agenten, Chatbots und LLM-Funktionen und legen klare Freigabekriterien fest.

Wer KI-Evaluierung braucht

Ihre KI-Funktion sieht in einer Demo gut aus, aber niemand kann bisher sagen, wie sie sich bei echten Fragen, feindseligen Eingaben und fehlenden Daten verhält oder ob das nächste Modell oder eine Änderung des Prompts sie verschlechtert.

  • Teams, die kurz davor stehen, einen Chatbot oder Assistenten für Kunden bereitzustellen
  • Product Owner, die Modell, Anbieter oder Prompts ändern und einen Vorher-Nachher-Vergleich brauchen
  • Unternehmen, die einen Agenten interne Datensätze lesen oder Aktionen in anderen Systemen auslösen lassen

Wie jedes Verhalten evaluiert wird

Beispielhafter Plan für einen kundenorientierten Assistenten; die Methoden verschieben sich je nach Anwendungsfall und Risiken.

Automatisierte EvalsExperten-ReviewRed-Team-TestsProduktionssignale
AntwortgenauigkeitPrimäre MethodePrimäre MethodeHier selten verwendetUnterstützend oder stichprobenartig
Fundierung und QuellenangabenPrimäre MethodeUnterstützend oder stichprobenartigHier selten verwendetUnterstützend oder stichprobenartig
BerechtigungsgrenzenUnterstützend oder stichprobenartigPrimäre MethodePrimäre MethodeUnterstützend oder stichprobenartig
Prompt InjectionUnterstützend oder stichprobenartigUnterstützend oder stichprobenartigPrimäre MethodeUnterstützend oder stichprobenartig
Ablehnungen und FallbacksPrimäre MethodeUnterstützend oder stichprobenartigUnterstützend oder stichprobenartigPrimäre Methode
  • Primäre Methode
  • Unterstützend oder stichprobenartig
  • Hier selten verwendet

Das Testen von KI-Funktionen ist eine andere Aufgabe

Ein Chatbot kann jeden Funktionstest bestehen und trotzdem selbstbewusst eine falsche Antwort geben, Daten preisgeben, die er nicht sollte, oder Anweisungen folgen, die in einer hochgeladenen Datei versteckt sind. KI-Funktionen brauchen ihre eigene Evaluierung: Datensätze mit echten und schwierigen Fällen, Prüfungen von Antwortqualität und Fundierung, Tool- und Datenberechtigungen, Anfälligkeit für Prompt-Injection, Fehlerbehandlung und Regressionsprüfungen, wann immer sich ein Modell oder Prompt ändert. Das unterscheidet sich vom Testen einer gewöhnlichen App, die mit Hilfe von KI erstellt wurde, was Software-QA & -Tests abdecken.

KI hilft beim Bewerten im großen Maßstab; Experten setzen die Messlatte

Wie KI unterstützt

  • Erzeugt Variationen echter Nutzerfragen, die Sie genehmigen, einschließlich Umformulierungen, Grenzfällen und gegnerischen Eingaben.
  • Bewertet große Stapel von Antworten mit modellbasierter Bewertung, kalibriert anhand von Antworten, die von Experten gekennzeichnet wurden.
  • Gruppiert Fehler nach Ursache, etwa fehlender Kontext, ein falscher Tool-Aufruf oder eine ignorierte Anweisung.
  • Vergleicht Läufe über Modell-, Prompt- oder Retrieval-Änderungen hinweg und markiert, wo sich das Verhalten verschlechtert hat.

Was unsere Experten verantworten

  • Experten definieren gemeinsam mit Ihren Fachspezialisten, was eine korrekte, sichere und nützliche Antwort ist.
  • Modellbasierte Bewertungen werden von Menschen stichprobenartig überprüft, und ein Bewerter, der mit Experten nicht übereinstimmt, wird korrigiert oder verworfen.
  • Menschen entscheiden, welche Tools und Daten ein Agent verwenden darf und wo ein Mensch genehmigen oder übernehmen muss.
  • Die Freigabekriterien und die Go/No-Go-Entscheidung bleiben bei Ihrem Team und unserem, nicht allein bei einer Bewertung.

Was Sie erhalten

Eine Evaluierung, die Sie bei jeder Änderung erneut ausführen können

  • Evaluierungsdatensatz

    Echte und synthetische Fälle, gekennzeichnet mit dem erwarteten Verhalten: häufige Fragen, Grenzfälle, Anfragen außerhalb des Geltungsbereichs und frühere Fehler.

  • Antwortqualität und Fundierung

    Genauigkeit, Relevanz und Ton sowie ob Antworten durch Ihre Quellen gestützt werden, mit überprüften Zitaten und markierten Halluzinationen.

  • Tool- und Datenberechtigungstests

    Was ein Agent lesen, ändern oder auslösen kann, getestet gegen das Prinzip der minimalen Rechte, Genehmigungspunkte und die Pfade für die menschliche Übernahme.

  • Anfälligkeit für Prompt-Injection

    Direkte und indirekte Injection durch Nachrichten, hochgeladene Dateien, Webseiten und abgerufene Dokumente, bewertet danach, was ein Angreifer erreichen könnte.

  • Fehlerbehandlung und Rückfalloptionen

    Verhalten, wenn das Modell eine Zeitüberschreitung hat, ein Anbieter ausfällt, das Retrieval nichts findet oder die Zuversicht gering ist: Rückfalloptionen, klare Meldungen, Übergabe an Menschen.

  • Regressionsprüfungen und Freigabekriterien

    Automatisierte Evaluierungen, die erneut ausgeführt werden, wenn sich Modelle, Prompts oder Daten ändern, mit vereinbarten Kriterien, die entscheiden, ob eine Änderung ausgeliefert wird.

Wie eine KI-Evaluierung abläuft

  1. 01

    Gutes Verhalten definieren

    Vereinbaren Sie Anwendungsfälle, Risiken, Qualitätskriterien und Berechtigungen mit Ihrem Team und Fachexperten und sammeln Sie echte Beispiele, deren Verwendung Sie uns erlauben.

  2. 02

    Den Datensatz aufbauen

    Stellen Sie Evaluierungsfälle zusammen und kennzeichnen Sie sie, einschließlich schwieriger und gegnerischer, und legen Sie die Freigabekriterien fest, die jede Änderung erfüllen muss.

  3. 03

    Evaluieren und untersuchen

    Führen Sie automatisierte Evaluierungen mit Expertenüberprüfung, Red-Team-Berechtigungen und Prompt-Injection durch und führen Sie Fehler auf Prompts, Retrieval, Tools oder das Modell zurück.

  4. 04

    Freigeben und überwachen

    Fügen Sie Evaluierungen in Ihren Freigabeprozess ein, berichten Sie Ergebnisse mit empfohlenen Korrekturen und halten Sie den Datensatz aktuell, während sich das Produkt ändert.

Zwei Wege, mit KI-Tools zu arbeiten

KI hilft beim Entwerfen von Tests und beim Untersuchen von Defekten. Wählen Sie, wo sie Ihren Code und Ihre Testdaten verarbeiten darf.

Nicht sicher? Wir empfehlen eines während des Scopings. KI-Bereitstellungsoptionen vergleichen

Typische Evaluierungsanfragen

Typische Szenarien, die wir abgrenzen, keine Kundenfallstudien.

  • Help-Center-Assistent vor dem öffentlichen Start

    Ein Team möchte einen Assistenten, der aus seinen Hilfeartikeln antwortet. Wir verwandeln echte Supportfragen in einen gelabelten Satz, bewerten Antworten und Quellenangaben, ergänzen Fälle außerhalb des Geltungsbereichs und adversariale Fälle und vereinbaren Freigabekriterien vor dem Start.

  • Umstellung einer Funktion auf ein kostengünstigeres Modell

    Ein Product Owner möchte eine Funktion auf ein günstigeres Modell oder einen günstigeren Anbieter umstellen. Wir führen denselben Evaluierungssatz auf beiden aus, zeigen, wo Antworten besser oder schlechter werden und wie sich die Latenz ändert, und überlassen die Entscheidung ihnen.

  • Ein Agent, der Datensätze ändern kann

    Ein Unternehmen lässt einen internen Agenten Bestellungen aktualisieren. Wir unterziehen seine Tool-Berechtigungen und Freigabepunkte einem Red-Team-Test, platzieren Anweisungen in Dokumenten, die er liest, um indirekte Injection zu testen, und empfehlen, wo eine Person vor dem Handeln zustimmen muss.

Wo die KI-Evaluierung aufhört

  • Das Ändern von Prompts, Retrieval oder des Modells selbst ist nicht Teil der Evaluierung; wir empfehlen Korrekturen, und Ihr Team nimmt sie vor oder wir definieren den Umfang im Rahmen von LLM Integration.
  • Angriffe auf die Server, APIs und das Cloud-Konto hinter der Funktion gehören zu Penetration Testing; hier prüfen wir die Anweisungen, Tools und den Datenzugriff des Modells.
  • Latenz, Rate-Limits und Modellkosten bei Spitzenauslastung werden im Performance Testing gemessen.
  • Eine rechtliche oder regulatorische Freigabe Ihrer KI-Nutzung ist nicht enthalten; die Ergebnisse dienen als Nachweis für Ihre eigene Risiko- und Compliance-Prüfung.

Wie die KI-Evaluierung mit Design, QA und Betrieb zusammenhängt

  • Design: Aufsicht, die Menschen nutzen können

    Designer gestalten, wie Nutzer Quellen, Unsicherheit und Fehler sehen und wie Ihre Mitarbeiter einen Agenten überprüfen, korrigieren oder von ihm übernehmen.

  • QA: auch der Rest des Produkts

    Software-QA deckt die App rund um die KI ab, etwa Anmeldung, Zahlungen, Rollen und Integrationen, die wie jede Freigabe gegen Anforderungen getestet werden.

  • Betrieb: Qualität in der Produktion

    Produktionslogs, Nutzer-Feedback, Latenz und Kosten speisen das Monitoring und neue Evaluierungsfälle, mit Warnungen, wenn die Qualität abzudriften beginnt.

  • Laufend: jede Änderung neu evaluieren

    Modell-Upgrades, Prompt-Bearbeitungen und neue Datenquellen werden vor der Freigabe evaluiert, als Teil des mit Ihnen vereinbarten KI-Betriebs.

FAQ

Häufig gestellte Fragen

Wie unterscheidet sich das vom Testen einer App, die mit Hilfe von KI erstellt wurde?

Eine mit KI-Programmierwerkzeugen geschriebene App verhält sich immer noch wie gewöhnliche Software, daher deckt Software-QA & -Tests sie ab. Die KI-Evaluierung ist für Produkte gedacht, bei denen ein Modell zur Laufzeit Antworten generiert oder Aktionen ausführt. Die Ausgaben variieren, daher messen wir die Qualität über viele Fälle hinweg, testen Berechtigungen und planen für Fehler. Viele Produkte brauchen beides, und wir fassen sie gemeinsam ins Auge.

Welche Modelle und KI-Stacks können Sie evaluieren?

Funktionen, die auf gehosteten Modellen wie OpenAI oder Claude, offenen Modellen wie Llama oder Mistral, Retrieval-Pipelines und Agenten-Frameworks aufbauen. Die Methode hängt nicht vom Anbieter ab, sodass Sie sie auch nutzen können, um Modelle oder Anbieter an Ihren eigenen Fällen zu vergleichen.

Kann die Evaluierung verhindern, dass die KI jemals falsch liegt?

Nein. Modelle können immer noch Fehler machen. Die Evaluierung zeigt, wo und wie sie scheitern, sodass Sie Freigabekriterien festlegen, Leitplanken und Rückfalloptionen hinzufügen, menschliche Überprüfung dort gestalten können, wo Fehler teuer sind, und schnell bemerken, wenn sich die Qualität ändert.

Wo werden unsere Prompts, Logs und Evaluierungsdaten verarbeitet?

Die Modellaufrufe Ihrer eigenen Funktion gehen an den Anbieter, den Sie bereits nutzen. KI-Tools, die wir bei der Arbeit einsetzen, etwa modellbasierte Bewertung, laufen innerhalb der von Ihnen gewählten Grenze: Private / lokale KI-Entwicklung auf von Ihnen kontrollierter Infrastruktur oder Entwicklung mit Claude Code / OpenAI Codex unter vereinbarten Bedingungen zur Datenverarbeitung. Personenbezogene Daten in Logs werden vor der Verwendung maskiert, wie mit Ihnen vereinbart.

Verwandte Lektüre

Sehen Sie, wie sich Ihre KI verhält, bevor Sie sie ausliefern

Sagen Sie uns, was Ihre KI-Funktion tut, welches Modell sie verwendet und was Sie beunruhigt. Wir schlagen Ihnen einen Evaluierungsplan und Freigabekriterien vor.