KI-Agenten testen: ein praktischer Ablauf
Entwirf nützliche Tests, kombiniere aktive und passive Tests und untersuche die Belege hinter Regressionen.
KI-Agenten brauchen mehr als einen Healthcheck. Ein guter Test prüft, ob der Agent den richtigen Weg gewählt, seine Tools sicher genutzt und passend zur Situation geantwortet hat.
Beginne mit dem Verhalten, das geschützt werden muss
Beschreibe das Szenario wie für ein Teammitglied: mit Auslöser, erwarteter Aktion und akzeptabler Antwort.
- Szenario: Der Nutzer möchte ein Abonnement kündigen.
- Erwartung: Der Agent erklärt den Weg und behauptet nicht, die Kündigung sei bereits erfolgt.
- Beleg: Das Billing-Tool erhält die richtige Konto-ID, bevor eine Aktion bestätigt wird.
Ein klares Szenario entscheidet, wann ein passiver Test relevant ist, und gibt genug Kontext, um einen Fehler zu verstehen.
Kombiniere semantische und prozedurale Prüfungen
Semantische Prüfungen bewerten Bedeutung und Richtlinien. Prozedurale Prüfungen kontrollieren beobachtbare Fakten wie Tool-Aufrufe, Argumente, HTTP-Status oder Span-Attribute.
Nutze beide, wenn das Verhalten von einer Entscheidungskette abhängt. Eine geschliffene Antwort ersetzt kein fehlendes Tool, und ein richtiger Aufruf rechtfertigt keine erfundene Aussage.
Führe aktive Tests vor dem Release aus
Aktive Tests folgen einer bewussten Schleife:
- Wähle ein Kundenziel oder einen bekannten Grenzfall.
- Sende ihn an die Agentenverbindung.
- Prüfe Antwort, Trace und Ergebnisse.
- Korrigiere Agent oder Orchestrierung.
- Wiederhole das Szenario und bewahre es als Regressionstest auf.
Starte mit wenigen wertvollen Szenarien und erweitere die Suite, sobald ein echter Trace einen neuen Fehlermodus zeigt.
Setze die passive Auswertung in Produktion fort
Synthetische Szenarien können nicht jede Nutzung vorhersagen. Passive Tests werten den Trace einer echten Interaktion im Hintergrund mit denselben aktiven Fällen aus.
Achte auf Relevanz: Ein Kündigungstest darf nicht an einer Frage zu Öffnungszeiten scheitern. Einen irrelevanten Test zu überspringen ist bessere Evidenz als ein erzwungener Fehler.
Lies mehr über Produktionstests und die n8n-Integration.
Untersuche Belege, nicht nur den Score
Ein Score fasst zusammen, diagnostiziert aber nicht. Prüfe Routing, Tool-Aufruf und Werte, unbelegte Aussagen sowie mögliche Lücken in der Instrumentierung.
So wird jedes Ergebnis zu einer konkreten Engineering-Aufgabe und die Suite bleibt am Produktverhalten ausgerichtet.
Kenne die Grenzen
Keine Suite deckt jede Interaktion ab. Interpretiere Scores zusammen mit Szenario, Belegen und Fehlergrund.
Sieh dir die Agenten-Evaluierung in Mibo und die Mibo-Dokumentation an.