Evaluierungsmetriken, die KI-Agentenqualität erklären
Ein praktischer Rahmen für Verhaltens-, Tool-, Antwort-, Status-, Latenz- und Tokenmetriken und ihre Grenzen.
Agentenqualität ist keine einzelne Zahl. Eine nützliche Evaluierung verbindet Verhalten, Ausführungsbelege und Antwortmetriken und bewahrt genug Kontext, um Veränderungen zu erklären.
Verhaltens- und Grounding-Metriken
Verhaltensqualität fragt, ob der Agent das Szenario erfüllt hat; Grounding prüft, ob die Antwort innerhalb der verfügbaren Fakten, Richtlinien und Kontexte blieb.
- Szenarioerfolg und gewünschtes Kundenergebnis.
- Belegte Antwort ohne erfundene Aktionen oder Aussagen.
- Vollständiger nächster Schritt und klare Grenzen.
- Richtlinienkonformer Ton.
Kriterien müssen präzise sein. „Sei hilfreich“ ist mehrdeutig; „erkläre die Kündigung und behaupte nicht, sie sei abgeschlossen“ ist testbar.
Tool- und Routing-Metriken
Eine plausible Antwort kann den falschen Pfad verbergen. Prüfe Spezialist, erforderliches Tool, Argumente, Nutzung des Ergebnisses und notwendige Span-Attribute.
Ein fehlendes Feld ist ein Sichtbarkeitsproblem und kein stiller Erfolg.
Antwort- und Protokollmetriken
- HTTP- oder Anwendungsstatus.
- Pflichtfelder oder Schemaform.
- Leere oder fehlerhafte Ausgabe.
- Erforderliche Sicherheits- oder Richtlinienmarker.
Ein 200-Status garantiert weder eine sichere Entscheidung noch eine wahre Aussage. Kombiniere diese Metriken mit Verhaltensprüfungen.
Latenz- und Tokenmetriken
Messe Gesamtdauer, Modell- und Tool-Zeit sowie Eingabe- und Ausgabe-Tokens, sofern sie im Trace verfügbar sind.
Nutze sie für Abwägungen, nicht als alleinige Qualitätsaussage. Eine schnellere Antwort mit dem falschen Tool ist keine Verbesserung.
Richte Metriken an Entscheidungen aus
- Können wir diese Änderung veröffentlichen?
- Ist eine Produktionsinteraktion nach dem Release regressiert?
- Welche Stufe muss korrigiert werden?
- Verbessert der Fix die Qualität ohne Kosten- oder Latenzproblem?
Ordne jeder Entscheidung eine semantische Metrik für das Ergebnis, eine prozedurale für den Pfad und eine operative für die Einschränkung zu. Behalte Szenario und Trace, damit der Score erklärbar bleibt.
Interpretiere Scores mit ihren Grenzen
Metriken sind Belege, kein Ersatz für Urteilskraft. Vergleiche Gleiches mit Gleichem und prüfe Szenario, Instrumentierung und Relevanz.
Mibo bewertet dieselben Definitionen aktiv vor dem Release und passiv an echten Traces. Lies über Agenten-Evaluierung oder starte einen Live-Test.
Nutze die Assertion-Referenz und die OpenTelemetry-Anleitung.