Zum Hauptinhalt springen

Mibo evaluiert das Verhalten von KI-Agenten über den Antwortcode hinaus.

Mibo verbindet die aktive Evaluierung vor dem Release mit der passiven Evaluierung realer Traces nach dem Start, damit Teams semantische Qualität, prozedurale Nachweise und die Grenzen jedes Signals prüfen können.

Eine Antwort kann erfolgreich sein, obwohl der Agent den falschen Weg nimmt.

Mibo verwandelt das erwartete Agentenverhalten in überprüfbare Nachweise, statt eine erfolgreiche HTTP-Antwort als Beleg für eine zuverlässige Interaktion zu behandeln.

Semantische Prüfungen

Die KI-gestützten Prüfungen von Mibo vergleichen die Bedeutung einer Antwort mit den von Ihnen beschriebenen Kriterien, etwa Fundierung, Vollständigkeit, Sicherheit oder Zielausrichtung. Sie bewerten die bereitgestellte Antwort, stellen aber keine Wahrheit fest und garantieren nicht allein deren Qualität.

Prozedurale Nachweise

Die deterministischen Prüfungen von Mibo untersuchen beobachtbare Fakten wie Knoten- oder Tool-Aufrufe, Argumente, Attribute, HTTP-Status, Schema und Antwortzeit. Ein fehlendes Trace-Feld wird als fehlende Instrumentierung gemeldet und nicht stillschweigend als bestanden gewertet.

Passive Traces

Nach einer realen Interaktion kann Ihr System einen Trace zur asynchronen Evaluierung anhand der zutreffenden aktiven Tests senden. Passive Ergebnisse decken ab, was Sie senden und was Ihre Tests beobachten können – nicht jede mögliche Unterhaltung.

Ein Evaluierungsmodell für den gesamten Lebenszyklus des Agenten

Verwenden Sie dieselben Erwartungen in einem kontrollierten aktiven Lauf und in passiven Traces, während Nachweise und Grenzen beider Modi sichtbar bleiben.

Erwartetes Verhalten definieren

Beschreiben Sie das Szenario und die relevanten Prüfungen, darunter semantische Kriterien und beobachtbare Ausführungsfakten wie einen erforderlichen Tool-Aufruf oder Status.

Aktive Evaluierung ausführen

Wählen Sie ein Szenario, senden Sie es an den verbundenen Agenten und prüfen Sie vor dem Release die Antwort zusammen mit den Ausführungsnachweisen. Aktive Läufe belegen keine unbeobachteten Fälle.

Passive Traces evaluieren

Senden Sie nach einer realen Interaktion einen kanonischen Trace. Mibo speichert und evaluiert ihn asynchron anhand der zutreffenden aktiven Tests außerhalb des Kundenanfragepfads; fehlende Felder können das Ergebnis begrenzen.

Bedeutung und Ausführungsnachweise gemeinsam prüfen

Semantische Prüfungen zeigen, wie eine Antwort ein Kriterium erfüllt

Bewerten Sie Bedeutung, Sicherheit, Vollständigkeit und Zielausrichtung anhand natürlichsprachlicher Kriterien. Das Ergebnis hängt von der bereitgestellten Antwort und ihrem Kontext ab und ist damit ein Nachweis zur Untersuchung, keine automatische Qualitätsgarantie.

Prozedurale Prüfungen zeigen, was der Trace aufzeichnet

Prüfen Sie Tool- oder Knoten-Aufrufe, Argumente, Attribute, HTTP-Status, Schema und Timing mit deterministischen Prüfungen. Diese Signale sind durch die Instrumentierung und die Felder in der aktiven Antwort oder im passiven Trace begrenzt.

Häufig gestellte Fragen

Was prüft die Evaluierung von KI-Agenten?

Mibo evaluiert das von Ihnen beschriebene Verhalten, darunter die Bedeutung der Antwort und beobachtbare Ausführungsnachweise wie Routing, Tool-Aufrufe, Werte, Status, Schema und Timing. Semantische Prüfungen bewerten natürlichsprachliche Kriterien; prozedurale Prüfungen bestätigen aufgezeichnete Fakten. Keine davon belegt jede mögliche Interaktion oder garantiert die Gesamtqualität.

Kann ich einen Agenten vor dem Release evaluieren?

Ja. Die aktive Evaluierung sendet ausgewählte Szenarien an einen verbundenen Staging- oder Produktionsagenten, damit Sie Antwort und Ausführungsnachweise prüfen können. Dieselben Testdefinitionen lassen sich für die passive Evaluierung wiederverwenden, sobald Traces realer Interaktionen eintreffen.

Was geschieht, wenn ein passiver Trace Mibo erreicht?

Ihr System sendet nach der Interaktion einen Trace. Mibo speichert ihn, ermittelt die zutreffenden aktiven Tests und evaluiert ihn asynchron im Hintergrund, ohne eine weitere Anfrage in den Kundenpfad einzufügen.

Garantiert Mibo eine vollständige Abdeckung oder automatische Qualität?

Nein. Mibo evaluiert konfigurierte Prüfungen anhand der verfügbaren Antworten und Traces. Zu enge Kriterien, unbeobachtete Randfälle, nicht verfügbare Klassifizierung und fehlende Instrumentierung können das Signal begrenzen. Deshalb sollten aktive Läufe und passive Traces gemeinsam geprüft werden.

Mehr entdecken