Zum Hauptinhalt springen

Mibo macht aus Agentenerwartungen Testfälle, die Sie ausführen und prüfen können.

Mibo hilft Teams, ein reales Agentenszenario zu beschreiben, semantische und prozedurale Prüfungen hinzuzufügen, ausgewählte Fälle gezielt auszuführen und passende Traces auszuwerten, wenn Nachweise verfügbar sind.

Ein Testplan lässt sich schwer anwenden, wenn Erwartungen nur als Text bestehen.

Teams müssen eine reale Kundensituation in eine konkrete Eingabe, erwartetes Verhalten und prüfbare Nachweise übersetzen. Mibo hält diese Teile zusammen, ohne ein einzelnes Szenario als Aussage über jede Interaktion zu behandeln.

Konkrete Szenarien

Beschreiben Sie Situation, Eingabe und zu schützendes Verhalten, damit ein Testfall ein gezieltes Kundenszenario statt einer vagen Anweisung darstellt.

Semantische Erwartungen

Formulieren Sie Kriterien für Bedeutung, Sicherheit, Vollständigkeit oder Zielausrichtung in natürlicher Sprache. Der Evaluator bewertet Antwort und verfügbaren Kontext anhand Ihrer Beschreibung.

Prozedurale Nachweise

Prüfen Sie beobachtbare Fakten wie Knoten- oder Tool-Aufrufe, Argumente, Status, Schema, Zeit oder Token-Nutzung, wenn die aktive Antwort oder der Trace die nötigen Felder enthält.

Von einer realen Erwartung zu prüfbaren Nachweisen

Erstellen Sie einen fokussierten Fall, wählen Sie passende Prüfungen und nutzen Sie das Ergebnis, um den nächsten Untersuchungsschritt festzulegen. Aktive Läufe und passive Traces bleiben unterschiedliche Signale.

Szenario beschreiben

Beschreiben Sie die Kundensituation und die Eingabe, die sie auslösen soll. Ergänzen Sie das erwartete Ergebnis sowie wichtige Sicherheits- oder Randbedingungen.

Prüfungen ergänzen

Kombinieren Sie semantische Kriterien mit prozeduralen Prüfungen für Antwort und Ausführungsnachweise, die Ihr Agent liefern kann. Legen Sie Schwellenwerte und erwartete Werte gezielt fest.

Ausführen und evaluieren

Führen Sie den ausgewählten Fall gegen einen verbundenen Agenten aus und evaluieren Sie anschließend passende kanonische Traces realer Interaktionen asynchron, wenn Ihr System sie sendet.

Ein Fall verbindet ein Kundenszenario mit seinen Nachweisen

Semantische Prüfungen

Beschreiben Sie, was eine hilfreiche, sichere, vollständige oder fundierte Antwort bedeutet. Der Score ist ein Untersuchungsnachweis und hängt von der für den Evaluator verfügbaren Antwort und dem Kontext ab.

Prozedurale Prüfungen

Prüfen Sie deterministische Fakten wie einen erforderlichen Tool-Aufruf, ein Argument, ein Antwortfeld, einen HTTP-Status, ein Schema, ein Zeitlimit oder Token-Nutzung. Fehlende Trace-Felder erscheinen als fehlende Instrumentierung.

Häufig gestellte Fragen

Was ist ein Testfall für einen KI-Agenten?

Ein definierter Testfall besteht aus Szenario, Eingabe, erwartetem Verhalten und Prüfungen, die Mibo auswerten kann. Prüfungen können die Bedeutung der Antwort beschreiben oder beobachtbare Fakten wie Tool-Aufrufe, Argumente, Status, Schema, Zeit oder Tokens untersuchen.

Wie unterscheiden sich Testfälle von der allgemeinen Evaluierung von KI-Agenten?

Ein Testfall ist die konkrete Definition von Szenario und Prüfungen. Mibo evaluiert die konfigurierten Prüfungen in einem gezielten aktiven Lauf und kann passende aktive Testfälle wiederverwenden, wenn Ihr System Traces realer Interaktionen sendet.

Kann Mibo einen ausgewählten Testfall vor dem Release ausführen?

Ja. Ein aktiver Test sendet die ausgewählte Eingabe an einen verbundenen Agenten und wertet Antwort und verfügbare Ausführungsnachweise aus. Das Ergebnis belegt dieses Szenario, nicht unbeobachtete Fälle.

Kann ein Testfall anhand eines realen Traces evaluiert werden?

Ja, wenn der Test aktiv und für passive Evaluierung geeignet ist und Ihr System nach der Interaktion einen kanonischen Trace sendet. Mibo klassifiziert passende Szenarien und evaluiert sie asynchron, ohne den Agenten erneut aufzurufen.

Was passiert, wenn eine Prüfung Daten benötigt, die der Trace nicht enthält?

Mibo meldet fehlende Instrumentierung für unterstützte Prüfungen, die das erforderliche Trace-Feld nicht finden, statt die Prüfung stillschweigend als bestanden oder fehlgeschlagen zu behandeln. Ergänzen Sie relevante Felder, wenn dieser Nachweis für Ihren Ablauf wichtig ist.

Garantieren Testfälle für KI-Agenten eine vollständige Abdeckung?

Nein. Das Signal ist durch konfigurierte Szenarien und Prüfungen, verfügbare Eingaben und Traces, Klassifizierung, Instrumentierung und die Breite der ausgeführten oder beobachteten Interaktionen begrenzt. Mibo verspricht weder garantierte Qualität noch automatische Behebung.

Mehr entdecken