Zum Hauptinhalt springen

Mibo testet Regressionen von KI-Agenten vor dem Release und nach realen Interaktionen.

Führen Sie ausgewählte Szenarien vor dem Release gezielt aus und werten Sie anschließend verfügbare Produktions-Traces realer Interaktionen mit denselben konfigurierten Tests aus. Mibo macht die Nachweise sichtbar, ohne vollständige Abdeckung zu behaupten.

Eine bestandene Prüfung vor dem Release kann eine Regression im Verhalten übersehen, das Nutzer später erleben.

Ein Agent kann ein ausgewähltes Szenario bestehen, während eine andere reale Interaktion eine Änderung bei Routing, Tool-Aufruf oder Antwort offenlegt. Mibo verbindet gezielte Prüfungen vor dem Release mit Trace-Nachweisen nach realen Interaktionen, ohne ein einzelnes Ergebnis als Qualitätsbeleg zu behandeln.

Aktive Regressionstests

Führen Sie ausgewählte Szenarien vor dem Release gegen Ihren Agenten aus und bewerten Sie Antwort sowie beobachtbare Ausführungsnachweise mit den von Ihnen konfigurierten Tests.

Auswertung von Produktions-Traces

Senden Sie Mibo nach einer realen Interaktion einen verfügbaren kanonischen Trace. Zutreffende aktive Tests werden asynchron ausgewertet, ohne dass Mibo Ihren Agenten erneut aufruft.

Ein begrenztes Signal

Interpretieren Sie Ergebnisse im Rahmen der definierten Prüfungen, der im Trace enthaltenen Instrumentierung, der Eingangsklassifizierung und der Breite der ausgeführten oder beobachteten Szenarien.

Ein Regressionsablauf zwischen Release-Prüfungen und realem Traffic

Nutzen Sie aktive Tests, um bekannte Szenarien gezielt auszuführen, und werten Sie anschließend passive Traces aus, um dasselbe Prüfset auf Interaktionen anzuwenden, die Ihr System tatsächlich verarbeitet hat.

Schützenwertes Verhalten definieren

Beschreiben Sie Szenarien und ergänzen Sie semantische oder prozedurale Prüfungen für Antwort, Tool-Aufrufe, Argumente, Status, Schema, Zeit oder andere Nachweise, die der Trace enthalten kann.

Vor dem Release testen

Führen Sie ausgewählte Eingaben vor der Veröffentlichung einer Änderung gegen den Agenten aus. Prüfen Sie Ergebnis und Nachweise als gezielten Regressionstest, nicht als Garantie für jede mögliche Eingabe.

Reale Interaktionen auswerten

Senden Sie verfügbare Produktions-Traces nach den Interaktionen. Mibo klassifiziert zutreffende Szenarien und wertet konfigurierte Tests asynchron aus, damit das Team Unterschiede im Zeitverlauf untersuchen kann.

Eine Regression von der geänderten Antwort bis zu den Nachweisen verfolgen

Semantische Prüfungen

KI-gestützte Prüfungen vergleichen eine Antwort mit den von Ihnen beschriebenen Kriterien, etwa Vollständigkeit, Fundierung, Sicherheit oder Zielausrichtung. Der Score ist ein Untersuchungsnachweis und hängt von der für die Auswertung verfügbaren Antwort und dem Kontext ab.

Prozedurale Prüfungen

Deterministische Prüfungen untersuchen aufgezeichnete Fakten wie Knoten- oder Tool-Aufrufe, Argumente, HTTP-Status, Schema, Token-Nutzung und Antwortzeit. Fehlende Felder werden als fehlende Instrumentierung gemeldet und nicht stillschweigend als bestanden oder fehlgeschlagen gewertet.

Häufig gestellte Fragen

Was unterscheidet Regressionstests für KI-Agenten von einem einmaligen Testlauf?

Mibo ermöglicht gezielte aktive Testläufe vor dem Release und die passive Auswertung verfügbarer Traces nach realen Interaktionen. Dasselbe konfigurierte Prüfset in beiden Modi hilft, ausgewählte Szenarien mit beobachtetem Verhalten zu vergleichen, während die Grenzen jedes Signals sichtbar bleiben.

Testet Mibo einen Agenten erneut, wenn ein Produktions-Trace ausgewertet wird?

Nein. Ihr System verarbeitet die reale Interaktion und sendet anschließend einen kanonischen Trace. Mibo wertet zutreffende aktive Tests asynchron anhand dieses Traces aus und ruft den Agenten bei der passiven Auswertung nicht erneut auf.

Wie entscheidet Mibo, welche Regressionstests zu einer realen Interaktion passen?

Mibo verwendet die im Trace verfügbare Eingabe, um relevante szenariobedingte Tests zu klassifizieren. Universelle Prüfungen können auf jeden Trace angewendet werden; ein Test kann jedoch nicht verfügbar sein, wenn der Trace keine verwertbare Übereinstimmung oder die erforderlichen Nachweise enthält.

Können Regressionstests für KI-Agenten vollständige Abdeckung garantieren?

Nein. Ergebnisse sind durch die von Ihnen konfigurierten Szenarien und Prüfungen, die auftretenden Interaktionen, das Klassifizierungssignal sowie die von Ihnen gesendete Instrumentierung und Felder begrenzt. Mibo verspricht weder vollständige Abdeckung noch garantierte Qualität oder automatische Behebung.

Was passiert, wenn eine Prüfung Daten benötigt, die der Trace nicht enthält?

Mibo meldet fehlende Instrumentierung für unterstützte Prüfungen, die das erforderliche Trace-Attribut nicht finden, statt sie stillschweigend als bestanden oder fehlgeschlagen zu behandeln. Ergänzen Sie die benötigten Felder, wenn dieser Nachweis für Ihren Ablauf wichtig ist.

Wie schützt Mibo die Vertraulichkeit von Traces?

Trace-Inhalte werden im Ruhezustand verschlüsselt, und der Produktzugriff ist auf das besitzende Konto beschränkt. Senden Sie synthetische oder angemessen verwaltete Daten entsprechend Ihren eigenen Datenschutzanforderungen.

Weiter untersuchen