Scénarios concrets
Décrivez la situation, l’entrée et le comportement à protéger afin que le cas représente un scénario client délibéré plutôt qu’une instruction vague.
Mibo aide les équipes à décrire un scénario réel de l’agent, à ajouter des vérifications sémantiques et procédurales, à exécuter délibérément des cas choisis et à évaluer les traces applicables lorsque les preuves sont disponibles.
Les équipes doivent transformer une situation client réelle en entrée concrète, en comportement attendu et en preuves à examiner. Mibo rassemble ces éléments sans traiter un scénario comme une affirmation sur toutes les interactions.
Décrivez la situation, l’entrée et le comportement à protéger afin que le cas représente un scénario client délibéré plutôt qu’une instruction vague.
Rédigez en langage naturel des critères sur le sens, la sécurité, l’exhaustivité ou l’alignement. L’évaluateur note la réponse et le contexte disponibles selon votre description.
Vérifiez des faits observables comme les appels de nœuds ou d’outils, les arguments, le statut, le schéma, le temps ou les tokens lorsque la réponse active ou la trace contient les champs nécessaires.
Construisez un cas ciblé, choisissez les vérifications qui expriment son comportement et utilisez le résultat pour décider quoi examiner ensuite. Les exécutions actives et les traces passives restent des signaux distincts.
01
Décrivez la situation du client et l’entrée qui doit l’exercer. Ajoutez le résultat attendu et toute condition importante liée à la sécurité ou à un cas limite.
02
Associez des critères sémantiques à des vérifications procédurales pour la réponse et les preuves d’exécution que votre agent peut exposer. Définissez les seuils et valeurs attendues avec intention.
03
Exécutez le cas choisi sur un agent connecté, puis évaluez de manière asynchrone les traces canoniques applicables des interactions réelles lorsque votre système les envoie.
Décrivez ce que signifie une réponse utile, sûre, complète ou fondée. Le score est une preuve à examiner et dépend de la réponse et du contexte disponibles pour l’évaluateur.
Vérifiez des faits déterministes comme un appel d’outil obligatoire, un argument, un champ de réponse, un statut HTTP, un schéma, une limite de temps ou l’usage de tokens. Les champs absents de la trace apparaissent comme une instrumentation manquante.
C’est un scénario défini avec une entrée, un comportement attendu et des vérifications que Mibo peut évaluer. Les vérifications peuvent décrire le sens de la réponse ou examiner des faits observables comme les appels d’outils, les arguments, le statut, le schéma, le temps ou les tokens.
Un cas de test est la définition concrète du scénario et de ses vérifications. Mibo évalue les vérifications configurées lors d’une exécution active délibérée et peut réutiliser les cas actifs applicables lorsque votre système envoie des traces d’interactions réelles.
Oui. Un test actif envoie l’entrée choisie à un agent connecté et évalue la réponse ainsi que les preuves d’exécution disponibles. Le résultat fournit une preuve sur ce scénario, pas sur les cas non observés.
Oui, lorsque le test est actif, éligible à l’évaluation passive et que votre système envoie une trace canonique après l’interaction. Mibo classe les scénarios applicables et les évalue de manière asynchrone sans rappeler l’agent.
Mibo signale une instrumentation manquante pour les vérifications compatibles qui ne trouvent pas le champ requis dans la trace, au lieu de considérer silencieusement la vérification comme réussie ou échouée. Ajoutez les champs concernés si cette preuve est importante pour votre flux.
Non. Le signal est limité par les scénarios et vérifications configurés, les entrées et traces disponibles, la classification, l’instrumentation et l’étendue des interactions exercées ou observées. Mibo ne promet ni qualité garantie ni correction automatique.
Utilisez la documentation maintenue pour définir les scénarios, les entrées, les vérifications et le comportement passif.
Lire la documentation →Consultez les vérifications sémantiques et procédurales disponibles et les preuves de trace que chacune peut utiliser.
Lire la documentation des vérifications →Définissez des scénarios, lancez des vérifications actives avant la mise en production et réutilisez-les pour évaluer les traces passives de production.
Découvrir les tests d’agents →Comprenez comment Mibo évalue le comportement configuré au-delà du code de réponse.
Découvrir l’évaluation →Découvrez quels scénarios conditionnels correspondent au trafic réel sans confondre couverture observée et résultats des vérifications.
Découvrir la couverture →Suivez une méthode pratique pour les scénarios, les vérifications, les exécutions actives, les traces passives et les limites d’interprétation.
Lire le guide →Lancez la vérification de fiabilité en direct avec une demande client synthétique.
Lancer une vérification →