Aller au contenu principal

Mibo transforme les attentes envers votre agent en cas de test à exécuter et à examiner.

Mibo aide les équipes à décrire un scénario réel de l’agent, à ajouter des vérifications sémantiques et procédurales, à exécuter délibérément des cas choisis et à évaluer les traces applicables lorsque les preuves sont disponibles.

Un plan de test est difficile à appliquer lorsque les attentes restent dans la prose.

Les équipes doivent transformer une situation client réelle en entrée concrète, en comportement attendu et en preuves à examiner. Mibo rassemble ces éléments sans traiter un scénario comme une affirmation sur toutes les interactions.

Scénarios concrets

Décrivez la situation, l’entrée et le comportement à protéger afin que le cas représente un scénario client délibéré plutôt qu’une instruction vague.

Attentes sémantiques

Rédigez en langage naturel des critères sur le sens, la sécurité, l’exhaustivité ou l’alignement. L’évaluateur note la réponse et le contexte disponibles selon votre description.

Preuves procédurales

Vérifiez des faits observables comme les appels de nœuds ou d’outils, les arguments, le statut, le schéma, le temps ou les tokens lorsque la réponse active ou la trace contient les champs nécessaires.

D’une attente réelle aux preuves à examiner

Construisez un cas ciblé, choisissez les vérifications qui expriment son comportement et utilisez le résultat pour décider quoi examiner ensuite. Les exécutions actives et les traces passives restent des signaux distincts.

Décrivez le scénario

Décrivez la situation du client et l’entrée qui doit l’exercer. Ajoutez le résultat attendu et toute condition importante liée à la sécurité ou à un cas limite.

Ajoutez des vérifications

Associez des critères sémantiques à des vérifications procédurales pour la réponse et les preuves d’exécution que votre agent peut exposer. Définissez les seuils et valeurs attendues avec intention.

Exécutez et évaluez

Exécutez le cas choisi sur un agent connecté, puis évaluez de manière asynchrone les traces canoniques applicables des interactions réelles lorsque votre système les envoie.

Un cas relie un scénario client à ses preuves

Vérifications sémantiques

Décrivez ce que signifie une réponse utile, sûre, complète ou fondée. Le score est une preuve à examiner et dépend de la réponse et du contexte disponibles pour l’évaluateur.

Vérifications procédurales

Vérifiez des faits déterministes comme un appel d’outil obligatoire, un argument, un champ de réponse, un statut HTTP, un schéma, une limite de temps ou l’usage de tokens. Les champs absents de la trace apparaissent comme une instrumentation manquante.

Questions fréquentes

Qu’est-ce qu’un cas de test d’agent IA ?

C’est un scénario défini avec une entrée, un comportement attendu et des vérifications que Mibo peut évaluer. Les vérifications peuvent décrire le sens de la réponse ou examiner des faits observables comme les appels d’outils, les arguments, le statut, le schéma, le temps ou les tokens.

En quoi les cas de test diffèrent-ils de l’évaluation générale des agents IA ?

Un cas de test est la définition concrète du scénario et de ses vérifications. Mibo évalue les vérifications configurées lors d’une exécution active délibérée et peut réutiliser les cas actifs applicables lorsque votre système envoie des traces d’interactions réelles.

Mibo peut-il exécuter un cas choisi avant la mise en production ?

Oui. Un test actif envoie l’entrée choisie à un agent connecté et évalue la réponse ainsi que les preuves d’exécution disponibles. Le résultat fournit une preuve sur ce scénario, pas sur les cas non observés.

Un cas de test peut-il être évalué sur une trace réelle ?

Oui, lorsque le test est actif, éligible à l’évaluation passive et que votre système envoie une trace canonique après l’interaction. Mibo classe les scénarios applicables et les évalue de manière asynchrone sans rappeler l’agent.

Que se passe-t-il si une vérification nécessite des données absentes de la trace ?

Mibo signale une instrumentation manquante pour les vérifications compatibles qui ne trouvent pas le champ requis dans la trace, au lieu de considérer silencieusement la vérification comme réussie ou échouée. Ajoutez les champs concernés si cette preuve est importante pour votre flux.

Les cas de test d’agents IA garantissent-ils une couverture complète ?

Non. Le signal est limité par les scénarios et vérifications configurés, les entrées et traces disponibles, la classification, l’instrumentation et l’étendue des interactions exercées ou observées. Mibo ne promet ni qualité garantie ni correction automatique.

Poursuivre la découverte