Aller au contenu principal

Mibo évalue le comportement des agents IA au-delà du code de réponse.

Mibo associe l’évaluation active avant la mise en production à l’évaluation passive de traces réelles après le lancement, afin que les équipes puissent examiner la qualité sémantique, les preuves procédurales et les limites de chaque signal.

Une réponse peut réussir alors que l’agent suit le mauvais chemin.

Mibo transforme le comportement attendu de l’agent en preuves que vous pouvez examiner, au lieu de considérer une réponse HTTP réussie comme la preuve que l’interaction était fiable.

Vérifications sémantiques

Les vérifications assistées par IA de Mibo comparent le sens de la réponse aux critères que vous décrivez, comme la fidélité aux sources, l’exhaustivité, la sécurité ou l’alignement. Elles évaluent la réponse fournie, sans établir la vérité ni garantir à elles seules la qualité.

Preuves procédurales

Les vérifications déterministes de Mibo examinent des faits observables tels que les appels de nœuds ou d’outils, les arguments, les attributs, le statut HTTP, le schéma et le temps de réponse. Un champ absent de la trace est signalé comme une instrumentation manquante plutôt que validé silencieusement.

Traces passives

Après une interaction réelle, votre système peut envoyer une trace pour une évaluation asynchrone avec les tests actifs applicables. Les résultats passifs couvrent ce que vous envoyez et ce que vos tests peuvent observer, pas toutes les conversations possibles.

Un modèle d’évaluation pour tout le cycle de vie de l’agent

Utilisez les mêmes attentes lors d’une exécution active contrôlée et dans les traces passives, tout en gardant visibles leurs preuves et leurs limites.

Définissez le comportement attendu

Décrivez le scénario et les vérifications importantes, notamment les critères sémantiques et les faits d’exécution observables comme un appel d’outil obligatoire ou un statut.

Lancez une évaluation active

Choisissez un scénario, envoyez-le à l’agent connecté et examinez la réponse avec ses preuves d’exécution avant la mise en production. Les exécutions actives ne prouvent pas les cas non observés.

Évaluez les traces passives

Envoyez une trace canonique après une interaction réelle. Mibo la stocke et l’évalue de manière asynchrone avec les tests actifs applicables, hors du parcours de la requête client ; des champs absents peuvent limiter le résultat.

Examinez ensemble le sens et les preuves d’exécution

Les vérifications sémantiques montrent comment une réponse satisfait un critère

Utilisez des critères en langage naturel pour évaluer le sens, la sécurité, l’exhaustivité et l’alignement. Le résultat dépend de la réponse et du contexte fournis : il s’agit d’une preuve à examiner, pas d’une garantie automatique de qualité.

Les vérifications procédurales montrent ce que la trace enregistre

Examinez les appels d’outils ou de nœuds, les arguments, les attributs, le statut HTTP, le schéma et le temps avec des vérifications déterministes. Ces signaux sont limités par l’instrumentation et les champs présents dans la réponse active ou la trace passive.

Questions fréquentes

Que vérifie l’évaluation des agents IA ?

Mibo évalue le comportement que vous décrivez, notamment le sens de la réponse et les preuves d’exécution observables comme le routage, les appels d’outils, les valeurs, le statut, le schéma et le temps. Les vérifications sémantiques évaluent des critères en langage naturel ; les vérifications procédurales confirment les faits enregistrés. Aucune ne prouve toutes les interactions possibles ni ne garantit la qualité globale.

Puis-je évaluer un agent avant sa mise en production ?

Oui. L’évaluation active envoie les scénarios choisis à un agent connecté en préproduction ou en production afin que vous puissiez examiner la réponse et les preuves d’exécution. Vous pouvez réutiliser les mêmes définitions de test pour l’évaluation passive lorsque des traces d’interactions réelles arrivent.

Que se passe-t-il lorsqu’une trace passive arrive dans Mibo ?

Votre système envoie une trace après l’interaction. Mibo la stocke, identifie les tests actifs applicables et l’évalue de manière asynchrone en arrière-plan, sans ajouter de requête au parcours client.

Mibo garantit-il une couverture complète ou une qualité automatique ?

Non. Mibo évalue les vérifications configurées à partir des réponses et des traces disponibles. Des critères trop étroits, des cas limites non observés, une classification indisponible et une instrumentation manquante peuvent limiter le signal ; les exécutions actives et les traces passives doivent donc être examinées ensemble.

Poursuivre la découverte