Des métriques d’évaluation qui expliquent la qualité des agents IA
Un cadre pratique pour les métriques de comportement, outils, réponse, statut, latence et tokens, avec leurs limites.
La qualité d’un agent n’est pas un nombre unique. Une évaluation utile combine comportement, preuves d’exécution et métriques de réponse, tout en gardant le contexte nécessaire pour expliquer les changements.
Métriques de comportement et d’ancrage
La qualité comportementale demande si l’agent a réalisé ce qu’exigeait le scénario ; l’ancrage vérifie que la réponse respecte les faits, politiques et le contexte disponibles.
- Réussite du scénario et résultat attendu par le client.
- Réponse ancrée sans action ni affirmation inventée.
- Étape suivante et limites complètes.
- Ton conforme à la politique.
Les critères doivent être précis. « Soyez utile » est ambigu ; « expliquez la résiliation sans dire qu’elle est déjà faite » est testable.
Métriques d’outils et de routage
Une réponse plausible peut masquer un mauvais parcours. Contrôlez le spécialiste choisi, l’outil requis, ses arguments, l’usage du résultat et les attributs de span nécessaires.
Un champ absent indique un problème de visibilité, pas une réussite silencieuse.
Métriques de réponse et de protocole
- Statut HTTP ou applicatif.
- Champs requis ou structure du schéma.
- Sortie vide ou incorrecte.
- Marqueurs de sécurité ou de politique.
Un statut 200 ne garantit ni décision sûre ni affirmation vraie. Associez ces métriques aux vérifications de comportement.
Métriques de latence et de tokens
Mesurez la durée totale, le temps du modèle et des outils, ainsi que les tokens d’entrée et de sortie disponibles dans la trace.
Utilisez-les pour étudier les compromis, pas pour déclarer la qualité seuls. Une réponse plus rapide avec le mauvais outil n’est pas une amélioration.
Construisez les métriques autour des décisions
- Pouvons-nous publier ce changement ?
- Une interaction en production a-t-elle régressé ?
- Quelle étape doit être corrigée ?
- Le correctif améliore-t-il la qualité sans dégrader coût ni latence ?
Associez à chaque décision une métrique sémantique pour le résultat, une métrique procédurale pour le parcours et une métrique opérationnelle pour la contrainte. Gardez le scénario et la trace pour expliquer le score.
Interprétez les scores avec leurs limites
Les métriques sont des preuves, pas un substitut au jugement. Comparez des cas équivalents et examinez scénario, instrumentation et pertinence.
Mibo applique les mêmes définitions activement avant la sortie et passivement aux traces réelles. Découvrez l’évaluation des agents ou lancez un test en direct.
Consultez la référence des assertions et le guide OpenTelemetry.