Aller au contenu principal

Mibo teste les régressions des agents IA avant la mise en production et après les interactions réelles.

Lancez délibérément des scénarios sélectionnés avant la mise en production, puis évaluez les traces de production disponibles après des interactions réelles avec les mêmes tests configurés. Mibo rend les preuves visibles sans prétendre à une couverture complète.

Une vérification réussie avant la mise en production peut manquer une régression dans le comportement réellement rencontré par les utilisateurs.

Un agent peut réussir un scénario sélectionné alors qu’une autre interaction réelle révèle un changement de routage, d’appel d’outil ou de réponse. Mibo relie les vérifications délibérées avant la mise en production aux preuves des traces après les interactions réelles, sans traiter un seul résultat comme une preuve de qualité.

Vérifications actives de régression

Lancez des scénarios sélectionnés contre votre agent avant la mise en production et évaluez la réponse ainsi que les preuves d’exécution observables avec les tests que vous configurez.

Évaluation des traces de production

Après une interaction réelle, envoyez à Mibo une trace canonique disponible. Les tests actifs applicables sont évalués de manière asynchrone sans que Mibo rappelle votre agent.

Un signal limité

Interprétez les résultats selon les vérifications définies, l’instrumentation présente dans la trace, la classification de l’entrée et l’étendue des scénarios exercés ou observés.

Un même flux de régression entre vérifications de mise en production et trafic réel

Utilisez les tests actifs pour exercer délibérément des scénarios connus, puis évaluez les traces passives afin de voir comment ces mêmes vérifications se comportent face aux interactions réellement traitées par votre système.

Définissez le comportement à protéger

Décrivez des scénarios et ajoutez des vérifications sémantiques ou procédurales pour la réponse, les appels d’outils, les arguments, le statut, le schéma, le temps ou toute autre preuve que la trace peut contenir.

Testez avant la mise en production

Lancez des entrées sélectionnées contre l’agent avant de publier une modification. Examinez le résultat et ses preuves comme une vérification de régression ciblée, pas comme une garantie pour toutes les entrées possibles.

Évaluez les interactions réelles

Envoyez les traces de production disponibles après les interactions. Mibo classe les scénarios applicables et évalue les tests configurés de manière asynchrone afin que l’équipe puisse étudier les différences dans le temps.

Suivez une régression d’une réponse modifiée jusqu’aux preuves qui l’expliquent

Vérifications sémantiques

Les vérifications assistées par IA comparent une réponse aux critères que vous décrivez, comme l’exhaustivité, la fidélité aux sources, la sécurité ou l’alignement. Le score fournit une preuve à examiner et dépend de la réponse et du contexte disponibles pour l’évaluateur.

Vérifications procédurales

Les vérifications déterministes examinent des faits enregistrés tels que les appels de nœuds ou d’outils, les arguments, le statut HTTP, le schéma, l’utilisation des tokens et le temps de réponse. Les champs absents sont signalés comme une instrumentation manquante, pas comme une réussite ou un échec silencieux.

Questions fréquentes

Qu’est-ce qui distingue les tests de régression des agents IA d’une exécution ponctuelle ?

Mibo permet de lancer délibérément des tests actifs avant la mise en production et d’évaluer passivement les traces disponibles après des interactions réelles. Utiliser les mêmes tests configurés dans les deux modes aide à comparer des scénarios sélectionnés au comportement observé, tout en rendant visibles les limites de chaque signal.

Mibo teste-t-il à nouveau un agent lors de l’évaluation d’une trace de production ?

Non. Votre système traite l’interaction réelle, puis envoie une trace canonique. Mibo évalue de manière asynchrone les tests actifs applicables sur cette trace et ne rappelle pas l’agent pendant l’évaluation passive.

Comment Mibo décide-t-il quels tests de régression s’appliquent à une interaction réelle ?

Mibo utilise l’entrée disponible dans la trace pour classer les tests conditionnels liés aux scénarios pertinents. Les vérifications universelles peuvent s’appliquer à chaque trace, tandis qu’un test peut ne pas être disponible si la trace n’offre pas de correspondance exploitable ou ne contient pas les preuves nécessaires.

Les tests de régression des agents IA peuvent-ils garantir une couverture complète ?

Non. Les résultats sont limités par les scénarios et vérifications que vous configurez, les interactions qui se produisent, le signal de classification, ainsi que l’instrumentation et les champs que vous envoyez. Mibo ne promet ni couverture complète, ni qualité garantie, ni correction automatique.

Que se passe-t-il lorsqu’une vérification nécessite des données absentes de la trace ?

Mibo signale une instrumentation manquante pour les vérifications compatibles qui ne trouvent pas l’attribut requis dans la trace, au lieu de considérer silencieusement la vérification comme réussie ou échouée. Ajoutez les champs nécessaires si cette preuve est importante pour votre flux.

Comment Mibo protège-t-il la confidentialité des traces ?

Les contenus des traces sont chiffrés au repos et l’accès dans le produit est limité au compte qui les possède. Envoyez des données synthétiques ou correctement gouvernées selon vos propres exigences de confidentialité.

Poursuivre l’analyse