Saltar al contenido principal

Mibo evalúa el comportamiento de los agentes de IA más allá del código de respuesta.

Mibo combina la evaluación activa antes del lanzamiento con la evaluación pasiva de trazas reales después de poner el agente en producción, para que los equipos revisen la calidad semántica, la evidencia procedimental y los límites de cada señal.

Una respuesta exitosa puede ocultar que el agente tomó el camino equivocado.

Mibo convierte el comportamiento esperado del agente en evidencia que puedes revisar, en lugar de tratar una respuesta HTTP exitosa como prueba de que la interacción fue fiable.

Comprobaciones semánticas

Las comprobaciones con IA de Mibo comparan el significado de la respuesta con criterios que describes, como fundamentación, integridad, seguridad o alineación. Puntúan la respuesta recibida; no establecen la verdad ni garantizan por sí solas la calidad.

Evidencia procedimental

Las comprobaciones deterministas de Mibo inspeccionan hechos observables como llamadas a nodos o herramientas, argumentos, atributos, estado HTTP, esquema y tiempo de respuesta. Un campo ausente se informa como instrumentación faltante, no como aprobado silenciosamente.

Trazas pasivas

Después de una interacción real, tu sistema puede enviar una traza para evaluarla de forma asíncrona con las pruebas activas aplicables. Los resultados pasivos cubren lo que envías y lo que tus pruebas pueden observar, no todas las conversaciones posibles.

Un modelo de evaluación para todo el ciclo del agente

Usa las mismas expectativas en una ejecución activa controlada y en las trazas pasivas, manteniendo visibles sus evidencias y límites.

Define el comportamiento esperado

Describe el escenario y las comprobaciones importantes, incluidos los criterios semánticos y los hechos observables como una llamada obligatoria a una herramienta o un estado.

Ejecuta una evaluación activa

Elige un escenario, envíalo a tu agente conectado y revisa la respuesta con su evidencia de ejecución antes del lanzamiento. Las ejecuciones activas no demuestran los casos no observados.

Evalúa trazas pasivas

Envía una traza canónica después de una interacción real. Mibo la almacena y la evalúa de forma asíncrona con las pruebas activas aplicables, fuera del recorrido de la solicitud; los campos ausentes pueden limitar el resultado.

Revisa juntos el significado y la evidencia de ejecución

Las comprobaciones semánticas muestran cómo responde un criterio

Usa criterios en lenguaje natural para evaluar significado, seguridad, integridad y alineación. El resultado depende de la respuesta y del contexto disponible, por lo que es evidencia para investigar, no una garantía automática de calidad.

Las comprobaciones procedimentales muestran lo que registra la traza

Inspecciona llamadas a herramientas o nodos, argumentos, atributos, estado HTTP, esquema y tiempo con comprobaciones deterministas. Estas señales están limitadas por la instrumentación y los campos presentes en la respuesta activa o la traza pasiva.

Preguntas frecuentes

¿Qué comprueba la evaluación de agentes de IA?

Mibo evalúa el comportamiento que describes, incluido el significado de la respuesta y la evidencia observable de ejecución, como rutas, llamadas a herramientas, valores, estado, esquema y tiempo. Las comprobaciones semánticas evalúan criterios en lenguaje natural; las procedimentales verifican hechos registrados. Ninguna demuestra todas las interacciones posibles ni garantiza la calidad general.

¿Puedo evaluar un agente antes del lanzamiento?

Sí. La evaluación activa envía escenarios seleccionados a un agente conectado de staging o producción para que revises la respuesta y la evidencia de ejecución. Puedes reutilizar las mismas definiciones de prueba para la evaluación pasiva cuando lleguen trazas de interacciones reales.

¿Qué ocurre cuando una traza pasiva llega a Mibo?

Tu sistema envía una traza después de la interacción. Mibo la almacena, encuentra las pruebas activas aplicables y la evalúa de forma asíncrona en segundo plano, sin añadir otra solicitud al recorrido del cliente.

¿Mibo garantiza una cobertura completa o calidad automática?

No. Mibo evalúa las comprobaciones configuradas frente a las respuestas y trazas disponibles. Los criterios estrechos, los casos límite no observados, la clasificación no disponible y la instrumentación faltante pueden limitar la señal, por lo que conviene revisar juntas las ejecuciones activas y las trazas pasivas.

Sigue explorando