Saltar al contenido principal

Prueba el comportamiento de tu agente de IA antes de ponerlo en producción.

Mibo ofrece a los equipos de ingeniería una forma repetible de ejecutar escenarios antes del lanzamiento, revisar la evidencia de cada resultado y evaluar trazas reales de producción con las mismas pruebas.

Una respuesta correcta no demuestra un comportamiento fiable.

Un agente puede devolver una respuesta HTTP exitosa y aun así elegir la herramienta equivocada, inventar una acción completada o dejar una solicitud sin resolver. Mibo convierte esas expectativas en evidencia revisable.

Ruta equivocada

Comprueba que la solicitud llegue al especialista y al flujo correctos, no solo que el endpoint responda.

Uso de herramientas

Verifica llamadas, argumentos y otros hechos observables en la traza del agente.

Respuesta incompleta

Evalúa si la respuesta es clara, segura y coherente con el resultado que necesita tu cliente.

Una suite de pruebas para todo el ciclo del agente

Define las expectativas una vez y úsalas para comprobar cambios antes del lanzamiento y revisar interacciones reales después.

Define el comportamiento

Describe el resultado esperado con comprobaciones semánticas y procedimentales.

Prueba antes del lanzamiento

Ejecuta escenarios elegidos contra el agente conectado y revisa la respuesta junto con su evidencia de ejecución.

Evalúa trazas reales

Envía trazas por OpenTelemetry o la API de Mibo para evaluarlas de forma asíncrona después de cada interacción.

Cada resultado conserva la evidencia que necesitas investigar

Comprobaciones semánticas

Evalúa significado, seguridad, integridad y alineación con el resultado que describiste, en lugar de exigir una cadena fija.

Comprobaciones procedimentales

Inspecciona hechos de la ejecución como llamadas a herramientas, argumentos, atributos, estado HTTP y esquema.

Preguntas frecuentes

¿Qué comprueba Mibo en un agente de IA?

Mibo evalúa el comportamiento que describes, incluida la respuesta y la evidencia de ejecución observable, como rutas, llamadas a herramientas, valores y estado. Las comprobaciones basadas en reglas verifican hechos y las comprobaciones con IA puntúan respuestas según criterios en lenguaje natural.

¿Puedo probar un agente antes y después del lanzamiento?

Sí. Las pruebas activas envían escenarios elegidos a un agente conectado. Después de las interacciones reales, tu sistema puede enviar trazas para evaluarlas de forma pasiva con las pruebas activas aplicables.

¿Las pruebas pasivas añaden Mibo a la solicitud del cliente?

No. Tu sistema atiende la interacción y después envía una traza a Mibo. Mibo evalúa la traza de forma asíncrona en segundo plano.

Sigue explorando