Saltar al contenido principal

Mibo convierte las expectativas de tu agente en casos de prueba que puedes ejecutar y revisar.

Mibo ayuda a los equipos a describir un escenario real del agente, añadir comprobaciones semánticas y procedimentales, ejecutar casos seleccionados deliberadamente y evaluar trazas aplicables cuando hay evidencia disponible.

Un plan de pruebas es difícil de aplicar cuando las expectativas se quedan en prosa.

Los equipos necesitan convertir una situación real del cliente en una entrada concreta, un comportamiento esperado y evidencia que puedan revisar. Mibo mantiene esas partes juntas sin tratar un escenario como una afirmación sobre todas las interacciones.

Escenarios concretos

Describe la situación, la entrada y el comportamiento que quieres proteger para que el caso represente un escenario deliberado, no una instrucción vaga.

Expectativas semánticas

Escribe criterios sobre significado, seguridad, integridad o alineación en lenguaje natural. El evaluador puntúa la respuesta y el contexto disponible según lo que describiste.

Evidencia procedimental

Comprueba hechos observables como llamadas a nodos o herramientas, argumentos, estado, esquema, tiempo o uso de tokens cuando la respuesta activa o la traza incluya los campos necesarios.

De una expectativa real a evidencia que puedes investigar

Crea un caso concreto, elige las comprobaciones que expresan su comportamiento y usa el resultado para decidir qué revisar después. Las ejecuciones activas y las trazas pasivas siguen siendo señales distintas.

Describe el escenario

Escribe la situación del cliente y la entrada que debería ejercitarla. Incluye el resultado esperado y cualquier condición importante de seguridad o de caso límite.

Añade comprobaciones

Combina criterios semánticos con comprobaciones procedimentales para la respuesta y la evidencia de ejecución que tu agente pueda exponer. Define los umbrales y valores esperados deliberadamente.

Ejecuta y evalúa

Ejecuta el caso seleccionado contra un agente conectado y después evalúa de forma asíncrona las trazas canónicas aplicables de interacciones reales cuando tu sistema las envíe.

Un caso puede conectar un escenario del cliente con su evidencia

Comprobaciones semánticas

Describe qué significa que una respuesta sea útil, segura, completa o fundamentada. La puntuación sirve como evidencia para revisar y depende de la respuesta y el contexto disponibles para el evaluador.

Comprobaciones procedimentales

Verifica hechos deterministas como una llamada obligatoria a una herramienta, un argumento, un campo de respuesta, un estado HTTP, un esquema, un límite de tiempo o el uso de tokens. Los campos ausentes de la traza se informan como instrumentación faltante.

Preguntas frecuentes

¿Qué es un caso de prueba de un agente de IA?

Es un escenario definido con una entrada, un comportamiento esperado y comprobaciones que Mibo puede evaluar. Las comprobaciones pueden describir el significado de la respuesta o revisar hechos observables como llamadas a herramientas, argumentos, estado, esquema, tiempo o tokens.

¿En qué se diferencian los casos de prueba de la evaluación general de agentes de IA?

Un caso de prueba es la definición concreta del escenario y sus comprobaciones. Mibo evalúa sus comprobaciones configuradas durante una ejecución activa deliberada y puede reutilizar los casos activos aplicables cuando tu sistema envía trazas de interacciones reales.

¿Puede Mibo ejecutar un caso seleccionado antes del lanzamiento?

Sí. Las pruebas activas envían la entrada seleccionada a un agente conectado y evalúan la respuesta y la evidencia de ejecución disponible. El resultado aporta evidencia sobre ese escenario, no sobre los casos no observados.

¿Se puede evaluar un caso de prueba frente a una traza real?

Sí, cuando la prueba está activa y puede evaluarse pasivamente y tu sistema envía una traza canónica después de la interacción. Mibo clasifica los escenarios aplicables y los evalúa de forma asíncrona sin volver a llamar al agente.

¿Qué ocurre si una comprobación necesita datos que la traza no contiene?

Mibo informa de instrumentación faltante para las comprobaciones compatibles que no encuentran el campo requerido en la traza, en lugar de tratar la comprobación silenciosamente como aprobada o fallida. Añade los campos relevantes si esa evidencia importa a tu flujo.

¿Los casos de prueba de agentes de IA garantizan una cobertura completa?

No. La señal está limitada por los escenarios y comprobaciones que configures, las entradas y trazas disponibles, la clasificación, la instrumentación y la amplitud de las interacciones que ejercites u observes. Mibo no afirma calidad garantizada ni corrección automática.

Sigue explorando