Saltar al contenido principal

Mibo prueba las regresiones de los agentes de IA antes del lanzamiento y después de las interacciones reales.

Ejecuta escenarios seleccionados deliberadamente antes del lanzamiento y evalúa después las trazas de producción disponibles de interacciones reales con las mismas pruebas configuradas. Mibo hace visible la evidencia sin afirmar una cobertura completa.

Una comprobación de lanzamiento aprobada puede pasar por alto una regresión en el comportamiento que después encuentran los usuarios.

Un agente puede superar un escenario seleccionado mientras otra interacción real revela un cambio de ruta, de llamada a una herramienta o de respuesta. Mibo conecta las comprobaciones deliberadas antes del lanzamiento con la evidencia de trazas después de interacciones reales, sin tratar un solo resultado como prueba de calidad.

Comprobaciones activas de regresión

Ejecuta escenarios seleccionados contra tu agente antes del lanzamiento y evalúa la respuesta y la evidencia de ejecución observable con las pruebas que configures.

Evaluación de trazas de producción

Después de una interacción real, envía a Mibo una traza canónica disponible. Las pruebas activas aplicables se evalúan de forma asíncrona sin que Mibo vuelva a llamar a tu agente.

Una señal limitada

Interpreta los resultados según las comprobaciones definidas, la instrumentación incluida en la traza, la clasificación de entradas y la amplitud de los escenarios ejercitados u observados.

Un flujo de regresión entre las comprobaciones de lanzamiento y el tráfico real

Usa pruebas activas para ejercitar deliberadamente escenarios conocidos y después evalúa trazas pasivas para ver cómo se comportan esas mismas comprobaciones frente a interacciones que tu sistema realmente atendió.

Define el comportamiento que quieres proteger

Describe escenarios y añade comprobaciones semánticas o procedimentales para la respuesta, las llamadas a herramientas, los argumentos, el estado, el esquema, el tiempo u otra evidencia que pueda llevar la traza.

Prueba antes del lanzamiento

Ejecuta entradas seleccionadas contra el agente antes de publicar un cambio. Revisa el resultado y su evidencia como una comprobación de regresión concreta, no como una garantía sobre todas las entradas posibles.

Evalúa interacciones reales

Envía trazas de producción disponibles después de las interacciones. Mibo clasifica los escenarios aplicables y evalúa las pruebas configuradas de forma asíncrona para investigar diferencias a lo largo del tiempo.

Sigue una regresión desde una respuesta modificada hasta la evidencia que la explica

Comprobaciones semánticas

Las comprobaciones con IA comparan una respuesta con criterios que describes, como ser completa, fundamentada, segura o alineada. La puntuación sirve como evidencia para investigar y depende de la respuesta y del contexto disponibles para el evaluador.

Comprobaciones procedimentales

Las comprobaciones deterministas inspeccionan hechos registrados como llamadas a nodos o herramientas, argumentos, estado HTTP, esquema, uso de tokens y tiempo de respuesta. Los campos ausentes se informan como instrumentación faltante, no como aprobación o fallo silencioso.

Preguntas frecuentes

¿Qué diferencia las pruebas de regresión de agentes de IA de una ejecución puntual?

Mibo permite ejecutar pruebas activas deliberadamente antes del lanzamiento y evaluar pasivamente las trazas disponibles después de interacciones reales. Usar las mismas pruebas configuradas en ambos modos ayuda a comparar escenarios seleccionados con el comportamiento observado, mostrando los límites de cada señal.

¿Mibo vuelve a probar un agente cuando evalúa una traza de producción?

No. Tu sistema atiende la interacción real y después envía una traza canónica. Mibo evalúa de forma asíncrona las pruebas activas aplicables contra esa traza y no vuelve a llamar al agente durante la evaluación pasiva.

¿Cómo decide Mibo qué pruebas de regresión se aplican a una interacción real?

Mibo usa la entrada disponible en la traza para clasificar qué pruebas condicionales de escenario son relevantes. Las comprobaciones universales pueden aplicarse a cada traza, mientras que una prueba puede no estar disponible si la traza no tiene una coincidencia utilizable o carece de la evidencia necesaria.

¿Las pruebas de regresión de agentes de IA pueden garantizar una cobertura completa?

No. Los resultados están limitados por los escenarios y las comprobaciones que configures, las interacciones que ocurran, la señal de clasificación y la instrumentación y los campos que envíes. Mibo no afirma cobertura completa, calidad garantizada ni corrección automática.

¿Qué ocurre cuando una comprobación necesita datos que la traza no incluye?

Mibo informa de instrumentación faltante para las comprobaciones compatibles que no encuentran el atributo de traza requerido, en lugar de tratarla silenciosamente como aprobada o fallida. Añade los campos necesarios si esa evidencia es importante para tu flujo.

¿Cómo gestiona Mibo la privacidad de las trazas?

Las cargas de las trazas están cifradas en reposo y el acceso del producto está limitado a la cuenta propietaria. Envía datos sintéticos o gobernados de forma adecuada según tus propios requisitos de privacidad.

Sigue investigando