Cómo probar agentes de IA: un flujo práctico
Diseña pruebas útiles, combina pruebas activas y pasivas e investiga la evidencia detrás de las regresiones.
Los agentes de IA necesitan más que una comprobación de disponibilidad. Una prueba útil verifica si el agente eligió el camino correcto, usó sus herramientas de forma segura y respondió según la situación del usuario.
Empieza por el comportamiento que debes proteger
Describe el escenario como se lo explicarías a un compañero: incluye el detonante, la acción esperada y la respuesta aceptable.
- Escenario: el usuario solicita cancelar una suscripción.
- Comportamiento esperado: explica el proceso sin afirmar que ya se canceló.
- Evidencia: la herramienta de facturación recibe el identificador correcto antes de confirmar una acción.
Esto es mucho más útil que una instrucción vaga. Un escenario claro permite decidir cuándo aplica una prueba pasiva y entender por qué falló.
Combina comprobaciones semánticas y procedimentales
Las comprobaciones semánticas evalúan el significado y el cumplimiento de políticas. Las procedimentales verifican hechos observables como una llamada a herramienta, sus argumentos, un estado HTTP o un atributo de span.
Usa ambas cuando el comportamiento dependa de una cadena de decisiones: una respuesta pulida no compensa una herramienta omitida ni una llamada correcta compensa una conclusión inventada.
Ejecuta pruebas activas antes del lanzamiento
La prueba activa es un ciclo deliberado:
- Elige un objetivo del cliente o un caso límite conocido.
- Envíalo a la conexión del agente.
- Inspecciona respuesta, traza y resultados.
- Corrige el agente o su orquestación.
- Repite el escenario y consérvalo como prueba de regresión.
Empieza con pocos escenarios de alto valor y amplía la suite cuando una traza real revele un nuevo modo de fallo.
Continúa con evaluación pasiva en producción
Los escenarios sintéticos no predicen todos los usos. Las pruebas pasivas evalúan en segundo plano la traza de una interacción real con los mismos casos activos.
Usa bien la relevancia: una prueba de cancelación no debería fallar en una consulta de horarios. Omitir una prueba que no aplica ofrece mejor evidencia que forzar un fallo.
Consulta las pruebas en producción y la integración con n8n.
Investiga la evidencia, no solo la puntuación
Una puntuación resume, pero no diagnostica. Revisa si el agente eligió el especialista correcto, si llamó la herramienta con los valores esperados, si la respuesta afirma más de lo que prueba la traza y si falta instrumentación.
Así, cada fallo se convierte en una tarea concreta de ingeniería y la suite sigue ligada al comportamiento del producto.
Conoce los límites
Ninguna suite cubre todas las interacciones. Interpreta las puntuaciones junto al escenario, la evidencia y el motivo del fallo.
Consulta la evaluación de agentes en Mibo y la documentación de Mibo.