Métricas de evaluación que explican la calidad de un agente de IA
Un marco práctico para métricas de comportamiento, herramientas, respuesta, estado, latencia y tokens, con sus límites.
La calidad de un agente no es un único número. Una evaluación útil combina comportamiento, evidencia de ejecución y métricas de respuesta, y conserva el contexto necesario para explicar qué cambió.
Métricas de comportamiento y fundamentación
La calidad de comportamiento pregunta si el agente hizo lo que exigía el escenario; la fundamentación, si respondió dentro de los hechos, políticas y contexto disponibles.
- Éxito del escenario y resultado buscado por el cliente.
- Respuesta fundamentada sin acciones ni afirmaciones inventadas.
- Siguiente paso y limitaciones completos.
- Tono coherente con la política.
Estas comprobaciones necesitan criterios precisos y comprensibles. “Sé útil” es ambiguo; “explica cómo cancelar y no afirmes que ya se canceló” se puede probar.
Métricas de herramientas y enrutamiento
Una respuesta plausible puede ocultar un recorrido incorrecto. Comprueba el especialista elegido, la llamada requerida, sus argumentos, el uso del resultado y los atributos de span necesarios.
Un campo ausente debe tratarse como un problema de visibilidad, no como un aprobado silencioso.
Métricas de respuesta y protocolo
- Estado HTTP o de aplicación.
- Campos obligatorios o forma del esquema.
- Salida vacía o malformada.
- Marcadores de seguridad o política.
Un 200 no garantiza una decisión segura ni una afirmación verdadera. Combina estas métricas con comprobaciones de comportamiento.
Métricas de latencia y tokens
Mide duración total, tiempo del modelo y herramientas, y tokens de entrada y salida cuando estén en la traza.
Úsalos para analizar compromisos, no para declarar calidad de forma aislada. Una respuesta más rápida con la herramienta equivocada no es una mejora.
Construye las métricas alrededor de decisiones
- ¿Podemos publicar este cambio?
- ¿Hubo una regresión en producción?
- ¿Qué etapa necesita una corrección?
- ¿La corrección mejoró la calidad sin empeorar coste o latencia?
Asocia cada decisión con una métrica semántica para el resultado, una procedimental para el recorrido y una operativa para la restricción. Conserva el escenario y la traza para que la puntuación se pueda explicar.
Interpreta las puntuaciones con sus límites
Las métricas son evidencia, no sustituyen el juicio. Compara casos equivalentes y revisa escenarios, instrumentación y relevancia.
Mibo evalúa las mismas definiciones activamente antes del lanzamiento y pasivamente sobre trazas reales. Lee sobre evaluación de agentes o ejecuta una prueba en vivo.
Consulta la referencia de aserciones y la guía de OpenTelemetry.