Métricas de avaliação que explicam a qualidade de agentes de IA
Um modelo prático para métricas de comportamento, ferramentas, resposta, status, latência e tokens, com seus limites.
A qualidade de um agente não é um único número. Uma avaliação útil combina comportamento, evidência de execução e métricas de resposta, mantendo contexto suficiente para explicar mudanças.
Métricas de comportamento e fundamentação
Qualidade de comportamento pergunta se o agente fez o que o cenário exigia; fundamentação pergunta se a resposta respeitou fatos, políticas e contexto disponíveis.
- Sucesso do cenário e resultado desejado pelo cliente.
- Resposta fundamentada, sem ações ou alegações inventadas.
- Próximo passo e limitações completos.
- Tom coerente com a política.
Critérios devem ser precisos. “Seja útil” é ambíguo; “explique o cancelamento e não diga que já aconteceu” é testável.
Métricas de ferramentas e roteamento
Uma resposta plausível pode esconder um caminho errado. Verifique especialista, ferramenta necessária, argumentos, uso do resultado e atributos obrigatórios do span.
Um campo ausente é um problema de visibilidade, não uma aprovação silenciosa.
Métricas de resposta e protocolo
- Status HTTP ou da aplicação.
- Campos obrigatórios ou formato do schema.
- Saída vazia ou malformada.
- Marcadores de segurança ou política.
Um status 200 não garante decisão segura nem afirmação verdadeira. Combine essas métricas com verificações de comportamento.
Métricas de latência e tokens
Meça duração total, tempo do modelo e ferramentas, e tokens de entrada e saída quando disponíveis no trace.
Use esses números para analisar trade-offs, não para declarar qualidade isoladamente. Uma resposta mais rápida com a ferramenta errada não é uma melhoria.
Construa métricas em torno de decisões
- Podemos publicar esta mudança?
- Houve regressão em produção?
- Qual etapa precisa de correção?
- A correção melhorou a qualidade sem piorar custo ou latência?
Associe cada decisão a uma métrica semântica para o resultado, uma procedural para o caminho e uma operacional para a restrição. Mantenha cenário e trace para explicar a pontuação.
Interprete pontuações com seus limites
Métricas são evidência, não substituem julgamento. Compare casos equivalentes e revise cenário, instrumentação e relevância.
O Mibo avalia as mesmas definições ativamente antes do lançamento e passivamente em traces reais. Leia sobre avaliação de agentes ou execute um teste ao vivo.
Consulte a referência de assertions e o guia OpenTelemetry.