Pular para o conteúdo principal

A Mibo avalia o comportamento do agente de IA além do código de resposta.

A Mibo combina avaliação ativa antes do lançamento com avaliação passiva de traces reais depois da publicação, para que as equipes analisem a qualidade semântica, as evidências procedurais e os limites de cada sinal.

Uma resposta pode ser bem-sucedida enquanto o agente segue o caminho errado.

A Mibo transforma o comportamento esperado do agente em evidências que você pode analisar, em vez de tratar uma resposta HTTP bem-sucedida como prova de que a interação foi confiável.

Verificações semânticas

As verificações com IA da Mibo comparam o significado da resposta com critérios que você descreve, como fundamentação, completude, segurança ou alinhamento. Elas pontuam a resposta fornecida; não estabelecem a verdade nem garantem qualidade por si só.

Evidências procedurais

As verificações determinísticas da Mibo analisam fatos observáveis, como chamadas de nós ou ferramentas, argumentos, atributos, status HTTP, schema e tempo de resposta. Um campo ausente no trace é informado como instrumentação ausente, não como uma aprovação silenciosa.

Traces passivos

Depois de uma interação real, seu sistema pode enviar um trace para avaliação assíncrona com os testes ativos aplicáveis. Os resultados passivos cobrem o que você envia e o que seus testes conseguem observar, não todas as conversas possíveis.

Um modelo de avaliação para todo o ciclo do agente

Use as mesmas expectativas em uma execução ativa controlada e em traces passivos, mantendo visíveis as evidências e os limites de cada modo.

Defina o comportamento esperado

Descreva o cenário e as verificações importantes, incluindo critérios semânticos e fatos observáveis da execução, como uma chamada obrigatória de ferramenta ou um status.

Execute uma avaliação ativa

Escolha um cenário, envie-o ao agente conectado e analise a resposta com suas evidências de execução antes do lançamento. Execuções ativas não comprovam casos não observados.

Avalie traces passivos

Envie um trace canônico depois de uma interação real. A Mibo o armazena e avalia de forma assíncrona com os testes ativos aplicáveis, fora do caminho da solicitação do cliente; campos ausentes podem limitar o resultado.

Analise o significado e as evidências de execução em conjunto

Verificações semânticas mostram como a resposta atende a um critério

Use critérios em linguagem natural para avaliar significado, segurança, completude e alinhamento. O resultado depende da resposta e do contexto fornecidos, portanto é uma evidência para investigação, não uma garantia automática de qualidade.

Verificações procedurais mostram o que o trace registra

Analise chamadas de ferramentas ou nós, argumentos, atributos, status HTTP, schema e tempo com verificações determinísticas. Esses sinais são limitados pela instrumentação e pelos campos presentes na resposta ativa ou no trace passivo.

Perguntas frequentes

O que a avaliação de agentes de IA verifica?

A Mibo avalia o comportamento que você descreve, incluindo o significado da resposta e evidências observáveis da execução, como rotas, chamadas de ferramentas, valores, status, schema e tempo. Verificações semânticas avaliam critérios em linguagem natural; verificações procedurais confirmam fatos registrados. Nenhuma delas comprova todas as interações possíveis nem garante a qualidade geral.

Posso avaliar um agente antes do lançamento?

Sim. A avaliação ativa envia cenários selecionados a um agente conectado em staging ou produção para que você analise a resposta e as evidências de execução. As mesmas definições de teste podem ser reutilizadas na avaliação passiva quando chegam traces de interações reais.

O que acontece quando um trace passivo chega à Mibo?

Seu sistema envia um trace depois da interação. A Mibo o armazena, encontra os testes ativos aplicáveis e o avalia de forma assíncrona em segundo plano, sem adicionar outra solicitação ao caminho do cliente.

A Mibo garante cobertura completa ou qualidade automática?

Não. A Mibo avalia as verificações configuradas com base nas respostas e nos traces disponíveis. Critérios estreitos, casos extremos não observados, classificação indisponível e instrumentação ausente podem limitar o sinal, por isso execuções ativas e traces passivos devem ser analisados em conjunto.

Continue explorando