Pular para o conteúdo principal

A Mibo transforma as expectativas do seu agente em casos de teste que você pode executar e analisar.

A Mibo ajuda equipes a descrever um cenário real do agente, adicionar verificações semânticas e procedurais, executar casos selecionados de forma deliberada e avaliar traces aplicáveis quando houver evidências disponíveis.

Um plano de testes é difícil de aplicar quando as expectativas ficam apenas na descrição.

As equipes precisam transformar uma situação real do cliente em uma entrada concreta, um comportamento esperado e evidências que possam analisar. A Mibo mantém essas partes juntas sem tratar um cenário como uma afirmação sobre todas as interações.

Cenários concretos

Descreva a situação, a entrada e o comportamento que você quer proteger para que o caso represente um cenário deliberado, não uma instrução vaga.

Expectativas semânticas

Escreva critérios sobre significado, segurança, completude ou alinhamento em linguagem natural. O avaliador pontua a resposta e o contexto disponível segundo o que você descreveu.

Evidências procedurais

Verifique fatos observáveis como chamadas de nós ou ferramentas, argumentos, status, schema, tempo ou uso de tokens quando a resposta ativa ou o trace contiver os campos necessários.

De uma expectativa real às evidências que você pode investigar

Crie um caso focado, escolha as verificações que expressam seu comportamento e use o resultado para decidir o que analisar em seguida. Execuções ativas e traces passivos continuam sendo sinais distintos.

Descreva o cenário

Escreva a situação do cliente e a entrada que deve exercitá-la. Inclua o resultado esperado e qualquer condição importante de segurança ou caso extremo.

Adicione verificações

Combine critérios semânticos com verificações procedurais para a resposta e as evidências de execução que seu agente pode expor. Defina limites e valores esperados de forma deliberada.

Execute e avalie

Execute o caso selecionado em um agente conectado e depois avalie de forma assíncrona os traces canônicos aplicáveis de interações reais quando seu sistema os enviar.

Um caso pode conectar um cenário do cliente às suas evidências

Verificações semânticas

Descreva o que significa uma resposta ser útil, segura, completa ou fundamentada. A pontuação é uma evidência para análise e depende da resposta e do contexto disponíveis para o avaliador.

Verificações procedurais

Confirme fatos determinísticos como uma chamada obrigatória de ferramenta, um argumento, um campo de resposta, um status HTTP, um schema, um limite de tempo ou o uso de tokens. Campos ausentes no trace aparecem como instrumentação ausente.

Perguntas frequentes

O que é um caso de teste de um agente de IA?

É um cenário definido com uma entrada, um comportamento esperado e verificações que a Mibo pode avaliar. As verificações podem descrever o significado da resposta ou analisar fatos observáveis como chamadas de ferramentas, argumentos, status, schema, tempo ou tokens.

Como os casos de teste diferem da avaliação geral de agentes de IA?

Um caso de teste é a definição concreta do cenário e das verificações. A Mibo avalia suas verificações configuradas durante uma execução ativa deliberada e pode reutilizar casos ativos aplicáveis quando seu sistema envia traces de interações reais.

A Mibo pode executar um caso selecionado antes do lançamento?

Sim. O teste ativo envia a entrada selecionada ao agente conectado e avalia a resposta e as evidências de execução disponíveis. O resultado é uma evidência para esse cenário, não uma prova sobre casos não observados.

Um caso de teste pode ser avaliado contra um trace real?

Sim, quando o teste está ativo e é elegível para avaliação passiva e seu sistema envia um trace canônico depois da interação. A Mibo classifica os cenários aplicáveis e os avalia de forma assíncrona sem chamar o agente novamente.

E se uma verificação precisar de dados que o trace não contém?

A Mibo informa instrumentação ausente para verificações compatíveis que não encontram o campo necessário no trace, em vez de tratar a verificação silenciosamente como aprovada ou reprovada. Adicione os campos relevantes se essa evidência for importante para o seu fluxo.

Os casos de teste de agentes de IA garantem cobertura completa?

Não. O sinal é limitado pelos cenários e verificações que você configura, pelas entradas e traces disponíveis, pela classificação, pela instrumentação e pela amplitude das interações que você exercita ou observa. A Mibo não afirma qualidade garantida nem correção automática.

Continue explorando