Pular para o conteúdo principal

A Mibo testa regressões de agentes de IA antes do lançamento e depois de interações reais.

Execute cenários selecionados de forma deliberada antes do lançamento e depois avalie traces de produção disponíveis de interações reais com os mesmos testes configurados. A Mibo torna as evidências visíveis sem afirmar cobertura completa.

Uma verificação aprovada antes do lançamento pode não detectar uma regressão no comportamento que os usuários encontrarão depois.

Um agente pode passar por um cenário selecionado enquanto outra interação real revela uma mudança de roteamento, chamada de ferramenta ou resposta. A Mibo conecta verificações deliberadas antes do lançamento a evidências de traces depois de interações reais, sem tratar um resultado isolado como prova de qualidade.

Verificações ativas de regressão

Execute cenários selecionados contra seu agente antes do lançamento e avalie a resposta e as evidências de execução observáveis com os testes que você configura.

Avaliação de traces de produção

Depois de uma interação real, envie à Mibo um trace canônico disponível. Os testes ativos aplicáveis são avaliados de forma assíncrona sem que a Mibo chame seu agente novamente.

Um sinal limitado

Interprete os resultados considerando as verificações definidas, a instrumentação incluída no trace, a classificação da entrada e a amplitude dos cenários exercitados ou observados.

Um fluxo de regressão entre verificações de lançamento e tráfego real

Use testes ativos para exercitar deliberadamente cenários conhecidos e depois avalie traces passivos para ver como essas mesmas verificações se comportam diante de interações que seu sistema realmente atendeu.

Defina o comportamento que você quer proteger

Descreva cenários e adicione verificações semânticas ou procedurais para resposta, chamadas de ferramentas, argumentos, status, schema, tempo ou outras evidências que o trace possa carregar.

Teste antes do lançamento

Execute entradas selecionadas contra o agente antes de publicar uma mudança. Revise o resultado e suas evidências como uma verificação de regressão específica, não como garantia para todas as entradas possíveis.

Avalie interações reais

Envie traces de produção disponíveis após as interações. A Mibo classifica os cenários aplicáveis e avalia os testes configurados de forma assíncrona para que a equipe investigue diferenças ao longo do tempo.

Acompanhe uma regressão da resposta alterada até as evidências por trás dela

Verificações semânticas

Verificações com IA comparam uma resposta com critérios que você descreve, como ser completa, fundamentada, segura ou alinhada. A pontuação é uma evidência para investigação e depende da resposta e do contexto disponíveis para o avaliador.

Verificações procedurais

Verificações determinísticas analisam fatos registrados como chamadas de nós ou ferramentas, argumentos, status HTTP, schema, uso de tokens e tempo de resposta. Campos ausentes são informados como instrumentação ausente, não como aprovação ou falha silenciosa.

Perguntas frequentes

O que diferencia testes de regressão de agentes de IA de uma execução pontual?

A Mibo permite executar testes ativos deliberadamente antes do lançamento e avaliar passivamente traces disponíveis depois de interações reais. Usar os mesmos testes configurados nos dois modos ajuda a comparar cenários selecionados com o comportamento observado, mantendo visíveis os limites de cada sinal.

A Mibo testa o agente novamente quando avalia um trace de produção?

Não. Seu sistema atende à interação real e depois envia um trace canônico. A Mibo avalia de forma assíncrona os testes ativos aplicáveis contra esse trace e não chama o agente novamente durante a avaliação passiva.

Como a Mibo decide quais testes de regressão se aplicam a uma interação real?

A Mibo usa a entrada disponível no trace para classificar quais testes condicionais de cenário são relevantes. Verificações universais podem ser aplicadas a todo trace, enquanto um teste pode não estar disponível quando o trace não tem uma correspondência utilizável ou não contém as evidências necessárias.

Os testes de regressão de agentes de IA podem garantir cobertura completa?

Não. Os resultados são limitados pelos cenários e verificações que você configura, pelas interações que acontecem, pelo sinal de classificação e pela instrumentação e pelos campos que você envia. A Mibo não afirma cobertura completa, qualidade garantida ou correção automática.

O que acontece quando uma verificação precisa de dados que o trace não inclui?

A Mibo informa instrumentação ausente para verificações compatíveis que não encontram o atributo necessário no trace, em vez de tratá-las silenciosamente como aprovadas ou reprovadas. Adicione os campos necessários se essa evidência for importante para o seu fluxo.

Como a Mibo trata a privacidade dos traces?

Os payloads dos traces são criptografados em repouso, e o acesso no produto é limitado à conta proprietária. Envie dados sintéticos ou devidamente governados de acordo com seus próprios requisitos de privacidade.

Continue investigando