Caminho completo: Dados e orquestração →Aplicar um critério
RESPOSTA DIRETA

O que você precisa saber

Teste o agente na tarefa completa, com resultados esperados e casos de falha. Avalie resposta, ação e estado final separadamente. A autonomia deve crescer depois de evidência repetida, com limite de permissão, responsável por exceções e forma clara de interromper o fluxo.

  • Uma resposta convincente não prova que a ação foi executada e persistida.
  • O conjunto de teste precisa incluir situações sem resposta e ações fora da permissão.
  • Mudanças de modelo, fonte ou ferramenta pedem nova avaliação dos casos afetados.

Transforme a promessa em um contrato de tarefa

Antes de testar, descreva o trabalho em termos observáveis. Preparar um resumo, consultar uma disponibilidade e registrar um interesse são tarefas diferentes. Para cada uma, registre entrada, informação necessária, permissões, saída e estado final esperado. Sem isso, a equipe avalia a impressão da conversa em vez da entrega.

A OpenAI recomenda avaliações específicas à tarefa, critérios claros e avaliação contínua. Essa orientação não oferece uma aprovação automática para qualquer agente. Ela ajuda a montar uma pergunta de trabalho: que evidência mostraria que este fluxo funciona nas situações que a empresa enfrenta?

Um caso hipotético de agendamento

Se o agente só propõe um horário, a saída esperada é uma sugestão correta. Se pode agendar, o teste precisa conferir disponibilidade, autorização, criação do compromisso e confirmação. O texto 'agendado' não substitui a leitura do registro no sistema que controla o calendário.

Monte uma coleção que represente a operação

Use casos autorizados e remova informações que não são necessárias. Distribua a amostra entre situações frequentes e exceções que têm impacto. Uma coleção formada apenas por perguntas fáceis favorece uma aprovação que desaparece quando o cliente escreve do próprio jeito.

Cada caso precisa de uma resposta ou comportamento esperado, com justificativa e fonte. Em tarefas de julgamento, a empresa deve dizer quem avalia e como trata discordância. Notas automáticas ajudam a triar, mas uma pontuação alta não encerra uma divergência sobre o que o agente tinha permissão para fazer.

Categorias que merecem entrar

O objetivo não é testar toda frase possível, e sim cobrir as condições que mudam a decisão.

  • Caso normal com dados completos e fonte vigente.
  • Pedido incompleto que exige esclarecimento.
  • Informações contraditórias ou regra substituída.
  • Pergunta fora do assunto ou sem resposta disponível.
  • Tentativa de acessar dado de outra empresa ou unidade.
  • Ação sem autorização, ferramenta indisponível e repetição da mesma solicitação.

Para continuar este critério: RAG na empresa: como dar contexto à IA sem perder o controle da informação →

Separe qualidade da resposta de qualidade da ação

Um agente pode escrever a resposta correta e executar a ação errada. Também pode executar uma ação válida e comunicar mal o resultado. Avalie as duas partes, incluindo o estado que ficou no sistema. Em uma operação com clientes, um erro de execução costuma ter consequências diferentes de uma frase pouco clara.

A proposta abaixo é uma matriz de decisão para adaptar à tarefa. Não é uma certificação, um padrão universal de nota nem um relato de resultado de cliente. A empresa deve calibrar aceitação e bloqueio conforme o impacto de cada falha.

Dimensões para avaliar o fluxo completo
DimensãoO que conferirEvidência necessária
ContextoFonte vigente e pessoa/unidade corretasDocumento e filtro usados
RespostaPrecisão, limite e clarezaComparação com resultado esperado
AçãoPermissão e parâmetros corretosRegistro da autorização e execução
PersistênciaEstado final e ausência de duplicaçãoLeitura do sistema de destino
ExceçãoParada ou transferência útilDestino e contexto entregue à pessoa

Defina o que bloqueia a liberação

Não esconda uma falha grave dentro de uma média. Um conjunto pode acertar quase todos os casos e ainda permitir leitura indevida ou execução duplicada. Estabeleça quais situações impedem a liberação, independentemente da taxa de acerto geral. Para problemas menores, registre correção e prazo sem chamá-los de resolvidos.

A arquitetura também influencia a avaliação. A Anthropic distingue fluxos com etapas definidas de agentes com mais liberdade para decidir o caminho. Quanto maior a liberdade, mais importante observar decisões intermediárias, limites de ferramentas e condições de parada. Complexidade adicional precisa demonstrar utilidade para a tarefa.

Autonomia em etapas

Comece pela forma de trabalho que permite aprender com menor impacto. Um fluxo pode preparar uma sugestão para a equipe, depois consultar informações e só então executar ações limitadas. Essa sequência é uma proposta de implementação gradual, não uma garantia de segurança por si só.

  1. Avalie sem execução externa, com saída revisada pela equipe.
  2. Libere consultas dentro de uma permissão específica e registre o contexto.
  3. Teste ações reversíveis em ambiente de validação e confira o estado final.
  4. Defina quem pode ampliar o escopo e que falhas interrompem o fluxo.
  5. Acompanhe casos reais autorizados e mantenha um caminho humano para exceções.

A avaliação continua depois da publicação

Quando muda o modelo, uma regra ou uma integração, muda o sistema que foi avaliado. Reexecute os casos afetados e conserve a versão usada na comparação. Se você também alterou o conjunto de perguntas, registre a diferença: comparar números de coleções distintas pode produzir uma conclusão falsa.

Na operação, acompanhe falhas por tarefa e tipo. Observe correções humanas, ações duplicadas, transferências e informação ausente. Métricas de velocidade precisam vir junto com qualidade e custo. Responder mais rápido pode apenas deslocar trabalho para outra pessoa.

A Genial Labs AI trata avaliação como parte da entrega: hipótese, caso, resultado esperado, execução e evidência. A pergunta final não é se o agente parece inteligente. É se a empresa consegue explicar o que ele fez, por que estava autorizado e como corrigir quando a situação sair do previsto.

DA LEITURA À PRÁTICA · Planilha XLSX

Roteiro de avaliação de agentes

Registre respostas, ações, permissões e exceções antes de decidir liberar um agente.

Ver o material gratuito →

Fontes e leitura complementar

DA LEITURA À APLICAÇÃO

Quer levar essa discussão para sua operação?

Conte seu desafio. Nossa equipe pode ajudar a definir uma hipótese, uma linha de base e o primeiro passo.

Conversar sobre meu desafio Conheça o serviço
Biblioteca de guiasAcompanhar por RSS
Voltar ao blog