Skip to main content
O Evals mede a qualidade do contexto que a plataforma entrega aos agentes. Avalia se o contexto estava completo, correto e relevante para a decisão — não o comportamento do modelo de linguagem que consome esse contexto.
Evals mede a qualidade do contexto, nunca a qualidade do LLM nem das respostas do agente. O modelo é responsabilidade do provider do cliente. O contexto é o que o time de dados controla.

Por que Evals existe

Quando a resposta de um agente piora, a pergunta é: foi o modelo ou foi o contexto? O time de dados não controla o modelo, mas controla tudo que chega até ele — o perfil da entidade, as fontes consultadas, o frescor dos dados. Evals separa as duas coisas. Ele avalia a camada de contexto de forma isolada, para que o time saiba exatamente por que as respostas melhoram ou pioram, e o que mudar para melhorar. Sem essa separação, um perfil incompleto e uma alucinação do modelo aparecem como o mesmo sintoma. Com Evals, o time vê que o contexto entregue não tinha o campo que faltava, e corrige a fonte em vez de culpar o modelo.

As três dimensões da qualidade do contexto

Evals avalia o contexto em três dimensões. Cada uma responde a uma pergunta que o time de dados pode acionar.

Completude

O contexto tinha tudo que era necessário para a decisão? Mede quantos dos campos exigidos do perfil estavam preenchidos e quantas das fontes configuradas efetivamente contribuíram. Exemplo: um perfil de tomador de crédito precisa de renda, histórico de pagamentos e contratos ativos. Se a fonte de contratos não sincronizou, a completude cai e o Evals aponta qual dimensão faltou.

Precisão

As informações estavam corretas e atualizadas? Mede se os dados entregues refletem o estado real da fonte, sem valores obsoletos ou divergentes entre sistemas.

Relevância

Havia ruído no contexto que poderia distorcer a decisão? Mede se o que foi entregue era pertinente à pergunta, sem eventos ou fontes irrelevantes ocupando o orçamento de tokens.

Métricas que o Evals consome

Memory e Knowledge emitem métricas de qualidade que o Evals agrega. Cada métrica alimenta uma das três dimensões acima.
Os limiares de cada métrica são configurados por cliente. Quando uma métrica viola o limiar, o evento é emitido para o Observability, que monitora o contexto em produção.

Como se conecta aos outros produtos

Evals fica na camada de Ops Engineering, ao lado do Observability. Um mede a qualidade do contexto de forma avaliativa; o outro monitora essa qualidade em produção.

Casos de uso

A qualidade das respostas de um agente de atendimento cai. O time abre o Evals e vê que a completude do perfil caiu de 95% para 70% na última semana. A causa é uma fonte de contratos que parou de sincronizar — não o modelo. A correção é no pipeline, não no prompt.
Antes de expor um novo conector aos agentes, o time avalia se o contexto resultante melhora a completude e a cobertura de fontes das entidades afetadas. Evals dá a medida antes e depois. [verificar: fluxo exato de avaliação pré-deploy na UI]

Próximos passos

Observability

Monitore a qualidade do contexto em produção e receba alertas antes que um problema impacte o agente.

Memory

Entenda como o contexto de entidade é montado e quais métricas ele emite.

Knowledge

Veja como a base de conhecimento é indexada e recuperada.