> ## Documentation Index
> Fetch the complete documentation index at: https://strattumai.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# Evals

> Avaliação da qualidade do contexto entregue aos agentes — completude, precisão e relevância. Mede o que o time de dados controla.

O **Evals** mede a qualidade do contexto que a plataforma entrega aos agentes. Avalia se o contexto estava completo, correto e relevante para a decisão — não o comportamento do modelo de linguagem que consome esse contexto.

<Warning>
  Evals mede a qualidade do **contexto**, nunca a qualidade do LLM nem das respostas do agente. O modelo é responsabilidade do provider do cliente. O contexto é o que o time de dados controla.
</Warning>

***

## Por que Evals existe

Quando a resposta de um agente piora, a pergunta é: foi o modelo ou foi o contexto? O time de dados não controla o modelo, mas controla tudo que chega até ele — o perfil da entidade, as fontes consultadas, o frescor dos dados.

Evals separa as duas coisas. Ele avalia a camada de contexto de forma isolada, para que o time saiba exatamente por que as respostas melhoram ou pioram, e o que mudar para melhorar.

Sem essa separação, um perfil incompleto e uma alucinação do modelo aparecem como o mesmo sintoma. Com Evals, o time vê que o contexto entregue não tinha o campo que faltava, e corrige a fonte em vez de culpar o modelo.

***

## As três dimensões da qualidade do contexto

Evals avalia o contexto em três dimensões. Cada uma responde a uma pergunta que o time de dados pode acionar.

### Completude

O contexto tinha tudo que era necessário para a decisão? Mede quantos dos campos exigidos do perfil estavam preenchidos e quantas das fontes configuradas efetivamente contribuíram.

Exemplo: um perfil de tomador de crédito precisa de renda, histórico de pagamentos e contratos ativos. Se a fonte de contratos não sincronizou, a completude cai e o Evals aponta qual dimensão faltou.

### Precisão

As informações estavam corretas e atualizadas? Mede se os dados entregues refletem o estado real da fonte, sem valores obsoletos ou divergentes entre sistemas.

### Relevância

Havia ruído no contexto que poderia distorcer a decisão? Mede se o que foi entregue era pertinente à pergunta, sem eventos ou fontes irrelevantes ocupando o orçamento de tokens.

***

## Métricas que o Evals consome

Memory e Knowledge emitem métricas de qualidade que o Evals agrega. Cada métrica alimenta uma das três dimensões acima.

| Métrica                       | Definição                                                 | Dimensão   |
| ----------------------------- | --------------------------------------------------------- | ---------- |
| **Completude do perfil**      | % dos campos obrigatórios preenchidos no golden record    | Completude |
| **Cobertura de fontes**       | Quantas fontes contribuíram vs quantas estão configuradas | Completude |
| **Taxa de ER ambíguo**        | % de entidades na fila de revisão vs total                | Precisão   |
| **Relevância de recuperação** | Aderência dos chunks retornados pelo Knowledge à consulta | Relevância |

<Note>
  Os limiares de cada métrica são configurados por cliente. Quando uma métrica viola o limiar, o evento é emitido para o [Observability](/observability/overview), que monitora o contexto em produção.
</Note>

***

## Como se conecta aos outros produtos

Evals fica na camada de Ops Engineering, ao lado do Observability. Um mede a qualidade do contexto de forma avaliativa; o outro monitora essa qualidade em produção.

| Produto            | Como o Evals se conecta                                                            |
| ------------------ | ---------------------------------------------------------------------------------- |
| **Memory**         | Consome métricas de completude do perfil, cobertura de fontes e taxa de ER ambíguo |
| **Knowledge**      | Consome métricas de relevância e cobertura da recuperação                          |
| **Observability**  | Recebe os eventos quando uma métrica de contexto viola o limiar configurado        |
| **Data Pipelines** | Metadados de ingestão (completude, frescor) são insumo para a avaliação            |

***

## Casos de uso

<AccordionGroup>
  <Accordion title="Diagnóstico de regressão de qualidade">
    A qualidade das respostas de um agente de atendimento cai. O time abre o Evals e vê que a completude do perfil caiu de 95% para 70% na última semana. A causa é uma fonte de contratos que parou de sincronizar — não o modelo. A correção é no pipeline, não no prompt.
  </Accordion>

  <Accordion title="Validação antes de subir uma nova fonte">
    Antes de expor um novo conector aos agentes, o time avalia se o contexto resultante melhora a completude e a cobertura de fontes das entidades afetadas. Evals dá a medida antes e depois. \[verificar: fluxo exato de avaliação pré-deploy na UI]
  </Accordion>
</AccordionGroup>

***

## Próximos passos

<CardGroup cols={2}>
  <Card title="Observability" icon="chart-line" href="/observability/overview">
    Monitore a qualidade do contexto em produção e receba alertas antes que um problema impacte o agente.
  </Card>

  <Card title="Memory" icon="brain" href="/memory/overview">
    Entenda como o contexto de entidade é montado e quais métricas ele emite.
  </Card>

  <Card title="Knowledge" icon="book-open" href="/knowledge/overview">
    Veja como a base de conhecimento é indexada e recuperada.
  </Card>
</CardGroup>
