O bloco Evaluator usa um modelo para pontuar conteúdo contra métricas que você define, retornando um número por métrica. Use para quality gates, comparar variações e controle de qualidade em saída de IA.
Configuração
Evaluation Metrics
As métricas contra as quais pontuar. Cada métrica tem um name, uma description do que mede e um range numérico:
Accuracy (1-5): How factually accurate is the content?
Clarity (1-5): How clear and understandable is it?
Relevance(1-5): How relevant is it to the original query?O modelo pontua o conteúdo em cada métrica e retorna os números. Métricas sem name ou range são puladas.
Content
O conteúdo a pontuar. Geralmente uma saída anterior como <agent.content>. Dados estruturados são formatados para texto antes da pontuação; a avaliação é baseada em texto, então não pontua imagens ou áudio diretamente.
Model
O modelo que faz a pontuação, com padrão claude-sonnet-4-6. Modelos de raciocínio mais fortes dão scores mais consistentes. Digite ou escolha qualquer modelo suportado. Temperature e um System Prompt estão disponíveis em advanced, e no Zoen hospedado a API key é fornecida para você.
Saídas
O Evaluator retorna um número para cada métrica, lido pelo nome da métrica em minúsculas:
| Saída | O que é |
|---|---|
<evaluator.accuracy> | O score de uma métrica (uma saída por métrica que você define) |
<evaluator.content> | O resumo da avaliação |
<evaluator.model> | O modelo que pontuou |
<evaluator.tokens> | Uso de tokens |
<evaluator.cost> | Custo estimado da chamada |
O bloco impõe um JSON Schema montado a partir das suas métricas, então o modelo retorna só os scores das métricas como números, sem texto extra.
Exemplos
Gate em um score de qualidade
O Evaluator pontua o rascunho, e um Condition faz gate em <evaluator.accuracy> — publicando um rascunho forte ou mandando um fraco de volta para revisar.
O mesmo formato cobre outro trabalho de qualidade: pontuar várias variações parallel e escolher a melhor, ou pontuar cada resposta de suporte e marcar as baixas para revisão.
Boas práticas
- Escreva descrições de métrica específicas. Uma definição clara do que cada métrica mede produz scores mais consistentes.
- Escolha uma faixa sensata. Granularidade suficiente para agir (1–5 ou 0–10), sem exagerar.
- Pontue a saída do Agent e faça loop de volta. Combine um Evaluator com um Condition para fazer gate num limiar e rotear saída fraca de volta para outra passagem.
- Mantenha métricas consistentes. Para comparar variações, use as mesmas métricas em cada avaliação.