Reference

Evaluator

O bloco Evaluator usa um modelo para pontuar conteúdo contra métricas que você define, retornando um número por métrica. Use para quality gates, comparar variações e controle de qualidade em saída de IA.

Configuração

Evaluation Metrics

As métricas contra as quais pontuar. Cada métrica tem um name, uma description do que mede e um range numérico:

Accuracy (1-5): How factually accurate is the content?
Clarity  (1-5): How clear and understandable is it?
Relevance(1-5): How relevant is it to the original query?

O modelo pontua o conteúdo em cada métrica e retorna os números. Métricas sem name ou range são puladas.

Content

O conteúdo a pontuar. Geralmente uma saída anterior como <agent.content>. Dados estruturados são formatados para texto antes da pontuação; a avaliação é baseada em texto, então não pontua imagens ou áudio diretamente.

Model

O modelo que faz a pontuação, com padrão claude-sonnet-4-6. Modelos de raciocínio mais fortes dão scores mais consistentes. Digite ou escolha qualquer modelo suportado. Temperature e um System Prompt estão disponíveis em advanced, e no Zoen hospedado a API key é fornecida para você.

Saídas

O Evaluator retorna um número para cada métrica, lido pelo nome da métrica em minúsculas:

SaídaO que é
<evaluator.accuracy>O score de uma métrica (uma saída por métrica que você define)
<evaluator.content>O resumo da avaliação
<evaluator.model>O modelo que pontuou
<evaluator.tokens>Uso de tokens
<evaluator.cost>Custo estimado da chamada

O bloco impõe um JSON Schema montado a partir das suas métricas, então o modelo retorna só os scores das métricas como números, sem texto extra.

Exemplos

Gate em um score de qualidade

O Evaluator pontua o rascunho, e um Condition faz gate em <evaluator.accuracy> — publicando um rascunho forte ou mandando um fraco de volta para revisar.

O mesmo formato cobre outro trabalho de qualidade: pontuar várias variações parallel e escolher a melhor, ou pontuar cada resposta de suporte e marcar as baixas para revisão.

Boas práticas

  • Escreva descrições de métrica específicas. Uma definição clara do que cada métrica mede produz scores mais consistentes.
  • Escolha uma faixa sensata. Granularidade suficiente para agir (1–5 ou 0–10), sem exagerar.
  • Pontue a saída do Agent e faça loop de volta. Combine um Evaluator com um Condition para fazer gate num limiar e rotear saída fraca de volta para outra passagem.
  • Mantenha métricas consistentes. Para comparar variações, use as mesmas métricas em cada avaliação.

Common Questions

Um objeto JSON em que cada chave é o nome da métrica em minúsculas e o valor é o score numérico dentro da faixa que você definiu. Uma métrica chamada 'Accuracy' com faixa 1-5 aparece como { "accuracy": 4 }, lida downstream como <evaluator.accuracy>.
Modelos com raciocínio forte dão os scores mais consistentes. O padrão é claude-sonnet-4-6; para métricas simples e claramente distintas, um modelo mais rápido serve.
O campo content aceita qualquer string. JSON ou dados estruturados são detectados e formatados antes da pontuação, mas a avaliação é baseada em texto, então não pontua imagens ou áudio diretamente.
Métricas sem name ou range são puladas. O Evaluator só pontua métricas que têm tanto um name quanto um range min/max definido.
Sim. Ele monta um JSON Schema a partir das suas métricas e impõe strict mode, então o modelo retorna só os scores esperados das métricas como números, sem texto extra.
A partir do uso de tokens da chamada ao modelo subjacente. As saídas incluem contagens de tokens e um breakdown de custo para você acompanhar o gasto por avaliação.

On this page