Concept

Visão geral

Uma base de conhecimento é um repositório de documentos que seus agentes podem buscar por significado. Você envia arquivos, o Zoen os divide em chunks e os indexa, e um bloco Knowledge recupera os chunks mais relevantes para uma consulta. É assim que um agente responde a partir do seu próprio conteúdo em vez do treinamento geral do modelo.

Como um documento se torna pesquisável

Quando você envia um documento, o Zoen o processa em segundo plano:

  1. Extrai o texto, com um parser para cada tipo de arquivo e OCR para PDFs escaneados.
  2. Divide em trechos (chunks), com tamanho e sobreposição que você pode ajustar.
  3. Gera embeddings de cada chunk como vetor para matching por significado, não só por palavras-chave.

Um documento fica pesquisável quando o status lê completed. Abra qualquer documento para ver, editar, mesclar ou dividir seus chunks.

O que você pode enviar

O Zoen aceita arquivos PDF, Word, texto, Markdown, HTML, Excel, PowerPoint, CSV, JSON e YAML, de até 100 MB cada (melhor abaixo de 50 MB). PDFs escaneados também funcionam: com Azure ou Mistral OCR configurado, o Zoen extrai texto de páginas baseadas em imagem.

Moldando o que uma busca retorna

Duas coisas controlam a qualidade da recuperação, e cada uma tem sua própria página:

  • Chunking decide como um documento é dividido. Chunks menores são mais precisos; maiores mantêm mais contexto. Veja estratégias de chunking.
  • Tags rotulam documentos para que uma busca possa filtrar um subconjunto. Veja tags e filtragem.

Para manter uma base sincronizada com uma fonte externa como o Google Drive, use um conector.

Próximos passos

Common Questions

Arquivos PDF, Word (DOC/DOCX), texto simples (TXT), Markdown (MD), HTML, Excel (XLS/XLSX), PowerPoint (PPT/PPTX), CSV, JSON e YAML.
Arquivos podem ter até 100 MB cada, com melhor desempenho abaixo de 50 MB.
Sim. Você pode ver, editar, mesclar, dividir e adicionar metadados a chunks individuais depois que um documento é processado.
Documentos são embeddados como vetores. Quando você busca, sua consulta também é embeddada e comparada aos vetores dos documentos para encontrar conteúdo conceitualmente semelhante, mesmo quando as palavras-chave exatas não batem.
Sim. Com Azure ou Mistral OCR configurado, o Zoen extrai texto de páginas de PDF baseadas em imagem e escaneadas.
Cada bloco Knowledge busca uma base de conhecimento. Use vários blocos Knowledge em um workflow para buscar em várias.
Ao criar uma base de conhecimento, você pode definir o tamanho máximo do chunk (100 a 4.000 tokens), o tamanho mínimo (100 a 2.000 caracteres) e a sobreposição (0 a 500 tokens). Veja estratégias de chunking para detalhes.

On this page