Uma base de conhecimento é um repositório de documentos que seus agentes podem buscar por significado. Você envia arquivos, o Zoen os divide em chunks e os indexa, e um bloco Knowledge recupera os chunks mais relevantes para uma consulta. É assim que um agente responde a partir do seu próprio conteúdo em vez do treinamento geral do modelo.
Como um documento se torna pesquisável
Quando você envia um documento, o Zoen o processa em segundo plano:
- Extrai o texto, com um parser para cada tipo de arquivo e OCR para PDFs escaneados.
- Divide em trechos (chunks), com tamanho e sobreposição que você pode ajustar.
- Gera embeddings de cada chunk como vetor para matching por significado, não só por palavras-chave.
Um documento fica pesquisável quando o status lê completed. Abra qualquer documento para ver, editar, mesclar ou dividir seus chunks.
O que você pode enviar
O Zoen aceita arquivos PDF, Word, texto, Markdown, HTML, Excel, PowerPoint, CSV, JSON e YAML, de até 100 MB cada (melhor abaixo de 50 MB). PDFs escaneados também funcionam: com Azure ou Mistral OCR configurado, o Zoen extrai texto de páginas baseadas em imagem.
Moldando o que uma busca retorna
Duas coisas controlam a qualidade da recuperação, e cada uma tem sua própria página:
- Chunking decide como um documento é dividido. Chunks menores são mais precisos; maiores mantêm mais contexto. Veja estratégias de chunking.
- Tags rotulam documentos para que uma busca possa filtrar um subconjunto. Veja tags e filtragem.
Para manter uma base sincronizada com uma fonte externa como o Google Drive, use um conector.
Próximos passos
Usando uma base de conhecimento em um workflow
O bloco Knowledge: busca, tags, reranking e leitura dos resultados.
Estratégias de chunking
Como o tamanho e os limites dos chunks moldam a recuperação.
Tags e filtragem
Rotule documentos e restrinja uma busca.
Conectores
Sincronize documentos de uma fonte externa.
Debugging da recuperação
Diagnostique por que uma busca retorna os chunks errados.