Pulse

A ferramenta Pulse permite extrair com facilidade texto e conteúdo estruturado de uma ampla variedade de documentos — incluindo PDFs, imagens e arquivos Office — usando OCR (Optical Character Recognition) de ponta alimentado pelo Pulse. Projetado para fluxos agentic automatizados, o Pulse Parser facilita liberar informações valiosas presas em documentos não estruturados e integrar o conteúdo extraído diretamente no seu fluxo de trabalho.

Com o Pulse, você pode:

  • Extrair texto de documentos: Converter rapidamente PDFs digitalizados, imagens e documentos Office em texto utilizável, markdown ou JSON.
  • Processar documentos por URL ou upload: Basta fornecer a URL de um arquivo ou fazer upload para extrair texto de documentos locais ou remotos.
  • Formatos de saída flexíveis: Escolher entre markdown, texto simples ou JSON do conteúdo extraído para processamento posterior.
  • Processamento seletivo de páginas: Especificar um intervalo de páginas, reduzindo tempo e custo quando você só precisa de parte do documento.
  • Extração de figuras e tabelas: Opcionalmente extrair figuras e tabelas, com geração automática de legendas e descrições para contexto.
  • Obter insights do processamento: Receber metadados detalhados de cada job, incluindo tipo de arquivo, contagem de páginas, tempo de processamento e mais.
  • Respostas prontas para integração: Incorporar o conteúdo extraído em pesquisa, automação de fluxos ou pipelines de análise de dados.

Ideal para automatizar revisões tediosas de documentos, habilitar sumarização, pesquisa e mais, o Pulse Parser traz documentos do mundo real para a era dos fluxos digitais.

Se você precisa de parsing de documentos preciso, escalável e amigável para desenvolvedores — em formatos, idiomas e layouts — o Pulse capacita seus agentes a ler o mundo.

Usage Instructions

Integrate Pulse into the workflow. Extract text from PDF documents, images, and Office files via upload or file references.

Actions

pulse_parser

Input

ParameterTypeRequiredDescription
filefileYesDocument to be processed

Output

ParameterTypeDescription
markdownstringExtracted content in markdown format
page_countnumberNumber of pages in the document
job_idstringUnique job identifier
bounding_boxesjsonBounding box layout information
extraction_urlstringURL for extraction results (for large documents)
htmlstringHTML content if requested
structured_outputjsonStructured output if schema was provided
chunksjsonChunked content if chunking was enabled
figuresjsonExtracted figures if figure extraction was enabled

On this page