A ferramenta Pulse permite extrair com facilidade texto e conteúdo estruturado de uma ampla variedade de documentos — incluindo PDFs, imagens e arquivos Office — usando OCR (Optical Character Recognition) de ponta alimentado pelo Pulse. Projetado para fluxos agentic automatizados, o Pulse Parser facilita liberar informações valiosas presas em documentos não estruturados e integrar o conteúdo extraído diretamente no seu fluxo de trabalho.
Com o Pulse, você pode:
- Extrair texto de documentos: Converter rapidamente PDFs digitalizados, imagens e documentos Office em texto utilizável, markdown ou JSON.
- Processar documentos por URL ou upload: Basta fornecer a URL de um arquivo ou fazer upload para extrair texto de documentos locais ou remotos.
- Formatos de saída flexíveis: Escolher entre markdown, texto simples ou JSON do conteúdo extraído para processamento posterior.
- Processamento seletivo de páginas: Especificar um intervalo de páginas, reduzindo tempo e custo quando você só precisa de parte do documento.
- Extração de figuras e tabelas: Opcionalmente extrair figuras e tabelas, com geração automática de legendas e descrições para contexto.
- Obter insights do processamento: Receber metadados detalhados de cada job, incluindo tipo de arquivo, contagem de páginas, tempo de processamento e mais.
- Respostas prontas para integração: Incorporar o conteúdo extraído em pesquisa, automação de fluxos ou pipelines de análise de dados.
Ideal para automatizar revisões tediosas de documentos, habilitar sumarização, pesquisa e mais, o Pulse Parser traz documentos do mundo real para a era dos fluxos digitais.
Se você precisa de parsing de documentos preciso, escalável e amigável para desenvolvedores — em formatos, idiomas e layouts — o Pulse capacita seus agentes a ler o mundo.
Usage Instructions
Integrate Pulse into the workflow. Extract text from PDF documents, images, and Office files via upload or file references.
Actions
pulse_parser
Input
| Parameter | Type | Required | Description |
|---|---|---|---|
file | file | Yes | Document to be processed |
Output
| Parameter | Type | Description |
|---|---|---|
markdown | string | Extracted content in markdown format |
page_count | number | Number of pages in the document |
job_id | string | Unique job identifier |
bounding_boxes | json | Bounding box layout information |
extraction_url | string | URL for extraction results (for large documents) |
html | string | HTML content if requested |
structured_output | json | Structured output if schema was provided |
chunks | json | Chunked content if chunking was enabled |
figures | json | Extracted figures if figure extraction was enabled |