Mistral Parser

A ferramenta Mistral Parse oferece uma forma poderosa de extrair e processar conteúdo de documentos PDF usando a OCR API da Mistral. Esta ferramenta aproveita reconhecimento óptico de caracteres avançado para extrair texto e estrutura de arquivos PDF com precisão, facilitando a incorporação de dados de documentos nos fluxos de trabalho dos seus agentes.

Com a ferramenta Mistral Parse, você pode:

  • Extrair texto de PDFs: Converter com precisão o conteúdo de PDF para formatos texto, markdown ou JSON
  • Processar PDFs a partir de URLs: Extrair conteúdo diretamente de PDFs hospedados online fornecendo suas URLs
  • Manter a estrutura do documento: Preservar formatação, tabelas e layout dos PDFs originais
  • Extrair imagens: Incluir opcionalmente imagens embutidas dos PDFs
  • Selecionar páginas específicas: Processar apenas as páginas de que você precisa em documentos multipágina

A ferramenta Mistral Parse é especialmente útil em cenários em que seus agentes precisam trabalhar com conteúdo de PDF, como analisar relatórios, extrair dados de formulários ou processar texto de documentos digitalizados. Ela simplifica o processo de disponibilizar conteúdo de PDF aos seus agentes, permitindo que trabalhem com informações armazenadas em PDFs com a mesma facilidade que com entrada de texto direta.

Usage Instructions

Integrate Mistral Parse into the workflow. Can extract text from uploaded PDF documents, or from a URL.

Actions

mistral_parser

Input

ParameterTypeRequiredDescription
filefileYesNormalized UserFile from file upload or file reference

Output

ParameterTypeDescription
pagesarrayArray of page objects from Mistral OCR
indexnumberPage index (zero-based)
markdownstringExtracted markdown content
imagesarrayImages extracted from this page with bounding boxes
idstringImage identifier (e.g., img-0.jpeg)
top_left_xnumberTop-left X coordinate in pixels
top_left_ynumberTop-left Y coordinate in pixels
bottom_right_xnumberBottom-right X coordinate in pixels
bottom_right_ynumberBottom-right Y coordinate in pixels
image_base64stringBase64-encoded image data (when include_image_base64=true)
dimensionsobjectPage dimensions
dpinumberDots per inch
heightnumberPage height in pixels
widthnumberPage width in pixels
tablesarrayExtracted tables as HTML/markdown (when table_format is set). Referenced via placeholders like [tbl-0.html]
hyperlinksarrayArray of URL strings detected in the page (e.g., ["https://...", "mailto:..."])
headerstringPage header content (when extract_header=true)
footerstringPage footer content (when extract_footer=true)
modelstringMistral OCR model identifier (e.g., mistral-ocr-latest)
usage_infoobjectUsage and processing statistics
pages_processednumberTotal number of pages processed
doc_size_bytesnumberDocument file size in bytes
document_annotationstringStructured annotation data as JSON string (when applicable)

On this page