Pular para o conteúdo principal

Analisar documento em n8n

O que este nó faz

PDF4me Analisar documento executa seu modelo de análise salvo em um PDF dentro de um n8n fluxo de trabalho e retorna os campos extraídos como dados estruturados. Alimente-o com dados binários de um nó anterior, um Base64 string, ou um público URL, faça referência ao modelo por ID de análisee canalize o resultado JSON, XML, ou CSV diretamente em Set, IF, HTTP Request ou qualquer outro método subsequente. n8n O nó contém a lógica de extração, portanto, o mesmo nó extrai faturas, contratos, recibos e qualquer layout personalizado que você tenha configurado.

Artigos relacionados no blogue(1)

Antes de executar este nó: criar um modelo de análise no PDF4me painel. Defina suas teclas de captura e selecione Expressão regular para padrões estáveis ou JavaScript Expressão para lógica condicional. O n8n nós fazem referência a esse modelo por ID de análise. Ver Preparar informações de análise para o documento Para configuração completa, exemplos de Regex (INV-\d{6,10}, \d{2}/\d{2}/\d{4}), e dois trabalhando JavaScript Exemplos de classificadores de expressão.

Autenticando seu API Solicitar

O PDF4me nó em n8n requer PDF4me API credenciaisCrie a credencial uma única vez em n8n com o seu API A chave é obtida do painel de controle e, em seguida, referencie-a em todos os locais. PDF4me nó em seu fluxo de trabalho.

Fatos importantes que você não deve perder

O ID de análise é obrigatório (é o seu TemplateId).
O ID de análise é o GUID atribuído pelo painel de controle ao salvar as alterações em um modelo. Copie-o do painel de detalhes do modelo e cole-o no campo indicado. n8n nó. Sem ele, o nó não possui um mapa de quais campos extrair.
Expressões regulares para padrões estáveis, JavaScript para lógica condicional
As chaves de captura residem no modelo. Use expressões regulares para números de faturas, datas, valores e números de identificação fiscal (cerca de 80% das chaves de produção). JavaScript Expressão com o texto Variável para regras de classificação e de contingência.
A saída são dados estruturados, não binários. PDF
Ao contrário dos nós Compress, Protect ou Convert, que retornam dados brutos. PDF bytes, Analisar Documento retorna JSON (padrão), XML, ou CSV No campo binário que você nomear. Conecte-o a nós Set ou IF para encaminhar os valores para os nós seguintes.
Configuração do nó de análise de documento em n8n

Parâmetros

ParâmetroObrigatórioO que fazExemplo
Input Data TypeYesHow the PDF reaches the node. Binary Data (from a prior node), Base64 String (inline encoded), or URL (public file URL).Binary Data
Input Binary FieldConditionalName of the binary field on the input item containing the PDF. Required when Input Data Type is Binary Data.data
Base64 PDF ContentConditionalBase64 encoded PDF content. Required when Input Data Type is Base64 String. No data: prefix.JVBERi0xLjQK...
PDF URLConditionalPublicly reachable URL of the PDF. Required when Input Data Type is URL. The PDF4me service downloads and processes it.https://example.com/invoice.pdf
Document NameYesSource filename including .pdf extension. Used for format detection and error tracing.invoice.pdf
Parse IDYesTemplateId GUID from the PDF4me dashboard. Identifies the parse template (capture keys + extraction rules) to apply.12345678-1234-1234-1234-123456789abc
Output FormatYesShape of the returned data. JSON (default, structured object), XML (hierarchical), or CSV (flat tabular). JSON is the right choice for almost every n8n workflow.JSON
Output Binary Field NameYesName of the binary field the node attaches the parsed output to on the output item. Reference it from downstream nodes.data
Custom ProfilesNoAdvanced JSON-style overrides for parsing behaviour (output sub-format, include metadata flag, etc). Leave empty for default behaviour.{ "outputDataFormat": "json", "includeMetadata": true }

Tipos de expressão em seu modelo de análise

As regras de captura residem no modelo, não no... n8n nó. Ambos os tipos de expressão são fornecidos com cada PDF4me conta.

Expressão regularPadrões estáveis
Números de fatura (INV-\d{6,10}), datas (\d{2}/\d{2}/\d{4}), quantidades ($?\d{1,3}(?:,\d{3})*(?:.\d{2})?Cerca de 80% das chaves de produção.
Expressão JavaScriptLógica condicional e classificadores
O texto da área de captura é passado como textoRetorna uma string. Classificação com múltiplos marcadores, regras de fallback, normalização de datas. Veja Preparar informações de análise para o documento para duas amostras de trabalho.

Saída

CampoTipoO que contém
fileNameStringGenerated output filename with timestamp and extension matching Output Format (.json / .xml / .csv).
mimeTypeStringMIME type of the output (application/json, application/xml, text/csv).
fileSizeNumberSize of the parsed output in bytes.
successBooleantrue on a successful parse, false otherwise. Wire into an IF node for branching.
messageStringStatus message. Document parsed successfully on the happy path, or a descriptive error.
docNameStringOriginal input filename, preserved for audit trails.

Os dados de chave/valor analisados residem no campo binário que você especificou em Nome do campo binário de saída.

Exemplos de fluxo de trabalho

Padrões comuns de fluxo de trabalho n8nTypical ways to chain Parse Document into an n8n workflow.
Anexo de e-mail para Postgres
  1. O gatilho do Gmail é acionado em novas faturas com a etiqueta "fatura de fornecedor".
  2. O filtro permite apenas anexos com extensão .pdf.
  3. A função "Parse Document" executa o modelo de fatura com base no anexo binário.
  4. Conjunto de mapas de nós analisados invoiceNumber, totalAmount, invoiceDate.
  5. O comando Insert do Postgres grava a linha na tabela accounts_payable.
Classificar e extrair em um único fluxo de trabalho
  1. O webhook recebe um PDF de um portal de upload de parceiros.
  2. A função Parse Document executa um modelo com um JavaScript Chave de expressão que retorna o tipo de documento.
  3. Alterne as rotas dos nós com base no tipo retornado (fatura / pedido / recibo) para ramificações downstream específicas do tipo.
  4. Cada filial envia os campos analisados para o sistema de destino correto.
Análise em lote de dados do S3 para o Airtable
  1. Programe disparos de gatilho a cada 15 minutos.
  2. A lista S3 + Obter Objeto carrega cada novo PDF no bucket de entrada.
  3. A função Parse Document executa o modelo em cada item binário.
  4. A função Criar Registro do Airtable grava os campos analisados na base de rastreamento.

Perguntas frequentes

What is a Parse ID and where do I get it?+
Parse ID is the TemplateId GUID generated by the PDF4me dashboard when you click Save Changes on a parse template. Find it in the template detail panel. Pin it in your n8n node so the same template runs every execution.
Do I need a template, or can the node parse any PDF without one?+
A template is required for field-level extraction in n8n. Without a Parse ID the node has no map of which regions to capture. Build a template once in the dashboard, then reuse the same Parse ID across runs and across platforms (Make, Zapier, Power Automate).
How does the n8n node know what fields to extract?+
The capture keys live in the template, not in n8n. Each capture area gets a key name (camelCase) and an extraction rule: Regex Expression for stable patterns or JavaScript Expression for conditional logic. The output has one field per key.
Which Input Data Type should I pick?+
Binary Data for files arriving from upstream nodes (Read Binary Files, HTTP Request with response format File, Gmail attachment, Dropbox Download). Base64 String when the PDF is encoded inline. URL when the file lives at a public web address.
Can I extract data using JavaScript Expression in addition to regex?+
Yes. The capture area text is passed as the variable text inside your JavaScript Expression and you return a string. Use it for multi-marker classification, fallback rules, or date normalization. See the Prepare Parse Info for Document guide for two working classifier samples.
JSON, XML, or CSV. Which Output Format should I use?+
JSON for almost every n8n workflow. It maps cleanly into Set, IF, and HTTP Request nodes. XML when your downstream system requires it natively. CSV for spreadsheet uploads and bulk imports.
Is the output a file I can save, or just a JSON object?+
Both. The parsed data is attached to the binary field you set under Output Binary Field Name, so you can Write Binary File to disk, send it as an email attachment, or upload it to storage. The structured data is also available on the regular json output for downstream node mapping.

Ações relacionadas

A mesma tarefa em outras plataformas.

Obtenha ajuda