Passa al contenuto principale

Analizza il documento in n8n

Cosa fa questo nodo

PDF4me Analizza il documento esegue il tuo modello di analisi salvato rispetto a PDF all'interno di un n8n flusso di lavoro e restituisce i campi estratti come dati strutturati. Forniscigli dati binari da un nodo precedente, un Base64 stringa o un pubblico URL, fare riferimento al modello tramite Analizza IDe inviare tramite pipe il risultato JSON, XML, O CSV direttamente in Set, IF, Richiesta HTTP o qualsiasi flusso successivo n8n nodo. Il modello contiene la logica di estrazione, quindi lo stesso nodo estrae fatture, contratti, ricevute e qualsiasi layout personalizzato che hai configurato.

Articoli correlati del blog(1)

Prima di eseguire questo nodo: creare un modello di analisi nel PDF4me dashboard. Definisci i tasti di acquisizione e scegli Espressione regolare per modelli stabili o JavaScript Espressione per la logica condizionale. Il n8n nodi fanno riferimento a quel modello tramite Analizza ID. Vedere Prepara le informazioni di analisi per il documento per la configurazione completa, esempi di Regex (INV-\d{6,10}, \d{2}/\d{2}/\d{4}), e due lavoratori JavaScript Esempi di classificatori di espressioni.

Autenticazione del tuo API Richiesta

IL PDF4me nodo in n8n requisiti PDF4me API credenziali. Crea le credenziali una volta n8n con il tuo API chiave dalla dashboard, quindi farvi riferimento da ogni PDF4me nodo nel tuo flusso di lavoro.

Informazioni importanti da non perdere

È richiesto l'ID di analisi (corrisponde al tuo TemplateId).
L'ID di analisi è il GUID assegnato dalla dashboard in Salva modifiche su un modello. Copialo dal pannello dei dettagli del modello e incollalo nel n8n nodo. Senza di esso, il nodo non ha una mappa dei campi da estrarre.
Espressioni regolari per modelli stabili, JavaScript per la logica condizionale
Cattura le chiavi direttamente nel modello. Usa espressioni Regex per numeri di fattura, date, importi, codici fiscali (circa l'80% delle chiavi di produzione). JavaScript Espressione con il testo variabile per le regole di classificazione e di fallback.
L'output è costituito da dati strutturati, non da dati binari. PDF
A differenza dei nodi Compress, Protect o Convert che restituiscono dati grezzi PDF byte, il documento di analisi restituisce JSON (predefinito), XML, O CSV nel campo binario che hai nominato. Collegalo ai nodi Set o IF per instradare i valori a valle.
Configurazione del nodo di analisi del documento in n8n

Parametri

ParametroNecessarioCosa faEsempio
Input Data TypeYesHow the PDF reaches the node. Binary Data (from a prior node), Base64 String (inline encoded), or URL (public file URL).Binary Data
Input Binary FieldConditionalName of the binary field on the input item containing the PDF. Required when Input Data Type is Binary Data.data
Base64 PDF ContentConditionalBase64 encoded PDF content. Required when Input Data Type is Base64 String. No data: prefix.JVBERi0xLjQK...
PDF URLConditionalPublicly reachable URL of the PDF. Required when Input Data Type is URL. The PDF4me service downloads and processes it.https://example.com/invoice.pdf
Document NameYesSource filename including .pdf extension. Used for format detection and error tracing.invoice.pdf
Parse IDYesTemplateId GUID from the PDF4me dashboard. Identifies the parse template (capture keys + extraction rules) to apply.12345678-1234-1234-1234-123456789abc
Output FormatYesShape of the returned data. JSON (default, structured object), XML (hierarchical), or CSV (flat tabular). JSON is the right choice for almost every n8n workflow.JSON
Output Binary Field NameYesName of the binary field the node attaches the parsed output to on the output item. Reference it from downstream nodes.data
Custom ProfilesNoAdvanced JSON-style overrides for parsing behaviour (output sub-format, include metadata flag, etc). Leave empty for default behaviour.{ "outputDataFormat": "json", "includeMetadata": true }

Tipi di espressione nel tuo modello di analisi

Le regole di cattura risiedono nel modello, non nel n8n nodo. Entrambi i tipi di espressione vengono forniti con ogni PDF4me account.

Espressione regolareModelli stabili
Numeri di fattura (INV-\d{6,10}), date (\d{2}/\d{2}/\d{4}), importi ($?\d{1,3}(?:,\d{3})*(?:.\d{2})?Circa l'80% delle chiavi di produzione.
Espressione JavaScriptLogica condizionale e classificatori
Il testo dell'area di cattura viene passato come testo; restituisce una stringa. Classificazione multimarcatore, regole di fallback, normalizzazione della data. Vedi Prepara le informazioni di analisi per il documento per due campioni di lavoro.

Produzione

CampoTipoCosa contiene
fileNameStringGenerated output filename with timestamp and extension matching Output Format (.json / .xml / .csv).
mimeTypeStringMIME type of the output (application/json, application/xml, text/csv).
fileSizeNumberSize of the parsed output in bytes.
successBooleantrue on a successful parse, false otherwise. Wire into an IF node for branching.
messageStringStatus message. Document parsed successfully on the happy path, or a descriptive error.
docNameStringOriginal input filename, preserved for audit trails.

I dati chiave/valore analizzati risiedono nel campo binario che hai nominato in Nome del campo binario di output.

Esempi di flusso di lavoro

Modelli di flusso di lavoro comuni di n8nTypical ways to chain Parse Document into an n8n workflow.
Allegato e-mail a Postgres
  1. Il trigger di Gmail si attiva alla comparsa di nuove fatture denominate "vendor-invoice".
  2. Il filtro consente il passaggio solo degli allegati con estensione .pdf.
  3. La funzione "Parse Document" esegue il modello di fattura sul file allegato binario.
  4. Imposta le mappe dei nodi analizzate invoiceNumber, totalAmount, invoiceDate.
  5. Postgres Insert scrive la riga nella tabella accounts_payable.
Classificazione ed estrazione in un unico flusso di lavoro
  1. Il webhook riceve un PDF da un portale di caricamento partner.
  2. Analizza documento esegue un modello con un JavaScript Chiave espressione che restituisce il tipo di documento.
  3. Modifica i percorsi dei nodi sul tipo restituito (fattura/ordine/ricevuta) verso i rami a valle specifici del tipo.
  4. Ciascun ramo invia i campi analizzati al sistema di destinazione corretto.
Analisi batch da S3 ad Airtable
  1. Programmare l'attivazione del segnale ogni 15 minuti.
  2. Elenco S3 + Ottieni oggetto carica ogni nuovo PDF nel bucket in entrata.
  3. La funzione Parse Document esegue il modello su ciascun elemento binario.
  4. La funzione "Crea record" di Airtable scrive i campi analizzati nel database di tracciamento.

Domande frequenti

What is a Parse ID and where do I get it?+
Parse ID is the TemplateId GUID generated by the PDF4me dashboard when you click Save Changes on a parse template. Find it in the template detail panel. Pin it in your n8n node so the same template runs every execution.
Do I need a template, or can the node parse any PDF without one?+
A template is required for field-level extraction in n8n. Without a Parse ID the node has no map of which regions to capture. Build a template once in the dashboard, then reuse the same Parse ID across runs and across platforms (Make, Zapier, Power Automate).
How does the n8n node know what fields to extract?+
The capture keys live in the template, not in n8n. Each capture area gets a key name (camelCase) and an extraction rule: Regex Expression for stable patterns or JavaScript Expression for conditional logic. The output has one field per key.
Which Input Data Type should I pick?+
Binary Data for files arriving from upstream nodes (Read Binary Files, HTTP Request with response format File, Gmail attachment, Dropbox Download). Base64 String when the PDF is encoded inline. URL when the file lives at a public web address.
Can I extract data using JavaScript Expression in addition to regex?+
Yes. The capture area text is passed as the variable text inside your JavaScript Expression and you return a string. Use it for multi-marker classification, fallback rules, or date normalization. See the Prepare Parse Info for Document guide for two working classifier samples.
JSON, XML, or CSV. Which Output Format should I use?+
JSON for almost every n8n workflow. It maps cleanly into Set, IF, and HTTP Request nodes. XML when your downstream system requires it natively. CSV for spreadsheet uploads and bulk imports.
Is the output a file I can save, or just a JSON object?+
Both. The parsed data is attached to the binary field you set under Output Binary Field Name, so you can Write Binary File to disk, send it as an email attachment, or upload it to storage. The structured data is also available on the regular json output for downstream node mapping.

Azioni correlate

Stessa attività su altre piattaforme

Richiedi assistenza