Passa al contenuto principale

Estrai i dati del modulo da PDF In n8n

Estrai i dati del modulo da PDF è un PDF4me azione del nodo in n8n che legge i valori inseriti da un campo compilabile PDF e li restituisce come strutturati formData JSON oggetto. Usalo per restituire i moduli di domanda, i fogli di ammissione firmati o i sondaggi PDFs in righe di database senza che nessuno dovesse riscrivere le risposte.

Cosa fa questo nodo

PDF4me: Estrai i dati del modulo da PDF richiede un modulo compilabile PDF da Binary Data, un Base64 String, o un URL, legge il suo livello di modulo interattivo e restituisce ogni campo come una coppia nome-valore all'interno di un singolo formData oggetto. Input di testo, caselle di controllo, pulsanti di opzione e selezioni a discesa vengono tutti riuniti, pronti per essere mappati su una riga del foglio di calcolo, un CRM record o un ramo condizionale nel flusso di lavoro.

Articoli correlati del blog(1)

Autenticazione del tuo API Richiesta

Ogni PDF4me nodo in n8n richiede un valido Credenziali per connettersi con. Crea o selezionane uno che contenga il tuo PDF4me API chiave affinché il flusso di lavoro possa autenticare in modo sicuro le richieste di estrazione.

Informazioni importanti da non perdere

IL PDF devono avere campi in forma reale
Questo nodo legge il livello interattivo AcroForm. Una pagina scansionata o un'immagine appiattita PDF non ha più oggetti di campo da leggere, quindi li instrada a un OCR O AI nodo di analisi invece.
Nell'output compaiono ancora dei campi vuoti.
Un campo non compilato restituisce una stringa vuota anziché essere omesso, quindi è consigliabile verificare la presenza di valori vuoti a valle invece di presumere che la chiave sia mancante.
I nomi dei campi provengono dall'autore del modulo
Le chiavi corrispondono a qualsiasi cosa PDF Il progettista ha assegnato un nome a ciascun campo e le caselle di controllo restituiscono il loro valore di esportazione anziché un valore garantito vero o falso. Esegui prima un file di esempio e controlla l'output reale.
Il nodo PDF4me in n8n è impostato su Azione Estrai dati modulo da PDF, Tipo di dati di input Dati binari, Campo binario di input dati, Nome documento document.pdf e Profili personalizzati in Opzioni avanzate

PDF4me Estrai i dati del modulo da PDF pannello dei parametri in n8n

Estrazione di dati da moduli vs. estrazione di testo semplice

Entrambi gli approcci estraggono il contenuto da un PDFma solo uno ti fornisce campi denominati. La distinzione determina quale nodo appartiene al tuo flusso di lavoro.

ApproccioCiò che ricevi indietroMigliore vestibilità
Extract Form Data From PDFNamed field and value pairs from the interactive form layerGenuine fillable PDFs where every answer already sits in a named field
Plain text extractionThe visible page content as one flat string, with no field namesStatic PDFs with no form layer, where you will parse the text yourself
AI document parsingModel-inferred fields from any layout, including scansScanned, flattened, or wildly inconsistent documents with no usable form structure

Quali parametri estrae i dati del modulo da PDF Bisogno?

Necessario: Azione, Tipo di dati di input, il campo corrispondente a tale tipo di input e Nome del documento. I profili personalizzati in Opzioni avanzate sono facoltativi.

ParametroNecessarioCosa faEsempio
ActionRequiredSelects the PDF4me node action to run. Choose Extract Form Data From PDF.Extract Form Data From PDF
Input Data TypeRequiredFormat of the source PDF input. Choose Binary Data (from a previous node), Base64 String, or URL.Binary Data
Input Binary FieldConditionalName of the binary property on the incoming n8n item that holds the filled PDF. Required when Input Data Type is Binary Data. Defaults to data.data
Base64 Document ContentConditionalBase64-encoded content of the filled PDF. Required when Input Data Type is Base64 String.JVBERi0xLjQK...
File URLConditionalPublicly reachable HTTPS URL to the filled PDF. Required when Input Data Type is URL.https://example.com/application_form.pdf
Document NameRequiredFilename of the source PDF, used for reference and tracking in the extraction request. Include the .pdf extension.application_form.pdf
Custom ProfilesOptionalAdvanced Options field for extra processing settings, supplied in a JSON-like format. Leave blank unless you have a specific profile to apply.{ 'outputDataFormat': 'json' }

Campi di output

Una corsa di successo restituisce uno n8n elemento che contiene i valori del modulo estratto come JSON.

CampoTipoCosa contiene
formDataObjectEvery form field read from the PDF, as a set of field name and field value pairs.
formData.<fieldName>StringThe name of an individual field exactly as the PDF author defined it, for example name, email, or country.
formData.<fieldValue>String, Number, or BooleanThe value entered or selected for that field. Blank fields return an empty string, and checkboxes return their export value.

Il corpo di una risposta tipica si presenta così:

{
"formData": {
"name": "PDF4me",
"email": "",
"country": "USA"
}
}

Come si imposta l'estrazione dei dati del modulo da PDF In n8n?

  1. Aggiungere PDF4me al tuo n8n flusso di lavoro e scegliere il Estrai i dati del modulo da PDF azione.
  2. In Credenziali per connettersi con, seleziona il tuo PDF4me credenziali o clicca Crea nuove credenziali e incolla il tuo API chiave.
  3. Impostato Tipo di dati di input A Dati binari (predefinito), Base64 String, O URL e fornire il corrispondente compilato PDF campo.
  4. Impostato Nome reale al nome del file sorgente, ad esempio application_form.pdf.
  5. Partire Profili personalizzati Sotto Opzioni avanzate Lasciare vuoto a meno che non sia necessario un profilo di elaborazione specifico.
  6. Esegui il nodo, quindi mappa i valori dal risultato formData oggetto nel passaggio successivo del flusso di lavoro.

Configurazioni tipiche

Esempi di flusso di lavoroCommon n8n workflow patterns using Extract Form Data From PDF.
Moduli di domanda inviati via e-mail a un foglio di calcolo
  1. Un trigger e-mail si attiva quando una domanda completata PDF obiettivi.
  2. Estrai i dati del modulo da PDF Legge l'allegato e lo memorizza in un oggetto formData.
  3. Un foglio Google o Excel Il nodo aggiunge una riga, mappando ciascun nome di campo a una colonna.
CRM Generazione di lead dai moduli di acquisizione
  1. Un trigger di archiviazione cloud si attiva al momento del caricamento di un nuovo elemento. PDF.
  2. Estrai i dati del modulo da PDF Estrae i dettagli di contatto dal livello del modulo.
  3. UN CRM Il nodo crea o aggiorna il record utilizzando i valori estratti relativi a nome, email e azienda.
Instradamento dell'approvazione condizionata
  1. Un webhook riceve un modulo di richiesta firmato da un portale esterno.
  2. Estrai i dati del modulo da PDF Restituisce l'importo e i campi relativi al dipartimento richiesti.
  3. Un nodo IF si dirama verso l'approvatore corretto in base a tali valori.
Digitalizzazione in batch di un archivio
  1. Un nodo Loop Over Items itera un elenco di moduli archiviati URLs.
  2. Estrai i dati del modulo da PDF esegue con il tipo di dati di input impostato su URL per ogni file.
  3. Ogni oggetto formData viene scritto in una tabella del database indicizzata dal nome del documento di origine.

Consigli pratici

Run one sample file before you map anything
Field names and checkbox export values are set by whoever designed the form, so inspect the real formData output first instead of guessing the key names.
Test for empty strings, not missing keys
Unfilled fields are still present in the output with an empty value, so a simple key existence check will not tell you whether the user answered.
Check the PDF is not flattened
A form that looks fillable in a viewer may have been flattened on save, which strips the field layer. If formData comes back empty, that is usually why.
Send scans to an AI parser instead
Scanned paper forms have no interactive fields at all. Route those to Parse Document rather than expecting this node to read them.
Keep Document Name meaningful
It is used for reference and tracking on the request, so passing the real source filename makes execution logs far easier to audit later.
Validate before writing to a system of record
Add a check on required fields after extraction so an incomplete submission is flagged rather than silently creating a half-empty CRM record.

Foglio riassuntivo

CampoValore
ActionExtract Form Data From PDF
Input Data TypeBinary Data
Input Binary Fielddata
Document Namedocument.pdf
Custom Profiles{ 'outputDataFormat': 'json' }
CredentialsPDF4me API credential
ReturnsformData object of field name and value pairs

Domande frequenti

Does Extract Form Data From PDF work on a scanned or flattened PDF?+
No. This node reads values from real interactive form fields, the AcroForm layer described in the ISO 32000 PDF specification. A scanned page is just an image, and a flattened PDF has had its fields painted into static content, so in both cases there are no field objects left to read. For those files use an OCR or AI parsing node instead, such as Parse Document.
What do empty form fields return?+
A field the user left blank still appears in the formData object, with an empty string as its value. The key set reflects the fields defined in the PDF, not only the ones that were filled in, so downstream nodes should test for empty values rather than assume a missing key.
How are checkboxes and radio buttons returned?+
Checkbox and radio button fields return their underlying export value as defined in the PDF, not always a literal true or false. Common values include Yes, Off, or a named choice set by whoever built the form. Run the node once on a sample filled PDF and inspect the actual output before writing comparison logic against it.
Can I send extracted PDF form data straight to Excel or a database?+
Yes. The formData object is standard JSON, so any node that accepts item fields can consume it. Map formData keys onto columns in a spreadsheet, database, or CRM node placed after the PDF4me node, using the standard n8n data mapping approach.
What is the difference between extracting form data and extracting text from a PDF?+
Extracting form data reads named field values from the interactive form layer, so you get reliable key and value pairs such as email mapped to its entered address. Extracting text returns the visible page content as a flat string with no field names attached, leaving you to parse it. Prefer form data extraction whenever the PDF is a genuine fillable form.

Azioni correlate

Stessa attività su altre piattaforme

Richiedi assistenza