Aller au contenu principal

Extraire les données du formulaire PDF dans n8n

Extraire les données du formulaire PDF est un PDF4me action de nœud dans n8n qui lit les valeurs saisies dans un champ remplissable PDF et les renvoie sous forme structurée formData JSON objet. Utilisez-le pour transformer les formulaires de demande retournés, les feuilles d'admission signées ou les enquêtes. PDFs dans les lignes de la base de données sans que personne n'ait à ressaisir les réponses.

Que fait ce nœud ?

PDF4meExtraire les données du formulaire PDF prend un formulaire remplissable PDF à partir de données binaires, un Base64 String, ou un URL, lit sa couche de formulaire interactive et renvoie chaque champ sous forme de paire nom-valeur dans un seul formData objet. Les champs de texte, les cases à cocher, les boutons radio et les listes déroulantes sont tous réunis, prêts à être mappés sur une ligne de feuille de calcul, un CRM enregistrement, ou branche conditionnelle dans le flux de travail.

Articles de blog connexes(1)

Authentification de votre API Demande

Chaque PDF4me nœud dans n8n nécessite un numéro valide Identifiant pour se connecter avecCréez ou sélectionnez-en un qui contient votre PDF4me API clé permettant au flux de travail d'authentifier les demandes d'extraction de manière sécurisée.

Informations importantes à ne pas manquer

Le PDF doivent comporter de vrais champs de formulaire
Ce nœud lit la couche interactive AcroForm. Une page numérisée ou une page aplatie PDF n'a plus d'objets de champ à lire, donc redirigez-les vers un OCR ou AI analyser le nœud à la place.
Des champs vides apparaissent toujours dans le résultat.
Un champ non rempli renvoie une chaîne vide au lieu d'être omis ; il faut donc vérifier les valeurs vides en aval au lieu de supposer que la clé est manquante.
Les noms des champs proviennent de l'auteur du formulaire.
Les clés correspondent à n'importe quel PDF Le concepteur a nommé chaque champ, et les cases à cocher renvoient leur valeur d'exportation plutôt qu'une réponse binaire (vrai ou faux). Commencez par exécuter un fichier d'exemple et examinez le résultat.
Dans n8n, le nœud PDF4me est configuré sur « Extraire les données d'un formulaire PDF », avec le type de données d'entrée « Données binaires », le champ binaire « data », le nom du document « document.pdf » et des profils personnalisés dans les options avancées.

PDF4me Extraire les données du formulaire PDF panneau des paramètres dans n8n

Extraction de données de formulaire vs extraction de texte brut

Les deux approches extraient du contenu d'un PDFMais une seule vous fournit des champs nommés. Cette distinction détermine quel nœud doit être inclus dans votre flux de travail.

ApprocheCe que vous récupérezMeilleure adaptation
Extract Form Data From PDFNamed field and value pairs from the interactive form layerGenuine fillable PDFs where every answer already sits in a named field
Plain text extractionThe visible page content as one flat string, with no field namesStatic PDFs with no form layer, where you will parse the text yourself
AI document parsingModel-inferred fields from any layout, including scansScanned, flattened, or wildly inconsistent documents with no usable form structure

Quels paramètres permettent d'extraire les données du formulaire ? PDF Besoin?

Requis: Action, type de données d'entrée, champ correspondant à ce type d'entrée et nom du document. Les profils personnalisés dans les options avancées sont facultatifs.

ParamètreRequisCe que cela faitExemple
ActionRequiredSelects the PDF4me node action to run. Choose Extract Form Data From PDF.Extract Form Data From PDF
Input Data TypeRequiredFormat of the source PDF input. Choose Binary Data (from a previous node), Base64 String, or URL.Binary Data
Input Binary FieldConditionalName of the binary property on the incoming n8n item that holds the filled PDF. Required when Input Data Type is Binary Data. Defaults to data.data
Base64 Document ContentConditionalBase64-encoded content of the filled PDF. Required when Input Data Type is Base64 String.JVBERi0xLjQK...
File URLConditionalPublicly reachable HTTPS URL to the filled PDF. Required when Input Data Type is URL.https://example.com/application_form.pdf
Document NameRequiredFilename of the source PDF, used for reference and tracking in the extraction request. Include the .pdf extension.application_form.pdf
Custom ProfilesOptionalAdvanced Options field for extra processing settings, supplied in a JSON-like format. Leave blank unless you have a specific profile to apply.{ 'outputDataFormat': 'json' }

Champs de sortie

Une course réussie rapporte un n8n élément contenant les valeurs de formulaire extraites comme JSON.

ChampTaperCe qu'il contient
formDataObjectEvery form field read from the PDF, as a set of field name and field value pairs.
formData.<fieldName>StringThe name of an individual field exactly as the PDF author defined it, for example name, email, or country.
formData.<fieldValue>String, Number, or BooleanThe value entered or selected for that field. Blank fields return an empty string, and checkboxes return their export value.

Voici à quoi ressemble un exemple de corps de réponse :

{
"formData": {
"name": "PDF4me",
"email": "",
"country": "USA"
}
}

Comment configurer l'extraction des données de formulaire à partir de PDF dans n8n?

  1. Ajouter PDF4me à votre n8n flux de travail et choisissez le Extraire les données du formulaire PDF action.
  2. Dans Identifiant pour se connecter avec, sélectionnez votre PDF4me identifiant ou cliquez Créer un nouveau compte et collez votre API clé.
  3. Ensemble Type de données d'entrée à Données binaires (défaut), Base64 String, ou URL et fournir le formulaire rempli correspondant PDF champ.
  4. Ensemble Nom du document au nom du fichier source, par exemple application_form.pdf.
  5. Partir Profils personnalisés sous Options avancées Laisser vide sauf si vous avez besoin d'un profil de traitement spécifique.
  6. Exécutez le nœud, puis mappez les valeurs renvoyées. formData Intégrez cet objet à l'étape suivante de votre flux de travail.

Configurations typiques

Exemples de flux de travailCommon n8n workflow patterns using Extract Form Data From PDF.
Formulaires de candidature envoyés par courriel à une feuille de calcul
  1. Un e-mail est déclenché lorsqu'une demande est complétée. PDF arrive.
  2. Extraire les données du formulaire PDF lit la pièce jointe dans un objet formData.
  3. Une feuille Google ou Excel Le nœud ajoute une ligne, associant chaque nom de champ à une colonne.
CRM Création de prospects à partir des formulaires d'admission
  1. Un déclencheur de stockage cloud s'active lors de l'ajout d'une nouvelle donnée téléchargée. PDF.
  2. Extraire les données du formulaire PDF extrait les coordonnées du formulaire.
  3. UN CRM Le nœud crée ou met à jour l'enregistrement en utilisant les valeurs extraites du nom, de l'adresse électronique et de l'entreprise.
Routage d'approbation conditionnelle
  1. Un webhook reçoit un formulaire de requête signé provenant d'un portail externe.
  2. Extraire les données du formulaire PDF renvoie le montant et les champs de département demandés.
  3. Un nœud IF se dirige vers l'approbateur approprié en fonction de ces valeurs.
Numérisation par lots d'archives
  1. Un nœud de boucle sur les éléments parcourt une liste de formulaires archivés URLs.
  2. Extraire les données du formulaire PDF s'exécute avec le type de données d'entrée défini sur URL pour chaque fichier.
  3. Chaque objet formData est enregistré dans une table de base de données indexée par le nom du document source.

Conseils pratiques

Run one sample file before you map anything
Field names and checkbox export values are set by whoever designed the form, so inspect the real formData output first instead of guessing the key names.
Test for empty strings, not missing keys
Unfilled fields are still present in the output with an empty value, so a simple key existence check will not tell you whether the user answered.
Check the PDF is not flattened
A form that looks fillable in a viewer may have been flattened on save, which strips the field layer. If formData comes back empty, that is usually why.
Send scans to an AI parser instead
Scanned paper forms have no interactive fields at all. Route those to Parse Document rather than expecting this node to read them.
Keep Document Name meaningful
It is used for reference and tracking on the request, so passing the real source filename makes execution logs far easier to audit later.
Validate before writing to a system of record
Add a check on required fields after extraction so an incomplete submission is flagged rather than silently creating a half-empty CRM record.

Aide-mémoire

ChampValeur
ActionExtract Form Data From PDF
Input Data TypeBinary Data
Input Binary Fielddata
Document Namedocument.pdf
Custom Profiles{ 'outputDataFormat': 'json' }
CredentialsPDF4me API credential
ReturnsformData object of field name and value pairs

Questions fréquentes

Does Extract Form Data From PDF work on a scanned or flattened PDF?+
No. This node reads values from real interactive form fields, the AcroForm layer described in the ISO 32000 PDF specification. A scanned page is just an image, and a flattened PDF has had its fields painted into static content, so in both cases there are no field objects left to read. For those files use an OCR or AI parsing node instead, such as Parse Document.
What do empty form fields return?+
A field the user left blank still appears in the formData object, with an empty string as its value. The key set reflects the fields defined in the PDF, not only the ones that were filled in, so downstream nodes should test for empty values rather than assume a missing key.
How are checkboxes and radio buttons returned?+
Checkbox and radio button fields return their underlying export value as defined in the PDF, not always a literal true or false. Common values include Yes, Off, or a named choice set by whoever built the form. Run the node once on a sample filled PDF and inspect the actual output before writing comparison logic against it.
Can I send extracted PDF form data straight to Excel or a database?+
Yes. The formData object is standard JSON, so any node that accepts item fields can consume it. Map formData keys onto columns in a spreadsheet, database, or CRM node placed after the PDF4me node, using the standard n8n data mapping approach.
What is the difference between extracting form data and extracting text from a PDF?+
Extracting form data reads named field values from the interactive form layer, so you get reliable key and value pairs such as email mapped to its entered address. Extracting text returns the visible page content as a flat string with no field names attached, leaving you to parse it. Prefer form data extraction whenever the PDF is a genuine fillable form.

Actions connexes

Même tâche sur d'autres plateformes

Obtenez de l'aide