Aller au contenu principal

Analyser le document dans n8n

Que fait ce nœud ?

PDF4me Analyser le document exécute votre modèle d'analyse enregistré sur un PDF à l'intérieur d'un n8n Le flux de travail renvoie les champs extraits sous forme de données structurées. Il peut être alimenté avec des données binaires provenant d'un nœud précédent. Base64 chaîne de caractères, ou une chaîne publique URL, référencez le modèle par Analyser l'IDet acheminer le résultat JSON, XML, ou CSV directement dans Set, IF, HTTP Request ou toute fonction en aval n8n Le modèle contient la logique d'extraction ; ainsi, le même nœud extrait les factures, les contrats, les reçus et toute mise en page personnalisée que vous avez configurée.

Articles de blog connexes(1)

Avant d'exécuter ce nœud : créer un modèle d'analyse dans le PDF4me tableau de bord. Définissez vos touches de capture et sélectionnez Expression régulière pour des modèles stables ou JavaScript Expression pour la logique conditionnelle. n8n références de nœuds qui modèle par Analyser l'ID. Voir Préparer les informations d'analyse pour le document pour une configuration complète, exemples d'expressions régulières (INV-\d{6,10}, \d{2}/\d{2}/\d{4}), et deux travailleurs JavaScript Exemples de classificateur d'expressions.

Authentification de votre API Demande

Le PDF4me nœud dans n8n nécessite PDF4me API informations d'identificationCréez l'identifiant une seule fois dans n8n avec votre API clé du tableau de bord, puis référencez-la depuis chaque PDF4me nœud dans votre flux de travail.

Informations importantes à ne pas manquer

L'identifiant d'analyse est requis (il s'agit de votre TemplateId).
L'ID d'analyse est le GUID attribué par le tableau de bord lors de l'enregistrement des modifications sur un modèle. Copiez-le depuis le panneau de détails du modèle et collez-le dans le champ prévu à cet effet. n8n nœud. Sans lui, le nœud ne dispose d'aucune carte indiquant les champs à extraire.
Expressions régulières pour les motifs stables, JavaScript pour la logique conditionnelle
Capturez les clés en direct dans le modèle. Utilisez une expression régulière pour les numéros de facture, les dates, les montants et les numéros de TVA (environ 80 % des clés de production). JavaScript Expression avec le texte Variable pour la classification et les règles de repli.
Le résultat est constitué de données structurées, et non de données binaires. PDF
Contrairement aux nœuds Compress, Protect ou Convert qui renvoient des données brutes PDF octets, Parse Document renvoie JSON (défaut), XML, ou CSV Dans le champ binaire que vous nommez, connectez-le à des nœuds Set ou IF pour acheminer les valeurs en aval.
Configuration du nœud de document d'analyse dans n8n

Paramètres

ParamètreRequisCe que cela faitExemple
Input Data TypeYesHow the PDF reaches the node. Binary Data (from a prior node), Base64 String (inline encoded), or URL (public file URL).Binary Data
Input Binary FieldConditionalName of the binary field on the input item containing the PDF. Required when Input Data Type is Binary Data.data
Base64 PDF ContentConditionalBase64 encoded PDF content. Required when Input Data Type is Base64 String. No data: prefix.JVBERi0xLjQK...
PDF URLConditionalPublicly reachable URL of the PDF. Required when Input Data Type is URL. The PDF4me service downloads and processes it.https://example.com/invoice.pdf
Document NameYesSource filename including .pdf extension. Used for format detection and error tracing.invoice.pdf
Parse IDYesTemplateId GUID from the PDF4me dashboard. Identifies the parse template (capture keys + extraction rules) to apply.12345678-1234-1234-1234-123456789abc
Output FormatYesShape of the returned data. JSON (default, structured object), XML (hierarchical), or CSV (flat tabular). JSON is the right choice for almost every n8n workflow.JSON
Output Binary Field NameYesName of the binary field the node attaches the parsed output to on the output item. Reference it from downstream nodes.data
Custom ProfilesNoAdvanced JSON-style overrides for parsing behaviour (output sub-format, include metadata flag, etc). Leave empty for default behaviour.{ "outputDataFormat": "json", "includeMetadata": true }

Types d'expressions dans votre modèle d'analyse

Les règles de capture se trouvent dans le modèle, et non dans le n8n Les deux types d'expressions sont fournis avec chaque nœud. PDF4me compte.

Expression régulièreModèles stables
Numéros de facture (INV-\d{6,10}), dates (\d{2}/\d{2}/\d{4}), montants ($?\d{1,3}(?:,\d{3})*(?:.\d{2})?Environ 80 % des clés de production.
Expression JavaScriptLogique conditionnelle et classificateurs
Le texte de la zone de capture est transmis comme texte; renvoie une chaîne de caractères. Classification multi-marqueurs, règles de repli, normalisation des dates. Voir Préparer les informations d'analyse pour le document pour deux échantillons de travail.

Sortir

ChampTaperCe qu'il contient
fileNameStringGenerated output filename with timestamp and extension matching Output Format (.json / .xml / .csv).
mimeTypeStringMIME type of the output (application/json, application/xml, text/csv).
fileSizeNumberSize of the parsed output in bytes.
successBooleantrue on a successful parse, false otherwise. Wire into an IF node for branching.
messageStringStatus message. Document parsed successfully on the happy path, or a descriptive error.
docNameStringOriginal input filename, preserved for audit trails.

Les données clé/valeur analysées se trouvent dans le champ binaire que vous avez nommé. Nom du champ binaire de sortie.

Exemples de flux de travail

Modèles de flux de travail n8n courantsTypical ways to chain Parse Document into an n8n workflow.
Pièce jointe à l'e-mail vers Postgres
  1. Le déclencheur Gmail s'active sur les nouvelles factures étiquetées « facture fournisseur ».
  2. Le filtre ne laisse passer que les pièces jointes se terminant par .pdf.
  3. L'outil Analyse de document applique le modèle de facture à la pièce jointe binaire.
  4. Ensemble des cartes de nœuds analysées invoiceNumber, totalAmount, invoiceDate.
  5. Postgres Insert inscrit la ligne dans la table accounts_payable.
Classer et extraire dans un seul flux de travail
  1. Le webhook reçoit un PDF depuis un portail de téléchargement partenaire.
  2. Analyser le document exécute un modèle avec un JavaScript Clé d'expression renvoyant le type de document.
  3. Basculer les routes des nœuds sur le type renvoyé (facture / commande / reçu) vers des branches en aval spécifiques au type.
  4. Chaque branche envoie les champs analysés au système de destination approprié.
Analyse par lots des données de S3 vers Airtable
  1. Programmer des déclenchements toutes les 15 minutes.
  2. Liste S3 + Obtenir un objet charge chaque nouvel PDF dans le compartiment des entrées.
  3. L'outil Analyser le document applique le modèle à chaque élément binaire.
  4. La fonction Créer un enregistrement d'Airtable inscrit les champs analysés dans la base de suivi.

Foire aux questions

What is a Parse ID and where do I get it?+
Parse ID is the TemplateId GUID generated by the PDF4me dashboard when you click Save Changes on a parse template. Find it in the template detail panel. Pin it in your n8n node so the same template runs every execution.
Do I need a template, or can the node parse any PDF without one?+
A template is required for field-level extraction in n8n. Without a Parse ID the node has no map of which regions to capture. Build a template once in the dashboard, then reuse the same Parse ID across runs and across platforms (Make, Zapier, Power Automate).
How does the n8n node know what fields to extract?+
The capture keys live in the template, not in n8n. Each capture area gets a key name (camelCase) and an extraction rule: Regex Expression for stable patterns or JavaScript Expression for conditional logic. The output has one field per key.
Which Input Data Type should I pick?+
Binary Data for files arriving from upstream nodes (Read Binary Files, HTTP Request with response format File, Gmail attachment, Dropbox Download). Base64 String when the PDF is encoded inline. URL when the file lives at a public web address.
Can I extract data using JavaScript Expression in addition to regex?+
Yes. The capture area text is passed as the variable text inside your JavaScript Expression and you return a string. Use it for multi-marker classification, fallback rules, or date normalization. See the Prepare Parse Info for Document guide for two working classifier samples.
JSON, XML, or CSV. Which Output Format should I use?+
JSON for almost every n8n workflow. It maps cleanly into Set, IF, and HTTP Request nodes. XML when your downstream system requires it natively. CSV for spreadsheet uploads and bulk imports.
Is the output a file I can save, or just a JSON object?+
Both. The parsed data is attached to the binary field you set under Output Binary Field Name, so you can Write Binary File to disk, send it as an email attachment, or upload it to storage. The structured data is also available on the regular json output for downstream node mapping.

Actions connexes

Même tâche sur d'autres plateformes

Obtenez de l'aide