Zum Hauptinhalt springen

Dokument parsen in n8n

Was dieser Knoten bewirkt

PDF4me Dokument analysieren Führt Ihre gespeicherte Parse-Vorlage gegen eine PDF innerhalb eines n8n Der Workflow gibt die extrahierten Felder als strukturierte Daten zurück. Er erhält Binärdaten von einem vorherigen Knoten. Base64 Zeichenkette oder öffentlich URL, beziehen Sie sich auf die Vorlage durch Parse-IDund leiten Sie das resultierende JSON, XML, oder CSV direkt in Set, IF, HTTP Request oder eine beliebige nachgelagerte Funktion n8n Der Knoten enthält die Extraktionslogik, sodass derselbe Knoten Rechnungen, Verträge, Quittungen und alle von Ihnen konfigurierten benutzerdefinierten Layouts extrahiert.

Verwandte Blog-Beiträge(1)

Bevor Sie diesen Knoten ausführen: Erstellen Sie eine Parse-Vorlage im PDF4me Dashboard. Definieren Sie Ihre Erfassungsschlüssel und wählen Sie aus Regex-Ausdruck für stabile Muster oder JavaScript Ausdruck für bedingte Logik. Die n8n Knotenverweise, die diese Vorlage verwenden Parse-ID. Sehen Parse-Informationen für Dokument vorbereiten Für die vollständige Einrichtung, Regex-Beispiele (INV-\d{6,10}, \d{2}/\d{2}/\d{4}), und zwei arbeitende JavaScript Beispiele für Ausdrucksklassifikatoren.

Authentifizierung Ihres API Anfrage

Der PDF4me Knoten in n8n erfordert PDF4me API ZugangsdatenErstellen Sie die Anmeldeinformationen einmalig in n8n mit Ihrem API Nehmen Sie den Schlüssel aus dem Dashboard und verweisen Sie dann von jedem darauf. PDF4me Knoten in Ihrem Workflow.

Wichtige Fakten, die Sie nicht verpassen sollten

Die Parse-ID ist erforderlich (es handelt sich um Ihre TemplateId).
Die Parse-ID ist die GUID, die vom Dashboard beim Speichern der Änderungen an einer Vorlage zugewiesen wird. Kopieren Sie sie aus dem Vorlagendetailbereich und fügen Sie sie in das Feld ein, in dem sie angezeigt wird. n8n Knoten. Ohne ihn hat der Knoten keine Zuordnung, welche Felder extrahiert werden sollen.
Reguläre Ausdrücke für stabile Muster, JavaScript für bedingte Logik
Die Erfassungsschlüssel sind in der Vorlage enthalten. Verwenden Sie reguläre Ausdrücke für Rechnungsnummern, Daten, Beträge und Steuer-IDs (ca. 80 % der Produktionsschlüssel). JavaScript Ausdruck mit dem Text Variable für Klassifizierungs- und Ausweichregeln.
Die Ausgabe sind strukturierte Daten, keine Binärdaten. PDF
Im Gegensatz zu den Knoten „Komprimieren“, „Schützen“ oder „Konvertieren“, die Rohdaten zurückgeben. PDF Bytes, Parse Document gibt Folgendes zurück JSON (Standard), XML, oder CSV im von Ihnen benannten Binärfeld. Verbinden Sie es mit Set- oder IF-Knoten, um die Werte weiterzuleiten.
Parse Document-Knotenkonfiguration in n8n

Parameter

ParameterErforderlichWas es tutBeispiel
Input Data TypeYesHow the PDF reaches the node. Binary Data (from a prior node), Base64 String (inline encoded), or URL (public file URL).Binary Data
Input Binary FieldConditionalName of the binary field on the input item containing the PDF. Required when Input Data Type is Binary Data.data
Base64 PDF ContentConditionalBase64 encoded PDF content. Required when Input Data Type is Base64 String. No data: prefix.JVBERi0xLjQK...
PDF URLConditionalPublicly reachable URL of the PDF. Required when Input Data Type is URL. The PDF4me service downloads and processes it.https://example.com/invoice.pdf
Document NameYesSource filename including .pdf extension. Used for format detection and error tracing.invoice.pdf
Parse IDYesTemplateId GUID from the PDF4me dashboard. Identifies the parse template (capture keys + extraction rules) to apply.12345678-1234-1234-1234-123456789abc
Output FormatYesShape of the returned data. JSON (default, structured object), XML (hierarchical), or CSV (flat tabular). JSON is the right choice for almost every n8n workflow.JSON
Output Binary Field NameYesName of the binary field the node attaches the parsed output to on the output item. Reference it from downstream nodes.data
Custom ProfilesNoAdvanced JSON-style overrides for parsing behaviour (output sub-format, include metadata flag, etc). Leave empty for default behaviour.{ "outputDataFormat": "json", "includeMetadata": true }

Ausdruckstypen in Ihrer Parsevorlage

Die Erfassungsregeln befinden sich in der Vorlage, nicht in der Datei. n8n Knoten. Beide Ausdruckstypen werden mit jedem Knoten ausgeliefert. PDF4me Konto.

Regex-AusdruckStabile Muster
Rechnungsnummern (INV-\d{6,10}), Daten (\d{2}/\d{2}/\d{4}), Beträge ($?\d{1,3}(?:,\d{3})*(?:.\d{2})?Rund 80 % der Produktionsschlüssel.
JavaScript-AusdruckBedingte Logik und Klassifikatoren
Der Text des Erfassungsbereichs wird übergeben als TextGibt eine Zeichenkette zurück. Klassifizierung mehrerer Marker, Ausweichregeln, Datumsnormalisierung. Siehe Parse-Informationen für Dokument vorbereiten für zwei Arbeitsmuster.

Ausgabe

FeldTypWas es enthält
fileNameStringGenerated output filename with timestamp and extension matching Output Format (.json / .xml / .csv).
mimeTypeStringMIME type of the output (application/json, application/xml, text/csv).
fileSizeNumberSize of the parsed output in bytes.
successBooleantrue on a successful parse, false otherwise. Wire into an IF node for branching.
messageStringStatus message. Document parsed successfully on the happy path, or a descriptive error.
docNameStringOriginal input filename, preserved for audit trails.

Die geparsten Schlüssel/Wert-Daten selbst befinden sich in dem von Ihnen benannten Binärfeld. Name des binären AusgabefeldsDie

Workflow-Beispiele

Gängige n8n-Workflow-MusterTypical ways to chain Parse Document into an n8n workflow.
E-Mail-Anhang an Postgres
  1. Der Gmail-Trigger wird bei neuen Rechnungen mit der Bezeichnung „Lieferantenrechnung“ ausgelöst.
  2. Der Filter lässt nur Anhänge mit der Endung .pdf durch.
  3. Parse Document wendet die Rechnungsvorlage auf den binären Anhang an.
  4. Knotenzuordnungen analysiert invoiceNumber, totalAmount, invoiceDateDie
  5. Postgres Insert schreibt die Zeile in die Tabelle accounts_payable.
Klassifizieren und extrahieren in einem Arbeitsablauf
  1. Der Webhook empfängt eine PDF von einem Partner-Upload-Portal.
  2. Parse Document führt eine Vorlage mit einem JavaScript Der Ausdrucksschlüssel gibt den Dokumenttyp zurück.
  3. Routen der Knoten werden anhand des zurückgegebenen Typs (Rechnung / Bestellung / Quittung) zu typspezifischen nachgelagerten Zweigen umgeleitet.
  4. Jeder Zweig sendet die analysierten Felder an das richtige Zielsystem.
Batch-Parsing von S3 nach Airtable
  1. Der Zeitplan-Trigger wird alle 15 Minuten ausgelöst.
  2. S3 List + Get Object lädt jedes neue PDF im Eingangs-Bucket.
  3. Parse Document wendet die Vorlage auf jedes Binärelement an.
  4. Airtable Create Record schreibt die analysierten Felder in die Tracking-Datenbank.

Häufig gestellte Fragen

What is a Parse ID and where do I get it?+
Parse ID is the TemplateId GUID generated by the PDF4me dashboard when you click Save Changes on a parse template. Find it in the template detail panel. Pin it in your n8n node so the same template runs every execution.
Do I need a template, or can the node parse any PDF without one?+
A template is required for field-level extraction in n8n. Without a Parse ID the node has no map of which regions to capture. Build a template once in the dashboard, then reuse the same Parse ID across runs and across platforms (Make, Zapier, Power Automate).
How does the n8n node know what fields to extract?+
The capture keys live in the template, not in n8n. Each capture area gets a key name (camelCase) and an extraction rule: Regex Expression for stable patterns or JavaScript Expression for conditional logic. The output has one field per key.
Which Input Data Type should I pick?+
Binary Data for files arriving from upstream nodes (Read Binary Files, HTTP Request with response format File, Gmail attachment, Dropbox Download). Base64 String when the PDF is encoded inline. URL when the file lives at a public web address.
Can I extract data using JavaScript Expression in addition to regex?+
Yes. The capture area text is passed as the variable text inside your JavaScript Expression and you return a string. Use it for multi-marker classification, fallback rules, or date normalization. See the Prepare Parse Info for Document guide for two working classifier samples.
JSON, XML, or CSV. Which Output Format should I use?+
JSON for almost every n8n workflow. It maps cleanly into Set, IF, and HTTP Request nodes. XML when your downstream system requires it natively. CSV for spreadsheet uploads and bulk imports.
Is the output a file I can save, or just a JSON object?+
Both. The parsed data is attached to the binary field you set under Output Binary Field Name, so you can Write Binary File to disk, send it as an email attachment, or upload it to storage. The structured data is also available on the regular json output for downstream node mapping.

Ähnliche Aktionen

Dieselbe Aufgabe auf anderen Plattformen

Hilfe erhalten