Zum Hauptinhalt springen

Parse-Informationen für Dokument vorbereiten

Was dieser Leitfaden umfasst

Parse-Informationen vorbereiten ist die Dashboard-Konfiguration, die ein Rohdaten-Datenpaket umwandelt. PDF hinein automatisiert PDF DatenextraktionSie definieren Erfassungsschlüssel, zeichnen Zonen auf einem Beispieldokument und weisen jedem Schlüssel eine Extraktionsregel zu, indem Sie entweder Regex-Ausdruck für stabile Muster oder JavaScript Ausdruck für bedingte Logik. Nach dem Speichern wird dieselbe Vorlage von dort ausgeführt. REST API, Make, Zapier, Power Automate, Und n8n indem er sich auf seine TemplateIdDie

Verwandte Blog-Beiträge
Zu dieser Funktion gibt es noch keinen Blogbeitrag – folgt in Kürze.
Schauen Sie sich in der Zwischenzeit im PDF4me-Blog Tutorials und Arbeitsabläufe für alle Plattformen an.
Besuchen Sie den Blog

Authentifizierung Ihrer Einrichtung

Die Erstellung der Parse-Vorlage erfolgt in der PDF4me Entwickler-Dashboard. Melden Sie sich mit Ihrem Konto an und erstellen oder kopieren Sie anschließend ein API Schlüssel für das Parse-Dokument API Aufrufe, die die hier erstellte Vorlage verwenden.

Wichtige Fakten, die Sie nicht verpassen sollten

Regulärer Ausdruck zuerst, JavaScript nur dort, wo es erforderlich ist
Verwenden Regex-Ausdruck für jedes Feld mit einer festen Form (Rechnungsnummer, Datum, Gesamtbetrag, Steuer-ID). Verwenden Sie JavaScript Ausdruck Nur wenn Sie bedingte Logik, Verzweigungen mit mehreren Regeln oder eine Dokumentenklassifizierung benötigen. Die Kombination beider Elemente in derselben Vorlage ist zulässig und empfehlenswert.
Eine Vorlage pro Stalllayoutfamilie
Eine einzige Vorlage verarbeitet kleinere Abweichungen wie Schriftartänderungen oder Positionsverschiebungen. Bei grundlegend unterschiedlichen Layouts (z. B. zwei Lieferanten mit unterschiedlichen Rechnungsdesigns) erstellen Sie separate Vorlagen und leiten die Dateien vor dem Aufruf von „Dokument analysieren“ anhand des Klassifikators oder des Quellsystems an die richtige Vorlage weiter.
Rettet die TemplateIdnicht der Name
Nach dem Speichern der Änderungen generiert das Dashboard eine GUID. TemplateId für die Vorlage. Immer bestehen TemplateId in Produktion API Anrufe. TemplateName Das funktioniert auch, aber das Umbenennen der Vorlage führt dazu, dass jegliche Automatisierung, die über ihren Namen darauf verweist, nicht mehr funktioniert.

Schritt 1: Erstellen der Parse-Vorlage

  1. Öffne die Parse Document DashboardDie
  2. Klicken Hinzufügen und geben Sie einen eindeutigen Vorlagennamen ein (zum Beispiel, invoice oder vendor-statement).
  3. Klicken Speichern um die leere Vorlage zu erstellen.
  4. Öffnen Sie die Vorlage in Bearbeiten Modus zum Starten der Konfiguration von Aufnahmeschlüsseln.
Die PDF4me-Dokumentenanalyse-Vorlagenliste im Entwickler-Dashboard enthält die Schaltfläche „Hinzufügen“, um eine neue Analysevorlage für die automatisierte PDF-Datenextraktion zu erstellen.

Schritt 2: Beispiel hochladen und Erfassungsschlüssel konfigurieren

Das Dashboard rendert ein hochgeladenes PDF auf der rechten Seite und zeigt die Parse-Informationen Formular auf der linken Seite. Verwenden Sie reale, produktionsnahe Muster, keine synthetischen Testdateien, damit die Erfassungsbereiche dem entsprechen, was Sie im Live-Verkehr sehen werden.

  1. Klicken Vorlagendatei hochladen und wählen Sie ein repräsentatives Beispiel (Rechnung, Vertrag, Formular).
  2. Unter Schlüssel, klicken + Um einen Erfassungsschlüssel hinzuzufügen, geben Sie ihm einen Namen in CamelCase: invoiceNumber, customerName, totalAmountDie
  3. Wählen Wählen Sie den Ausdruckstyp aus. zum Schlüssel: Javascript Expression oder Regex ExpressionDie
  4. Fügen Sie den Ausdruckstext in das angezeigte Feld ein.
  5. Satz Seiten Zu all alle Seiten oder eine bestimmte Seitenzahl scannen (1, 2usw.), um den Umfang einzugrenzen.
  6. Umschalten Ganze Seite durchsuchen Diese Option wird aktiviert, wenn sich der Wert nicht an einer festen Position befindet. Ist sie deaktiviert, wird nur der gezeichnete Erfassungsbereich durchsucht.
PDF4me-Benutzeroberfläche zur Konfiguration des Analysedokuments. Im linken Bereich werden Analyseinformationen mit dem Vorlagennamen „Rechnung“, der Analyse-ID und einem Schlüsselnamen angezeigt. Dieser enthält die Optionen „Ausdruckstyp auswählen“ (JavaScript-Ausdruck), „JavaScript-Ausdruckstext“, „Alle Seiten“ und „Gesamte Seite durchsuchen“. Im rechten Bereich wird die hochgeladene Rechnungs-PDF-Datei gerendert. Die Aktionsschaltflächen „Vorlagendatei hochladen“, „Analyse testen“ und „Änderungen speichern“ befinden sich oben (von links nach rechts) in der Reihenfolge ihrer Ausführung.

Einrichtungsbildschirm für das Parse-Dokument. Links: Formular „Parse-Informationen“ mit Schlüsseln und Ausdruckstyp. Rechts: Hochgeladenes Beispiel. PDFDie Aktionsschaltflächen sind von links nach rechts angeordnet: Vorlagendatei hochladen, Testanalyse, Änderungen speichern.

Schritt 3: Wählen Sie den Ausdruckstyp pro Schlüssel aus

AusdruckstypAm besten geeignet fürTypische VerwendungKomplexität
Regex ExpressionFixed text patternsInvoice number, dates, totals, tax IDs, postal codesLow
JavaScript ExpressionConditional and multi-rule extractionDocument classification, fallback logic, rule orchestrationMedium to High

Regex-Ausdrucksmuster (Grundlagen des Regex-PDF-Parsers)

Verwenden Regex-Ausdruck Wenn das Spielfeld eine stabile, vorhersehbare Form aufweist, wird der erfasste Bereich für das erste Spiel abgetastet.

INV-\d{6,10}
\d{2}/\d{2}/\d{4}
\$?\d{1,3}(?:,\d{3})*(?:\.\d{2})?

Gängige Tastenkombinationen für eine Rechnung:

  • invoiceNumberINV-\d{6,10}
  • invoiceDate\d{2}/\d{2}/\d{4}
  • totalAmount\$?\d{1,3}(?:,\d{3})*(?:\.\d{2})?

Diese Muster funktionieren auch für die gleichen Felder in Lieferantenabrechnungen, Bestellungen und Versanddokumenten, da Rechnungsnummern, Daten und Beträge in den meisten Geschäftsdokumenten die gleiche Form aufweisen.

JavaScript Ausdruck für bedingte Logik

Verwenden JavaScript Ausdruck wenn die Ausgabe von der Anwesenheit oder Kombination mehrerer Markierungen im Dokument abhängt. PDF4me übergibt den extrahierten Text als Variable an Ihre Funktion. textIhre Funktion wertet den Text aus und gibt eine Zeichenkette zurück, die zum Wert für den Schlüssel wird.

Beispiel 1: Klassifizierung anhand von Inhaltsmerkmalen

Unterscheidet ein Dokument mit Allgemeinen Geschäftsbedingungen von einem Bestelldokument durch Überprüfung der darin enthaltenen Markierungsphrasen:

function functionFormatTextDate1(text) {
console.log("Hello");
var term = [...text.matchAll(/General Terms and Conditions/gi)];
var order = [...text.matchAll(/your ordernumber/gi)];

if (term.length) {
if (order.length) {
return "Order document";
} else {
return "Terms and Conditions";
}
} else {
return "Not Terms and Conditions";
}
}

return functionFormatTextDate1(text);

Beispiel 2: Rechnungs- vs. Auftragserkennung

Ein kurzer Klassifikator, der anhand des Vorhandenseins der Wörter entscheidet, ob es sich bei dem Dokument um eine Rechnung oder eine Bestellung handelt. invoice Und ordernumber:

function functionGetInvoiceOrder(text) {
// You get all PDF text in `text`
var invoice = [...text.matchAll(/invoice/gi)];
var order = [...text.matchAll(/ordernumber/gi)];

if (invoice.length) {
if (order.length) {
return "Order document";
} else {
return "invoice";
}
} else {
return "";
}
}

return functionGetInvoiceOrder(text);

Implementierungstipp: Packen Sie Ihre Logik in eine benannte Funktion und rufen Sie diese auf mit return functionName(text); Ganz unten. Das Dashboard führt den Ausdruckskörper als Funktion aus, deren endgültiger Rückgabewert den Schlüssel belegt.

Schritt 4: Testen Sie die Analyse und speichern Sie die Änderungen.

Die Aktionsschaltflächen am oberen Rand des Editors sind in der Reihenfolge ihrer Verwendung von links nach rechts angeordnet:

  1. Vorlagendatei hochladen lädt die Probe PDF Wird zum Zeichnen von Erfassungsbereichen verwendet.
  2. Test Parse Führt alle Schlüssel anhand der hochgeladenen Probe aus und zeigt die extrahierten Werte direkt an. Verwenden Sie dies, um jeden regulären Ausdruck zu validieren. JavaScript Ausdruck vor dem Speichern.
  3. Änderungen speichern speichert die Vorlage und weist ihr eine stabile TemplateId (GUID). Kopieren Sie diese GUID zur Verwendung in API Anruf- und Automatisierungsplattformen.

Wiederhole jeden Schlüssel, bis Test Parse Gibt den erwarteten Wert für jedes Feld zurück. Verkleinern Sie den Erfassungsbereich, wenn benachbarter Text angezeigt wird, oder verfeinern Sie den Ausdruck, wenn die Musterübereinstimmungen zu weit gefasst sind.

Verwenden Sie die Vorlage in API oder automatisierte Anrufe

Einmal Änderungen speichern weist eine TemplateIdDie gleiche Parse-Vorlage kann überall per Referenz ausgeführt werden. Sie müssen die Konfiguration nicht auf jeder Plattform neu erstellen.

FeldQuelleZweck
TemplateIdDie GUID wird nach dem Speichern im Vorlagendetailbereich angezeigt.Stabiler Identifikator für die Produktionsautomatisierung. Diesem sollte man stets den Vorzug geben. TemplateNameDie
TemplateNameDer Name, den Sie in Schritt 1 eingegeben habenAlternative für die Suche. Das Umbenennen der Vorlage führt zu Fehlern bei Aufrufen, die über ihren Namen darauf verweisen.
ParseIdEine GUID, die Sie clientseitig generieren (eine pro Aufruf).Korreliert Ihre Anfrage mit der Analyseausgabe, was für Protokollierung und Prüfprotokolle nützlich ist.
docNameQuelle PDF DateinameWird zur Nachverfolgung und für Fehlermeldungen verwendet.
docContentQuelle PDF kodiert als Base64Die zu analysierende Datei.
asyncfalse für synchrone true für UmfragenSteuert die Übermittlung von Antworten.

Beispiel REST Anfragetext:

{
"docName": "invoice.pdf",
"docContent": "BASE64_ENCODED_PDF_CONTENT",
"TemplateId": "12345678-1234-1234-1234-123456789abc",
"ParseId": "87654321-4321-4321-4321-cba987654321",
"async": false
}

Die Antwort enthält ein Feld pro Schlüssel, den Sie in der Vorlage definiert haben. Leiten Sie diese Antwort weiter. JSON in einen beliebigen nachgelagerten Knoten: Google Sheets, Airtable, eine Datenbank, Excel oder ein Webhook.

Gängige Arbeitsabläufe

Typische Parse-Template-MusterHow a saved parse template moves from dashboard to production.
Rechnungseingang an Buchhaltungstabelle
  1. Eine Lieferantenrechnung PDF landet in einem überwachten E-Mail- oder Cloud-Ordner.
  2. Make, Zapier, Power Automate, oder n8n ruft Parse Document mit Ihrem auf TemplateIdDie
  3. Die strukturierte JSON Die Ausgabe (Rechnungsnummer, Gesamtbetrag, Rechnungsdatum) wird als Zeile angehängt in Google Sheets oder Excel.
  4. Die Buchhaltung prüft und genehmigt direkt anhand der Tabellenkalkulation.
Formularerfassung zur Datenbankaufzeichnung
  1. Ein Kunde lädt ein ausgefülltes Formular hoch PDF Formular über Ihr Portal ausfüllen.
  2. Ihr Backend ruft Parse Document auf. TemplateId und die Base64 PDFDie
  3. Die analysierte JSON wird in eine Datenbank-INSERT-Anweisung abgebildet, wobei jede Spalte einem Vorlagenschlüssel entspricht.
  4. An den Kunden wird eine Bestätigungs-E-Mail mit dem extrahierten Namen und der Referenznummer zurückgesendet.
Dokumentenklassifikator plus Extraktor
  1. In einem einzigen überwachten Ordner werden verschiedene Dokumente (Rechnungen, Bestellungen, Verträge) gespeichert.
  2. A JavaScript Der Ausdrucksschlüssel in der Vorlage gibt den Dokumenttyp zurück (siehe Beispiel 2 oben).
  3. Ihr Workflow leitet jede Datei anhand des zurückgegebenen Typs an das richtige nachgelagerte System weiter.
  4. Als Rechnungen identifizierte Dateien werden weiterhin im selben Template-Aufruf einer Regex-basierten Feldextraktion unterzogen.

Best Practices für die Vorlagenkonfiguration

  • Zeichnen Sie die Erfassungsbereiche etwas größer als den erwarteten Wert, damit Schriftart- oder Positionsabweichungen den Wert nicht aus dem Bildausschnitt verschieben.
  • Verwenden Sie für alle Vorlagen die CamelCase-Schreibweise für die Schlüsselnamen, damit die nachfolgende Zuordnung in Tabellenkalkulationen, Datenbanken und Webhooks vorhersehbar bleibt.
  • Testen Sie jeden Schlüssel anhand von mindestens drei realen Beispielen, einschließlich Sonderfällen wie fehlenden optionalen Feldern, Rechnungen auf der zweiten Seite und OCR-abgeleiteter Text aus gescannten PDFsDie
  • Verwenden JavaScript Nur Ausdrücke werden verwendet, wenn reguläre Ausdrücke die Regel nicht ausdrücken können. Eine einfache Logik erleichtert das Debuggen der Vorlage.
  • Versionieren Sie Ihre Vorlagen anhand ihres Namens (invoice-v1, invoice-v2) bei grundlegenden Änderungen, damit die Produktionsautomatisierung in ihrem eigenen Tempo migrieren kann.
  • Scanvorgang ausgeführt PDFs durch OCR zuerst (die PDF4me OCR Endpunkt) vor dem Parsen. Vorlagen werden aus der Textschicht extrahiert, die gescannt wurde. PDFs erst dann OCR wird angewendet.

Ähnliche Aktionen

Dokument analysieren API
REST Endpunkt, der Ihre gespeicherte Vorlage gegen beliebige PDF Verwendung TemplateId und Renditen strukturiert JSONDie
Dokumentenklassifizierung einrichten
Begleitender Leitfaden für Ausgaben, die nur Kategorien ohne Feldextraktion enthalten. Nützlich als Vorverarbeitungsschritt vor dem Parsen des Dokuments.
Dokument parsen in Make
Wenden Sie Ihre Vorlage in visuellen Arbeitsabläufen mit nachgelagerten Routing-, Speicher- und Benachrichtigungsmodulen an.
Dokument parsen in Zapier
Vorlagenanalyse per Trigger ausführen SaaS Automatisierungen in über 6.000 Apps.
Dokument parsen in Power Automate
Integrieren Sie die Parse-Ausgabe mit Microsoft 365 Genehmigungsprozesse, SharePoint Aufzeichnungen und Dynamics Pipelines.
Dokument parsen in n8n
Selbstgehosteter Workflow mit regulären Ausdrücken oder JavaScript Ausdrucksbasiert PDF Datenextraktion plus vollständige Kontrolle über nachgelagerte Knoten.

Häufig gestellte Fragen

Should I use Regex Expression or JavaScript Expression first?+
Start with Regex Expression for fixed-shape fields like invoice numbers, dates, totals, and tax IDs. Move to JavaScript Expression when extraction depends on multiple conditions, fallback rules, or document classification. Most production templates use Regex for around 80% of keys and JavaScript for the rest.
Where does the text variable in JavaScript Expression come from?+
PDF4me passes the extracted text of the captured region (or the full PDF when Search Whole Page is enabled) into the expression context as the variable named text. Your function evaluates that string and returns a string for the configured key.
Does parse template extraction work on scanned PDFs?+
Yes, when the PDF has been OCR-processed first. Scanned PDFs are images until OCR is applied. Run the source file through the PDF4me OCR endpoint or upload an already-OCR'd PDF to the dashboard before drawing capture areas. The template then extracts from the OCR text layer.
Can one template handle multiple invoice layouts?+
It can absorb small differences in font, position, or page count. For genuinely different layouts (two vendors with different invoice designs) create separate templates and route files to the right one by classifier or source system before calling Parse Document.
What do I need to call the parse template from the API?+
Send docName, docContent (the PDF as Base64), TemplateId (the GUID copied from the dashboard after Save Changes), ParseId (a client-generated GUID), and async (false for immediate response, true for polling). TemplateName works instead of TemplateId but TemplateId is recommended for stable automation.
How do I move extracted data into Excel, Google Sheets, or a database?+
The parse output is structured JSON, with one field per key you defined in the template. Route that JSON to any destination from your automation platform: Add Row in Google Sheets, Insert Row in Airtable or a database, or write to Excel via the Excel module in Make, Power Automate, n8n, or Zapier. The same TemplateId works on every platform.
How does this compare with Python PDF data extraction libraries?+
Tools like pdfplumber, PyMuPDF, and pdfminer give you raw extraction primitives in Python, but you write and maintain the matching logic yourself. PDF4me parse templates give you a saved, named template you configure once in a dashboard and call from any language or platform. Use Python libraries when you need full programmatic control inside a single codebase; use PDF4me parse templates when you want the same extraction running across the REST API, Make, Zapier, Power Automate, and n8n without copying logic between systems.
How should I test a parse template before production?+
Validate each key against at least three real samples, including edge cases such as missing optional fields, alternate fonts, multi-page documents, and second-page positions. Use Test Parse in the dashboard for each sample, confirm the output matches expectations, then run a small automation against live files in monitor mode before enabling end-to-end automation.
How do I connect this setup to no-code platforms?+
Use the platform-specific guides under Related actions. Each platform exposes the same TemplateId and ParseId fields so the parsing logic stays identical to what you tested in the dashboard. The output structure also matches across platforms.

Hilfe erhalten