Zum Hauptinhalt springen

KI-Dokumentenparser mit Parse

Was dieser Leitfaden umfasst

KI-Dokumentenparser. Parsen ist die Dashboard-Konfiguration, die ein JSON umwandelt Dokumentenschema hinein KI-gestützte Extraktion strukturierter PDFsSie erstellen einen Analysator, wähle die Parse Geben Sie den Typ ein und beschreiben Sie die gewünschten Felder als Feldname, Feldtyp, Und FeldbeschreibungDie KI liest das Dokument semantisch, daher sind keine gezeichneten Erfassungsbereiche oder reguläre Ausdrücke erforderlich. Nach dem Speichern wird dieselbe Analyzer-ID von dort aus ausgeführt. REST API, Make, Zapier, Power Automate, Und n8nDie

Verwandte Blog-Beiträge(4)
KI-gestütztes Extrahieren und intelligentes Umbenennen beliebiger PDFs in Make: Ein 4-Modul-Dropbox-Workflow mit PDF4me AI – Dokumentenparser
Szenario mit vier Modulen: Eine Lieferanten-PDF-Datei aus Dropbox abrufen, den KI-Dokumentenparser mit der Standard-Rechnungsextraktion ausführen, das JSON parsen, um den Lieferantennamen zu extrahieren, und die Datei anschließend mit dem Namen „Lieferantenname.pdf“ erneut hochladen. Echte Screenshots, exakte Feldwerte, keine manuelle Dateneingabe.
Beitrag lesen
KI-gestütztes Umbenennen von Lieferantenrechnungen in Zapier: Ein 5-stufiger Workflow mit Dropbox und PDF4me
Fünf-Schritte-Zap: Dropbox Neue Datei im Ordner → Dropbox Datei suchen → PDF4me AI – Dokumentenparser → Code von Zapier JavaScript ausführen → Dropbox Datei hochladen. Extrahiert den Kundennamen mithilfe von KI und verwendet ihn als Ausgabedateinamen. Echte Screenshots, exakte Feldwerte, kein Code außer einer zweizeiligen JSON.parse-Anweisung.
Beitrag lesen
Alle Lieferantenrechnungen in Zapier nach Lieferantennamen umbenennen: Ein 5-stufiger Dropbox- und PDF4me-KI-Workflow
Fünf-Schritte-Zap für Ihre Buchhaltung. Dropbox überwacht Ihren Rechnungseingangsordner, PDF4me AI – Document Parser extrahiert den Lieferantennamen aus jeder PDF-Datei, Code by Zapier wandelt die Parser-Ausgabe in zuordnungsfähige Token um, und Dropbox lädt die Datei mit dem Lieferantennamen als Dateinamen wieder hoch. Echte Screenshots, exakte Feldwerte und die in dieser Anleitung verwendete Beispielrechnung (sample-vendor-invoice.pdf) stehen zum Download bereit.
Beitrag lesen

Authentifizierung Ihrer Einrichtung

KI-Dokumentenparser-Analysatoren werden in der PDF4me Entwickler-Dashboard. Melden Sie sich mit Ihrem Konto an und erstellen oder kopieren Sie anschließend ein API Schlüssel für den KI-Parser API Aufrufe, die auf den hier erstellten Analysator verweisen.

Dashboard-URLs, die Sie in dieser Anleitung verwenden werden:

Wichtige Fakten, die Sie nicht verpassen sollten

Parse extrahiert Daten; klassifiziert Routendokumente
Wählen Parse wenn Sie eine strukturierte JSON Ausgabe mit einem Wert pro definiertem Feld. Auswählen Klassifizieren Wenn Sie nur eine Kategoriebezeichnung benötigen. Die beiden Analysetypen verwenden zwar dasselbe Hinzufügen-Modal, erzeugen aber unterschiedliche Ausgabeformen.
Die Feldbeschreibung steuert die Genauigkeit
Die KI ist auf Folgendes angewiesen: Feldbeschreibung Um jeden Wert im Dokument zu finden, verwenden Sie eine präzise Zeichenkette. Geben Sie dabei auch alternative Bezeichnungen an (z. B. Auftragsnummer, manchmal auch als SO-Nr. abgekürzt). Ungenaue Beschreibungen beeinträchtigen die Qualität der extrahierten Werte.
Die Analyzer-ID ist die stabile Produktionsreferenz.
Die Zeichenkette, die Sie in der Zeile „Hinzufügen“ eingeben (zum Beispiel Einkaufsbestellparser) ist das, was jeder API Verwendung des Anruf- und Automatisierungsmoduls. Legen Sie von Anfang an eine eindeutige Namenskonvention fest; eine spätere Änderung erfordert die Neukonfiguration aller Workflows, die darauf verweisen.

Schritt 1: Öffnen Sie den AI Document Parser im Dashboard.

  1. Anmelden unter dev.pdf4me.comDie
  2. Klicken Sie in der Seitenleiste des Dashboards auf KI-DokumentenparserDie
  3. Die Listenseite zeigt alle vorhandenen Analyzer in drei Spalten an: Analysator-ID, Analysatortyp (Parse or Classify), und AktionenDie
  4. Klicken Sie auf das Blaue + Hinzufügen Schaltfläche zum Starten eines neuen Analysators.
PDF4me AI Document Parser Dashboard-Seite mit Seitenleisteneintrag „AI Document Parser“ in Rot hervorgehoben, Hauptbereich mit dem Titel „AI Document Parser“, einer blauen Schaltfläche „Hinzufügen“ und einer leeren Liste mit den Spaltenüberschriften „Analyzer-ID“, „Analyzer-Typ“ und „Aktionen“

Listenansicht des KI-Dokumentenparsers. Klicken Sie auf „+ Hinzufügen“, um einen neuen Analysator zu erstellen.

Schritt 2: Wählen Sie den Analysetyp „Parsen“ und benennen Sie ihn.

Es erscheint eine neue Zeile mit drei Steuerelementen:

  1. Analyzer-ID-EingabeGeben Sie eine beliebige eindeutige Kennung ein, die Sie sich merken können, zum Beispiel purchase order parser, Invoice Parser v1, oder vendor_statement_parserEs gibt keine Einschränkungen hinsichtlich des Namensformats. Snake Case, Camel Case, Kebab Case, einfache Wörter mit Leerzeichen – alles funktioniert gleich.
  2. Dropdown-Liste für Analysetyp. wählen Parse (diese Anleitung) oder Klassifizieren (siehe die Klassifizierungsleitfaden).
  3. Speichern / Abbrechen Schaltflächen. Speichern erstellt den Analysator; Abbrechen verwirft die Zeile.
PDF4me AI Document Parser: Eine neue Zeile wird geöffnet, in der das Feld „Analyzer-ID“ mit „purchase_order_parser“ ausgefüllt ist. Im Dropdown-Menü „Analyzer-Typ“ werden die Optionen „Klassifizieren“ und „Parsen“ angezeigt, wobei „Parsen“ ausgewählt ist. Rechts befinden sich die Schaltflächen „Speichern“ und „Abbrechen“.

Zeile hinzufügen: Analyzer-ID eingeben, Parse auswählen und dann speichern.

Namenstipp: Fügen Sie die Dokumentenfamilie in den Namen ein (Rechnungsparser, Einkaufsbestellparser, Versandbeleg-ParserDie Analyzer-ID wird von nachgelagerten Automatisierungen aufgerufen; ein eindeutiger Name zahlt sich jedes Mal aus, wenn Sie sie in eine neue Plattform einbinden. Groß- und Kleinschreibung sowie Trennzeichen sind beliebig.

Schritt 3: Öffnen Sie den Analysator und fügen Sie ein Schema hinzu

Klicken Sie auf die neue Zeile, um die Detailseite zu öffnen. Das URL-Muster lautet:

https://dev.pdf4me.com/ai-document-parser/?id=<your-analyzer-guid>

Das Dashboard generiert beim ersten Öffnen eine GUID pro Analysator. Speichern Sie diese URL als Lesezeichen, um beim nächsten Mal direkt zum selben Analysator zurückzukehren.

Auf der Detailseite wird Folgendes angezeigt:

  • Parse-Informationen (links) zeigt die in Schritt 2 eingegebene Analyzer-ID an. Dieses Feld ist schreibgeschützt.
  • Schemas (rechts). Standardmäßig leer. Klicken Sie auf + Schaltfläche oben rechts zum Hinzufügen eines Schemas.
  • Änderungen speichern (oben links). Alle Änderungen, die Sie auf dieser Seite vornehmen, bleiben erhalten.
  • Zurückkehrt zurück zum AnalysatorlisteDie
Die Detailseite des PDF4me AI Document Parsers enthält ein blaues Hero-Banner mit der Aufschrift „AI Document Parser“, den Untertitel „Automatische Extraktion von Rechnungsdaten mithilfe von KI mit schneller, präziser und strukturierter Ausgabe“, einen Zurück-Button, einen Speichern-Button, ein Info-Panel mit der Analyzer-ID „purchase_order_parser“ und einen leeren Abschnitt „Schemas“ mit einem blauen Plus-Button zum Hinzufügen eines Schemas.

Analysedetails. Klicken Sie auf die blaue Schaltfläche „+“, um ein Dokumentschema hinzuzufügen.

Schritt 4: Dokumentschema definieren JSON

Nach dem Klicken +Es öffnet sich eine leere Schema-Karte. Fügen Sie ein JSON Objekt mit zwei Schlüsseln der obersten Ebene:

  • descriptionEine kurze Zusammenfassung der vom Schema extrahierten Informationen in einem Satz. Die KI nutzt dies als Gesamtkontext.
  • fields. Array von Felddefinitionen. Jedes Feld hat:
    • fieldName. maschinenlesbarer Name (ohne Leerzeichen), verwendet als JSON Schlüssel in der Antwort.
    • fieldTypeDie string, number, oder date. Steuert das Parsen und die Validierung.
    • fieldDescription. Natürlichsprachlicher Hinweis, den die KI verwendet, um dieses Feld zu finden. Bitte seien Sie präzise.
PDF4me AI Document Parser Schema 1 öffnet sich mit einem Dokumentenschema-Editor, der JSON mit der Beschreibung „Datenextraktion aus Bestellungen und Verkaufsaufträgen“ und einem Feld-Array mit den Zeichenketten „SalesOrderNumber“ (Verkaufsauftragsnummer), „AgentName“ (Name des Agenten, meist als Agentenname angegeben) und „DeptCode“ (teilweise sichtbar) anzeigt. Unterhalb des Editors befinden sich Schnellzugriffsschaltflächen für Rechnungen und Bestellungen.

Dokumentenschema-Editor mit Schnellfüllbuttons für Rechnungs- und Bestellvorlagen.

Beispiel: Bestellschema

{
"description": "Extracting data from purchase orders and sales orders.",
"fields": [
{
"fieldName": "SalesOrderNumber",
"fieldType": "string",
"fieldDescription": "Sales Order Number"
},
{
"fieldName": "AgentName",
"fieldType": "string",
"fieldDescription": "Name of the agent, mostly given as Agent Name."
},
{
"fieldName": "DeptCode",
"fieldType": "string",
"fieldDescription": "Department or cost-centre code printed on the order."
},
{
"fieldName": "OrderDate",
"fieldType": "date",
"fieldDescription": "Date the order was placed. Accept formats like DD/MM/YYYY, MM-DD-YYYY, or written out as 5 June 2026."
},
{
"fieldName": "TotalAmount",
"fieldType": "number",
"fieldDescription": "Grand total of the order in the document's currency, after taxes."
}
]
}

Beispiel: Rechnungsschema (verwenden Sie die Schaltfläche „Rechnung schnell ausfüllen“)

{
"description": "Extracting data from supplier invoices.",
"fields": [
{
"fieldName": "InvoiceNumber",
"fieldType": "string",
"fieldDescription": "Unique invoice identifier, sometimes shown as Invoice No. or INV."
},
{
"fieldName": "InvoiceDate",
"fieldType": "date",
"fieldDescription": "Date the invoice was issued."
},
{
"fieldName": "DueDate",
"fieldType": "date",
"fieldDescription": "Date payment is due, sometimes shown as Payment Due or Net Due."
},
{
"fieldName": "VendorName",
"fieldType": "string",
"fieldDescription": "Company name of the supplier or vendor sending the invoice."
},
{
"fieldName": "TotalAmount",
"fieldType": "number",
"fieldDescription": "Grand total in the invoice currency, including taxes."
}
]
}

Schnellausfüll-Schaltflächen (Rechnung, Bestellung): am unteren Rand der Schema-Karte. Nutzen Sie sie als Ausgangspunkt Klicken Sie einfach auf ein Schema, um ein typisches Schema für die jeweilige Dokumentfamilie zu laden. Anschließend können Sie die Felder umbenennen, kürzen oder erweitern, um sie an Ihre tatsächlichen Dokumente anzupassen. Die Voreinstellungen dienen als Gerüst und stellen keine endgültigen Schemas dar.

Schema mit einem Tabellenfeld (verschachtelte Zeilen)

Verwenden Feldtyp: "Tabelle" Wenn Sie wiederholte Zeilen wie Rechnungspositionen oder Bestellpositionen extrahieren müssen. Jedes Tabellenfeld enthält seine eigene verschachtelte Struktur. Felder Array, das die Spalten beschreibt.

{
"description": "Invoice data extractor",
"fields": [
{
"fieldName": "invoiceNumber",
"fieldType": "string",
"fieldDescription": "Invoice number / bill number / receipt number"
},
{
"fieldName": "invoiceDate",
"fieldType": "date",
"fieldDescription": "Look for labels: 'Invoice Date', 'Bill Date', 'Date', 'Dated', 'Issue Date', 'Doc Date'. If 4 digit year not found then consider 2 digit year at the end of extracted date.",
"fieldMethod": "generate"
},
{
"fieldName": "lineItems",
"fieldType": "table",
"fieldDescription": "All product / service rows from the invoice table. Be careful, sometimes a row can be part of the next item like when description goes over one line, but it's of a single item.",
"fields": [
{
"fieldName": "itemNumber",
"fieldType": "string",
"fieldDescription": "Product number, product id number or product code"
},
{
"fieldName": "hsnCode",
"fieldType": "string",
"fieldDescription": "HSN / SAC code (4 to 8 digit)"
}
]
}
]
}

Feldattribute

AttributErforderlich?Was es tut
fieldNameRequiredThe name of the field and how it will appear in the response JSON.
fieldTypeRequiredThe type of data to extract. One of string, number, date, or table.
fieldDescriptionRequiredNatural-language description of what needs to be extracted and where to find it. Include alternate labels and example formats so the AI matches correctly.
fieldMethodOptional (default extract)How the AI fills the value. extract takes the value verbatim from the document. generate tells the AI to derive or normalise it (useful for dates, computed totals, or cleaned-up IDs). Omit for default extract behaviour.
fieldsRequired when fieldType is tableNested array describing the columns of the table. Each entry takes the same attributes as a top-level field (fieldName, fieldType, fieldDescription, fieldMethod). Cannot itself be table.

Feldtyp-Referenz

FeldtypAm besten geeignet fürBeispielfeldbeschreibung
stringNames, identifiers, codes, free textCustomer name as printed on the invoice header.
numberAmounts, quantities, tax rates, countsGrand total of the order in the document currency, including taxes.
dateDates, due dates, issue dates, timestampsDate the invoice was issued, accept DD/MM/YYYY and 5 June 2026 formats.
tableRepeated rows (line items, addresses, transactions)All product / service rows from the invoice table. Carries a nested fields array describing the columns.

Schritt 5: Änderungen speichern und den Analysator verwenden

Klicken Änderungen speichern Oben links befindet sich die Schaltfläche zum Speichern des Schemas. Der Analyzer ist nun aktiv und kann von jeder Plattform aus über seine Analyzer-ID aufgerufen werden.

Verwenden Sie den Analysator in API oder automatisierte Anrufe

Nach dem Speichern kann derselbe Analyzer überall per Referenz ausgeführt werden. Sie müssen das Schema nicht auf jeder Plattform neu erstellen.

FeldQuelleZweck
AnalyzerIdDie Zeichenkette, die Sie in Schritt 2 eingegeben habenStabiler Bezeichner, den der KI-Parser verwendet, um Ihr Schema zu finden.
docNameQuelle PDF DateinameWird zur Nachverfolgung und für Fehlermeldungen verwendet.
docContentQuelle PDF kodiert als Base64Das Dokument, aus dem der Datenextrakt erfolgen soll.
asyncfalse für synchrone true für UmfragenSteuert die Übermittlung von Antworten.

Beispiel REST Anfragetext:

{
"docName": "purchase_order.pdf",
"docContent": "BASE64_ENCODED_PDF_CONTENT",
"AnalyzerId": "purchase_order_parser",
"async": false
}

Die Antwort enthält ein Feld pro Element, das Sie definiert haben in fieldsRoute, die JSON in ein beliebiges nachgelagertes System: Google Sheets, Airtable, eine Datenbank, Exceloder ein Webhook.

Gängige Arbeitsabläufe

Typische KI-Parser-MusterHow a saved Analyzer moves from dashboard to production.
Posteingang für Bestellungen an ERP
  1. Eine neue Bestellung PDF landet in einem überwachten Postfach oder Upload-Ordner.
  2. Make, Zapier, Power Automate, oder n8n ruft den KI-Parser auf mit AnalyzerId: purchase_order_parserDie
  3. Die zurückgekehrten JSON (Auftragsnummer, Agentenname, Bestelldatum, Gesamtbetrag) wird in Ihre ERP Auftragserstellung APIDie
  4. An den Kunden wird eine Bestätigungs-E-Mail mit der extrahierten Bestellnummer zurückgesendet.
Rechnungseingang an Buchhaltungstabelle
  1. Eine Rechnung PDF Die Nachricht wird per Webhook, überwachtem Ordner oder freigegebenem Posteingang empfangen.
  2. Der KI-Parser wird aufgerufen mit AnalyzerId: invoice_parser (Schnellausfüllschema für Rechnungen).
  3. Die strukturierte Antwort (Rechnungsnummer, Gesamtbetrag, Fälligkeitsdatum) wird als Zeile angehängt in Google Sheets oder Excel für das Buchhaltungsteam.
Router zum Klassifizieren und dann Parsen
  1. In einem einzigen überwachten Ordner werden verschiedene Dokumente (Rechnungen, Bestellungen, Lieferscheine) gespeichert.
  2. Ein Klassifizierungsanalysator ordnet jede Datei der richtigen Kategorie zu.
  3. Basierend auf dem Label ruft der Workflow den passenden Parse Analyzer auf (Rechnungsparser, Einkaufsbestellparser, Versandnotizparser) und schreibt die strukturierte Ausgabe an das richtige Ziel.

Best Practices für Schemas

  • Verwenden Sie beschreibende fieldDescription Zeichenketten. Erwähnen Sie alternative Bezeichnungen, die Sie in realen Dokumenten sehen („Auftragsnummer, auch als SO-Nr., Auftragsreferenz oder PO-Referenz angegeben“).
  • Wählen fieldType sorgfältig. date Und number Dem Engine-Parsing-Hinweise geben; string ist die Ausweichlösung, wenn die Form unvorhersehbar ist.
  • Halten fieldName Maschinenlesbar (CamelCase oder PascalCase, keine Leerzeichen). Es erscheint als JSON Schlüssel in der Antwort.
  • Beginnen Sie mit der Schnellausfüllung für Rechnungen oder Bestellungen und passen Sie die Felder anschließend an oder fügen Sie weitere hinzu. Die Voreinstellungen bieten eine gute Grundlage.
  • Testen Sie den Analyzer anhand von drei realen Beispielen, bevor Sie den Produktionsdatenverkehr darauf richten. Berücksichtigen Sie dabei auch Grenzfälle wie fehlende optionale Felder, Dokumente auf der zweiten Seite und OCR-generierten Text.
  • Versionsanalysator-IDs beim Vornehmen von Schemaänderungen mit potenziellen Fehlern (invoice_parser_v1, invoice_parser_v2) sodass Live-Automatisierungen in ihrem eigenen Tempo migrieren können.

Ähnliche Aktionen

KI-Dokumentenparser mit Klassifizierung
Gleiches Dashboard, mehrere Schemas pro Analyzer. Verwendung, wenn ein Analyzer zwischen Dokumentvarianten routen muss (Kunde ABC vs. Kunde XYZ).
KI - Dokumentenparser in Make
Verwenden Sie Ihre gespeicherte Parse Analyzer-ID von einem Make Szenario. Kombinieren Sie es mit beliebigen Datenquellen- und Speichermodulen, um die KI-Extraktion in visuellen Arbeitsabläufen durchzuführen.
KI - Dokumentenparser in Power Automate
Führen Sie denselben Analysator von einem Power Automate Fluss. Verbindet sich auf natürliche Weise mit SharePoint, Excel, Dataverse, Und OutlookDie
KI - Dokumentenparser in n8n
Selbst gehostet oder Cloud n8n Workflows. Das Dropdown-Menü „KI-Analysator-ID“ lädt Ihre gespeicherten Analysatoren direkt aus Ihrem Konto.
KI - Dokumentenparser in Zapier
Trigger-KI-Extraktion aus über 6.000 Quellen SaaS Apps und Webhooks. Geben Sie Ihre gespeicherte Analyzer-ID in das Feld „Name des KI-Analyzers“ ein.

Häufig gestellte Fragen

What is the difference between Parse and Classify in AI Document Parser?+
Parse extracts structured field values from documents using a Document Schema. The response is a JSON object with one value per field you defined. Classify routes a document into one of several categories you defined; the response is a label string. Use Parse when you need data, Classify when you need a routing decision.
How is AI Document Parser different from the older Parse Document templates?+
The older Parse Document setup uses Regex Expression or JavaScript Expression applied to drawn capture areas on a sample PDF. AI Document Parser uses a JSON Document Schema with natural-language field descriptions; the AI engine reads the document semantically rather than by fixed positions. No sample PDF is required when defining an AI Analyzer.
What does fieldDescription do?+
It is the natural-language hint the AI uses to find each field in the document. Be specific and include alternate names ("Sales Order Number, sometimes shown as SO No."). Descriptions are the single biggest factor in extraction accuracy.
Can I add more than one Schema to the same Analyzer?+
Yes. The detail page supports multiple Schemas via the + button. Use this when one Analyzer should handle two related document families (purchase orders and sales orders) with slightly different field sets.
Does the Analyzer Id change after Save Changes?+
No. The Analyzer Id is the string you typed in the Add row in Step 2. It stays stable across edits and is the value every API call and automation module uses. Pick a clear naming convention up front.
Do I need to upload a sample PDF when setting up the Analyzer?+
No. Unlike the older Parse Document templates, the AI Analyzer does not need a sample for setup. You define a Document Schema in JSON; the AI engine applies it to whatever document you send at runtime.
How do I call the Analyzer from the REST API?+
Send docName, docContent (the PDF as Base64), AnalyzerId (the string you typed in Step 2), and async (false for immediate response, true for polling). The response contains one JSON property per field you defined in the Document Schema.
Can the AI Parser handle scanned PDFs?+
Yes, when the PDF has been OCR-processed first. Run the source file through the PDF4me OCR endpoint before sending it to the AI Parser. The schema then extracts from the OCR text layer the same way it would from a native PDF.

Hilfe erhalten