KI-Dokumentenparser mit Klassifizierung
Was dieser Leitfaden umfasst
KI-Dokumentenparser. Klassifizieren. ermöglicht es einem Analyzer, mehrere Dokumentvarianten in einem einzigen Aufruf zu verarbeiten. Sie definieren einen Analysator-IDFüge dann eins hinzu Diagramm pro Variante (Kunde ABC, Kunde XYZ, Standardrechnung, Standardbestellung). Jedes Schema enthält eine Klassifizierungsname, A Klassifizierungsaufforderung in natürlicher Sprache und ein Dokumentenschema Die zu extrahierenden Felder werden beschrieben. Zur Laufzeit gleicht die KI die eingehenden Daten ab. PDF Anhand jeder Klassifizierungsabfrage des Schemas wird die am besten passende Klassifizierung ausgewählt und sowohl der entsprechende Klassifizierungsname als auch die extrahierten Felder zurückgegeben. Dieselbe Analyzer-ID funktioniert von allen Seiten. REST API und jede unterstützte Automatisierungsplattform.
Authentifizierung Ihrer Einrichtung
Klassifizierungsanalysatoren werden in der PDF4me Entwickler-Dashboard. Melden Sie sich mit Ihrem Konto an und erstellen oder kopieren Sie anschließend ein API Schlüssel für den KI-Parser API Aufrufe, die sich auf den hier erstellten Analyzer beziehen.
- Analysatorliste (Schritte 1, 2):
https://dev.pdf4me.com/dashboard/#/ai-document-parser/ - Analysator-Details (Schritte 3, 4, 5):
https://dev.pdf4me.com/ai-document-parser/?id=<analyzer-guid>
Wichtige Fakten, die Sie nicht verpassen sollten
Schritt 1: Öffnen Sie den AI Document Parser im Dashboard.
- Anmelden unter dev.pdf4me.comDie
- Klicken Sie in der Seitenleiste des Dashboards auf KI-DokumentenparserDie
- Die Listenseite zeigt alle vorhandenen Analyzer in drei Spalten an: Analysator-ID, Analysatortyp (Parse or Classify), und AktionenDie
- Klicken Sie auf das Blaue + Hinzufügen Schaltfläche zum Starten eines neuen Analysators.

Listenansicht des KI-Dokumentenparsers. Klicken Sie auf „+ Hinzufügen“, um einen neuen Analysator zu starten.
Schritt 2: Erstellen Sie einen Klassifizierungsanalysator
Es erscheint eine neue Zeile mit drei Steuerelementen:
- Analyzer-ID-EingabeGeben Sie eine beliebige eindeutige Kennung ein, die Sie sich merken können, zum Beispiel
client_invoices,Vendor Documents, oderincoming-ordersEs gibt keine Einschränkungen hinsichtlich des Namensformats. Snake Case, Camel Case, Kebab Case, einfache Wörter mit Leerzeichen – alles funktioniert gleich. Das folgende Beispiel verwendet …client_invoicesDie - Dropdown-Liste für Analysetyp. wählen Klassifizieren (diese Anleitung) oder Parse (siehe die Parse-Leitfaden).
- Speichern / Abbrechen Schaltflächen. Speichern erstellt den Analysator; Abbrechen verwirft die Zeile.

Zeile hinzufügen: Geben Sie die Analyzer-ID ein (hier Kundenrechnungen), wählen KlassifizierenDann speichern.
Schritt 3: Öffnen Sie den Analysator und fügen Sie das erste Schema hinzu.
Klicken Sie auf die neue Zeile, um die Detailseite zu öffnen. Das URL-Muster lautet:
https://dev.pdf4me.com/ai-document-parser/?id=<your-analyzer-guid>
Das Dashboard generiert beim ersten Öffnen eine GUID pro Analysator. Speichern Sie diese URL als Lesezeichen, um beim nächsten Mal direkt zum selben Klassifizierungsanalysator zurückzukehren.
Auf der Detailseite wird Folgendes angezeigt:
- Informationen klassifizieren (links) zeigt die Analyzer-ID, die Sie in Schritt 2 eingegeben haben (hier
client_invoicesDieses Panel ist schreibgeschützt. - Schemas (rechts). Standardmäßig leer. Jedes Schema ist eine Dokumentvariante. Klicken Sie auf + Schaltfläche oben rechts zum Hinzufügen des ersten Schemas.
- Änderungen speichern (oben links). Alle Änderungen, die Sie auf dieser Seite vornehmen, bleiben erhalten.
- Zurückkehrt zurück zum AnalysatorlisteDie

Detailseite. Informationen klassifizieren Links befindet sich die Analyzer-ID. Klicken Sie auf die blaue Schaltfläche „+“, um ein Schema hinzuzufügen.
Schritt 4: Klassifizierungsname, Aufgabenstellung und Dokumentenschema ausfüllen
Jedes Schema stellt eine Dokumentvariante dar, die der Analysator verarbeiten muss. Jedes Schema verfügt über drei erforderliche Eingaben und eine bekannte Schnellausfüllzeile am Ende.
Schemafelder (erforderlich)
| Feld | Zweck | Beispiel |
|---|---|---|
| Classification Name | The label returned by the API when this Schema matches. Use a short, business-friendly name. | Client ABC |
| Classification Prompt | Natural-language description of how to recognise this variant. Mention company name, email, layout cues, distinguishing phrases. This is what the AI uses to route. | The invoice has the company name ABC at the top, followed by the contact email [email protected]. |
| Document Schema | JSON object with a description and a fields array. Each field has fieldName, fieldType, and fieldDescription, plus an optional fieldMethod such as generate for derived values. | { "description": "Extract invoice detail for ABC invoices", "fields": [ ... ] } |
Beispielschema: Kunde ABC

Erstes Schema. Klassifizierungsname, Klassifizierungsaufforderung und Dokumentschema beschreiben zusammen eine Dokumentvariante.
{
"description": "Extract invoice detail for ABC invoices",
"fields": [
{
"fieldName": "invoiceNumber",
"fieldType": "string",
"fieldDescription": "Invoice number / bill number / receipt number"
},
{
"fieldName": "invoiceDate",
"fieldType": "date",
"fieldMethod": "generate",
"fieldDescription": "Look for labels: 'Invoice Date', 'Bill Date', 'Date', 'Dated', 'Issue Date', 'Doc Date'. If 4-digit year not found then consider 2-digit year at the end of extracted date."
}
]
}
Die Klassifizierungsaufforderung für Client ABC ist der natürlichsprachliche Hinweis, der die KI zu diesem Schema führt:
„Auf der Rechnung steht oben der Firmenname ABC, gefolgt von der Kontakt-E-Mail-Adresse.“
[email protected]"
Schritt 5: Weitere Schemas hinzufügen und Änderungen speichern
Klicken Sie auf das Blaue + Klicken Sie erneut auf die Schaltfläche, um ein Schema für die nächste Variante hinzuzufügen. Jedes neue Schema erhält einen eigenen Klassifizierungsnamen, eine eigene Klassifizierungsabfrage und ein eigenes Dokumentschema. Die Felder können sich zwischen den Schemas vollständig unterscheiden. Kunde ABC hat möglicherweise keine Spalte für Kundenreferenzen, Kunde XYZ hingegen schon.
Zweites Beispielschema: Kunde XYZ

Zweites Schema für denselben Analyzer. Beide Schemas befinden sich nun unter KundenrechnungenDie
{
"description": "Extract Invoice data from company XYZ's Invoice",
"fields": [
{
"fieldName": "invoiceNumber",
"fieldType": "string",
"fieldDescription": "Invoice number / bill number / receipt number"
},
{
"fieldName": "invoiceDate",
"fieldType": "date",
"fieldMethod": "generate",
"fieldDescription": "Look for labels: 'Invoice Date', 'Bill Date', 'Date', 'Dated', 'Issue Date', 'Doc Date'. If 4-digit year not found then consider 2-digit year at the end of extracted date."
}
]
}
Die Schemaliste wird nach dem Speichern ausgeblendet.
Sobald beide Schemata importiert sind, wird jedes Schema als ausklappbare Karte angezeigt. Links befindet sich der Klassifizierungsname, rechts ein Pfeil zum Einklappen. Klicken Sie auf eine Karte, um sie später erneut zu bearbeiten.

Beide Schemas wurden gespeichert. Klicken Sie auf eine beliebige Karte, um sie zu erweitern und zu bearbeiten; verwenden Sie das Pluszeichen (+), um weitere Varianten hinzuzufügen.
Klicken Änderungen speichern Oben links können Sie jedes hinzugefügte Schema speichern. Der Analyzer ist jetzt live und bereit, Daten zu empfangen. PDFsDie
Optionen auf Feldebene innerhalb des Dokumentschemas
| Attribut | Erforderlich? | Was es tut |
|---|---|---|
fieldName | Required | The name of the field and how it will appear in the response JSON. |
fieldType | Required | The type of data to extract. One of string, number, date, or table. |
fieldDescription | Required | Natural-language description of what needs to be extracted and where to find it. Include alternate labels and example formats so the AI matches correctly. |
fieldMethod | Optional (default extract) | How the AI fills the value. extract takes the value verbatim from the document. generate tells the AI to derive or normalise it (useful for dates, computed totals, or cleaned-up IDs). Omit for default extract behaviour. |
fields | Required when fieldType is table | Nested array describing the columns of the table. Each entry takes the same attributes as a top-level field (fieldName, fieldType, fieldDescription, fieldMethod). Cannot itself be table. |
Schema mit einem Tabellenfeld (verschachtelte Zeilen)
Verwenden Feldtyp: "Tabelle" Wenn ein Schema wiederholte Zeilen wie Rechnungspositionen extrahieren muss, enthält jedes Tabellenfeld seine eigene verschachtelte Struktur. Felder Array, das die Spalten beschreibt.
{
"description": "Invoice data extractor",
"fields": [
{
"fieldName": "invoiceNumber",
"fieldType": "string",
"fieldDescription": "Invoice number / bill number / receipt number"
},
{
"fieldName": "invoiceDate",
"fieldType": "date",
"fieldDescription": "Look for labels: 'Invoice Date', 'Bill Date', 'Date', 'Dated', 'Issue Date', 'Doc Date'. If 4 digit year not found then consider 2 digit year at the end of extracted date.",
"fieldMethod": "generate"
},
{
"fieldName": "lineItems",
"fieldType": "table",
"fieldDescription": "All product / service rows from the invoice table. Be careful, sometimes a row can be part of the next item like when description goes over one line, but it's of a single item.",
"fields": [
{
"fieldName": "itemNumber",
"fieldType": "string",
"fieldDescription": "Product number, product id number or product code"
},
{
"fieldName": "hsnCode",
"fieldType": "string",
"fieldDescription": "HSN / SAC code (4 to 8 digit)"
}
]
}
]
}
Schnellfüll-Schaltflächen (als Ausgangspunkt verwenden)
Der Schema-Editor bietet Rechnung Und Auftragsbestätigung Voreingestellte Schaltflächen am unteren Rand der Dokumentschema-Karte. Nutzen Sie sie als Ausgangspunkt Klicken Sie auf eine Option, um ein typisches Schema für diese Dokumentfamilie zu erstellen. Passen Sie anschließend Feldnamen, -typen, -methoden und -beschreibungen an die von Ihnen konfigurierte Variante an. Die Voreinstellungen dienen als Gerüst und stellen nicht die endgültige Form dar.
Verwenden Sie den Klassifizierungsanalysator in API oder automatisierte Anrufe
Nach dem Speichern kann dieselbe Analyzer-ID überall per Referenz verwendet werden. Sie müssen die Schemas nicht auf jeder Plattform neu erstellen.
| Feld | Quelle | Zweck |
|---|---|---|
AnalyzerId | Die Zeichenkette, die Sie in Schritt 2 eingegeben haben (client_invoices) | Stabile Kennung für den Klassifikationsanalysator. |
docName | Quelle PDF Dateiname | Wird zur Nachverfolgung und für Fehlermeldungen verwendet. |
docContent | Quelle PDF kodiert als Base64 | Das Dokument, das klassifiziert und aus dem extrahiert werden soll. |
async | false für synchrone true für Umfragen | Steuert die Übermittlung von Antworten. |
Beispiel REST Anfragetext:
{
"docName": "incoming_invoice.pdf",
"docContent": "BASE64_ENCODED_PDF_CONTENT",
"AnalyzerId": "client_invoices",
"async": false
}
Die Antwort enthält den übereinstimmenden Klassifizierungsnamen sowie die im Dokumentschema des jeweiligen Schemas definierten Felder. Ein als Mandant ABC erkanntes Dokument liefert die Felder von Mandant ABC; ein als Mandant XYZ erkanntes Dokument liefert die Felder von Mandant XYZ. Ein Aufruf, beide Entscheidungen.
Gängige Arbeitsabläufe
Typische Muster des KlassifizierungsanalysatorsHow a Classify Analyzer with multiple Schemas runs in production.
- Rechnungen von Kunden ABC, Kunden XYZ und einigen anderen treffen in einem einzigen Briefkasten ein.
- Make, Zapier, Power Automate, oder n8n ruft den KI-Parser auf mit
AnalyzerId: client_invoicesDie - Die Antwort enthält den Klassifizierungsnamen (Kunde ABC, Kunde XYZ usw.) und die extrahierten Felder.
- Ein Schaltschritt leitet jedes Ergebnis an das entsprechende ERP Kundendatensatz mit dem Klassifizierungsnamen; die extrahierten Felder werden direkt in den Rechnungsdatensatz übernommen.
- Ein neuer Lieferant sendet zum ersten Mal eine Rechnung mit einem anderen Layout.
- Der Betrieb öffnet die bestehenden
KundenrechnungenAnalysator im Dashboard und klicken +Die - Es wird ein neues Schema hinzugefügt mit einem Klassifizierungsnamen (dem Namen des Anbieters), einer Klassifizierungsaufforderung, die das Layout beschreibt, und einem Dokumentschema für die relevanten Felder.
- Der nächste eingehende PDF Die Weiterleitung an das neue Schema erfolgt automatisch. Es ist keine Neuverdrahtung der Automatisierung erforderlich.
- One Analyzer deckt Rechnungen, Bestellungen und Gutschriften ab.
- Die Klassifizierungsaufforderung jedes Schemas beschreibt die Unterscheidungsmerkmale ("enthält") Gesetzesentwurf für und ein zu zahlender Gesamtbetrag" vs. "enthält eine Bestellnummer und eine Lieferadresse").
- Das Dokumentschema extrahiert pro Schema die für diesen Dokumenttyp relevanten Felder.
- Die nachgelagerten Routing-Verzweigungen basieren auf dem Klassifizierungsnamen; jede Verzweigung schreibt in das entsprechende System.
Best Practices für Schemas zur Klassifizierung
- Ein Schema pro stabiler Dokumentvariante. Zwei Anbieter mit sehr unterschiedlichen Layouts sollten zwei separate Schemas haben, nicht ein einziges mit sich überschneidenden Regeln.
- Die Klassifizierungsaufforderung ist Ihre Routing-Regel. Formulieren Sie sie in einfachem Englisch und verwenden Sie konkrete Kennzeichnungen (Firmenname, E-Mail-Adresse, charakteristische Formulierungen, Layouthinweise).
- Wählen Sie einen kurzen, geschäftsfreundlichen und aussagekräftigen Klassifizierungsnamen. Dieser dient als Grundlage für Ihre nachgelagerten Routing-Verzweigungen.
- Nutzen Sie die Schnellfüllbuttons für Rechnungen und Bestellungen als Ausgangspunkt und präzisieren Sie anschließend die Feldbeschreibungen für jede Variante.
- Hinzufügen
fieldMethod: "generate"bei Datumsangaben, berechneten Summen oder Feldern, bei denen die KI den Wert normalisieren und nicht wortgetreu kopieren soll. - Testen Sie jedes Schema anhand eines realen Beispiels, bevor Sie es in Betrieb nehmen: Eine offensichtliche Rechnung des Kunden ABC sollte immer an das Schema des Kunden ABC weitergeleitet werden, nicht an das Schema des Kunden XYZ.
- Klicken Änderungen speichern Nach jeder Bearbeitungsrunde gehen nicht gespeicherte Schemas bei der Navigation verloren.