Text nach Ausdruck extrahieren n8n Aktion
PDF4me Text nach Ausdruck extrahieren extrahiert spezifische Textinhalte aus PDF Dokumente, die Mustervergleich und ausdrucksbasierte Filterung verwenden, werden durch n8n Automatisierte Arbeitsabläufe. Prozess PDFs weg n8n Trigger, Binärdaten, Base64-Strings oder öffentliche URLDiese Lösung dient der Texterkennung und -extraktion mithilfe von Platzhaltermustern (%), regulären Ausdrücken, spezifischen Datenfeldern, seitenbezogener Ausrichtung und flexiblen Extraktionsregeln mit strukturierter Ausgabe. Sie eignet sich ideal für die Extraktion von Rechnungsnummern, die Erfassung von Datenfeldern, die musterbasierte Textsuche, die automatisierte Datenextraktion, das Dokumentenparsing und Workflows zur Inhaltsanalyse, die eine präzise Textausrichtung mit flexibler Übereinstimmung und nahtloser Integration erfordern.
Aufstellen
Füge die PDF4me Fügen Sie Ihrem Knoten „Text nach Ausdruck extrahieren“ hinzu n8n Führen Sie den Workflow durch und konfigurieren Sie die erforderlichen Parameter. Anweisungen zur Ersteinrichtung finden Sie in unserer [Website/Dokumentation/etc.]. n8n IntegrationsleitfadenDie
Voraussetzungen:
- PDF4me API Zugangsdaten
- n8n Workflow-Zugriff
Konfiguration:
- Hinzufügen PDF4me Knoten zum Workflow
- Wählen Sie die Aktion „Text nach Ausdruck extrahieren“ aus.
- Eingabeparameter konfigurieren (siehe unten)

Parameter
Vollständige Liste der Parameter für die Aktion „Text nach Ausdruck extrahieren“. Konfigurieren Sie diese Parameter, um die Textextraktion zu steuern.
Wichtig: Mit einem Sternchen (***) gekennzeichnete Parameter sind erforderlich und müssen angegeben werden, damit die Aktion ordnungsgemäß funktioniert.
| Parameter | Typ | Beschreibung | Beispiel |
|---|---|---|---|
| Eingabedatentyp*** | String | PDF Auswahl des Eingabeformats • Wählen Sie das Format Ihrer PDF Dateneingabe • PDF4me unterstützt mehrere Eingabetypen • Optionen: Binärdaten, Base64 Zeichenkette oder URL | Binary Data |
| Binäres Eingabefeld | Binär | Binär PDF Dateieingabe (Erforderlich bei Binärdaten) • Referenz PDF Datei von vorheriger n8n Knoten- oder Datei-Upload • PDF4me Prozesse binär PDF Dateien mit automatischer Formaterkennung • Erforderlich, wenn der Eingabedatentyp "Binärdaten" ist | {{ $binary.data }} |
| Base64-PDF-Inhalt | String | Base64 Kodiert PDF Eingabe (Erforderlich, wenn Base64 Zeichenkette) • Bieten PDF Inhalt als Base64-kodierter String • PDF4me dekodiert und verarbeitet automatisch die PDF Inhalt • Erforderlich, wenn der Eingabedatentyp "Base64 String" | JVBER... |
| PDF-URL | String | Öffentlich PDF URL Eingabe (Erforderlich, wenn URL) • Eine öffentliche/offene Genehmigung einholen URL zum PDF Datei • PDF4me lädt die Datei herunter und verarbeitet sie von URL • Erforderlich, wenn der Eingabedatentyp "URL" | https://abc.com/document.pdf |
| Dokumentenname*** | String | Eingabedateiname • Geben Sie den Namen der Eingabe an. PDF Datei • Wird zur Formaterkennung und Verarbeitungsoptimierung verwendet • Muss die Dateiendung .pdf enthalten. | document.pdf |
| Ausdruck*** | String | Textextraktionsmuster • Definieren Sie das Muster oder den Ausdruck, der dem Textinhalt entspricht. • Unterstützt reguläre Ausdrücke, Platzhalter und benutzerdefinierte Ausdrücke • Verwenden % für Wildcard-Übereinstimmung oder spezifische Regex-Muster | % |
| Seitenfolge*** | String | Seitenbereichsspezifikation • Festlegen, welche Seiten zur Textextraktion verarbeitet werden sollen • Verwenden Sie „alle“ für das gesamte Dokument oder für bestimmte Seitenzahlen/Seitenbereiche. • Beispiele: „1,3,5“ (spezifisch), „1-5“ (Bereich), „1-“ (von Seite 1 bis Ende) | 1- |
Erweiterte Optionen
Folgende Parameter stehen im Abschnitt „Erweiterte Optionen“ zur Verfügung und sind optional:
| Parameter | Typ | Beschreibung | Beispiel |
|---|---|---|---|
| Benutzerdefinierte Profile | String | Benutzerdefinierte Konfigurationsprofile • Zusätzliche Optionen mithilfe benutzerdefinierter Profile festlegen • JSON-ähnliches Format mit vordefinierten Parametern • Ermöglicht erweiterte Extraktionsverarbeitungseinstellungen • Optional für spezielle Anforderungen | { "outputDataFormat": "json" } |
Ausgabe
Ausgabeparameter
| Parameter | Typ | Beschreibung | Beispiel |
|---|---|---|---|
| Dateiname | String | PDF4me generierter Dateiname - Der vollständige Dateiname des erfolgreich verarbeiteten Dokuments mit korrekter Dateiendung und Zeitstempel. PDF4me gewährleistet eine eindeutige Benennung und validiert die Einhaltung des Dateiformats für eine nahtlose Integration mit nachgelagerten Prozessen. | text_extraction_results_1756999697398.json |
| MIME-Typ | String | PDF4me MIME Typbezeichner - Die standardisierte MIME Typ für die extrahierte Inhaltsdatei, typischerweise application/json für strukturierte Daten oder application/zip Dies gilt für mehrere Dateien und gewährleistet die korrekte Dateiverarbeitung und -erkennung in allen Systemen und Anwendungen. | application/json |
| Dateigröße | Nummer | PDF4me Dateigröße in Bytes Die genaue Größe der extrahierten Inhaltsdatei in Bytes wird für die Speicherplanung, Bandbreitenoptimierung und Überwachung von Dateiübertragungen bereitgestellt. Unverzichtbar für die Dokumentenverwaltung und Workflow-Automatisierung in Unternehmen. | 106 |
| Erfolg | Boolean | PDF4me Extraktionsstatusanzeige - Boolescher Wert, der den Erfolg oder Misserfolg des Textextraktionsprozesses angibt. Rückgabewert true für erfolgreiche Extraktionen und false für alle Fehler, wodurch eine robuste Fehlerbehandlung in automatisierten Arbeitsabläufen ermöglicht wird | true |
| Nachricht | String | PDF4me Extraktionsstatusmeldung - Eine beschreibende Meldung, die das Ergebnis des Textextraktionsprozesses angibt. Sie liefert klare Statusmeldungen für erfolgreiche Extraktionen und detaillierte Fehlerinformationen zur Fehlerbehebung. | Text extraction by expression completed successfully |
| docName | String | PDF4me Originaldokumentname-Referenz - Der ursprüngliche Dateiname der Eingabedatei PDF Die verarbeitete Datei. Diese Referenz wird für Prüfprotokolle, Debugging-Zwecke und die Nachverfolgung der Quelle extrahierter Inhalte in Unternehmensworkflows aufbewahrt. | document.pdf |
| Ausdruck | String | PDF4me verwendeter Extraktionsausdruck Das Muster oder der Ausdruck, der zur Textextraktion verwendet wurde. Dieses Feld zeigt den tatsächlichen Ausdruck an, der während des Extraktionsprozesses angewendet wurde, um Überprüfungs- und Debugging-Zwecke zu ermöglichen. | % |
| Seitenfolge | String | PDF4me verarbeiteter Seitenbereich Der Seitenbereich, der bei der Textextraktion verarbeitet wurde. Dieses Feld zeigt die tatsächlich nach dem angegebenen Ausdruck durchsuchten Seiten an und ist zur Überprüfung und Fehlerbehebung hilfreich. | 1-2 |
N8N Maßnahmenreaktion
Der PDF4me Text nach Ausdruck extrahieren API Die Antwort kann in verschiedenen Formaten angezeigt werden. Wählen Sie die Ansicht, die Ihren Bedürfnissen am besten entspricht:
- JSON
- Table
- Schema
- Binary
JSON Antwortformat
Das Rohmaterial JSON Antwort von der API:
{
"fileName": "text_extraction_results_1756999697398.json",
"mimeType": "application/json",
"fileSize": 106,
"success": true,
"message": "Text extraction by expression completed successfully",
"docName": "document.pdf",
"expression": "%",
"pageSequence": "1-2"
}
Tabellenansicht
Antwortdaten in strukturierter Tabellenform:
| Parameter | Wert |
|---|---|
| fileName | text_extraction_results_1756999697398.json |
| mimeType | application/json |
| fileSize | 106 |
| success | true |
| docName | document.pdf |
| message | Text extraction by expression completed successfully |
| expression | % |
| pageSequence | 1-2 |
Schemaansicht
Die Datenstruktur und die Datentypen der Antwort:
fileName: AB text_extraction_results_1756999697398.json
mimeType: AB application/json
fileSize: # 106
success: ✓ true
docName: AB document.pdf
message: AB Text extraction by expression completed successfully
expression: AB %
pageSequence: AB 1-2
Typenindikatoren:
AB= String#= Zahl✓= Boolean
Binärdatenansicht
Die tatsächlich extrahierten Textinhaltsdaten und Metadaten:
data
─────────────────────────────────────────
File Name: text_extraction_results_1756999697398.json
File Extension: json
Mime Type: application/json
File Size: 106 bytes
Anwendungsfälle
Data Mining und Informationsextraktion
- Extrahieren Sie spezifische Datenmuster, Kontaktinformationen und strukturierte Daten aus PDF Dokumente, die benutzerdefinierte Ausdrücke für Data Mining und Business Intelligence verwenden
- Rechtsdokumente, Verträge und amtliche Aufzeichnungen verarbeiten, indem mithilfe gezielter Ausdrücke spezifische Klauseln, Begriffe und rechtliche Informationen extrahiert werden.
- Transformieren Sie Finanzberichte, Rechnungen und Buchhaltungsbelege, indem Sie mithilfe benutzerdefinierter Ausdrücke spezifische Finanzdaten, Beträge und Transaktionsinformationen extrahieren.
Inhaltsanalyse und Forschung
- Extrahieren Sie Forschungsdaten, Zitate und akademische Informationen aus PDF Dokumente, die benutzerdefinierte Ausdrücke für akademische Forschung und Inhaltsanalyse verwenden
- Verarbeiten Sie wissenschaftliche Arbeiten, Forschungsdokumente und technische Publikationen, indem Sie mithilfe gezielter Ausdrücke spezifische Daten, Messungen und Forschungsergebnisse extrahieren.
- Transformieren Sie Geschäftsberichte, Marktforschungsergebnisse und Branchenanalysen, indem Sie mithilfe benutzerdefinierter Ausdrücke spezifische Kennzahlen, Statistiken und Geschäftsdaten extrahieren.
Compliance- und Regulierungsabwicklung
- Extrahieren Sie Compliance-Daten, regulatorische Informationen und Auditdetails aus PDF Dokumente, die benutzerdefinierte Ausdrücke für die Einhaltung gesetzlicher Vorschriften und die Prüfungsabwicklung verwenden
- Qualitätskontrolldokumente, Inspektionsberichte und Zertifizierungsunterlagen werden durch die Extraktion spezifischer Konformitätsdaten, Normen und regulatorischer Informationen verarbeitet.
- Offizielle Dokumente, Genehmigungen und behördliche Anmeldungen lassen sich durch die Extraktion spezifischer regulatorischer Daten, Compliance-Kennzahlen und offizieller Informationen mithilfe benutzerdefinierter Ausdrücke transformieren.