Zum Hauptinhalt springen

Text nach Ausdruck extrahieren n8n Aktion

PDF4me Text nach Ausdruck extrahieren extrahiert spezifische Textinhalte aus PDF Dokumente, die Mustervergleich und ausdrucksbasierte Filterung verwenden, werden durch n8n Automatisierte Arbeitsabläufe. Prozess PDFs weg n8n Trigger, Binärdaten, Base64-Strings oder öffentliche URLDiese Lösung dient der Texterkennung und -extraktion mithilfe von Platzhaltermustern (%), regulären Ausdrücken, spezifischen Datenfeldern, seitenbezogener Ausrichtung und flexiblen Extraktionsregeln mit strukturierter Ausgabe. Sie eignet sich ideal für die Extraktion von Rechnungsnummern, die Erfassung von Datenfeldern, die musterbasierte Textsuche, die automatisierte Datenextraktion, das Dokumentenparsing und Workflows zur Inhaltsanalyse, die eine präzise Textausrichtung mit flexibler Übereinstimmung und nahtloser Integration erfordern.

Verwandte Blog-Beiträge
Zu dieser Funktion gibt es noch keinen Blogbeitrag – folgt in Kürze.
Schauen Sie sich in der Zwischenzeit im PDF4me-Blog Tutorials und Arbeitsabläufe für alle Plattformen an.
Besuchen Sie den Blog

Aufstellen

Füge die PDF4me Fügen Sie Ihrem Knoten „Text nach Ausdruck extrahieren“ hinzu n8n Führen Sie den Workflow durch und konfigurieren Sie die erforderlichen Parameter. Anweisungen zur Ersteinrichtung finden Sie in unserer [Website/Dokumentation/etc.]. n8n IntegrationsleitfadenDie

Voraussetzungen:

  • PDF4me API Zugangsdaten
  • n8n Workflow-Zugriff

Konfiguration:

  1. Hinzufügen PDF4me Knoten zum Workflow
  2. Wählen Sie die Aktion „Text nach Ausdruck extrahieren“ aus.
  3. Eingabeparameter konfigurieren (siehe unten)
Text nach Ausdruckskonfiguration extrahieren

Parameter

Vollständige Liste der Parameter für die Aktion „Text nach Ausdruck extrahieren“. Konfigurieren Sie diese Parameter, um die Textextraktion zu steuern.

Wichtig: Mit einem Sternchen (***) gekennzeichnete Parameter sind erforderlich und müssen angegeben werden, damit die Aktion ordnungsgemäß funktioniert.

ParameterTypBeschreibungBeispiel
Eingabedatentyp***StringPDF Auswahl des Eingabeformats
• Wählen Sie das Format Ihrer PDF Dateneingabe
PDF4me unterstützt mehrere Eingabetypen
• Optionen: Binärdaten, Base64 Zeichenkette oder URL
Binary Data
Binäres EingabefeldBinärBinär PDF Dateieingabe (Erforderlich bei Binärdaten)
• Referenz PDF Datei von vorheriger n8n Knoten- oder Datei-Upload
PDF4me Prozesse binär PDF Dateien mit automatischer Formaterkennung
• Erforderlich, wenn der Eingabedatentyp "Binärdaten" ist
{{ $binary.data }}
Base64-PDF-InhaltStringBase64 Kodiert PDF Eingabe (Erforderlich, wenn Base64 Zeichenkette)
• Bieten PDF Inhalt als Base64-kodierter String
PDF4me dekodiert und verarbeitet automatisch die PDF Inhalt
• Erforderlich, wenn der Eingabedatentyp "Base64 String"
JVBER...
PDF-URLStringÖffentlich PDF URL Eingabe (Erforderlich, wenn URL)
• Eine öffentliche/offene Genehmigung einholen URL zum PDF Datei
PDF4me lädt die Datei herunter und verarbeitet sie von URL
• Erforderlich, wenn der Eingabedatentyp "URL"
https://abc.com/document.pdf
Dokumentenname***StringEingabedateiname
• Geben Sie den Namen der Eingabe an. PDF Datei
• Wird zur Formaterkennung und Verarbeitungsoptimierung verwendet
• Muss die Dateiendung .pdf enthalten.
document.pdf
Ausdruck***StringTextextraktionsmuster
• Definieren Sie das Muster oder den Ausdruck, der dem Textinhalt entspricht.
• Unterstützt reguläre Ausdrücke, Platzhalter und benutzerdefinierte Ausdrücke
• Verwenden % für Wildcard-Übereinstimmung oder spezifische Regex-Muster
%
Seitenfolge***StringSeitenbereichsspezifikation
• Festlegen, welche Seiten zur Textextraktion verarbeitet werden sollen
• Verwenden Sie „alle“ für das gesamte Dokument oder für bestimmte Seitenzahlen/Seitenbereiche.
• Beispiele: „1,3,5“ (spezifisch), „1-5“ (Bereich), „1-“ (von Seite 1 bis Ende)
1-

Erweiterte Optionen

Folgende Parameter stehen im Abschnitt „Erweiterte Optionen“ zur Verfügung und sind optional:

ParameterTypBeschreibungBeispiel
Benutzerdefinierte ProfileStringBenutzerdefinierte Konfigurationsprofile
• Zusätzliche Optionen mithilfe benutzerdefinierter Profile festlegen
JSON-ähnliches Format mit vordefinierten Parametern
• Ermöglicht erweiterte Extraktionsverarbeitungseinstellungen
• Optional für spezielle Anforderungen
{ "outputDataFormat": "json" }

Ausgabe

Ausgabeparameter

ParameterTypBeschreibungBeispiel
DateinameStringPDF4me generierter Dateiname - Der vollständige Dateiname des erfolgreich verarbeiteten Dokuments mit korrekter Dateiendung und Zeitstempel. PDF4me gewährleistet eine eindeutige Benennung und validiert die Einhaltung des Dateiformats für eine nahtlose Integration mit nachgelagerten Prozessen.text_extraction_results_1756999697398.json
MIME-TypStringPDF4me MIME Typbezeichner - Die standardisierte MIME Typ für die extrahierte Inhaltsdatei, typischerweise application/json für strukturierte Daten oder application/zip Dies gilt für mehrere Dateien und gewährleistet die korrekte Dateiverarbeitung und -erkennung in allen Systemen und Anwendungen.application/json
DateigrößeNummerPDF4me Dateigröße in Bytes Die genaue Größe der extrahierten Inhaltsdatei in Bytes wird für die Speicherplanung, Bandbreitenoptimierung und Überwachung von Dateiübertragungen bereitgestellt. Unverzichtbar für die Dokumentenverwaltung und Workflow-Automatisierung in Unternehmen.106
ErfolgBooleanPDF4me Extraktionsstatusanzeige - Boolescher Wert, der den Erfolg oder Misserfolg des Textextraktionsprozesses angibt. Rückgabewert true für erfolgreiche Extraktionen und false für alle Fehler, wodurch eine robuste Fehlerbehandlung in automatisierten Arbeitsabläufen ermöglicht wirdtrue
NachrichtStringPDF4me Extraktionsstatusmeldung - Eine beschreibende Meldung, die das Ergebnis des Textextraktionsprozesses angibt. Sie liefert klare Statusmeldungen für erfolgreiche Extraktionen und detaillierte Fehlerinformationen zur Fehlerbehebung.Text extraction by expression completed successfully
docNameStringPDF4me Originaldokumentname-Referenz - Der ursprüngliche Dateiname der Eingabedatei PDF Die verarbeitete Datei. Diese Referenz wird für Prüfprotokolle, Debugging-Zwecke und die Nachverfolgung der Quelle extrahierter Inhalte in Unternehmensworkflows aufbewahrt.document.pdf
AusdruckStringPDF4me verwendeter Extraktionsausdruck Das Muster oder der Ausdruck, der zur Textextraktion verwendet wurde. Dieses Feld zeigt den tatsächlichen Ausdruck an, der während des Extraktionsprozesses angewendet wurde, um Überprüfungs- und Debugging-Zwecke zu ermöglichen.%
SeitenfolgeStringPDF4me verarbeiteter Seitenbereich Der Seitenbereich, der bei der Textextraktion verarbeitet wurde. Dieses Feld zeigt die tatsächlich nach dem angegebenen Ausdruck durchsuchten Seiten an und ist zur Überprüfung und Fehlerbehebung hilfreich.1-2

N8N Maßnahmenreaktion

Der PDF4me Text nach Ausdruck extrahieren API Die Antwort kann in verschiedenen Formaten angezeigt werden. Wählen Sie die Ansicht, die Ihren Bedürfnissen am besten entspricht:

JSON Antwortformat

Das Rohmaterial JSON Antwort von der API:

{
"fileName": "text_extraction_results_1756999697398.json",
"mimeType": "application/json",
"fileSize": 106,
"success": true,
"message": "Text extraction by expression completed successfully",
"docName": "document.pdf",
"expression": "%",
"pageSequence": "1-2"
}

Anwendungsfälle

Data Mining und Informationsextraktion

  • Extrahieren Sie spezifische Datenmuster, Kontaktinformationen und strukturierte Daten aus PDF Dokumente, die benutzerdefinierte Ausdrücke für Data Mining und Business Intelligence verwenden
  • Rechtsdokumente, Verträge und amtliche Aufzeichnungen verarbeiten, indem mithilfe gezielter Ausdrücke spezifische Klauseln, Begriffe und rechtliche Informationen extrahiert werden.
  • Transformieren Sie Finanzberichte, Rechnungen und Buchhaltungsbelege, indem Sie mithilfe benutzerdefinierter Ausdrücke spezifische Finanzdaten, Beträge und Transaktionsinformationen extrahieren.

Inhaltsanalyse und Forschung

  • Extrahieren Sie Forschungsdaten, Zitate und akademische Informationen aus PDF Dokumente, die benutzerdefinierte Ausdrücke für akademische Forschung und Inhaltsanalyse verwenden
  • Verarbeiten Sie wissenschaftliche Arbeiten, Forschungsdokumente und technische Publikationen, indem Sie mithilfe gezielter Ausdrücke spezifische Daten, Messungen und Forschungsergebnisse extrahieren.
  • Transformieren Sie Geschäftsberichte, Marktforschungsergebnisse und Branchenanalysen, indem Sie mithilfe benutzerdefinierter Ausdrücke spezifische Kennzahlen, Statistiken und Geschäftsdaten extrahieren.

Compliance- und Regulierungsabwicklung

  • Extrahieren Sie Compliance-Daten, regulatorische Informationen und Auditdetails aus PDF Dokumente, die benutzerdefinierte Ausdrücke für die Einhaltung gesetzlicher Vorschriften und die Prüfungsabwicklung verwenden
  • Qualitätskontrolldokumente, Inspektionsberichte und Zertifizierungsunterlagen werden durch die Extraktion spezifischer Konformitätsdaten, Normen und regulatorischer Informationen verarbeitet.
  • Offizielle Dokumente, Genehmigungen und behördliche Anmeldungen lassen sich durch die Extraktion spezifischer regulatorischer Daten, Compliance-Kennzahlen und offizieller Informationen mithilfe benutzerdefinierter Ausdrücke transformieren.

Hilfe erhalten