Zum Hauptinhalt springen

Textextraktion anhand von Ausdrücken – RegEx-Suche API

PDF4me Text nach Ausdruck extrahieren ermöglicht es Ihnen, bestimmten Text zu extrahieren aus PDF Dokumente, die reguläre Ausdrücke verwenden. API Serviceprozesse PDF Dateien und extrahiert Text, der bestimmten Mustern/Ausdrücken entspricht. PDF Dokumente. Die API empfängt PDF Inhalte und reguläre Ausdrucksmuster durch REST API Anrufe, die genutzt werden Base64 Verschlüsselung für sichere Übertragung. Dank Unterstützung komplexer regulärer Ausdrücke und flexibler Seitenansprache eignet sich diese Lösung ideal für Workflows zur Dokumentenverarbeitung und Datenextraktion.

Verwandte Blog-Beiträge
Zu dieser Funktion gibt es noch keinen Blogbeitrag – folgt in Kürze.
Schauen Sie sich in der Zwischenzeit im PDF4me-Blog Tutorials und Arbeitsabläufe für alle Plattformen an.
Besuchen Sie den Blog

Authentifizierung Ihres API Anfrage

Um auf die PDF4me REST APIJede Anfrage muss die entsprechenden Authentifizierungsdaten enthalten. Die Authentifizierung gewährleistet eine sichere Kommunikation und bestätigt Ihre Identität als autorisierter Benutzer des Systems. REST APIDie

Hauptmerkmale

  • Unterstützung für reguläre Ausdrücke: Extrahieren von Text mithilfe von regulären Ausdrücken für präzise Textübereinstimmung
  • Flexibles Seiten-Targeting: Einzelne Seiten oder ganze Dokumente mit benutzerdefinierten Seitensequenzen verarbeiten
  • MustererkennungUnterstützung für komplexe reguläre Ausdrücke und Mustererkennung
  • Base64 Kodierung: Sichere Übertragung von Dateiinhalten mithilfe von Base64 Kodierung
  • Einfach API IntegrationRESTful API Entwickelt für automatisierte Textextraktions-Workflows

REST API Endpunkt

Der PDF4me REST API verwendet Standard HTTP Methoden zur Interaktion mit Ressourcen. Die gesamte Textextraktion mittels Ausdrucksoperationen erfolgt über einen einzigen Endpunkt:

  • Verfahren: POST
  • Endpunkt: /api/v2/ExtractTextByExpression

REST API Parameter

Vollständige Liste der Parameter für „Text nach Ausdruck extrahieren“. REST APIDie Parameter sind zur besseren Verständlichkeit und Implementierung nach Kategorien geordnet.

Wichtig: Mit einem Sternchen (*) gekennzeichnete Parameter sind erforderlich und müssen angegeben werden. API um ordnungsgemäß zu funktionieren.

Erforderliche Parameter

ParameterTypBeschreibungBeispiel
docContent*Base64 (String)Der Inhalt der Eingabe PDF Datei in Base64 FormatJVBERi...
docName*StringQuelle PDF Dateiname mit korrekter Dateiendungoutput.pdf
expression*StringReguläres Ausdrucksmuster zur Textextraktion. Unterstützt die Standard-Regex-Syntax einschließlich Gruppen, Quantifizierern und Ankern.% oder [A-Za-z]+
pageSequence*StringGeben Sie an, welche Seiten verarbeitet werden sollen. Verwenden Sie „1-“ für alle Seiten, „1-3“ für einen Bereich oder „1,2,3“ für bestimmte Seiten.1-3

Optionale Parameter

ParameterTypBeschreibungBeispiel
asyncBooleanAktivieren Sie die asynchrone Verarbeitung. Wenn true, Die API Rückgaben 202 Accepted mit einem Location Kopfzeile zum Abfragen des Ergebnissestrue

Ausgabe

Der PDF4me Text nach Ausdruck extrahieren REST API Die Antwort hängt vom Verarbeitungsmodus ab. API gibt extrahierte Textübereinstimmungen als ein zurück JSON AntwortDie

Synchrone Verarbeitung (Standard)

Wann async Ist false oder nicht bereitgestellt, die API Gibt die extrahierten Textübereinstimmungen sofort zurück.

Statuscode: 200 OK

Antwortformat:

{
"textList": ["extracted text 1", "extracted text 2", "extracted text 3"]
}

Die Antwort enthält ein Array von Textzeichenfolgen, die dem angegebenen regulären Ausdrucksmuster entsprechen.

Beispielanfrage

Kopfzeile

Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY

Notiz:

  • Hol dir deins API Schlüssel vom PDF4me Armaturenbrett
  • Der API Der Schlüssel muss sein Base64 kodiert und mit "Basic" präfixiert in der Authorization Überschrift
  • Beispiel: Wenn Ihr API Schlüssel ist abc123, kodieren Sie es zu Base64 und verwenden Authorization: Basic YWJjMTIz

Nutzlast

Grundlegende Anfrage:

{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output.pdf",
"expression": "%",
"pageSequence": "1-3"
}

Mit asynchroner Verarbeitung:

{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output.pdf",
"expression": "\\d+",
"pageSequence": "1-3",
"async": true
}

Codebeispiele

Der PDF4me Text nach Ausdruck extrahieren REST API Es werden Codebeispiele in verschiedenen Programmiersprachen bereitgestellt. Wählen Sie die Sprache, die am besten zu Ihrer Entwicklungsumgebung passt:

C# (CSharp) Beispiel

Vollständig C# Implementierung zum Extrahieren von Text anhand eines Ausdrucks PDF:

Funktionen zur Textextraktion

Verarbeitung regulärer Ausdrücke

  • Mustererkennung: Volle Unterstützung für die Standard-Syntax regulärer Ausdrücke und Muster
  • Komplexe MusterUnterstützung für erweiterte Regex-Funktionen einschließlich Gruppen, Quantifizierer und Anker
  • Benutzerdefinierte Ausdrücke: Flexible Mustererstellung für spezifische Anforderungen an die Textextraktion
  • MustervalidierungIntegrierte Validierung für Regex-Mustersyntax und Kompatibilität
  • Professionelle ErgebnisseZuverlässige Textextraktion mit präziser Mustererkennung

Seitenverarbeitung

  • Seitenausrichtung: Text aus bestimmten Seiten oder ganzen Dokumenten extrahieren
  • SeitenfolgenUnterstützung für benutzerdefinierte Seitenbereiche und die Auswahl einzelner Seiten
  • Flexible Verarbeitung: Beliebige Seitenkombinationen mit präziser Steuerung verarbeiten
  • Stapelverarbeitung: Mehrere Seiten effizient in einem einzigen Prozess verarbeiten API Anrufe
  • Professionelles Layout: Einheitliche Textextraktion auf allen Zielseiten

Erweiterte Funktionen

  • TextanalyseUmfassende Textmusteranalyse und -identifizierung
  • Benutzerdefinierte FilterungErweiterte Filteroptionen für spezifische Textextraktionsanforderungen
  • Professionelle ExtraktionHochwertige Textextraktion mit klarer Sichtbarkeit
  • Flexible MusterUnterstützung für beliebige reguläre Ausdrücke und Textvergleichsanforderungen

Branchenspezifische Anwendungsfälle und Anwendungen

Anwendungsfälle für Rechts- und Beratungsdienstleistungen

  • Dokumentenanalyse: Spezifische Datenmuster aus Verträgen, Rechnungen und Rechtsdokumenten extrahieren
  • Vertragsanalyse: Schlüsselbegriffe und Datenmuster aus Rechtsverträgen extrahieren
  • Überwachung der Einhaltung: Regulatorische Informationen und Compliance-Daten aus Dokumenten extrahieren
  • Rechtliche Datenextraktion: Spezifische Datenmuster aus juristischen Dokumenten extrahieren

Hilfe erhalten