Textextraktion anhand von Ausdrücken – RegEx-Suche API
PDF4me Text nach Ausdruck extrahieren ermöglicht es Ihnen, bestimmten Text zu extrahieren aus PDF Dokumente, die reguläre Ausdrücke verwenden. API Serviceprozesse PDF Dateien und extrahiert Text, der bestimmten Mustern/Ausdrücken entspricht. PDF Dokumente. Die API empfängt PDF Inhalte und reguläre Ausdrucksmuster durch REST API Anrufe, die genutzt werden Base64 Verschlüsselung für sichere Übertragung. Dank Unterstützung komplexer regulärer Ausdrücke und flexibler Seitenansprache eignet sich diese Lösung ideal für Workflows zur Dokumentenverarbeitung und Datenextraktion.
Authentifizierung Ihres API Anfrage
Um auf die PDF4me REST APIJede Anfrage muss die entsprechenden Authentifizierungsdaten enthalten. Die Authentifizierung gewährleistet eine sichere Kommunikation und bestätigt Ihre Identität als autorisierter Benutzer des Systems. REST APIDie
Hauptmerkmale
- Unterstützung für reguläre Ausdrücke: Extrahieren von Text mithilfe von regulären Ausdrücken für präzise Textübereinstimmung
- Flexibles Seiten-Targeting: Einzelne Seiten oder ganze Dokumente mit benutzerdefinierten Seitensequenzen verarbeiten
- MustererkennungUnterstützung für komplexe reguläre Ausdrücke und Mustererkennung
- Base64 Kodierung: Sichere Übertragung von Dateiinhalten mithilfe von Base64 Kodierung
- Einfach API IntegrationRESTful API Entwickelt für automatisierte Textextraktions-Workflows
REST API Endpunkt
Der PDF4me REST API verwendet Standard HTTP Methoden zur Interaktion mit Ressourcen. Die gesamte Textextraktion mittels Ausdrucksoperationen erfolgt über einen einzigen Endpunkt:
- Verfahren: POST
- Endpunkt:
/api/v2/ExtractTextByExpression
REST API Parameter
Vollständige Liste der Parameter für „Text nach Ausdruck extrahieren“. REST APIDie Parameter sind zur besseren Verständlichkeit und Implementierung nach Kategorien geordnet.
Wichtig: Mit einem Sternchen (*) gekennzeichnete Parameter sind erforderlich und müssen angegeben werden. API um ordnungsgemäß zu funktionieren.
Erforderliche Parameter
| Parameter | Typ | Beschreibung | Beispiel |
|---|---|---|---|
| docContent* | Base64 (String) | Der Inhalt der Eingabe PDF Datei in Base64 Format | JVBERi... |
| docName* | String | Quelle PDF Dateiname mit korrekter Dateiendung | output.pdf |
| expression* | String | Reguläres Ausdrucksmuster zur Textextraktion. Unterstützt die Standard-Regex-Syntax einschließlich Gruppen, Quantifizierern und Ankern. | % oder [A-Za-z]+ |
| pageSequence* | String | Geben Sie an, welche Seiten verarbeitet werden sollen. Verwenden Sie „1-“ für alle Seiten, „1-3“ für einen Bereich oder „1,2,3“ für bestimmte Seiten. | 1-3 |
Optionale Parameter
| Parameter | Typ | Beschreibung | Beispiel |
|---|---|---|---|
| async | Boolean | Aktivieren Sie die asynchrone Verarbeitung. Wenn true, Die API Rückgaben 202 Accepted mit einem Location Kopfzeile zum Abfragen des Ergebnisses | true |
Ausgabe
Der PDF4me Text nach Ausdruck extrahieren REST API Die Antwort hängt vom Verarbeitungsmodus ab. API gibt extrahierte Textübereinstimmungen als ein zurück JSON AntwortDie
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
Synchrone Verarbeitung (Standard)
Wann async Ist false oder nicht bereitgestellt, die API Gibt die extrahierten Textübereinstimmungen sofort zurück.
Statuscode: 200 OK
Antwortformat:
{
"textList": ["extracted text 1", "extracted text 2", "extracted text 3"]
}
Die Antwort enthält ein Array von Textzeichenfolgen, die dem angegebenen regulären Ausdrucksmuster entsprechen.
Asynchrone Verarbeitung
Wann async Ist true, Die API Das Dokument wird asynchron verarbeitet.
Erste Reaktion:
Statuscode: 202 Accepted
Antwort-Header:
Location: https://api.pdf4me.com/api/v2/ExtractTextByExpressionStatus/{operationId}
Antworttext:
{
"traceId": "operation-trace-id"
}
Umfrageergebnisse:
Verwenden Sie die Location Überschrift URL zur Vervollständigung der Umfrage:
const response = await fetch(locationUrl, {
headers: { 'Authorization': 'Basic ' + apiKey }
});
// Continue polling until status code is 200
if (response.status === 200) {
const result = await response.json();
// Process extracted text matches
}
Fehlermeldungen
| Statuscode | Beschreibung | Beispielantwort |
|---|---|---|
| 400 Bad Request | Ungültige Anfrageparameter, fehlende Pflichtfelder oder ungültiges reguläres Ausdrucksmuster | {"error": "Missing required parameter: expression"} |
| 401 Unauthorized | Ungültig oder fehlend API Schlüssel | {"error": "Unauthorized"} |
| 408 Anfrage-Timeout | Zeitüberschreitung bei der Anfrageverarbeitung | {"error": "Request timeout"} |
| 500 Internal Server Error | Serverfehler während der Verarbeitung | {"error": "Internal server error"} |
das Verständnis des JSON Antwort
Die Antwort der Textextraktion ist eine JSON Objekt, das Folgendes enthält:
- textListe: Array von Zeichenketten, die alle Textübereinstimmungen enthalten, die dem angegebenen regulären Ausdrucksmuster entsprechen
Seitenreihenfolgeformate:
"1-": Alle Seiten von Seite 1 bis zum Ende verarbeiten"1-3": Seiten 1, 2 und 3 bearbeiten"1,2,3": Spezifische Seiten 1, 2 und 3 verarbeiten
Ausdrucksbeispiele:
"%": Prozentzeichen"\\d+": Eine oder mehrere Ziffern übereinstimmen"[a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\\.[a-zA-Z]{2,}": E-Mail-Adressen abgleichen"https?://[^\\s]+": URLs abgleichen
Beispielanfrage
Kopfzeile
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
Notiz:
- Hol dir deins API Schlüssel vom PDF4me Armaturenbrett
- Der API Der Schlüssel muss sein Base64 kodiert und mit "Basic" präfixiert in der Authorization Überschrift
- Beispiel: Wenn Ihr API Schlüssel ist
abc123, kodieren Sie es zu Base64 und verwendenAuthorization: Basic YWJjMTIz
Nutzlast
Grundlegende Anfrage:
{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output.pdf",
"expression": "%",
"pageSequence": "1-3"
}
Mit asynchroner Verarbeitung:
{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output.pdf",
"expression": "\\d+",
"pageSequence": "1-3",
"async": true
}
Codebeispiele
Der PDF4me Text nach Ausdruck extrahieren REST API Es werden Codebeispiele in verschiedenen Programmiersprachen bereitgestellt. Wählen Sie die Sprache, die am besten zu Ihrer Entwicklungsumgebung passt:
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
C# (CSharp) Beispiel
Vollständig C# Implementierung zum Extrahieren von Text anhand eines Ausdrucks PDF:
Java Probe
Java Implementierung mit vollständiger Fehlerbehandlung und Antwortverarbeitung:
Python Probe
Python Implementierung mit der Requests-Bibliothek und JSON Handhabung:
Google Apps Script Probe
Google Apps Script Implementierung für Google Workspace Integration:
Funktionen zur Textextraktion
Verarbeitung regulärer Ausdrücke
- Mustererkennung: Volle Unterstützung für die Standard-Syntax regulärer Ausdrücke und Muster
- Komplexe MusterUnterstützung für erweiterte Regex-Funktionen einschließlich Gruppen, Quantifizierer und Anker
- Benutzerdefinierte Ausdrücke: Flexible Mustererstellung für spezifische Anforderungen an die Textextraktion
- MustervalidierungIntegrierte Validierung für Regex-Mustersyntax und Kompatibilität
- Professionelle ErgebnisseZuverlässige Textextraktion mit präziser Mustererkennung
Seitenverarbeitung
- Seitenausrichtung: Text aus bestimmten Seiten oder ganzen Dokumenten extrahieren
- SeitenfolgenUnterstützung für benutzerdefinierte Seitenbereiche und die Auswahl einzelner Seiten
- Flexible Verarbeitung: Beliebige Seitenkombinationen mit präziser Steuerung verarbeiten
- Stapelverarbeitung: Mehrere Seiten effizient in einem einzigen Prozess verarbeiten API Anrufe
- Professionelles Layout: Einheitliche Textextraktion auf allen Zielseiten
Erweiterte Funktionen
- TextanalyseUmfassende Textmusteranalyse und -identifizierung
- Benutzerdefinierte FilterungErweiterte Filteroptionen für spezifische Textextraktionsanforderungen
- Professionelle ExtraktionHochwertige Textextraktion mit klarer Sichtbarkeit
- Flexible MusterUnterstützung für beliebige reguläre Ausdrücke und Textvergleichsanforderungen
Branchenspezifische Anwendungsfälle und Anwendungen
- Legal & Professional Services
- Finance & Banking
- Business & Enterprise
- Education & Research
- Government & Compliance
Anwendungsfälle für Rechts- und Beratungsdienstleistungen
- Dokumentenanalyse: Spezifische Datenmuster aus Verträgen, Rechnungen und Rechtsdokumenten extrahieren
- Vertragsanalyse: Schlüsselbegriffe und Datenmuster aus Rechtsverträgen extrahieren
- Überwachung der Einhaltung: Regulatorische Informationen und Compliance-Daten aus Dokumenten extrahieren
- Rechtliche Datenextraktion: Spezifische Datenmuster aus juristischen Dokumenten extrahieren
Anwendungsfälle im Finanz- und Bankwesen
- Rechnungsverarbeitung: Rechnungsdaten und Feldwerte mithilfe von Mustererkennung extrahieren
- Finanzberichte: Spezifische Metriken und Datenpunkte extrahieren aus PDF Berichte
- Überwachung der Einhaltung: Regulatorische Informationen und Compliance-Daten aus Dokumenten extrahieren
- Finanzdatenanalyse: Strukturierte Daten aus Finanzdokumenten extrahieren
Anwendungsfälle für Unternehmen und Organisationen
- Data Mining: Strukturierte Daten aus unstrukturierten Daten identifizieren und extrahieren PDF Dokumente
- Inhaltsverarbeitung: Spezifische Textmuster für Inhaltsmanagement und -analyse extrahieren
- Formularverarbeitung: Formulardaten und Feldwerte mithilfe von Mustervergleich extrahieren
- Business Intelligence: Wichtige Geschäftskennzahlen und Leistungsindikatoren extrahieren aus PDF Berichte
Anwendungsfälle in Bildung und Forschung
- Forschungsanwendungen: Spezifische Datenmuster aus Forschungsarbeiten und akademischen Dokumenten extrahieren
- Akademische Datenextraktion: Strukturierte Daten aus Forschungsarbeiten extrahieren
- Forschungsanalyse: Spezifische Kennzahlen aus akademischen Dokumenten extrahieren
- Verarbeitung von Bildungsinhalten: Textmuster aus Bildungsdokumenten extrahieren
Anwendungsfälle im Bereich Regierung und Compliance
- Überwachung der Einhaltung: Regulatorische Informationen und Compliance-Daten aus Dokumenten extrahieren
- Extraktion regulatorischer Daten: Strukturierte Daten aus regulatorischen Dokumenten extrahieren
- Regierungsberichte: Spezifische Kennzahlen aus Regierungsberichten extrahieren
- Öffentliche AufzeichnungenDatenmuster aus öffentlichen Aufzeichnungen und Dokumenten extrahieren