Ressourcen extrahieren – Text- und Bildextraktor API
PDF4me Rohstoffgewinnung ermöglicht es Ihnen, Textinhalte und eingebettete Bilder zu extrahieren aus PDF Dokumente. Diese API Serviceprozesse PDF Dateien und extrahiert Text- und Bildressourcen aus PDF Dokumente. Die API empfängt PDF Inhalte durch REST API Anrufe, die genutzt werden Base64 Verschlüsselung für sichere Übertragung. Dank der Unterstützung für die selektive Extraktion von Text und Bildern eignet sich diese Lösung ideal für Workflows zur Inhaltsverarbeitung und Datenextraktionsplattformen.
Authentifizierung Ihres API Anfrage
Um auf die PDF4me REST APIJede Anfrage muss die entsprechenden Authentifizierungsdaten enthalten. Die Authentifizierung gewährleistet eine sichere Kommunikation und bestätigt Ihre Identität als autorisierter Benutzer des Systems. REST APIDie
Hauptmerkmale
- Textextraktion: Extrahieren Sie den gesamten Textinhalt aus PDF Dokumente
- Bildextraktion: Alle Bilder und visuellen Elemente abrufen von PDF Dokumente
- Selektive ExtraktionWählen Sie je nach Ihren Anforderungen, ob nur Text, nur Bilder oder beides extrahiert werden soll.
- Base64 Kodierung: Sichere Übertragung von Dateiinhalten mithilfe von Base64 Kodierung
- Einfach API IntegrationRESTful API Entwickelt für automatisierte Arbeitsabläufe zur Inhaltsextraktion
REST API Endpunkt
Der PDF4me REST API verwendet Standard HTTP Methoden zur Interaktion mit Ressourcen. Alle Ressourcenextraktionsvorgänge werden über einen einzigen Endpunkt durchgeführt:
- Verfahren: POST
- Endpunkt:
/api/v2/ExtractResources
REST API Parameter
Vollständige Liste der Parameter für die Ressourcenextraktion REST APIDie Parameter sind zur besseren Verständlichkeit und Implementierung nach Kategorien geordnet.
Wichtig: Mit einem Sternchen (*) gekennzeichnete Parameter sind erforderlich und müssen angegeben werden. API um ordnungsgemäß zu funktionieren.
Erforderliche Parameter
| Parameter | Typ | Beschreibung | Beispiel |
|---|---|---|---|
| docContent* | Base64 (String) | Der Inhalt der Eingabe PDF Datei kodiert in Base64 Format für die Ressourcenextraktion und Inhaltsanalyse | JVBERi... |
| docName* | String | Quelle PDF Dateiname mit korrekter .pdf-Erweiterung zur Dokumentenidentifizierung und Ressourcenextraktion | sample.pdf |
| extractText* | Boolean | Wählen Sie aus, ob Textinhalte aus dem extrahiert werden sollen. PDF: WAHR: Extrahieren Sie den gesamten Textinhalt inklusive Formatierung, FALSCH: Textextraktion bei reiner Bildverarbeitung überspringen | true |
| extractImages* | Boolean | Wählen Sie aus, ob Bilder aus dem extrahiert werden sollen. PDF: WAHR: Bilder und visuelle Elemente extrahieren, FALSCH: Bildextraktion überspringen, um die Verarbeitung von reinem Text zu beschleunigen | true |
Optionale Parameter
| Parameter | Typ | Beschreibung | Beispiel |
|---|---|---|---|
| async | Boolean | Aktivieren Sie die asynchrone Verarbeitung. Wenn true, Die API Rückgaben 202 Accepted mit einem Location Kopfzeile zum Abfragen des Ergebnisses | true |
Ausgabe
Der PDF4me Rohstoffgewinnung REST API Die Antwort hängt vom Verarbeitungsmodus ab. API gibt extrahierten Text und Bilder als JSON AntwortDie
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
Synchrone Verarbeitung (Standard)
Wann async Ist false oder nicht bereitgestellt, die API Gibt die extrahierten Ressourcen sofort zurück.
Statuscode: 200 OK
Antwortformat:
{
"textList": ["extracted text content...", "more text..."],
"imageList": [
{
"fileName": "image1.png",
"imageContent": "base64-encoded-image-content..."
},
{
"fileName": "image2.jpg",
"imageContent": "base64-encoded-image-content..."
}
]
}
Die Antwort enthält extrahierten Text als ein Array von Zeichenketten und extrahierte Bilder als ein Array von Objekten mit Dateinamen und Base64-kodierter Inhalt.
Asynchrone Verarbeitung
Wann async Ist true, Die API Das Dokument wird asynchron verarbeitet.
Erste Reaktion:
Statuscode: 202 Accepted
Antwort-Header:
Location: https://api.pdf4me.com/api/v2/ExtractResourcesStatus/{operationId}
Antworttext:
{
"traceId": "operation-trace-id"
}
Umfrageergebnisse:
Verwenden Sie die Location Überschrift URL zur Vervollständigung der Umfrage:
const response = await fetch(locationUrl, {
headers: { 'Authorization': 'Basic ' + apiKey }
});
// Continue polling until status code is 200
if (response.status === 200) {
const result = await response.json();
// Process extracted resources
}
Fehlermeldungen
| Statuscode | Beschreibung | Beispielantwort |
|---|---|---|
| 400 Bad Request | Ungültige Anfrageparameter oder fehlende Pflichtfelder | {"error": "Missing required parameter: docContent"} |
| 401 Unauthorized | Ungültig oder fehlend API Schlüssel | {"error": "Unauthorized"} |
| 408 Anfrage-Timeout | Zeitüberschreitung bei der Anfrageverarbeitung | {"error": "Request timeout"} |
| 500 Internal Server Error | Serverfehler während der Verarbeitung | {"error": "Internal server error"} |
das Verständnis des JSON Antwort
Die Reaktion auf die Rohstoffgewinnung ist eine JSON Objekt, das Folgendes enthält:
- textListe: Array von Zeichenketten, die extrahierten Textinhalt enthalten (wenn
extractTextIsttrue) - Bildliste: Array von Bildobjekten (wenn
extractImagesIsttrue) - DateinameDer Name der extrahierten Bilddatei
- Bildinhalt: Base64-kodierter Inhalt des Bildes
Dekodierung Base64 Bildinhalt:
Zum Entschlüsseln und Speichern Base64-kodierte Bilder:
// JavaScript
const decoded = atob(base64String);
const blob = new Blob([decoded], { type: 'image/png' });
const url = URL.createObjectURL(blob);
# Python
import base64
image_data = base64.b64decode(base64_string)
with open('extracted_image.png', 'wb') as f:
f.write(image_data)
Beispielanfrage
Kopfzeile
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
Notiz:
- Hol dir deins API Schlüssel vom PDF4me Armaturenbrett
- Der API Der Schlüssel muss sein Base64 kodiert und mit "Basic" präfixiert in der Authorization Überschrift
- Beispiel: Wenn Ihr API Schlüssel ist
abc123, kodieren Sie es zu Base64 und verwendenAuthorization: Basic YWJjMTIz
Nutzlast
Grundlegende Anfrage:
{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "sample.pdf",
"extractText": true,
"extractImages": true
}
Mit asynchroner Verarbeitung:
{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "sample.pdf",
"extractText": true,
"extractImages": true,
"async": true
}
Codebeispiele
Der PDF4me Rohstoffgewinnung REST API Es werden Codebeispiele in verschiedenen Programmiersprachen bereitgestellt. Wählen Sie die Sprache, die am besten zu Ihrer Entwicklungsumgebung passt:
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
C# (CSharp) Beispiel
Vollständig C# Implementierung zur Extraktion von Ressourcen aus PDF:
Java Probe
Java Implementierung mit vollständiger Fehlerbehandlung und Antwortverarbeitung:
Python Probe
Python Implementierung mit der Requests-Bibliothek und JSON Handhabung:
Google Apps Script Probe
Google Apps Script Implementierung für Google Workspace Integration:
Bildextraktionsmerkmale
- Hochwertige Bilder: Bilder in Originalauflösung und -qualität extrahieren
- Mehrere Formate: Unterstützung für verschiedene Bildformate (JPG, PNG, GIF, usw.)
- Vektorgrafiken: Skalierbare Vektorgrafiken und Diagramme extrahieren
- Metadatenerhaltung: Bildeigenschaften und Metadaten pflegen
Erweiterte Verarbeitung
- Selektive ExtraktionWählen Sie zwischen reiner Text-, reiner Bild- oder kombinierter Extraktion.
- Stapelverarbeitung: Mehrere Prozesse PDFs und Ressourcen effizient gewinnen
- Inhaltsanalyse: Analysieren und kategorisieren Sie die extrahierten Inhaltstypen
- Professionelle ErgebnisseHochwertige Extraktion, geeignet für Unternehmensanwendungen
Branchenspezifische Anwendungsfälle und Anwendungen
- Document Management & Processing
- Business & Finance
- Legal & Compliance
- Healthcare & Medical
- Education & Research
- Marketing & Content
Anwendungsfälle für Dokumentenmanagement und -verarbeitung
- Inhaltsdigitalisierung: Text und Bilder aus gescannten Dokumenten für digitale Archive extrahieren
- Dokumentenanalyse: Analysieren PDF Inhalte zur Informationsgewinnung und -verarbeitung
- Datenmigration: Inhalte während der Dokumentenmigration und Systemaktualisierungen extrahieren
- Inhaltsindexierung: Erstellen Sie durchsuchbare Indizes aus PDF Text- und Bildinhalte
Anwendungsfälle im Bereich Wirtschaft und Finanzen
- Rechnungsverarbeitung: Extrahieren von Text und Bildern aus Rechnungen zur automatisierten Verarbeitung
- BerichtsanalyseDaten und Diagramme aus Finanzberichten und -aufstellungen extrahieren
- Vertragsmanagement: Text- und Bildelemente aus Verträgen und Vereinbarungen extrahieren
- Konformitätsdokumentation: Regulatorische Dokumente verarbeiten und die benötigten Informationen extrahieren
Anwendungsfälle im Bereich Recht und Compliance
- Bearbeitung von Rechtsdokumenten: Text und Beweismittel aus juristischen Dokumenten extrahieren
- Fallmanagement: Inhalte aus Fallakten und Schriftsätzen extrahieren
- Einhaltung gesetzlicher Bestimmungen: Konformitätsdokumente verarbeiten und erforderliche Daten extrahieren
- Beweissammlung: Text und Bilder für rechtliche Beweismittel und Dokumentation extrahieren
Anwendungsfälle im Gesundheitswesen und in der Medizin
- Krankenakten: Text und Bilder aus Patientenakten und medizinischen Berichten extrahieren
- ForschungsdatenForschungsdokumente verarbeiten und Daten und Diagramme extrahieren
- Klinische Studien: Informationen aus klinischen Studiendokumenten extrahieren
- Medizinische Bildgebung: Medizinische Bilder und diagnostische Inhalte extrahieren aus PDFs
Anwendungsfälle in Bildung und Forschung
- Wissenschaftliche Arbeiten: Text und Abbildungen aus Forschungsarbeiten und Publikationen extrahieren
- BildungsinhalteProzesslehrbücher und Lehrmaterialien
- ForschungsdatenDaten und Diagramme aus Forschungsdokumenten extrahieren
- Bibliotheksdigitalisierung: Bibliotheksbestände digitalisieren und durchsuchbare Inhalte extrahieren
Anwendungsfälle im Bereich Marketing & Content
- Inhaltserstellung: Texte und Bilder für Content-Marketing und soziale Medien extrahieren
- Markenwerte: Logos und Branding-Elemente extrahieren aus PDF Dokumente
- Designressourcen: Designelemente und Grafiken für kreative Projekte extrahieren
- InhaltswiederverwendungInhalte extrahieren, um sie in verschiedenen Formaten und Plattformen wiederzuverwenden.