Zum Hauptinhalt springen

Ressourcen extrahieren – Text- und Bildextraktor API

PDF4me Rohstoffgewinnung ermöglicht es Ihnen, Textinhalte und eingebettete Bilder zu extrahieren aus PDF Dokumente. Diese API Serviceprozesse PDF Dateien und extrahiert Text- und Bildressourcen aus PDF Dokumente. Die API empfängt PDF Inhalte durch REST API Anrufe, die genutzt werden Base64 Verschlüsselung für sichere Übertragung. Dank der Unterstützung für die selektive Extraktion von Text und Bildern eignet sich diese Lösung ideal für Workflows zur Inhaltsverarbeitung und Datenextraktionsplattformen.

Verwandte Blog-Beiträge
Zu dieser Funktion gibt es noch keinen Blogbeitrag – folgt in Kürze.
Schauen Sie sich in der Zwischenzeit im PDF4me-Blog Tutorials und Arbeitsabläufe für alle Plattformen an.
Besuchen Sie den Blog

Authentifizierung Ihres API Anfrage

Um auf die PDF4me REST APIJede Anfrage muss die entsprechenden Authentifizierungsdaten enthalten. Die Authentifizierung gewährleistet eine sichere Kommunikation und bestätigt Ihre Identität als autorisierter Benutzer des Systems. REST APIDie

Hauptmerkmale

  • Textextraktion: Extrahieren Sie den gesamten Textinhalt aus PDF Dokumente
  • Bildextraktion: Alle Bilder und visuellen Elemente abrufen von PDF Dokumente
  • Selektive ExtraktionWählen Sie je nach Ihren Anforderungen, ob nur Text, nur Bilder oder beides extrahiert werden soll.
  • Base64 Kodierung: Sichere Übertragung von Dateiinhalten mithilfe von Base64 Kodierung
  • Einfach API IntegrationRESTful API Entwickelt für automatisierte Arbeitsabläufe zur Inhaltsextraktion

REST API Endpunkt

Der PDF4me REST API verwendet Standard HTTP Methoden zur Interaktion mit Ressourcen. Alle Ressourcenextraktionsvorgänge werden über einen einzigen Endpunkt durchgeführt:

  • Verfahren: POST
  • Endpunkt: /api/v2/ExtractResources

REST API Parameter

Vollständige Liste der Parameter für die Ressourcenextraktion REST APIDie Parameter sind zur besseren Verständlichkeit und Implementierung nach Kategorien geordnet.

Wichtig: Mit einem Sternchen (*) gekennzeichnete Parameter sind erforderlich und müssen angegeben werden. API um ordnungsgemäß zu funktionieren.

Erforderliche Parameter

ParameterTypBeschreibungBeispiel
docContent*Base64 (String)Der Inhalt der Eingabe PDF Datei kodiert in Base64 Format für die Ressourcenextraktion und InhaltsanalyseJVBERi...
docName*StringQuelle PDF Dateiname mit korrekter .pdf-Erweiterung zur Dokumentenidentifizierung und Ressourcenextraktionsample.pdf
extractText*BooleanWählen Sie aus, ob Textinhalte aus dem extrahiert werden sollen. PDF: WAHR: Extrahieren Sie den gesamten Textinhalt inklusive Formatierung, FALSCH: Textextraktion bei reiner Bildverarbeitung überspringentrue
extractImages*BooleanWählen Sie aus, ob Bilder aus dem extrahiert werden sollen. PDF: WAHR: Bilder und visuelle Elemente extrahieren, FALSCH: Bildextraktion überspringen, um die Verarbeitung von reinem Text zu beschleunigentrue

Optionale Parameter

ParameterTypBeschreibungBeispiel
asyncBooleanAktivieren Sie die asynchrone Verarbeitung. Wenn true, Die API Rückgaben 202 Accepted mit einem Location Kopfzeile zum Abfragen des Ergebnissestrue

Ausgabe

Der PDF4me Rohstoffgewinnung REST API Die Antwort hängt vom Verarbeitungsmodus ab. API gibt extrahierten Text und Bilder als JSON AntwortDie

Synchrone Verarbeitung (Standard)

Wann async Ist false oder nicht bereitgestellt, die API Gibt die extrahierten Ressourcen sofort zurück.

Statuscode: 200 OK

Antwortformat:

{
"textList": ["extracted text content...", "more text..."],
"imageList": [
{
"fileName": "image1.png",
"imageContent": "base64-encoded-image-content..."
},
{
"fileName": "image2.jpg",
"imageContent": "base64-encoded-image-content..."
}
]
}

Die Antwort enthält extrahierten Text als ein Array von Zeichenketten und extrahierte Bilder als ein Array von Objekten mit Dateinamen und Base64-kodierter Inhalt.

Beispielanfrage

Kopfzeile

Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY

Notiz:

  • Hol dir deins API Schlüssel vom PDF4me Armaturenbrett
  • Der API Der Schlüssel muss sein Base64 kodiert und mit "Basic" präfixiert in der Authorization Überschrift
  • Beispiel: Wenn Ihr API Schlüssel ist abc123, kodieren Sie es zu Base64 und verwenden Authorization: Basic YWJjMTIz

Nutzlast

Grundlegende Anfrage:

{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "sample.pdf",
"extractText": true,
"extractImages": true
}

Mit asynchroner Verarbeitung:

{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "sample.pdf",
"extractText": true,
"extractImages": true,
"async": true
}

Codebeispiele

Der PDF4me Rohstoffgewinnung REST API Es werden Codebeispiele in verschiedenen Programmiersprachen bereitgestellt. Wählen Sie die Sprache, die am besten zu Ihrer Entwicklungsumgebung passt:

C# (CSharp) Beispiel

Vollständig C# Implementierung zur Extraktion von Ressourcen aus PDF:

Bildextraktionsmerkmale

  • Hochwertige Bilder: Bilder in Originalauflösung und -qualität extrahieren
  • Mehrere Formate: Unterstützung für verschiedene Bildformate (JPG, PNG, GIF, usw.)
  • Vektorgrafiken: Skalierbare Vektorgrafiken und Diagramme extrahieren
  • Metadatenerhaltung: Bildeigenschaften und Metadaten pflegen

Erweiterte Verarbeitung

  • Selektive ExtraktionWählen Sie zwischen reiner Text-, reiner Bild- oder kombinierter Extraktion.
  • Stapelverarbeitung: Mehrere Prozesse PDFs und Ressourcen effizient gewinnen
  • Inhaltsanalyse: Analysieren und kategorisieren Sie die extrahierten Inhaltstypen
  • Professionelle ErgebnisseHochwertige Extraktion, geeignet für Unternehmensanwendungen

Branchenspezifische Anwendungsfälle und Anwendungen

Anwendungsfälle für Dokumentenmanagement und -verarbeitung

  • Inhaltsdigitalisierung: Text und Bilder aus gescannten Dokumenten für digitale Archive extrahieren
  • Dokumentenanalyse: Analysieren PDF Inhalte zur Informationsgewinnung und -verarbeitung
  • Datenmigration: Inhalte während der Dokumentenmigration und Systemaktualisierungen extrahieren
  • Inhaltsindexierung: Erstellen Sie durchsuchbare Indizes aus PDF Text- und Bildinhalte

Hilfe erhalten