Tabelle extrahieren PDF - Datenparser API
PDF4me Tabelle extrahieren PDF ermöglicht es Ihnen, Tabellenstrukturen und Daten zu extrahieren aus PDF Dokumente. Diese API Serviceprozesse PDF Dateien und extrahiert Tabelleninhalte, Struktur und Daten aus PDF Dokumente. Die API empfängt PDF Inhalte durch REST API Anrufe, die genutzt werden Base64 Verschlüsselung für sichere Übertragung. Dank Unterstützung für strukturierte Datenausgabe und Tabellenanalyse eignet sich diese Lösung ideal für Datenverarbeitungs-Workflows und Business-Intelligence-Plattformen.
Authentifizierung Ihres API Anfrage
Um auf die PDF4me REST APIJede Anfrage muss die entsprechenden Authentifizierungsdaten enthalten. Die Authentifizierung gewährleistet eine sichere Kommunikation und bestätigt Ihre Identität als autorisierter Benutzer des Systems. REST APIDie
Hauptmerkmale
- Tabellenextraktion: Tabellenstrukturen und Daten extrahieren aus PDF Dokumente
- Ausgabe strukturierter Daten: Abrufen von Tabellendaten in organisierten, strukturierten Formaten zur einfachen Integration
- Erhaltung der Tabellenstruktur: Tabellenlayout, Überschriften, Zeilen und Spaltenbeziehungen beibehalten
- Base64 Kodierung: Sichere Übertragung von Dateiinhalten mithilfe von Base64 Kodierung
- Einfach API IntegrationRESTful API Entwickelt für automatisierte Tabellenextraktions-Workflows
REST API Endpunkt
Der PDF4me REST API verwendet Standard HTTP Methoden zur Interaktion mit Ressourcen. Alle Tabellenextraktionsoperationen werden über einen einzigen Endpunkt durchgeführt:
- Verfahren: POST
- Endpunkt:
/api/v2/ExtractTableFromPdf
REST API Parameter
Vollständige Liste der Parameter für die Funktion „Tabelle extrahieren aus“ PDF REST APIDie Parameter sind zur besseren Verständlichkeit und Implementierung nach Kategorien geordnet.
Wichtig: Mit einem Sternchen (*) gekennzeichnete Parameter sind erforderlich und müssen angegeben werden. API um ordnungsgemäß zu funktionieren.
Erforderliche Parameter
| Parameter | Typ | Beschreibung | Beispiel |
|---|---|---|---|
| docName* | String | Quelle PDF Dateiname mit korrekter .pdf-Erweiterung zur Dokumentenidentifizierung und Tabellenextraktion | output.pdf |
| docContent* | Base64 (String) | Der Inhalt der Eingabe PDF Datei kodiert in Base64 Format für Tabellenanalyse und Datenextraktionsverarbeitung | JVBERi... |
Optionale Parameter
| Parameter | Typ | Beschreibung | Beispiel |
|---|---|---|---|
| async | Boolean | Aktivieren Sie die asynchrone Verarbeitung. Wenn true, Die API Rückgaben 202 Accepted mit einem Location Kopfzeile zum Abfragen des Ergebnisses | true |
Ausgabe
Der PDF4me Tabelle extrahieren PDF REST API Die Antwort hängt vom Verarbeitungsmodus ab. API gibt extrahierte Tabellendaten als JSON AntwortDie
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
Synchrone Verarbeitung (Standard)
Wann async Ist false oder nicht bereitgestellt, die API Gibt die extrahierten Tabellendaten sofort zurück.
Statuscode: 200 OK
Antwortformat:
{
"tables": [
{
"rows": [
["Header 1", "Header 2", "Header 3"],
["Data 1", "Data 2", "Data 3"],
["Data 4", "Data 5", "Data 6"]
],
"columns": 3,
"rows": 3
}
]
}
Die Antwort enthält ein Array von Tabellen, die jeweils Zeilen, Spalten und Zellendaten enthalten.
Asynchrone Verarbeitung
Wann async Ist true, Die API Das Dokument wird asynchron verarbeitet.
Erste Reaktion:
Statuscode: 202 Accepted
Antwort-Header:
Location: https://api.pdf4me.com/api/v2/ExtractTableFromPdfStatus/{operationId}
Antworttext:
{
"traceId": "operation-trace-id"
}
Umfrageergebnisse:
Verwenden Sie die Location Überschrift URL zur Vervollständigung der Umfrage:
const response = await fetch(locationUrl, {
headers: { 'Authorization': 'Basic ' + apiKey }
});
// Continue polling until status code is 200
if (response.status === 200) {
const result = await response.json();
// Process extracted table data
}
Fehlermeldungen
| Statuscode | Beschreibung | Beispielantwort |
|---|---|---|
| 400 Bad Request | Ungültige Anfrageparameter oder fehlende Pflichtfelder | {"error": "Missing required parameter: docContent"} |
| 401 Unauthorized | Ungültig oder fehlend API Schlüssel | {"error": "Unauthorized"} |
| 408 Anfrage-Timeout | Zeitüberschreitung bei der Anfrageverarbeitung | {"error": "Request timeout"} |
| 500 Internal Server Error | Serverfehler während der Verarbeitung | {"error": "Internal server error"} |
das Verständnis des JSON Antwort
Die Antwort der Tabellenextraktion ist eine JSON Objekt, das Folgendes enthält:
- Tabellen: Array von Tabellenobjekten
- Zeilen: Array von Arrays, die Tabellenzeilen darstellen (jede Zeile ist ein Array von Zellwerten)
- Spalten: Anzahl der Spalten in der Tabelle
- ZeilenAnzahl der Zeilen in der Tabelle
Tabellenstruktur:
Jede Tabelle wird als zweidimensionales Array dargestellt, wobei:
- Das äußere Array repräsentiert Zeilen.
- Die inneren Arrays stellen Zellen in jeder Zeile dar.
- Die erste Zeile enthält typischerweise Spaltenüberschriften.
Beispielanfrage
Kopfzeile
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
Notiz:
- Hol dir deins API Schlüssel vom PDF4me Armaturenbrett
- Der API Der Schlüssel muss sein Base64 kodiert und mit "Basic" präfixiert in der Authorization Überschrift
- Beispiel: Wenn Ihr API Schlüssel ist
abc123, kodieren Sie es zu Base64 und verwendenAuthorization: Basic YWJjMTIz
Nutzlast
Grundlegende Anfrage:
{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output.pdf"
}
Mit asynchroner Verarbeitung:
{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output.pdf",
"async": true
}
Codebeispiele
Der PDF4me Tabelle extrahieren PDF REST API Es werden Codebeispiele in verschiedenen Programmiersprachen bereitgestellt. Wählen Sie die Sprache, die am besten zu Ihrer Entwicklungsumgebung passt:
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
C# (CSharp) Beispiel
Vollständig C# Implementierung zum Extrahieren von Tabellen aus PDF:
Java Probe
Java Implementierung mit vollständiger Fehlerbehandlung und Antwortverarbeitung:
Python Probe
Python Implementierung mit der Requests-Bibliothek und JSON Handhabung:
Google Apps Script Probe
Google Apps Script Implementierung für Google Workspace Integration:
Funktionen zur Tabellenextraktion
Datenextraktionsfähigkeiten
- Vollständige Tischwiederherstellung: Alle Tabellendaten extrahieren aus PDF Dokumente mit präziser Strukturerhaltung
- Header-Erkennung: Tabellenüberschriften, Spaltennamen und Zeilenbeschriftungen identifizieren und beibehalten
- Extraktion des Zellinhalts: Einzelne Zelleninhalte mit den richtigen Datentypen und Formatierungen extrahieren
- Tabellenstrukturanalyse: Tabellenlayout, Beziehungen und hierarchische Struktur beibehalten
Erweiterte Verarbeitung
- Unterstützung mehrerer Tabellen: Mehrere Tabellen innerhalb eines einzigen Prozesses verarbeiten PDF dokumentieren
- Komplexe Tischhandhabung: Tabellen mit verbundenen Zellen, zeilenübergreifenden Daten und komplexen Layouts extrahieren
- Formaterhaltung: Die ursprüngliche Tabellenformatierung, das Styling und das visuelle Erscheinungsbild beibehalten.
- Datenvalidierung: Sicherstellung der Datenintegrität und -genauigkeit während des Extraktionsprozesses
Professionelle Funktionen
- Strukturierte Ausgabe: Organisierte, strukturierte Daten für eine einfache Integration generieren
- Stapelverarbeitung: Mehrere Prozesse PDFs und Tabellen effizient extrahieren
- Qualitätssicherung: Sicherstellung der Genauigkeit und Zuverlässigkeit der Datenextraktion für Geschäftsanwendungen
- UnternehmensintegrationNahtlose Integration mit bestehenden Datenverwaltungssystemen
Branchenspezifische Anwendungsfälle und Anwendungen
- Business Intelligence & Analytics
- Document Management & Processing
- Data Migration & Integration
- Research & Analysis
- Compliance & Regulatory
- Healthcare & Medical
Anwendungsfälle für Business Intelligence und Analytik
- Finanzberichterstattung: Finanztabellen aus Berichten für die Datenanalyse und Berichtserstellung extrahieren.
- LeistungskennzahlenProzess-KPI-Tabellen und Performance-Dashboards für Business Intelligence
- Data Warehousing: Strukturierte Daten aus Dokumenten extrahieren, um das Data Warehouse zu befüllen
- Business Analytics: Konvertieren PDF Tabellen in analysierbare Datenformate umwandeln, um Erkenntnisse zu gewinnen
Anwendungsfälle für Dokumentenmanagement und -verarbeitung
- Rechnungsverarbeitung: Extrahieren von Positionen und Preistabellen aus Rechnungen zur automatisierten Verarbeitung
- Vertragsanalyse: Tabellen mit Allgemeinen Geschäftsbedingungen aus Rechtsdokumenten extrahieren
- Berichtdigitalisierung: Umwandlung papierbasierter Berichte in digitale, durchsuchbare Daten
- Inhaltsverwaltung: Strukturierte Daten aus Dokumenten für Content-Management-Systeme extrahieren
Anwendungsfälle für Datenmigration und -integration
- Systemmigration: Tabellendaten während Systemmigrationen und Datentransfers extrahieren
- Legacy-Datenkonvertierung: Historische Dokumente in moderne Datenformate konvertieren
- API Integration: Daten zur Integration mit Drittsystemen extrahieren und APIs
- Datenbankpopulation: Datenbanken mit strukturierten Daten füllen von PDF Dokumente
Anwendungsfälle für Forschung und Analyse
- Akademische ForschungDatentabellen aus Forschungsarbeiten und wissenschaftlichen Publikationen extrahieren
- Marktforschung: Ergebnisse der Prozessumfrage und Marktanalysetabellen
- Wissenschaftliche Daten: Experimentelle Daten und Forschungsergebnisse aus wissenschaftlichen Dokumenten extrahieren
- Statistische Analyse: Konvertieren PDF Tabellen in statistische Analysewerkzeuge
Anwendungsfälle im Bereich Compliance und Regulierung
- Meldepflichten: Konformitätsdaten aus regulatorischen Dokumenten und Berichten extrahieren
- Unterstützung bei Audits: Finanztabellen und Prüfprotokolle zur Überprüfung der Einhaltung der Vorschriften verarbeiten
- Rechtsermittlung: Strukturierte Daten aus juristischen Dokumenten für Ermittlungsverfahren extrahieren
- Politikanalyse: Extrahieren von Richtlinientabellen und regulatorischen Anforderungen zur Analyse
Anwendungsfälle im Gesundheitswesen und in der Medizin
- Krankenakten: Patientendatentabellen aus medizinischen Berichten und Akten extrahieren
- Klinische Studien: Prozessforschungsdaten und Ergebnisse klinischer Studien
- Versicherungsansprüche: Abrechnungstabellen und Schadensinformationen extrahieren
- Medizinische Forschung: Medizinische Forschungsdaten in analysierbare Formate umwandeln