Text aus Word extrahieren – Inhaltsparser API
PDF4me Text aus Word extrahieren Ermöglicht das Extrahieren von Textinhalten aus Word-Dokumenten mit Optionen zur Seitenbereichs- und Inhaltsfilterung. API Der Dienst verarbeitet Word-Dateien und extrahiert Textinhalte aus Word-Dokumenten mit anpassbaren Optionen. API empfängt Word-Dokumentinhalte über REST API Anrufe, die genutzt werden Base64 Sichere Datenübertragung durch Kodierung. Dank Unterstützung für Seitenbereichsauswahl, Kommentarentfernung, Kopf-/Fußzeilenfilterung und Änderungsannahme ist diese Lösung ideal für Workflows zur Dokumentenverarbeitung und Inhaltsanalyse.
Authentifizierung Ihres API Anfrage
Um auf die PDF4me REST APIJede Anfrage muss die entsprechenden Authentifizierungsdaten enthalten. Die Authentifizierung gewährleistet eine sichere Kommunikation und bestätigt Ihre Identität als autorisierter Benutzer des Systems. REST APIDie
Hauptmerkmale
- Word-Dokumentunterstützung: Text aus Microsoft Word-Dokumenten extrahieren (.doc, .docx)
- Seitenbereichsauswahl: Bestimmte Seitenbereiche oder ganze Dokumente mit benutzerdefinierten Start- und Endseitenzahlen verarbeiten
- Inhaltsfilterung: Kommentare, Kopf- und Fußzeilen entfernen und Änderungen nachverfolgen, um eine saubere Textextraktion zu ermöglichen.
- Base64 Kodierung: Sichere Übertragung von Dateiinhalten mithilfe von Base64 Kodierung
- Einfach API IntegrationRESTful API Entwickelt für automatisierte Arbeitsabläufe zur Verarbeitung von Word-Dokumenten
REST API Endpunkt
Der PDF4me REST API verwendet Standard HTTP Methoden zur Interaktion mit Ressourcen. Alle Word-Textextraktionsoperationen werden über einen einzigen Endpunkt durchgeführt:
- Verfahren: POST
- Endpunkt:
/api/v2/ExtractTextFromWord
REST API Parameter
Vollständige Liste der Parameter für die Funktion „Text aus Word extrahieren“ REST APIDie Parameter sind zur besseren Verständlichkeit und Implementierung nach Kategorien geordnet.
Wichtig: Mit einem Sternchen (*) gekennzeichnete Parameter sind erforderlich und müssen angegeben werden. API um ordnungsgemäß zu funktionieren.
Erforderliche Parameter
| Parameter | Typ | Beschreibung | Beispiel |
|---|---|---|---|
| docName* | String | Name der Word-Quelldatei (ohne Dateiendung oder mit der Dateiendung .docx/.doc) | output |
| docContent* | Base64 (String) | Der Inhalt des eingegebenen Word-Dokuments in Base64 Format | JVBERi... |
| StartPageNumber* | Integer | Startseitenzahl für die Textextraktion | 1 |
| EndPageNumber* | Integer | Endseitenzahl für die Textextraktion | 3 |
| RemoveComments* | Boolean | Wählen Sie aus, ob Kommentare aus dem extrahierten Text entfernt werden sollen: WAHR: Kommentare entfernen, FALSCH: Kommentare hinzufügen | true |
| RemoveHeaderFooter* | Boolean | Wählen Sie aus, ob Kopf- und Fußzeilen entfernt werden sollen: WAHR: Kopf- und Fußzeilen entfernen, FALSCH: Kopf- und Fußzeilen einfügen | true |
| AcceptChanges* | Boolean | Wählen Sie aus, ob Sie nachverfolgte Änderungen akzeptieren möchten: WAHRÄnderungen akzeptieren, FALSCHÄnderungen ablehnen | true |
Optionale Parameter
| Parameter | Typ | Beschreibung | Beispiel |
|---|---|---|---|
| async | Boolean | Aktivieren Sie die asynchrone Verarbeitung. Wenn true, Die API Rückgaben 202 Accepted mit einem Location Kopfzeile zum Abfragen des Ergebnisses | false |
Ausgabe
Der PDF4me Text aus Word extrahieren REST API Die Antwort hängt vom Verarbeitungsmodus ab. API gibt den extrahierten Text als JSON Antwort oder TextdateiDie
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
Synchrone Verarbeitung (Standard)
Wann async Ist false oder nicht bereitgestellt, die API Gibt den extrahierten Text sofort zurück.
Statuscode: 200 OK
Antwortformat:
{
"extractedText": "Extracted text content from Word document pages 1 to 3...",
"fileName": "output.txt"
}
Oder als Textdatei:
Extracted text content from Word document pages 1 to 3...
Die Antwort enthält den extrahierten Textinhalt aus dem angegebenen Seitenbereich.
Asynchrone Verarbeitung
Wann async Ist true, Die API Das Dokument wird asynchron verarbeitet.
Erste Reaktion:
Statuscode: 202 Accepted
Antwort-Header:
Location: https://api.pdf4me.com/api/v2/ExtractTextFromWordStatus/{operationId}
Antworttext:
{
"traceId": "operation-trace-id"
}
Umfrageergebnisse:
Verwenden Sie die Location Überschrift URL zur Vervollständigung der Umfrage:
const response = await fetch(locationUrl, {
headers: { 'Authorization': 'Basic ' + apiKey }
});
// Continue polling until status code is 200
if (response.status === 200) {
const result = await response.json();
// Process extracted text
}
Fehlermeldungen
| Statuscode | Beschreibung | Beispielantwort |
|---|---|---|
| 400 Bad Request | Ungültige Anfrageparameter oder fehlende Pflichtfelder | {"error": "Missing required parameter: docContent"} |
| 401 Unauthorized | Ungültig oder fehlend API Schlüssel | {"error": "Unauthorized"} |
| 408 Anfrage-Timeout | Zeitüberschreitung bei der Anfrageverarbeitung | {"error": "Request timeout"} |
| 500 Internal Server Error | Serverfehler während der Verarbeitung | {"error": "Internal server error"} |
Die Antwort verstehen
Die Antwort der Textextraktion kann in zwei Formaten vorliegen:
- JSON FormatEnthält
extractedText(Zeichenkette) undfileName(Zeichenkette) - Textformat: Einfache Textdatei mit dem extrahierten Inhalt
Parameterdetails:
- StartPageNumber Und EndPageNumber: Seitenbereich definieren (1-basierte Indizierung)
- RemoveComments: Wann
true, entfernt alle Kommentare aus dem Word-Dokument vor der Extraktion - RemoveHeaderFooter: Wann
trueEntfernt vor der Extraktion Kopf- und Fußzeilen von jeder Seite. - AcceptChanges: Wann
true, akzeptiert alle nachverfolgten Änderungen im Word-Dokument vor der Extraktion
Unterstützte Wortformate:
.docx(Word 2007 und später).doc(Word 97-2003)
Beispielanfrage
Kopfzeile
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
Notiz:
- Hol dir deins API Schlüssel vom PDF4me Armaturenbrett
- Der API Der Schlüssel muss sein Base64 kodiert und mit "Basic" präfixiert in der Authorization Überschrift
- Beispiel: Wenn Ihr API Schlüssel ist
abc123, kodieren Sie es zu Base64 und verwendenAuthorization: Basic YWJjMTIz
Nutzlast
Grundlegende Anfrage:
{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output",
"StartPageNumber": 1,
"EndPageNumber": 3,
"RemoveComments": true,
"RemoveHeaderFooter": true,
"AcceptChanges": true
}
Mit asynchroner Verarbeitung:
{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output",
"StartPageNumber": 1,
"EndPageNumber": 3,
"RemoveComments": true,
"RemoveHeaderFooter": true,
"AcceptChanges": true,
"async": true
}
Codebeispiele
Der PDF4me Text aus Word extrahieren REST API Es werden Codebeispiele in verschiedenen Programmiersprachen bereitgestellt. Wählen Sie die Sprache, die am besten zu Ihrer Entwicklungsumgebung passt:
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
C# (CSharp) Beispiel
Vollständig C# Implementierung zum Extrahieren von Text aus Word-Dokumenten:
Java Probe
Java Implementierung mit vollständiger Fehlerbehandlung und Antwortverarbeitung:
Python Probe
Python Implementierung mit der Requests-Bibliothek und JSON Handhabung:
Google Apps Script Probe
Google Apps Script Implementierung für Google Workspace Integration:
Funktionen zur Extraktion von Wörtern
Dokumentenverarbeitung
- Unterstützung für das Word-FormatVolle Unterstützung für die Microsoft Word-Dokumentformate .doc und .docx.
- Formaterhaltung: Erhält Textformatierung und -struktur während der Extraktion bei
- Komplexe DokumenteVerarbeitet komplexe Word-Dokumente mit Tabellen, Bildern und eingebetteten Inhalten
- Professionelle VerarbeitungHochwertige Textextraktion mit präziser Inhaltserhaltung
- Flexible EingabeUnterstützung für verschiedene Word-Dokumentversionen und -formate
Seitenverarbeitung
- Seitenbereichsauswahl: Text aus bestimmten Seitenbereichen mit Angabe der Start- und Endseitenzahlen extrahieren
- Flexibles Targeting: Einzelne Seiten, Seitenbereiche oder ganze Dokumente verarbeiten
- Kundenspezifische BearbeitungUnterstützung für jede Seitenkombination mit präziser Steuerung
- Stapelverarbeitung: Mehrere Seiten effizient in einem einzigen Prozess verarbeiten API Anrufe
- Professionelles Layout: Einheitliche Textextraktion auf allen Zielseiten
Inhaltsfilterung
- Kommentar entfernenOption zum Ausschließen von Kommentaren und Anmerkungen aus dem extrahierten Text
- Kopf-/Fußzeilenfilterung: Entfernen Sie Kopf- und Fußzeilen für eine saubere Inhaltsextraktion
- ÄnderungsverfolgungÄnderungen, die während der Textextraktion nachverfolgt werden, akzeptieren oder ablehnen.
- InhaltsbereinigungErweiterte Filteroptionen für spezifische Textextraktionsanforderungen
- Professionelle ErgebnisseSaubere, formatierte Textausgabe mit präziser Inhaltserhaltung
Branchenspezifische Anwendungsfälle und Anwendungen
- Business & Enterprise
- Legal & Professional Services
- Education & Research
- Government & Compliance
- Technology & Development
Anwendungsfälle für Unternehmen und Organisationen
- Dokumentenanalyse: Textinhalte aus Word-Dokumenten extrahieren zur Analyse und Verarbeitung
- Inhaltsverwaltung: Text aus Word-Dokumenten für Content-Management-Systeme extrahieren
- Berichtsverarbeitung: Text aus Word-Berichten extrahieren zur automatisierten Verarbeitung und Analyse
- Business Intelligence: Text aus Word-Geschäftsdokumenten für die Datenanalyse extrahieren
Anwendungsfälle für Rechts- und Beratungsdienstleistungen
- Bearbeitung von Rechtsdokumenten: Text aus juristischen Word-Dokumenten für das Fallmanagement extrahieren
- Vertragsanalyse: Text aus Verträgen und Rechtsdokumenten extrahieren
- Fallmanagement: Text aus juristischen Dokumenten für Fallmanagementsysteme extrahieren
- Rechtsrecherche: Text aus juristischen Dokumenten für Forschungs- und Analysezwecke extrahieren
Anwendungsfälle in Bildung und Forschung
- Akademische Forschung: Text aus akademischen Word-Dokumenten für Forschungs- und Analysezwecke extrahieren
- Forschungsdokumente: Text aus Forschungsarbeiten und akademischen Dokumenten extrahieren
- Bildungsinhalte: Text aus schulischen Word-Dokumenten extrahieren
- Akademische Analyse: Text aus akademischen Dokumenten zur Analyse extrahieren
Anwendungsfälle im Bereich Regierung und Compliance
- Überwachung der Einhaltung: Text aus Word-Dokumenten zur Einhaltung von Vorschriften für Überwachungs- und Prüfungszwecke extrahieren
- Regulierungsdokumentation: Text aus regulatorischen Word-Dokumenten extrahieren
- Regierungsberichte: Text aus Regierungsdokumenten (Word-Dokumente) extrahieren
- Öffentliche Aufzeichnungen: Text aus öffentlichen Word-Dokumenten extrahieren
Anwendungsfälle für Technologie und Entwicklung
- Datenmigration: Word-Dokumentinhalte für die Datenmigration in andere Formate konvertieren
- Inhaltsverarbeitung: Text aus Word-Dokumenten für die Systemintegration extrahieren
- API Integration: Text aus Word-Dokumenten extrahieren für API Verarbeitung
- Datenextraktion: Text aus Word-Dokumenten zur Datenverarbeitung extrahieren