Zum Hauptinhalt springen

Text aus Word extrahieren – Inhaltsparser API

PDF4me Text aus Word extrahieren Ermöglicht das Extrahieren von Textinhalten aus Word-Dokumenten mit Optionen zur Seitenbereichs- und Inhaltsfilterung. API Der Dienst verarbeitet Word-Dateien und extrahiert Textinhalte aus Word-Dokumenten mit anpassbaren Optionen. API empfängt Word-Dokumentinhalte über REST API Anrufe, die genutzt werden Base64 Sichere Datenübertragung durch Kodierung. Dank Unterstützung für Seitenbereichsauswahl, Kommentarentfernung, Kopf-/Fußzeilenfilterung und Änderungsannahme ist diese Lösung ideal für Workflows zur Dokumentenverarbeitung und Inhaltsanalyse.

Verwandte Blog-Beiträge
Zu dieser Funktion gibt es noch keinen Blogbeitrag – folgt in Kürze.
Schauen Sie sich in der Zwischenzeit im PDF4me-Blog Tutorials und Arbeitsabläufe für alle Plattformen an.
Besuchen Sie den Blog

Authentifizierung Ihres API Anfrage

Um auf die PDF4me REST APIJede Anfrage muss die entsprechenden Authentifizierungsdaten enthalten. Die Authentifizierung gewährleistet eine sichere Kommunikation und bestätigt Ihre Identität als autorisierter Benutzer des Systems. REST APIDie

Hauptmerkmale

  • Word-Dokumentunterstützung: Text aus Microsoft Word-Dokumenten extrahieren (.doc, .docx)
  • Seitenbereichsauswahl: Bestimmte Seitenbereiche oder ganze Dokumente mit benutzerdefinierten Start- und Endseitenzahlen verarbeiten
  • Inhaltsfilterung: Kommentare, Kopf- und Fußzeilen entfernen und Änderungen nachverfolgen, um eine saubere Textextraktion zu ermöglichen.
  • Base64 Kodierung: Sichere Übertragung von Dateiinhalten mithilfe von Base64 Kodierung
  • Einfach API IntegrationRESTful API Entwickelt für automatisierte Arbeitsabläufe zur Verarbeitung von Word-Dokumenten

REST API Endpunkt

Der PDF4me REST API verwendet Standard HTTP Methoden zur Interaktion mit Ressourcen. Alle Word-Textextraktionsoperationen werden über einen einzigen Endpunkt durchgeführt:

  • Verfahren: POST
  • Endpunkt: /api/v2/ExtractTextFromWord

REST API Parameter

Vollständige Liste der Parameter für die Funktion „Text aus Word extrahieren“ REST APIDie Parameter sind zur besseren Verständlichkeit und Implementierung nach Kategorien geordnet.

Wichtig: Mit einem Sternchen (*) gekennzeichnete Parameter sind erforderlich und müssen angegeben werden. API um ordnungsgemäß zu funktionieren.

Erforderliche Parameter

ParameterTypBeschreibungBeispiel
docName*StringName der Word-Quelldatei (ohne Dateiendung oder mit der Dateiendung .docx/.doc)output
docContent*Base64 (String)Der Inhalt des eingegebenen Word-Dokuments in Base64 FormatJVBERi...
StartPageNumber*IntegerStartseitenzahl für die Textextraktion1
EndPageNumber*IntegerEndseitenzahl für die Textextraktion3
RemoveComments*BooleanWählen Sie aus, ob Kommentare aus dem extrahierten Text entfernt werden sollen: WAHR: Kommentare entfernen, FALSCH: Kommentare hinzufügentrue
RemoveHeaderFooter*BooleanWählen Sie aus, ob Kopf- und Fußzeilen entfernt werden sollen: WAHR: Kopf- und Fußzeilen entfernen, FALSCH: Kopf- und Fußzeilen einfügentrue
AcceptChanges*BooleanWählen Sie aus, ob Sie nachverfolgte Änderungen akzeptieren möchten: WAHRÄnderungen akzeptieren, FALSCHÄnderungen ablehnentrue

Optionale Parameter

ParameterTypBeschreibungBeispiel
asyncBooleanAktivieren Sie die asynchrone Verarbeitung. Wenn true, Die API Rückgaben 202 Accepted mit einem Location Kopfzeile zum Abfragen des Ergebnissesfalse

Ausgabe

Der PDF4me Text aus Word extrahieren REST API Die Antwort hängt vom Verarbeitungsmodus ab. API gibt den extrahierten Text als JSON Antwort oder TextdateiDie

Synchrone Verarbeitung (Standard)

Wann async Ist false oder nicht bereitgestellt, die API Gibt den extrahierten Text sofort zurück.

Statuscode: 200 OK

Antwortformat:

{
"extractedText": "Extracted text content from Word document pages 1 to 3...",
"fileName": "output.txt"
}

Oder als Textdatei:

Extracted text content from Word document pages 1 to 3...

Die Antwort enthält den extrahierten Textinhalt aus dem angegebenen Seitenbereich.

Beispielanfrage

Kopfzeile

Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY

Notiz:

  • Hol dir deins API Schlüssel vom PDF4me Armaturenbrett
  • Der API Der Schlüssel muss sein Base64 kodiert und mit "Basic" präfixiert in der Authorization Überschrift
  • Beispiel: Wenn Ihr API Schlüssel ist abc123, kodieren Sie es zu Base64 und verwenden Authorization: Basic YWJjMTIz

Nutzlast

Grundlegende Anfrage:

{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output",
"StartPageNumber": 1,
"EndPageNumber": 3,
"RemoveComments": true,
"RemoveHeaderFooter": true,
"AcceptChanges": true
}

Mit asynchroner Verarbeitung:

{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output",
"StartPageNumber": 1,
"EndPageNumber": 3,
"RemoveComments": true,
"RemoveHeaderFooter": true,
"AcceptChanges": true,
"async": true
}

Codebeispiele

Der PDF4me Text aus Word extrahieren REST API Es werden Codebeispiele in verschiedenen Programmiersprachen bereitgestellt. Wählen Sie die Sprache, die am besten zu Ihrer Entwicklungsumgebung passt:

C# (CSharp) Beispiel

Vollständig C# Implementierung zum Extrahieren von Text aus Word-Dokumenten:

Funktionen zur Extraktion von Wörtern

Dokumentenverarbeitung

  • Unterstützung für das Word-FormatVolle Unterstützung für die Microsoft Word-Dokumentformate .doc und .docx.
  • Formaterhaltung: Erhält Textformatierung und -struktur während der Extraktion bei
  • Komplexe DokumenteVerarbeitet komplexe Word-Dokumente mit Tabellen, Bildern und eingebetteten Inhalten
  • Professionelle VerarbeitungHochwertige Textextraktion mit präziser Inhaltserhaltung
  • Flexible EingabeUnterstützung für verschiedene Word-Dokumentversionen und -formate

Seitenverarbeitung

  • Seitenbereichsauswahl: Text aus bestimmten Seitenbereichen mit Angabe der Start- und Endseitenzahlen extrahieren
  • Flexibles Targeting: Einzelne Seiten, Seitenbereiche oder ganze Dokumente verarbeiten
  • Kundenspezifische BearbeitungUnterstützung für jede Seitenkombination mit präziser Steuerung
  • Stapelverarbeitung: Mehrere Seiten effizient in einem einzigen Prozess verarbeiten API Anrufe
  • Professionelles Layout: Einheitliche Textextraktion auf allen Zielseiten

Inhaltsfilterung

  • Kommentar entfernenOption zum Ausschließen von Kommentaren und Anmerkungen aus dem extrahierten Text
  • Kopf-/Fußzeilenfilterung: Entfernen Sie Kopf- und Fußzeilen für eine saubere Inhaltsextraktion
  • ÄnderungsverfolgungÄnderungen, die während der Textextraktion nachverfolgt werden, akzeptieren oder ablehnen.
  • InhaltsbereinigungErweiterte Filteroptionen für spezifische Textextraktionsanforderungen
  • Professionelle ErgebnisseSaubere, formatierte Textausgabe mit präziser Inhaltserhaltung

Branchenspezifische Anwendungsfälle und Anwendungen

Anwendungsfälle für Unternehmen und Organisationen

  • Dokumentenanalyse: Textinhalte aus Word-Dokumenten extrahieren zur Analyse und Verarbeitung
  • Inhaltsverwaltung: Text aus Word-Dokumenten für Content-Management-Systeme extrahieren
  • Berichtsverarbeitung: Text aus Word-Berichten extrahieren zur automatisierten Verarbeitung und Analyse
  • Business Intelligence: Text aus Word-Geschäftsdokumenten für die Datenanalyse extrahieren

Hilfe erhalten