Text aus Word extrahieren
Extrakt → Text aus Word extrahieren
Der Text aus Word extrahieren API Extrahiert Text aus einem Word-Dokument (.doc, .docx). Sie senden das Dokument als Base64 (docContent), docName, StartPageNumber, EndPageNumber, RemoveComments, RemoveHeaderFooter, AcceptChangesund optional async. Der API Rückgaben JSON oder eine Textdatei mit dem extrahierten Text. Nutzen Sie den unten stehenden Tester, um es auszuprobieren; weitere Details finden Sie in den folgenden Abschnitten.
Probieren Sie die Funktion „Text aus Word extrahieren“ aus. API
:::Hinweis Kurzübersicht
Kurzübersicht
Endpunkt: POST /api/v2/ExtractTextFromWord · Erforderlich: api-key, docContent, docName, StartPageNumber, EndPageNumber, RemoveComments, RemoveHeaderFooter, AcceptChanges
:::
Nutzen Sie das untenstehende Formular, um Ihre Anfrage zu senden API Schlüssel, Word-Dokument (Base64Seitenbereich und Optionen (Kommentare entfernen, Kopf-/Fußzeile, Änderungen nachverfolgen). Die Antwort lautet: JSON oder Text mit extrahiertem Inhalt. Kein Code erforderlich, einfach die Felder ausfüllen und klicken. Anfrage senden.
Überblick, Parameter und Anwendungsfälle
- Overview
- Parameters
- Use cases
Was bedeutet „Text aus Word extrahieren“?
Dieser Endpunkt extrahiert Text aus einem Word-Dokument (.doc, .docx). Sie geben einen Seitenbereich an (StartPageNumber, EndPageNumber) und Optionen: RemoveComments (Kommentare ausziehen), RemoveHeaderFooter (Streifenkopf-/Fußzeilen), AcceptChanges (Änderungen nachverfolgen). Die API Rückgaben JSON oder eine Textdatei mit dem extrahierten Text. Verwenden Sie diese, wenn Sie reinen Word-Text für die Suche, Analyse oder Migration benötigen.
Hauptmerkmale
- Seitenbereich: StartPageNumber Und EndPageNumber Beschränken Sie die Extraktion auf bestimmte Seiten.
- Inhaltsfilterung: RemoveComments, RemoveHeaderFooter, AcceptChanges kontrollieren, was enthalten ist.
- FormateUnterstützt .doc und .docx (Base64).
- Asynchron: Verwenden async für große Dokumente.
:::Tipp Am besten geeignet für Verwenden Sie diese Funktion, wenn Sie reinen Text aus Word benötigen (z. B. für Suche, Migration oder Analyse). Für PDF Extraktionsnutzung Rohstoffgewinnung oder Text nach Ausdruck extrahieren.
:::
API Parameter
| Parameter | Typ | Erforderlich | Beschreibung |
|---|---|---|---|
| api-key | Zeichenkette | Ja | Dein PDF4me API Schlüssel, Base64 kodiert. Holen Sie es sich von der ArmaturenbrettDie |
| docContent | base64 | Ja | Inhalt des Word-Dokuments (Base64).doc, .docx. |
| docName | Zeichenkette | Ja | Name der Word-Datei (z. B. output). |
| StartPageNumber | ganze Zahl | Ja | Startseitennummer. |
| EndPageNumber | ganze Zahl | Ja | Endseitenzahl. |
| RemoveComments | boolescher Wert | Ja | Kommentare aus dem extrahierten Text entfernen. |
| RemoveHeaderFooter | boolescher Wert | Ja | Kopf- und Fußzeile aus dem extrahierten Text entfernen. |
| AcceptChanges | boolescher Wert | Ja | Änderungen im Dokument nachverfolgen. |
| async | boolescher Wert | NEIN | Asynchrone Verarbeitung aktivieren. |
Wann sollte man „Text aus Word extrahieren“ verwenden?
- Inhaltsmigration: Text aus Word extrahieren zum Import in CMS, Suche oder Datenbanken.
- Analyse: Erhalten Sie Klartext für NLP, Suchindexierung oder Berichterstellung.
- Seitenspezifisch: Nur einen Seitenbereich extrahieren (z. B. Anhang, bestimmte Abschnitte).
Für Anfrage-/Antwortschemata und Codebeispiele siehe Text aus Word extrahieren im PDF4me API Dokumente.
Voraussetzungen
Bevor Sie diesen Endpunkt verwenden, stellen Sie sicher, dass Sie Folgendes haben:
- Ein gültiger PDF4me API Schlüssel (Hol dir deins API Schlüssel)
- Ein Word-Dokument (.docx oder .doc) in Base64 Format
Antwortformat
Der API gibt ein zurück JSON Antwortdatei oder Textdatei mit extrahiertem Textinhalt aus dem angegebenen Seitenbereich.