Text aus Word extrahieren n8n
Text aus Word extrahieren ist ein n8n Knoten durch PDF4me Dieses Tool extrahiert sauberen Text aus .docx-Dateien und bietet Optionen zum Entfernen von Kommentaren, Kopf- und Fußzeilen sowie zum Abschließen der Änderungsverfolgung vor der Extraktion. Es eignet sich für die Inhaltsmigration, Text Mining oder die Weiterleitung von Dokumenttexten an nachfolgende Analysen ohne manuelles Kopieren und Einfügen.
Was dieser Knoten bewirkt
PDF4me: Text aus Word extrahieren Liest eine .docx-Datei und gibt deren Textinhalt zurück, optional beschränkt auf einen Seitenbereich und bereinigt von Kommentaren, Kopf-/Fußzeilen oder nicht aufgelösten Änderungen. Akzeptiert Eingaben über Binärdaten. Base64 Zeichenkette oder URLIdeal für die Migration von Inhalten, die redaktionelle Bereinigung, die Suchindexierung und die Einspeisung von Dokumenttexten in Text-Mining- oder Analyse-Pipelines.
Authentifizierung Ihres API Anfrage
Jeder PDF4me Knoten in n8n erfordert eine gültige Anmeldeinformationen zum Verbinden mitErstellen oder wählen Sie einen Eintrag aus, der Ihre Daten enthält. PDF4me API Schlüssel, damit der Workflow Extraktionsanfragen sicher authentifizieren kann.
Wichtige Fakten, die Sie nicht verpassen sollten

PDF4me Extrahieren Sie Text aus dem Wort-Knotenparameterbereich in n8n
Welche Parameter benötigt „Text aus Word extrahieren“?
Erforderlich: Eingabedatentyp und Dokumentname sowie das Feld, das Ihrem gewählten Eingabetyp entspricht (Binäreingabefeld, Base64 Wortinhalt oder Wort-URL). Startseitenzahl, Endseitenzahl, Name des Ausgabebinärfelds und die drei Optionen zur Extraktion sind alle optional.
| Parameter | Erforderlich | Was es tut | Beispiel |
|---|---|---|---|
| Input Data Type | Required | Format of the source Word document. Choose Binary Data (from a previous node), Base64 String, or URL. | Binary Data |
| Input Binary Field | Conditional | Name of the binary property on the incoming n8n item that holds the Word file. Required when Input Data Type is Binary Data. | data |
| Base64 Word Content | Conditional | Base64-encoded Word content. Required when Input Data Type is Base64 String. | UEsDBBQAAAAIAA... |
| Word URL | Conditional | Publicly reachable HTTPS URL to the source Word file. Required when Input Data Type is URL. | https://example.com/document.docx |
| Document Name | Required | Filename of the input Word file, including the .docx extension, used for format detection. | document.docx |
| Start Page Number | Optional | First page to include in extraction. Leave unset to start from page 1. | 1 |
| End Page Number | Optional | Last page to include in extraction. Leave unset to extract through the last page. | 3 |
| Remove Comments | Optional | Strips reviewer comments from the extracted text when enabled. | true |
| Remove Header/Footer | Optional | Excludes running headers and footers when enabled, leaving only body content. | true |
| Accept Changes | Optional | Finalizes all tracked changes before extraction when enabled, so text reflects the edited version. | true |
| Output Binary Field Name | Optional | Name of the binary property the output item exposes. Default is data. | data |
Erweiterte Optionen
{ "outputDataFormat": "json" }, die über den einzelnen Feldern oben liegen.Ausgabefelder
| Feld | Typ | Was es enthält |
|---|---|---|
success | Boolean | True when extraction succeeded. Use to route error-handling branches. |
fileName | String | Generated filename for the extracted content file, typically ending in .json. |
mimeType | String | MIME type of the output, typically application/json or text/plain. |
fileSize | Number | Size of the extracted content file in bytes. |
docName | String | Original filename of the input Word document, kept for audit and tracking. |
message | String | Human-readable status message for the extraction result. |
Binary (data) | Binary | The extracted text content under Output Binary Field Name (default data). Pass into a downstream node to read or store the text. |
Wie richte ich die Funktion „Text aus Word extrahieren“ ein? n8n?
- Hinzufügen PDF4me zu Ihrem n8n Workflow und wählen Sie den Text aus Word extrahieren Aktion.
- In Anmeldeinformationen zum Verbinden mit, wählen Sie Ihre PDF4me Anmeldeinformationen oder klicken Neue Anmeldeinformationen erstellen und fügen Sie Ihren ein API Schlüssel.
- Satz Eingabedatentyp Zu Binärdaten (Standard), Base64 Zeichenkette, oder URL und geben Sie das entsprechende Quellfeld an.
- Satz Dokumentname mit dem
.docxVerlängerung. - Optional einstellbar Startseitennummer Und Endseitenzahl um die Extraktion auf einen Seitenbereich zu beschränken.
- Satz Kommentare entfernen, Kopf-/Fußzeile entfernen, Und Änderungen akzeptieren je nach Bedarf für die Extraktion einer bereinigten oder bearbeiteten Version.
- Führen Sie den Knoten aus und leiten Sie den extrahierten Text in Ihre Content-Pipeline, Ihren Suchindex oder Ihren Analyse-Workflow weiter.
Typische Konfigurationen
Workflow-BeispieleCommon n8n workflow patterns using Extract Text From Word.
- Ein Google Drive-Trigger wird ausgelöst, wenn ein älteres Word-Dokument zu einem Migrationsordner hinzugefügt wird.
- PDF4me Die Funktion „Text aus Word extrahieren“ wird mit aktivierten Optionen „Kopf-/Fußzeile entfernen“ und „Kommentare entfernen“ ausgeführt, um eine saubere Extraktion nur des Textkörpers zu gewährleisten.
- Der extrahierte Text wird als neuer Inhaltseintrag in ein Headless-CMS eingefügt.
- Ein geprüftes Manuskript mit nachverfolgten Änderungen und Kommentaren wird über ein Formular hochgeladen.
- PDF4me Die Funktion „Text aus Word extrahieren“ wird mit aktivierten Optionen „Änderungen übernehmen“ und „Kommentare entfernen“ ausgeführt, um eine saubere Endversion zu gewährleisten.
- Der finale Text wird an die Redaktion oder den Verlag weitergeleitet.
- Ein Schleifenknoten durchläuft Word-Dokumente aus einem SharePoint Dokumentenbibliothek.
- PDF4me Die Funktion „Text aus Word extrahieren“ wird für jede Datei mit den Standardextraktionsoptionen ausgeführt.
- Der extrahierte Text wird in einer Suchmaschine wie Elasticsearch oder Algolia indexiert.
- Für einen Workflow wird lediglich die Managementzusammenfassung aus einem längeren Bericht benötigt.
- PDF4me Die Funktion „Text aus Word extrahieren“ wird mit der Startseitenzahl 1 und der Endseitenzahl 2 ausgeführt, um die Extraktion auf die Zusammenfassungsseiten zu beschränken.
- Der extrahierte Zusammenfassungstext wird an einen Textzusammenfassungs- oder Analyseschritt weitergeleitet.
Praktische Tipps
Spickzettel
| Feld | Wert |
|---|---|
| Action | Extract Text From Word |
| Input Data Type | Binary Data |
| Input Binary Field | data |
| Document Name | document.docx |
| Start Page Number | 1 (optional) |
| End Page Number | (optional, defaults to last page) |
| Remove Comments | true |
| Remove Header/Footer | true |
| Accept Changes | true |
| Credentials | PDF4me API credential |