Zum Hauptinhalt springen

Text aus Word extrahieren n8n

Text aus Word extrahieren ist ein n8n Knoten durch PDF4me Dieses Tool extrahiert sauberen Text aus .docx-Dateien und bietet Optionen zum Entfernen von Kommentaren, Kopf- und Fußzeilen sowie zum Abschließen der Änderungsverfolgung vor der Extraktion. Es eignet sich für die Inhaltsmigration, Text Mining oder die Weiterleitung von Dokumenttexten an nachfolgende Analysen ohne manuelles Kopieren und Einfügen.

Was dieser Knoten bewirkt

PDF4me: Text aus Word extrahieren Liest eine .docx-Datei und gibt deren Textinhalt zurück, optional beschränkt auf einen Seitenbereich und bereinigt von Kommentaren, Kopf-/Fußzeilen oder nicht aufgelösten Änderungen. Akzeptiert Eingaben über Binärdaten. Base64 Zeichenkette oder URLIdeal für die Migration von Inhalten, die redaktionelle Bereinigung, die Suchindexierung und die Einspeisung von Dokumenttexten in Text-Mining- oder Analyse-Pipelines.

Verwandte Blog-Beiträge
Zu dieser Funktion gibt es noch keinen Blogbeitrag – folgt in Kürze.
Schauen Sie sich in der Zwischenzeit im PDF4me-Blog Tutorials und Arbeitsabläufe für alle Plattformen an.
Besuchen Sie den Blog

Authentifizierung Ihres API Anfrage

Jeder PDF4me Knoten in n8n erfordert eine gültige Anmeldeinformationen zum Verbinden mitErstellen oder wählen Sie einen Eintrag aus, der Ihre Daten enthält. PDF4me API Schlüssel, damit der Workflow Extraktionsanfragen sicher authentifizieren kann.

Wichtige Fakten, die Sie nicht verpassen sollten

Nur 2 Felder sind wirklich erforderlich.
Die Eingabe des Word-Dokuments (über den Eingabedatentyp) und der Dokumentname. Seitenbereich und die drei Bereinigungsoptionen verfügen alle über funktionierende Standardeinstellungen, die dem bereits verifizierten Muster entsprechen. Make Version dieser Aktion.
Die Funktion „Änderungen akzeptieren“ wird vor der Extraktion ausgeführt, nicht danach.
Die Option „Änderungen übernehmen“ führt dazu, dass alle nachverfolgten Änderungen im Dokument zuerst abgeschlossen werden, sodass der extrahierte Text die bearbeitete Version widerspiegelt. Deaktivieren Sie diese Option, wenn Sie Text benötigen, der logisch dem Quelltext vor der Bearbeitung entspricht.
Die Ausgabe ist eine Binärdatei, keine einfache Zeichenkette.
Der extrahierte Text wird als Binärdatei unter dem Namen des Ausgabebinärfelds zurückgegeben, typischerweise JSONÜbergeben Sie es an einen nachgelagerten Knoten, um den eigentlichen Textinhalt zu lesen, zu analysieren oder zu speichern.
Der Knoten „Text aus Word extrahieren“ (n8n) ist wie folgt konfiguriert: Aktion „Text aus Word extrahieren“, Eingabedatentyp „Binärdaten“, Eingabefeld „Binärdaten“, Dokumentname „document.docx“, Startseitennummer „1“, Endseitennummer „3“ und die Extraktionsoptionen „Kommentare entfernen“, „Kopf-/Fußzeile entfernen“ und „Änderungen übernehmen“ sind alle aktiviert.

PDF4me Extrahieren Sie Text aus dem Wort-Knotenparameterbereich in n8n

Welche Parameter benötigt „Text aus Word extrahieren“?

Erforderlich: Eingabedatentyp und Dokumentname sowie das Feld, das Ihrem gewählten Eingabetyp entspricht (Binäreingabefeld, Base64 Wortinhalt oder Wort-URL). Startseitenzahl, Endseitenzahl, Name des Ausgabebinärfelds und die drei Optionen zur Extraktion sind alle optional.

ParameterErforderlichWas es tutBeispiel
Input Data TypeRequiredFormat of the source Word document. Choose Binary Data (from a previous node), Base64 String, or URL.Binary Data
Input Binary FieldConditionalName of the binary property on the incoming n8n item that holds the Word file. Required when Input Data Type is Binary Data.data
Base64 Word ContentConditionalBase64-encoded Word content. Required when Input Data Type is Base64 String.UEsDBBQAAAAIAA...
Word URLConditionalPublicly reachable HTTPS URL to the source Word file. Required when Input Data Type is URL.https://example.com/document.docx
Document NameRequiredFilename of the input Word file, including the .docx extension, used for format detection.document.docx
Start Page NumberOptionalFirst page to include in extraction. Leave unset to start from page 1.1
End Page NumberOptionalLast page to include in extraction. Leave unset to extract through the last page.3
Remove CommentsOptionalStrips reviewer comments from the extracted text when enabled.true
Remove Header/FooterOptionalExcludes running headers and footers when enabled, leaving only body content.true
Accept ChangesOptionalFinalizes all tracked changes before extraction when enabled, so text reflects the edited version.true
Output Binary Field NameOptionalName of the binary property the output item exposes. Default is data.data

Erweiterte Optionen

Benutzerdefinierte Profile (optional)
A JSON-ähnlicher Block vordefinierter Parameter für spezielle Extraktionskonfigurationen, wie zum Beispiel { "outputDataFormat": "json" }, die über den einzelnen Feldern oben liegen.

Ausgabefelder

FeldTypWas es enthält
successBooleanTrue when extraction succeeded. Use to route error-handling branches.
fileNameStringGenerated filename for the extracted content file, typically ending in .json.
mimeTypeStringMIME type of the output, typically application/json or text/plain.
fileSizeNumberSize of the extracted content file in bytes.
docNameStringOriginal filename of the input Word document, kept for audit and tracking.
messageStringHuman-readable status message for the extraction result.
Binary (data)BinaryThe extracted text content under Output Binary Field Name (default data). Pass into a downstream node to read or store the text.

Wie richte ich die Funktion „Text aus Word extrahieren“ ein? n8n?

  1. Hinzufügen PDF4me zu Ihrem n8n Workflow und wählen Sie den Text aus Word extrahieren Aktion.
  2. In Anmeldeinformationen zum Verbinden mit, wählen Sie Ihre PDF4me Anmeldeinformationen oder klicken Neue Anmeldeinformationen erstellen und fügen Sie Ihren ein API Schlüssel.
  3. Satz Eingabedatentyp Zu Binärdaten (Standard), Base64 Zeichenkette, oder URL und geben Sie das entsprechende Quellfeld an.
  4. Satz Dokumentname mit dem .docx Verlängerung.
  5. Optional einstellbar Startseitennummer Und Endseitenzahl um die Extraktion auf einen Seitenbereich zu beschränken.
  6. Satz Kommentare entfernen, Kopf-/Fußzeile entfernen, Und Änderungen akzeptieren je nach Bedarf für die Extraktion einer bereinigten oder bearbeiteten Version.
  7. Führen Sie den Knoten aus und leiten Sie den extrahierten Text in Ihre Content-Pipeline, Ihren Suchindex oder Ihren Analyse-Workflow weiter.

Typische Konfigurationen

Workflow-BeispieleCommon n8n workflow patterns using Extract Text From Word.
Inhaltsmigration in ein CMS
  1. Ein Google Drive-Trigger wird ausgelöst, wenn ein älteres Word-Dokument zu einem Migrationsordner hinzugefügt wird.
  2. PDF4me Die Funktion „Text aus Word extrahieren“ wird mit aktivierten Optionen „Kopf-/Fußzeile entfernen“ und „Kommentare entfernen“ ausgeführt, um eine saubere Extraktion nur des Textkörpers zu gewährleisten.
  3. Der extrahierte Text wird als neuer Inhaltseintrag in ein Headless-CMS eingefügt.
Redaktionelle Überarbeitung nach der Überprüfung
  1. Ein geprüftes Manuskript mit nachverfolgten Änderungen und Kommentaren wird über ein Formular hochgeladen.
  2. PDF4me Die Funktion „Text aus Word extrahieren“ wird mit aktivierten Optionen „Änderungen übernehmen“ und „Kommentare entfernen“ ausgeführt, um eine saubere Endversion zu gewährleisten.
  3. Der finale Text wird an die Redaktion oder den Verlag weitergeleitet.
Suchindex aus einer Dokumentbibliothek erstellen
  1. Ein Schleifenknoten durchläuft Word-Dokumente aus einem SharePoint Dokumentenbibliothek.
  2. PDF4me Die Funktion „Text aus Word extrahieren“ wird für jede Datei mit den Standardextraktionsoptionen ausgeführt.
  3. Der extrahierte Text wird in einer Suchmaschine wie Elasticsearch oder Algolia indexiert.
Extraktion auf Abschnittsebene für große Berichte
  1. Für einen Workflow wird lediglich die Managementzusammenfassung aus einem längeren Bericht benötigt.
  2. PDF4me Die Funktion „Text aus Word extrahieren“ wird mit der Startseitenzahl 1 und der Endseitenzahl 2 ausgeführt, um die Extraktion auf die Zusammenfassungsseiten zu beschränken.
  3. Der extrahierte Zusammenfassungstext wird an einen Textzusammenfassungs- oder Analyseschritt weitergeleitet.

Praktische Tipps

Only Input and Document Name are required
Page range and the three cleanup toggles all have working defaults; set them only when your workflow needs the behavior to differ.
Use page range for large documents
Set Start Page Number and End Page Number to extract only the section you need instead of processing an entire long document.
Accept Changes changes the output text
With Accept Changes on, deleted text in tracked changes will not appear in the extraction; with it off, the pre-edit text may still be present.
Output is binary, read it downstream
The extracted text arrives as a binary file, not a plain n8n string field; use a node that reads binary content to access the actual text.
Document Name still matters with Binary Data
The extension drives format detection regardless of input type; keep it accurate even when the file itself comes from a previous node.
Remove Header/Footer helps content analysis
Running headers and footers (page numbers, document titles) can pollute text-mining results; strip them for cleaner analysis.

Spickzettel

FeldWert
ActionExtract Text From Word
Input Data TypeBinary Data
Input Binary Fielddata
Document Namedocument.docx
Start Page Number1 (optional)
End Page Number(optional, defaults to last page)
Remove Commentstrue
Remove Header/Footertrue
Accept Changestrue
CredentialsPDF4me API credential

Häufig gestellte Fragen

Which fields are required for Extract Text From Word?+
Two: the Word document input (via Input Data Type) and Document Name. Start Page Number, End Page Number, Remove Comments, Remove Header/Footer, and Accept Changes are all optional; the node applies sensible defaults.
What do Remove Comments, Remove Header/Footer, and Accept Changes do?+
Remove Comments strips reviewer comments from the extracted text. Remove Header/Footer excludes running headers and footers so only body content comes through. Accept Changes finalizes tracked changes before extraction, so the text reflects the edited version rather than the original with revision marks.
Can I extract text from only part of the document?+
Yes. Set Start Page Number and End Page Number to limit extraction to a specific page range, leave them unset to extract the entire document.
What format is the extracted text returned in?+
A binary file (typically JSON) exposed under Output Binary Field Name, alongside metadata fields like fileName, fileSize, and success. Pass the binary into a downstream node to read or store the text, similar to how the general-purpose Python approach in this Word text-extraction guide returns structured content rather than a raw string.
Does Accept Changes run before or after extraction?+
Before. Setting Accept Changes finalizes every tracked change in the document first, so the extracted text reflects the edited version, the same distinction raised in Microsoft Q&A discussions on extracting text from Word documents about edited versus original content.

Verwandte Aktionen

Dieselbe Aufgabe auf anderen Plattformen

Hilfe erhalten