Zum Hauptinhalt springen

Text aus Word extrahieren in Make: Saubere Textabfrage mit PDF4me

PDF4me Text aus Word extrahieren ist ein Make Dieses Modul extrahiert den Textinhalt aus einem Word-Dokument und bietet die Möglichkeit, Seitenbereiche auszuwählen sowie Kommentare, Kopf- und Fußzeilen zu entfernen und die Änderungsverfolgung abzuschließen. So können Sie bereinigten Text direkt in Suchindizes, Übersetzungsdienste oder Text-Mining-Pipelines einspeisen, ohne Word öffnen zu müssen.

Was dieses Modul bewirkt

PDF4me Text aus Word extrahieren Gibt den Textinhalt einer .docx-Datei als einzelnes extrahiertes Textfeld zurück, optional beschränkt auf einen Seitenbereich und bereinigt durch Entfernen von Kommentaren, Kopf- und Fußzeilen oder durch vorheriges Akzeptieren der Änderungsnachverfolgung. Ein einziger Vorgang ersetzt das manuelle Öffnen des Dokuments zum Kopieren des Textes.

Verwandte Blog-Beiträge
Zu dieser Funktion gibt es noch keinen Blogbeitrag – folgt in Kürze.
Schauen Sie sich in der Zwischenzeit im PDF4me-Blog Tutorials und Arbeitsabläufe für alle Plattformen an.
Besuchen Sie den Blog

Wie authentifiziere ich mein Konto? Make Szenario?

Jeder PDF4me Modul in Make erfordert eine gültige VerbindungErstellen oder wählen Sie einen Eintrag aus, der Ihre Daten enthält. PDF4me API Der Schlüssel dient dazu, dass das Szenario Textextraktionsanfragen sicher authentifizieren kann.

Wichtige Fakten, die Sie nicht verpassen sollten

Die Funktion „Änderungen akzeptieren“ wird vor der Extraktion ausgeführt, nicht danach.
Die Einstellung „Änderungen übernehmen“ führt dazu, dass alle nachverfolgten Änderungen im Dokument zuerst abgeschlossen werden, sodass der extrahierte Text die bearbeitete Version widerspiegelt. Deaktivieren Sie diese Option, wenn der Text mit den Revisionsmarkierungen weiterhin im Quelltext enthalten sein soll.
Seitenbereich optional, nicht erforderlich
Die Felder „Startseitenzahl“ und „Endseitenzahl“ beschränken die Extraktion auf eine Teilmenge der Seiten. Lassen Sie beide Felder leer, um das gesamte Dokument in einem einzigen Aufruf zu extrahieren.
Das Dokumentpufferfeld ist mit „JSON-Datei“ beschriftet.
Trotz des Namens enthält die JSON-Datei den zugeordneten Binärinhalt des Word-Dokuments, nicht JSON Text. Ordnen Sie ihn genau wie einen Dateipuffer in jedem anderen Format zu. PDF4me Modul.
Das PDF4me-Modul „Text aus Word extrahieren“ ist wie folgt konfiguriert: Verbindung, Datei auf „Zuordnen“ mit Word-Dateinamen und zugeordneter JSON-Datei, Startseite 1, Endseite 10 sowie die Optionen „Kommentare entfernen“, „Kopf- und Fußzeile entfernen“ und „Änderungen übernehmen“.

Stellen Sie „Datei zuordnen“ ein, verknüpfen Sie den Word-Dateinamen und die JSON-Datei aus dem vorherigen Modul und legen Sie dann optional einen Seitenbereich und die Bereinigungsoptionen fest.

Parameter

Erforderlich: Verbindung und Datei müssen immer angegeben werden. Word-Dateiname und JSON-Datei sind erforderlich, wenn es sich bei der Datei um eine Zuordnung handelt. Seitenbereich und Bereinigungsoptionen sind optional.

ParameterErforderlichWas es tutBeispiel
ConnectionRequiredPDF4me API connection. Click Add and paste your API key if connecting for the first time.TestUser01
FileRequiredRadio button picking how the source Word document arrives. Pick a quick storage option (Dropbox - Download a File) or choose Map to bind Word File Name and Json File from any prior module.Map
Word File NameConditionalSub-field of File, shown when Map is selected. Filename of the source document including its .docx extension.annual_report.docx
Json FileConditionalSub-field of File, shown when Map is selected. Binary content of the Word document, mapped from the prior module Data output despite the Json label.[Word Buffer]
Start Page NumberOptional1-based page number where extraction begins. Leave blank to start from the first page.1
End Page NumberOptional1-based page number where extraction ends. Leave blank to extract through the last page.10
Remove CommentsOptionalStrips reviewer comments from the extracted text when enabled.Yes
Remove Header FooterOptionalExcludes running headers and footers from the extracted text when enabled, leaving only body content.Yes
Accept ChangesOptionalFinalizes all tracked changes before extraction when enabled, so the text reflects the edited version.Yes

Ausgabefelder

FeldTypWas es enthält
Extracted TextStringComplete text content from the Word document, filtered by the page range and cleanup options selected.

Wie richte ich die Funktion „Text aus Word extrahieren“ ein? Make?

  1. Hinzufügen PDF4meText aus Word extrahieren zu Ihrem Make Szenario.
  2. Wählen Verbindung (oder klicken Sie hier) Hinzufügen um einen mit Ihrem PDF4me API Schlüssel).
  3. Unter Datei, wählen Karte und Draht Word-Dateiname Und JSON-Datei aus einem vorherigen Modul (Dropbox, Google Drive oder E-Mail-Anhang).
  4. Optional einstellbar Startseitennummer Und Endseitenzahl um die Extraktion auf einen Seitenbereich zu beschränken.
  5. Umschalten Kommentare entfernen, Kopfzeile und Fußzeile entfernen, Und Änderungen akzeptieren Bei Bedarf. Führen Sie das Szenario aus; der extrahierte Text wird zurückgegeben als Extrahierter TextDie

Typische Konfigurationen

Workflow-BeispieleCommon Make scenario patterns using Extract Text from Word.
Suchindex für Vertragsklauseln
  1. Ein Trigger wird ausgelöst, sobald ein unterzeichneter Vertrag im Repository landet.
  2. Get File lädt den ausgefüllten Word-Vertrag herunter.
  3. Die Funktion „Text aus Word extrahieren“ wird mit aktivierten Optionen „Änderungen übernehmen“ und „Kommentare entfernen“ ausgeführt, um eine saubere Endversion zu gewährleisten.
  4. Der extrahierte Text wird in eine durchsuchbare Datenbank oder einen Volltextindex geschrieben.
  5. Nachgelagerte Regex- oder NLP-Schritte extrahieren Schlüsselbegriffe, Daten und Parteien.
Übersetzungsvorbereitung
  1. In einem Projekt-Tracker ist ein Dokument zur Übersetzung markiert.
  2. Get File ruft die Word-Quelldatei ab.
  3. Die Funktion „Text aus Word extrahieren“ wird mit aktivierter Option „Kopf- und Fußzeile entfernen“ ausgeführt, um den Textkörper zu isolieren.
  4. Der bereinigte Text wird an einen Übersetzer gesendet APIDie
  5. Der übersetzte Text wird in ein neues Dokument umgewandelt und zusammen mit dem Quelltext archiviert.
Migration von Legacy-Inhalten
  1. Ein älteres Word-Dokument wird zur Migration aus einem Archivordner abgerufen.
  2. Die Funktion „Text aus Word extrahieren“ ruft den gesamten Textinhalt in einem einzigen Aufruf ab.
  3. Das Szenario extrahiert Überschriften und Absätze aus dem zurückgegebenen Text.
  4. Der CMS-Schritt „Eintrag erstellen“ importiert die Inhalte in die neue Plattform.
  5. Das Originaldokument ist im Archiv als migriert gekennzeichnet.

Praktische Tipps

Enable Accept Changes for a final-version extract
If the source document still has open tracked changes, leaving Accept Changes off can pull ambiguous or duplicated text. Turn it on whenever you want the clean, finalized wording.
Use the page range for large documents
Setting Start Page Number and End Page Number avoids pulling an entire multi-hundred-page manual when you only need a specific section.
Remove Header Footer before search indexing
Repeated headers and footers pollute keyword frequency in search indexes and NLP pipelines. Strip them for cleaner downstream analysis.
Map Json File like any other buffer
The label is misleading, it is not a JSON string. Map the binary Data output from the prior module the same way you would for any PDF4me file input.
Pair with Parse JSON only after your own restructuring
Extracted Text is plain text, not structured JSON. If you need individual fields, run your own regex or AI parsing step against Extracted Text first.

Spickzettel

FeldWert
ModuleExtract Text from Word
ConnectionPDF4me API key
Document sourceFile = Map (Word File Name + Json File)
Page rangeStart Page Number / End Page Number (optional)
Cleanup togglesRemove Comments / Remove Header Footer / Accept Changes
OutputExtracted Text (String)

Häufig gestellte Fragen

How do I extract text from a Word document in Make?+
Add the PDF4me Extract Text from Word module, connect your API key, set File to Map and supply Word File Name and Json File from a prior module, then run the scenario. The module returns the document text as a single Extracted Text field.
Can I extract text from only part of the document?+
Yes. Set Start Page Number and End Page Number to a 1-based page range. Leave both blank to extract the entire document.
What do Remove Comments, Remove Header Footer, and Accept Changes do?+
Remove Comments strips reviewer comments from the extracted text. Remove Header Footer excludes running headers and footers so only body content comes through. Accept Changes finalizes tracked changes before extraction, so the text reflects the edited version rather than the original with revision marks.
Why is the document content field called Json File?+
Json File is the exact label PDF4me's Make module uses for the mapped binary content of the Word document, even though the value itself is a document buffer rather than JSON text. Map it the same way you would map a file buffer in any other PDF4me module.
What text mining and NLP tasks pair well with this module?+
The extracted text feeds directly into sentiment analysis, keyword extraction, translation services, or full-text search indexing. See <a href="https://learn.microsoft.com/en-us/office/open-xml/word/structure-of-a-wordprocessingml-document" target="_blank" rel="noopener noreferrer">Microsoft's WordprocessingML document structure reference</a> for how text content is organized inside a .docx file.

Branchenspezifische Anwendungsfälle und Anwendungen

  • Vertragsanalyse: Text für die Vertragsanalyse extrahieren
  • Rechtsrecherche: Rechtsdokumente nach Präzedenzfällen durchsuchen
  • Compliance-Prüfung: Text für Compliance-Prüfungen extrahieren
  • EntdeckungInhalte für die elektronische Beweissicherung extrahieren

Verwandte Aktionen

Dieselbe Aufgabe auf anderen Plattformen

Hilfe erhalten