Aller au contenu principal

Extraire du texte d'un mot dans n8n

Extraire du texte de Word est un n8n nœud par PDF4me Cet outil extrait le texte propre des fichiers .docx, avec la possibilité de supprimer les commentaires, les en-têtes et les pieds de page, et de finaliser le suivi des modifications avant l'extraction. Il est idéal pour la migration de contenu, l'exploration de texte ou l'intégration de documents dans des analyses ultérieures, sans avoir à effectuer de copier-coller manuel.

Que fait ce nœud ?

PDF4meExtraire du texte de Word Lit un fichier .docx et renvoie son contenu textuel, éventuellement limité à une plage de pages et nettoyé des commentaires, en-têtes/pieds de page et modifications non résolues. Accepte les données binaires en entrée. Base64 Chaîne, ou URLIdéal pour la migration de contenu, le nettoyage éditorial, l'indexation de recherche et l'alimentation des pipelines d'exploration ou d'analyse de texte en texte.

Articles de blog connexes
Il n'y a pas encore d'article de blog consacré à cette fonctionnalité — à venir prochainement.
En attendant, n'hésitez pas à consulter le blog de PDF4me pour découvrir des tutoriels et des procédures de travail adaptés à toutes les plateformes.
Consultez le blog

Authentification de votre API Demande

Chaque PDF4me nœud dans n8n nécessite un numéro valide Identifiant pour se connecter avecCréez ou sélectionnez-en un qui contient votre PDF4me API clé permettant au flux de travail d'authentifier les demandes d'extraction de manière sécurisée.

Informations importantes à ne pas manquer

Seuls 2 champs sont obligatoires.
L'entrée du document Word (via le type de données d'entrée) et le nom du document. La plage de pages et les trois options de nettoyage ont toutes des valeurs par défaut fonctionnelles, correspondant au même modèle que celui déjà vérifié. Make version de cette action.
Accepter les modifications s'exécute avant l'extraction, et non après.
L'option « Accepter les modifications » valide d'abord toutes les modifications suivies dans le document, de sorte que le texte extrait reflète la version modifiée. Désactivez cette option si vous avez besoin d'un texte qui corresponde logiquement à la source avant modification.
Le résultat est un fichier binaire, et non une simple chaîne de caractères.
Le texte extrait est renvoyé sous forme de fichier binaire sous le nom de champ binaire de sortie, généralement JSONTransmettez-le à un nœud en aval pour lire, analyser ou stocker le contenu textuel réel.
Le nœud n8n « Extraire du texte d'un document Word » est configuré avec l'action « Extraire du texte d'un document Word », le type de données d'entrée « Données binaires », le champ d'entrée « data » (binaire), le nom du document « document.docx », la page de début 1, la page de fin 3 et les options d'extraction « Supprimer les commentaires », « Supprimer l'en-tête/le pied de page » et « Accepter les modifications » sont activées.

PDF4me Panneau des paramètres du nœud Extraire le texte de Word dans n8n

De quels paramètres a besoin la fonction « Extraire du texte de Word » ?

Requis: Type de données d'entrée et nom du document, plus le champ correspondant au type d'entrée choisi (Champ binaire d'entrée, Base64 Le contenu Word ou l'URL Word, le numéro de page de début, le numéro de page de fin, le nom du champ binaire de sortie et les trois options d'extraction sont tous facultatifs.

ParamètreRequisCe que cela faitExemple
Input Data TypeRequiredFormat of the source Word document. Choose Binary Data (from a previous node), Base64 String, or URL.Binary Data
Input Binary FieldConditionalName of the binary property on the incoming n8n item that holds the Word file. Required when Input Data Type is Binary Data.data
Base64 Word ContentConditionalBase64-encoded Word content. Required when Input Data Type is Base64 String.UEsDBBQAAAAIAA...
Word URLConditionalPublicly reachable HTTPS URL to the source Word file. Required when Input Data Type is URL.https://example.com/document.docx
Document NameRequiredFilename of the input Word file, including the .docx extension, used for format detection.document.docx
Start Page NumberOptionalFirst page to include in extraction. Leave unset to start from page 1.1
End Page NumberOptionalLast page to include in extraction. Leave unset to extract through the last page.3
Remove CommentsOptionalStrips reviewer comments from the extracted text when enabled.true
Remove Header/FooterOptionalExcludes running headers and footers when enabled, leaving only body content.true
Accept ChangesOptionalFinalizes all tracked changes before extraction when enabled, so text reflects the edited version.true
Output Binary Field NameOptionalName of the binary property the output item exposes. Default is data.data

Options avancées

Profils personnalisés (facultatif)
UN JSON- un bloc de paramètres prédéfinis pour des configurations d'extraction spécialisées, comme { "outputDataFormat": "json" }, superposés aux champs individuels ci-dessus.

Champs de sortie

ChampTaperCe qu'il contient
successBooleanTrue when extraction succeeded. Use to route error-handling branches.
fileNameStringGenerated filename for the extracted content file, typically ending in .json.
mimeTypeStringMIME type of the output, typically application/json or text/plain.
fileSizeNumberSize of the extracted content file in bytes.
docNameStringOriginal filename of the input Word document, kept for audit and tracking.
messageStringHuman-readable status message for the extraction result.
Binary (data)BinaryThe extracted text content under Output Binary Field Name (default data). Pass into a downstream node to read or store the text.

Comment configurer l'extraction de texte à partir de Word dans n8n?

  1. Ajouter PDF4me à votre n8n flux de travail et choisissez le Extraire du texte de Word action.
  2. Dans Identifiant pour se connecter avec, sélectionnez votre PDF4me identifiant ou cliquez Créer un nouveau compte et collez votre API clé.
  3. Ensemble Type de données d'entrée à Données binaires (défaut), Base64 Chaîne, ou URL et indiquez le champ source correspondant.
  4. Ensemble Nom du document avec le .docx extension.
  5. Paramètre optionnel Numéro de page de début et Numéro de page de fin limiter l'extraction à une plage de pages.
  6. Ensemble Supprimer les commentaires, Supprimer l'en-tête/le pied de page, et Accepter les modifications selon les besoins pour une extraction propre ou une version éditée.
  7. Exécutez le nœud et acheminez le texte extrait vers votre pipeline de contenu, votre index de recherche ou votre flux de travail d'analyse.

Configurations typiques

Exemples de flux de travailCommon n8n workflow patterns using Extract Text From Word.
Migration de contenu vers un CMS
  1. Un déclencheur Google Drive s'active lorsqu'un document Word ancien est ajouté à un dossier de migration.
  2. PDF4me La fonction Extraire le texte de Word s'exécute avec les options Supprimer l'en-tête/le pied de page et Supprimer les commentaires activées pour une extraction propre du corps du texte uniquement.
  3. Le texte extrait est publié dans un CMS headless en tant que nouvelle entrée de contenu.
Corrections éditoriales après révision
  1. Un manuscrit relu, avec suivi des modifications et commentaires, est téléchargé via un formulaire.
  2. PDF4me L'option « Extraire le texte de Word » s'exécute avec les options « Accepter les modifications » et « Supprimer les commentaires » activées pour obtenir une version finale propre.
  3. Le texte finalisé est envoyé à un processus de correction ou de publication.
Index de recherche construit à partir d'une bibliothèque de documents
  1. Un nœud de boucle sur les éléments parcourt les documents Word à partir d'un SharePoint bibliothèque de documents.
  2. PDF4me L'outil Extract Text From Word s'exécute sur chaque fichier avec les options d'extraction par défaut.
  3. Le texte extrait est indexé dans un moteur de recherche tel qu'Elasticsearch ou Algolia.
Extraction au niveau de la section pour les rapports volumineux
  1. Un flux de travail ne nécessite que le résumé d'un long rapport.
  2. PDF4me La fonction « Extraire du texte de Word » s'exécute avec le numéro de page de début 1 et le numéro de page de fin 2 afin de limiter l'extraction aux pages récapitulatives.
  3. Le texte récapitulatif extrait est envoyé à une étape de résumé ou d'analyse de texte.

Conseils pratiques

Only Input and Document Name are required
Page range and the three cleanup toggles all have working defaults; set them only when your workflow needs the behavior to differ.
Use page range for large documents
Set Start Page Number and End Page Number to extract only the section you need instead of processing an entire long document.
Accept Changes changes the output text
With Accept Changes on, deleted text in tracked changes will not appear in the extraction; with it off, the pre-edit text may still be present.
Output is binary, read it downstream
The extracted text arrives as a binary file, not a plain n8n string field; use a node that reads binary content to access the actual text.
Document Name still matters with Binary Data
The extension drives format detection regardless of input type; keep it accurate even when the file itself comes from a previous node.
Remove Header/Footer helps content analysis
Running headers and footers (page numbers, document titles) can pollute text-mining results; strip them for cleaner analysis.

Aide-mémoire

ChampValeur
ActionExtract Text From Word
Input Data TypeBinary Data
Input Binary Fielddata
Document Namedocument.docx
Start Page Number1 (optional)
End Page Number(optional, defaults to last page)
Remove Commentstrue
Remove Header/Footertrue
Accept Changestrue
CredentialsPDF4me API credential

Questions fréquentes

Which fields are required for Extract Text From Word?+
Two: the Word document input (via Input Data Type) and Document Name. Start Page Number, End Page Number, Remove Comments, Remove Header/Footer, and Accept Changes are all optional; the node applies sensible defaults.
What do Remove Comments, Remove Header/Footer, and Accept Changes do?+
Remove Comments strips reviewer comments from the extracted text. Remove Header/Footer excludes running headers and footers so only body content comes through. Accept Changes finalizes tracked changes before extraction, so the text reflects the edited version rather than the original with revision marks.
Can I extract text from only part of the document?+
Yes. Set Start Page Number and End Page Number to limit extraction to a specific page range, leave them unset to extract the entire document.
What format is the extracted text returned in?+
A binary file (typically JSON) exposed under Output Binary Field Name, alongside metadata fields like fileName, fileSize, and success. Pass the binary into a downstream node to read or store the text, similar to how the general-purpose Python approach in this Word text-extraction guide returns structured content rather than a raw string.
Does Accept Changes run before or after extraction?+
Before. Setting Accept Changes finalizes every tracked change in the document first, so the extracted text reflects the edited version, the same distinction raised in Microsoft Q&A discussions on extracting text from Word documents about edited versus original content.

Actions connexes

Même tâche sur d'autres plateformes

Obtenez de l'aide