Extraire du texte d'un mot dans n8n
Extraire du texte de Word est un n8n nœud par PDF4me Cet outil extrait le texte propre des fichiers .docx, avec la possibilité de supprimer les commentaires, les en-têtes et les pieds de page, et de finaliser le suivi des modifications avant l'extraction. Il est idéal pour la migration de contenu, l'exploration de texte ou l'intégration de documents dans des analyses ultérieures, sans avoir à effectuer de copier-coller manuel.
Que fait ce nœud ?
PDF4meExtraire du texte de Word Lit un fichier .docx et renvoie son contenu textuel, éventuellement limité à une plage de pages et nettoyé des commentaires, en-têtes/pieds de page et modifications non résolues. Accepte les données binaires en entrée. Base64 Chaîne, ou URLIdéal pour la migration de contenu, le nettoyage éditorial, l'indexation de recherche et l'alimentation des pipelines d'exploration ou d'analyse de texte en texte.
Authentification de votre API Demande
Chaque PDF4me nœud dans n8n nécessite un numéro valide Identifiant pour se connecter avecCréez ou sélectionnez-en un qui contient votre PDF4me API clé permettant au flux de travail d'authentifier les demandes d'extraction de manière sécurisée.
Informations importantes à ne pas manquer

PDF4me Panneau des paramètres du nœud Extraire le texte de Word dans n8n
De quels paramètres a besoin la fonction « Extraire du texte de Word » ?
Requis: Type de données d'entrée et nom du document, plus le champ correspondant au type d'entrée choisi (Champ binaire d'entrée, Base64 Le contenu Word ou l'URL Word, le numéro de page de début, le numéro de page de fin, le nom du champ binaire de sortie et les trois options d'extraction sont tous facultatifs.
| Paramètre | Requis | Ce que cela fait | Exemple |
|---|---|---|---|
| Input Data Type | Required | Format of the source Word document. Choose Binary Data (from a previous node), Base64 String, or URL. | Binary Data |
| Input Binary Field | Conditional | Name of the binary property on the incoming n8n item that holds the Word file. Required when Input Data Type is Binary Data. | data |
| Base64 Word Content | Conditional | Base64-encoded Word content. Required when Input Data Type is Base64 String. | UEsDBBQAAAAIAA... |
| Word URL | Conditional | Publicly reachable HTTPS URL to the source Word file. Required when Input Data Type is URL. | https://example.com/document.docx |
| Document Name | Required | Filename of the input Word file, including the .docx extension, used for format detection. | document.docx |
| Start Page Number | Optional | First page to include in extraction. Leave unset to start from page 1. | 1 |
| End Page Number | Optional | Last page to include in extraction. Leave unset to extract through the last page. | 3 |
| Remove Comments | Optional | Strips reviewer comments from the extracted text when enabled. | true |
| Remove Header/Footer | Optional | Excludes running headers and footers when enabled, leaving only body content. | true |
| Accept Changes | Optional | Finalizes all tracked changes before extraction when enabled, so text reflects the edited version. | true |
| Output Binary Field Name | Optional | Name of the binary property the output item exposes. Default is data. | data |
Options avancées
{ "outputDataFormat": "json" }, superposés aux champs individuels ci-dessus.Champs de sortie
| Champ | Taper | Ce qu'il contient |
|---|---|---|
success | Boolean | True when extraction succeeded. Use to route error-handling branches. |
fileName | String | Generated filename for the extracted content file, typically ending in .json. |
mimeType | String | MIME type of the output, typically application/json or text/plain. |
fileSize | Number | Size of the extracted content file in bytes. |
docName | String | Original filename of the input Word document, kept for audit and tracking. |
message | String | Human-readable status message for the extraction result. |
Binary (data) | Binary | The extracted text content under Output Binary Field Name (default data). Pass into a downstream node to read or store the text. |
Comment configurer l'extraction de texte à partir de Word dans n8n?
- Ajouter PDF4me à votre n8n flux de travail et choisissez le Extraire du texte de Word action.
- Dans Identifiant pour se connecter avec, sélectionnez votre PDF4me identifiant ou cliquez Créer un nouveau compte et collez votre API clé.
- Ensemble Type de données d'entrée à Données binaires (défaut), Base64 Chaîne, ou URL et indiquez le champ source correspondant.
- Ensemble Nom du document avec le
.docxextension. - Paramètre optionnel Numéro de page de début et Numéro de page de fin limiter l'extraction à une plage de pages.
- Ensemble Supprimer les commentaires, Supprimer l'en-tête/le pied de page, et Accepter les modifications selon les besoins pour une extraction propre ou une version éditée.
- Exécutez le nœud et acheminez le texte extrait vers votre pipeline de contenu, votre index de recherche ou votre flux de travail d'analyse.
Configurations typiques
Exemples de flux de travailCommon n8n workflow patterns using Extract Text From Word.
- Un déclencheur Google Drive s'active lorsqu'un document Word ancien est ajouté à un dossier de migration.
- PDF4me La fonction Extraire le texte de Word s'exécute avec les options Supprimer l'en-tête/le pied de page et Supprimer les commentaires activées pour une extraction propre du corps du texte uniquement.
- Le texte extrait est publié dans un CMS headless en tant que nouvelle entrée de contenu.
- Un manuscrit relu, avec suivi des modifications et commentaires, est téléchargé via un formulaire.
- PDF4me L'option « Extraire le texte de Word » s'exécute avec les options « Accepter les modifications » et « Supprimer les commentaires » activées pour obtenir une version finale propre.
- Le texte finalisé est envoyé à un processus de correction ou de publication.
- Un nœud de boucle sur les éléments parcourt les documents Word à partir d'un SharePoint bibliothèque de documents.
- PDF4me L'outil Extract Text From Word s'exécute sur chaque fichier avec les options d'extraction par défaut.
- Le texte extrait est indexé dans un moteur de recherche tel qu'Elasticsearch ou Algolia.
- Un flux de travail ne nécessite que le résumé d'un long rapport.
- PDF4me La fonction « Extraire du texte de Word » s'exécute avec le numéro de page de début 1 et le numéro de page de fin 2 afin de limiter l'extraction aux pages récapitulatives.
- Le texte récapitulatif extrait est envoyé à une étape de résumé ou d'analyse de texte.
Conseils pratiques
Aide-mémoire
| Champ | Valeur |
|---|---|
| Action | Extract Text From Word |
| Input Data Type | Binary Data |
| Input Binary Field | data |
| Document Name | document.docx |
| Start Page Number | 1 (optional) |
| End Page Number | (optional, defaults to last page) |
| Remove Comments | true |
| Remove Header/Footer | true |
| Accept Changes | true |
| Credentials | PDF4me API credential |