Aller au contenu principal

Extraire du texte de Word dans Make: Récupération de texte propre avec PDF4me

PDF4me Extraire du texte de Word est un Make Ce module extrait le contenu textuel d'un document Word, avec contrôle de la plage de pages et options permettant de supprimer les commentaires, les en-têtes et les pieds de page, et de finaliser d'abord le suivi des modifications. Utilisez-le pour alimenter les index de recherche, les services de traduction ou les pipelines d'exploration de texte avec du texte propre, sans avoir à ouvrir Word.

Que fait ce module ?

PDF4me Extraire du texte de Word Récupère le contenu textuel d'un fichier .docx sous forme d'un champ Texte extrait unique, éventuellement limité à une plage de pages et nettoyé en supprimant les commentaires, les en-têtes et les pieds de page, ou en acceptant au préalable les modifications suivies. Cette action remplace l'ouverture manuelle du document pour en copier le texte.

Articles de blog connexes
Il n'y a pas encore d'article de blog consacré à cette fonctionnalité — à venir prochainement.
En attendant, n'hésitez pas à consulter le blog de PDF4me pour découvrir des tutoriels et des procédures de travail adaptés à toutes les plateformes.
Consultez le blog

Comment puis-je authentifier mon Make Scénario ?

Chaque PDF4me module dans Make nécessite un numéro valide ConnexionCréez ou sélectionnez-en un qui contient votre PDF4me API clé permettant au scénario d'authentifier de manière sécurisée les requêtes d'extraction de texte.

Informations importantes à ne pas manquer

Accepter les modifications s'exécute avant l'extraction, et non après.
L'option « Accepter les modifications » valide d'abord toutes les modifications suivies dans le document, afin que le texte extrait reflète la version éditée. Désactivez cette option si vous souhaitez conserver le texte avec les marques de révision dans la source.
La plage de pages est facultative.
Les champs « Numéro de page de début » et « Numéro de page de fin » permettent de limiter l'extraction à un sous-ensemble de pages. Laissez ces champs vides pour extraire le document complet en une seule opération.
Le champ de mémoire tampon du document est intitulé Fichier JSON
Malgré son nom, un fichier JSON contient le contenu binaire mappé du document Word, et non pas le contenu binaire. JSON texte. Associez-le exactement comme un tampon de fichier dans n'importe quel autre PDF4me module.
Configurez le module PDF4me Extract Text from Word avec la connexion, le fichier défini sur « Mapper » avec le nom du fichier Word et le fichier JSON mappé, la page de début numéro 1, la page de fin numéro 10, et activez les options « Supprimer les commentaires », « Supprimer l’en-tête et le pied de page » et « Accepter les modifications ».

Définissez le fichier à mapper, connectez le nom du fichier Word et le fichier JSON du module précédent, puis définissez une plage de pages facultative et les bascules de nettoyage.

Paramètres

Requis: Le champ Connexion et le champ Fichier doivent toujours être fournis. Le nom du fichier Word et le champ JSON sont obligatoires lorsque le fichier est une carte. Les options Plage de pages et Nettoyage sont facultatives.

ParamètreRequisCe que cela faitExemple
ConnectionRequiredPDF4me API connection. Click Add and paste your API key if connecting for the first time.TestUser01
FileRequiredRadio button picking how the source Word document arrives. Pick a quick storage option (Dropbox - Download a File) or choose Map to bind Word File Name and Json File from any prior module.Map
Word File NameConditionalSub-field of File, shown when Map is selected. Filename of the source document including its .docx extension.annual_report.docx
Json FileConditionalSub-field of File, shown when Map is selected. Binary content of the Word document, mapped from the prior module Data output despite the Json label.[Word Buffer]
Start Page NumberOptional1-based page number where extraction begins. Leave blank to start from the first page.1
End Page NumberOptional1-based page number where extraction ends. Leave blank to extract through the last page.10
Remove CommentsOptionalStrips reviewer comments from the extracted text when enabled.Yes
Remove Header FooterOptionalExcludes running headers and footers from the extracted text when enabled, leaving only body content.Yes
Accept ChangesOptionalFinalizes all tracked changes before extraction when enabled, so the text reflects the edited version.Yes

Champs de sortie

ChampTaperCe qu'il contient
Extracted TextStringComplete text content from the Word document, filtered by the page range and cleanup options selected.

Comment configurer l'extraction de texte à partir de Word dans Make?

  1. Ajouter PDF4meExtraire du texte de Word à votre Make scénario.
  2. Sélectionner Connexion (ou cliquez Ajouter pour en créer un avec votre PDF4me API clé).
  3. Sous Déposer, choisir Carte et fil Nom du fichier Word et Fichier JSON d'un module précédent (Dropbox, Google Drive ou pièce jointe d'un courriel).
  4. Paramètre optionnel Numéro de page de début et Numéro de page de fin limiter l'extraction à une plage de pages.
  5. Basculer Supprimer les commentaires, Supprimer l'en-tête et le pied de page, et Accepter les modifications au besoin. Exécutez le scénario, le texte extrait s'affiche comme suit : Texte extrait.

Configurations typiques

Exemples de flux de travailCommon Make scenario patterns using Extract Text from Word.
Index de recherche des clauses contractuelles
  1. Un déclencheur s'active lorsqu'un contrat signé est déposé dans le référentiel.
  2. Téléchargez le fichier contenant le contrat Word exécuté.
  3. L'extraction de texte à partir de Word s'effectue avec les options Accepter les modifications et Supprimer les commentaires activées pour obtenir une version finale propre.
  4. Le texte extrait est enregistré dans une base de données consultable ou un index de texte intégral.
  5. Les étapes suivantes, utilisant des expressions régulières ou du traitement automatique du langage naturel (NLP), extraient les termes clés, les dates et les parties.
Préparation de la traduction
  1. Un document est marqué pour traduction dans un outil de suivi de projet.
  2. La fonction « Obtenir un fichier » récupère le fichier Word source.
  3. Extraire le texte d'un document Word s'effectue avec l'option Supprimer l'en-tête et le pied de page activée afin d'isoler le contenu du corps du texte.
  4. Le texte propre est envoyé à la traduction. API.
  5. Le texte traduit est reconstitué dans un nouveau document et archivé avec le texte source.
Migration du contenu existant
  1. Un document Word ancien est extrait d'un dossier d'archives en vue de sa migration.
  2. La fonction Extract Text from Word récupère l'intégralité du contenu textuel en un seul appel.
  3. Le scénario analyse les titres et les paragraphes du texte renvoyé.
  4. L'étape « Créer une entrée » du CMS importe le contenu dans la nouvelle plateforme.
  5. Le document original est marqué comme migré dans l'archive.

Conseils pratiques

Enable Accept Changes for a final-version extract
If the source document still has open tracked changes, leaving Accept Changes off can pull ambiguous or duplicated text. Turn it on whenever you want the clean, finalized wording.
Use the page range for large documents
Setting Start Page Number and End Page Number avoids pulling an entire multi-hundred-page manual when you only need a specific section.
Remove Header Footer before search indexing
Repeated headers and footers pollute keyword frequency in search indexes and NLP pipelines. Strip them for cleaner downstream analysis.
Map Json File like any other buffer
The label is misleading, it is not a JSON string. Map the binary Data output from the prior module the same way you would for any PDF4me file input.
Pair with Parse JSON only after your own restructuring
Extracted Text is plain text, not structured JSON. If you need individual fields, run your own regex or AI parsing step against Extracted Text first.

Aide-mémoire

ChampValeur
ModuleExtract Text from Word
ConnectionPDF4me API key
Document sourceFile = Map (Word File Name + Json File)
Page rangeStart Page Number / End Page Number (optional)
Cleanup togglesRemove Comments / Remove Header Footer / Accept Changes
OutputExtracted Text (String)

Questions fréquentes

How do I extract text from a Word document in Make?+
Add the PDF4me Extract Text from Word module, connect your API key, set File to Map and supply Word File Name and Json File from a prior module, then run the scenario. The module returns the document text as a single Extracted Text field.
Can I extract text from only part of the document?+
Yes. Set Start Page Number and End Page Number to a 1-based page range. Leave both blank to extract the entire document.
What do Remove Comments, Remove Header Footer, and Accept Changes do?+
Remove Comments strips reviewer comments from the extracted text. Remove Header Footer excludes running headers and footers so only body content comes through. Accept Changes finalizes tracked changes before extraction, so the text reflects the edited version rather than the original with revision marks.
Why is the document content field called Json File?+
Json File is the exact label PDF4me's Make module uses for the mapped binary content of the Word document, even though the value itself is a document buffer rather than JSON text. Map it the same way you would map a file buffer in any other PDF4me module.
What text mining and NLP tasks pair well with this module?+
The extracted text feeds directly into sentiment analysis, keyword extraction, translation services, or full-text search indexing. See <a href="https://learn.microsoft.com/en-us/office/open-xml/word/structure-of-a-wordprocessingml-document" target="_blank" rel="noopener noreferrer">Microsoft's WordprocessingML document structure reference</a> for how text content is organized inside a .docx file.

Cas d'utilisation et applications industrielles

  • Analyse de contratExtraire du texte pour l'analyse des contrats
  • Recherche juridique: Rechercher des précédents dans les documents juridiques
  • Examen de conformitéExtraire le texte pour les contrôles de conformité
  • DécouverteExtraire du contenu pour la découverte électronique

Actions connexes

Même tâche sur d'autres plateformes

Obtenez de l'aide