Passa al contenuto principale

Estrai il testo da Word in n8n

Estrai testo da Word è un n8n nodo per PDF4me Questo strumento estrae testo pulito da un file .docx, con opzioni per rimuovere commenti, intestazioni e piè di pagina e per finalizzare le modifiche rilevate prima dell'estrazione. È utile per la migrazione di contenuti, l'analisi testuale o per fornire testo da documenti ad analisi successive senza dover ricorrere al copia-incolla manuale.

Cosa fa questo nodo

PDF4me: Estrai testo da Word Legge un file .docx e restituisce il suo contenuto testuale, facoltativamente limitato a un intervallo di pagine e ripulito da commenti, intestazioni/piè di pagina o modifiche tracciate non risolte. Accetta input tramite dati binari, Base64 Corda o URLIdeale per la migrazione di contenuti, la pulizia editoriale, l'indicizzazione per i motori di ricerca e l'inserimento del testo dei documenti in pipeline di text mining o analisi.

Articoli correlati del blog
Non ci sono ancora post sul blog dedicati a questa funzionalità — in arrivo a breve.
Nel frattempo, dai un'occhiata al blog di PDF4me per trovare tutorial e procedure operative su tutte le piattaforme.
Visita il blog

Autenticazione del tuo API Richiesta

Ogni PDF4me nodo in n8n richiede un valido Credenziali per connettersi con. Crea o selezionane uno che contenga il tuo PDF4me API chiave affinché il flusso di lavoro possa autenticare in modo sicuro le richieste di estrazione.

Informazioni importanti da non perdere

Solo 2 campi sono effettivamente obbligatori
L'input del documento Word (tramite Input Data Type) e il nome del documento. L'intervallo di pagine e i tre interruttori di pulizia hanno tutti impostazioni predefinite funzionanti, che corrispondono allo stesso modello di quello già verificato Make versione di questa azione.
L'azione "Accetta modifiche" viene eseguita prima dell'estrazione, non dopo.
L'opzione "Accetta modifiche" finalizza prima tutte le modifiche rilevate nel documento, in modo che il testo estratto rifletta la versione modificata. Disattiva questa opzione se hai bisogno di un testo che corrisponda logicamente al codice sorgente precedente alla modifica.
L'output è un file binario, non una semplice stringa.
Il testo estratto viene restituito come file binario in Output Binary Field Name, in genere JSONPassalo a un nodo a valle per leggere, analizzare o memorizzare il contenuto testuale effettivo.
Il nodo n8n per l'estrazione del testo da Word è configurato con l'azione "Estrai testo da Word", tipo di dati di input "Dati binari", campo di input binario "data", nome del documento "document.docx", numero di pagina iniziale "1", numero di pagina finale "3" e le opzioni di estrazione "Rimuovi commenti", "Rimuovi intestazione/piè di pagina" e "Accetta modifiche" sono tutte abilitate.

PDF4me pannello dei parametri del nodo Estrai testo da Word in n8n

Quali parametri sono necessari per estrarre il testo da un documento Word?

Necessario: Tipo di dati di input e nome del documento, più il campo corrispondente al tipo di input scelto (campo binario di input, Base64 Contenuto Word (o URL Word). Numero di pagina iniziale, Numero di pagina finale, Nome del campo binario di output e le tre opzioni di estrazione sono tutte facoltative.

ParametroNecessarioCosa faEsempio
Input Data TypeRequiredFormat of the source Word document. Choose Binary Data (from a previous node), Base64 String, or URL.Binary Data
Input Binary FieldConditionalName of the binary property on the incoming n8n item that holds the Word file. Required when Input Data Type is Binary Data.data
Base64 Word ContentConditionalBase64-encoded Word content. Required when Input Data Type is Base64 String.UEsDBBQAAAAIAA...
Word URLConditionalPublicly reachable HTTPS URL to the source Word file. Required when Input Data Type is URL.https://example.com/document.docx
Document NameRequiredFilename of the input Word file, including the .docx extension, used for format detection.document.docx
Start Page NumberOptionalFirst page to include in extraction. Leave unset to start from page 1.1
End Page NumberOptionalLast page to include in extraction. Leave unset to extract through the last page.3
Remove CommentsOptionalStrips reviewer comments from the extracted text when enabled.true
Remove Header/FooterOptionalExcludes running headers and footers when enabled, leaving only body content.true
Accept ChangesOptionalFinalizes all tracked changes before extraction when enabled, so text reflects the edited version.true
Output Binary Field NameOptionalName of the binary property the output item exposes. Default is data.data

Opzioni avanzate

Profili personalizzati (facoltativo)
UN JSON-blocco di parametri predefiniti per configurazioni di estrazione specializzate, come ad esempio { "outputDataFormat": "json" }, sovrapposti ai singoli campi soprastanti.

Campi di output

CampoTipoCosa contiene
successBooleanTrue when extraction succeeded. Use to route error-handling branches.
fileNameStringGenerated filename for the extracted content file, typically ending in .json.
mimeTypeStringMIME type of the output, typically application/json or text/plain.
fileSizeNumberSize of the extracted content file in bytes.
docNameStringOriginal filename of the input Word document, kept for audit and tracking.
messageStringHuman-readable status message for the extraction result.
Binary (data)BinaryThe extracted text content under Output Binary Field Name (default data). Pass into a downstream node to read or store the text.

Come si imposta l'estrazione del testo da Word in n8n?

  1. Aggiungere PDF4me al tuo n8n flusso di lavoro e scegliere il Estrai testo da Word azione.
  2. In Credenziali per connettersi con, seleziona il tuo PDF4me credenziali o clicca Crea nuove credenziali e incolla il tuo API chiave.
  3. Impostato Tipo di dati di input A Dati binari (predefinito), Base64 Corda, O URL e fornire il campo sorgente corrispondente.
  4. Impostato Nome reale con il .docx estensione.
  5. Impostazione facoltativa Inizia il numero di pagina E Numero di fine pagina per limitare l'estrazione a un intervallo di pagine.
  6. Impostato Rimuovi commenti, Rimuovi intestazione/piè di pagina, E Accetta modifiche come necessario per un'estrazione pulita o in versione modificata.
  7. Esegui il nodo e instrada il testo estratto nella tua pipeline di contenuti, nell'indice di ricerca o nel flusso di lavoro di analisi.

Configurazioni tipiche

Esempi di flusso di lavoroCommon n8n workflow patterns using Extract Text From Word.
Migrazione dei contenuti in un CMS
  1. Un trigger di Google Drive si attiva quando un documento Word preesistente viene aggiunto a una cartella di migrazione.
  2. PDF4me Le funzioni "Estrai testo da Word" vengono eseguite con le opzioni "Rimuovi intestazione/piè di pagina" e "Rimuovi commenti" abilitate per un'estrazione pulita del solo corpo del testo.
  3. Il testo estratto viene pubblicato su un CMS headless come nuovo elemento di contenuto.
Revisione editoriale successiva
  1. Il manoscritto revisionato, con le modifiche evidenziate e i commenti, viene caricato tramite un modulo.
  2. PDF4me La funzione "Estrai testo da Word" viene eseguita con le opzioni "Accetta modifiche" e "Rimuovi commenti" abilitate per una versione finale pulita.
  3. Il testo definitivo viene inviato al processo di revisione o pubblicazione.
Indice di ricerca creato da una raccolta documenti
  1. Un nodo Loop Over Items itera i documenti Word da un SharePoint biblioteca di documenti.
  2. PDF4me Il programma Extract Text From Word esegue l'operazione su ciascun file con le opzioni di estrazione predefinite.
  3. Il testo estratto viene indicizzato in un motore di ricerca come Elasticsearch o Algolia.
Estrazione a livello di sezione per report di grandi dimensioni
  1. Un flusso di lavoro richiede solo il riepilogo esecutivo di un rapporto lungo.
  2. PDF4me La funzione "Estrai testo da Word" viene eseguita con i parametri "Inizia pagina numero 1" e "Fine pagina numero 2" per limitare l'estrazione alle sole pagine di riepilogo.
  3. Il testo riassuntivo estratto viene inviato a una fase di riassunto o analisi del testo.

Consigli pratici

Only Input and Document Name are required
Page range and the three cleanup toggles all have working defaults; set them only when your workflow needs the behavior to differ.
Use page range for large documents
Set Start Page Number and End Page Number to extract only the section you need instead of processing an entire long document.
Accept Changes changes the output text
With Accept Changes on, deleted text in tracked changes will not appear in the extraction; with it off, the pre-edit text may still be present.
Output is binary, read it downstream
The extracted text arrives as a binary file, not a plain n8n string field; use a node that reads binary content to access the actual text.
Document Name still matters with Binary Data
The extension drives format detection regardless of input type; keep it accurate even when the file itself comes from a previous node.
Remove Header/Footer helps content analysis
Running headers and footers (page numbers, document titles) can pollute text-mining results; strip them for cleaner analysis.

Foglio riassuntivo

CampoValore
ActionExtract Text From Word
Input Data TypeBinary Data
Input Binary Fielddata
Document Namedocument.docx
Start Page Number1 (optional)
End Page Number(optional, defaults to last page)
Remove Commentstrue
Remove Header/Footertrue
Accept Changestrue
CredentialsPDF4me API credential

Domande frequenti

Which fields are required for Extract Text From Word?+
Two: the Word document input (via Input Data Type) and Document Name. Start Page Number, End Page Number, Remove Comments, Remove Header/Footer, and Accept Changes are all optional; the node applies sensible defaults.
What do Remove Comments, Remove Header/Footer, and Accept Changes do?+
Remove Comments strips reviewer comments from the extracted text. Remove Header/Footer excludes running headers and footers so only body content comes through. Accept Changes finalizes tracked changes before extraction, so the text reflects the edited version rather than the original with revision marks.
Can I extract text from only part of the document?+
Yes. Set Start Page Number and End Page Number to limit extraction to a specific page range, leave them unset to extract the entire document.
What format is the extracted text returned in?+
A binary file (typically JSON) exposed under Output Binary Field Name, alongside metadata fields like fileName, fileSize, and success. Pass the binary into a downstream node to read or store the text, similar to how the general-purpose Python approach in this Word text-extraction guide returns structured content rather than a raw string.
Does Accept Changes run before or after extraction?+
Before. Setting Accept Changes finalizes every tracked change in the document first, so the extracted text reflects the edited version, the same distinction raised in Microsoft Q&A discussions on extracting text from Word documents about edited versus original content.

Azioni correlate

Stessa attività su altre piattaforme

Richiedi assistenza