Estrai il testo da Word in n8n
Estrai testo da Word è un n8n nodo per PDF4me Questo strumento estrae testo pulito da un file .docx, con opzioni per rimuovere commenti, intestazioni e piè di pagina e per finalizzare le modifiche rilevate prima dell'estrazione. È utile per la migrazione di contenuti, l'analisi testuale o per fornire testo da documenti ad analisi successive senza dover ricorrere al copia-incolla manuale.
Cosa fa questo nodo
PDF4me: Estrai testo da Word Legge un file .docx e restituisce il suo contenuto testuale, facoltativamente limitato a un intervallo di pagine e ripulito da commenti, intestazioni/piè di pagina o modifiche tracciate non risolte. Accetta input tramite dati binari, Base64 Corda o URLIdeale per la migrazione di contenuti, la pulizia editoriale, l'indicizzazione per i motori di ricerca e l'inserimento del testo dei documenti in pipeline di text mining o analisi.
Autenticazione del tuo API Richiesta
Ogni PDF4me nodo in n8n richiede un valido Credenziali per connettersi con. Crea o selezionane uno che contenga il tuo PDF4me API chiave affinché il flusso di lavoro possa autenticare in modo sicuro le richieste di estrazione.
Informazioni importanti da non perdere

PDF4me pannello dei parametri del nodo Estrai testo da Word in n8n
Quali parametri sono necessari per estrarre il testo da un documento Word?
Necessario: Tipo di dati di input e nome del documento, più il campo corrispondente al tipo di input scelto (campo binario di input, Base64 Contenuto Word (o URL Word). Numero di pagina iniziale, Numero di pagina finale, Nome del campo binario di output e le tre opzioni di estrazione sono tutte facoltative.
| Parametro | Necessario | Cosa fa | Esempio |
|---|---|---|---|
| Input Data Type | Required | Format of the source Word document. Choose Binary Data (from a previous node), Base64 String, or URL. | Binary Data |
| Input Binary Field | Conditional | Name of the binary property on the incoming n8n item that holds the Word file. Required when Input Data Type is Binary Data. | data |
| Base64 Word Content | Conditional | Base64-encoded Word content. Required when Input Data Type is Base64 String. | UEsDBBQAAAAIAA... |
| Word URL | Conditional | Publicly reachable HTTPS URL to the source Word file. Required when Input Data Type is URL. | https://example.com/document.docx |
| Document Name | Required | Filename of the input Word file, including the .docx extension, used for format detection. | document.docx |
| Start Page Number | Optional | First page to include in extraction. Leave unset to start from page 1. | 1 |
| End Page Number | Optional | Last page to include in extraction. Leave unset to extract through the last page. | 3 |
| Remove Comments | Optional | Strips reviewer comments from the extracted text when enabled. | true |
| Remove Header/Footer | Optional | Excludes running headers and footers when enabled, leaving only body content. | true |
| Accept Changes | Optional | Finalizes all tracked changes before extraction when enabled, so text reflects the edited version. | true |
| Output Binary Field Name | Optional | Name of the binary property the output item exposes. Default is data. | data |
Opzioni avanzate
{ "outputDataFormat": "json" }, sovrapposti ai singoli campi soprastanti.Campi di output
| Campo | Tipo | Cosa contiene |
|---|---|---|
success | Boolean | True when extraction succeeded. Use to route error-handling branches. |
fileName | String | Generated filename for the extracted content file, typically ending in .json. |
mimeType | String | MIME type of the output, typically application/json or text/plain. |
fileSize | Number | Size of the extracted content file in bytes. |
docName | String | Original filename of the input Word document, kept for audit and tracking. |
message | String | Human-readable status message for the extraction result. |
Binary (data) | Binary | The extracted text content under Output Binary Field Name (default data). Pass into a downstream node to read or store the text. |
Come si imposta l'estrazione del testo da Word in n8n?
- Aggiungere PDF4me al tuo n8n flusso di lavoro e scegliere il Estrai testo da Word azione.
- In Credenziali per connettersi con, seleziona il tuo PDF4me credenziali o clicca Crea nuove credenziali e incolla il tuo API chiave.
- Impostato Tipo di dati di input A Dati binari (predefinito), Base64 Corda, O URL e fornire il campo sorgente corrispondente.
- Impostato Nome reale con il
.docxestensione. - Impostazione facoltativa Inizia il numero di pagina E Numero di fine pagina per limitare l'estrazione a un intervallo di pagine.
- Impostato Rimuovi commenti, Rimuovi intestazione/piè di pagina, E Accetta modifiche come necessario per un'estrazione pulita o in versione modificata.
- Esegui il nodo e instrada il testo estratto nella tua pipeline di contenuti, nell'indice di ricerca o nel flusso di lavoro di analisi.
Configurazioni tipiche
Esempi di flusso di lavoroCommon n8n workflow patterns using Extract Text From Word.
- Un trigger di Google Drive si attiva quando un documento Word preesistente viene aggiunto a una cartella di migrazione.
- PDF4me Le funzioni "Estrai testo da Word" vengono eseguite con le opzioni "Rimuovi intestazione/piè di pagina" e "Rimuovi commenti" abilitate per un'estrazione pulita del solo corpo del testo.
- Il testo estratto viene pubblicato su un CMS headless come nuovo elemento di contenuto.
- Il manoscritto revisionato, con le modifiche evidenziate e i commenti, viene caricato tramite un modulo.
- PDF4me La funzione "Estrai testo da Word" viene eseguita con le opzioni "Accetta modifiche" e "Rimuovi commenti" abilitate per una versione finale pulita.
- Il testo definitivo viene inviato al processo di revisione o pubblicazione.
- Un nodo Loop Over Items itera i documenti Word da un SharePoint biblioteca di documenti.
- PDF4me Il programma Extract Text From Word esegue l'operazione su ciascun file con le opzioni di estrazione predefinite.
- Il testo estratto viene indicizzato in un motore di ricerca come Elasticsearch o Algolia.
- Un flusso di lavoro richiede solo il riepilogo esecutivo di un rapporto lungo.
- PDF4me La funzione "Estrai testo da Word" viene eseguita con i parametri "Inizia pagina numero 1" e "Fine pagina numero 2" per limitare l'estrazione alle sole pagine di riepilogo.
- Il testo riassuntivo estratto viene inviato a una fase di riassunto o analisi del testo.
Consigli pratici
Foglio riassuntivo
| Campo | Valore |
|---|---|
| Action | Extract Text From Word |
| Input Data Type | Binary Data |
| Input Binary Field | data |
| Document Name | document.docx |
| Start Page Number | 1 (optional) |
| End Page Number | (optional, defaults to last page) |
| Remove Comments | true |
| Remove Header/Footer | true |
| Accept Changes | true |
| Credentials | PDF4me API credential |