Extrair texto de uma palavra em n8n
Extrair texto do Word é um n8n nó por PDF4me que extrai conteúdo de texto limpo de um arquivo .docx, com opções para remover comentários, cabeçalhos, rodapés e finalizar as alterações controladas antes da extração. Use-o para migração de conteúdo, mineração de texto ou para alimentar análises subsequentes com texto de documentos sem a necessidade de copiar e colar manualmente.
O que este nó faz
PDF4meExtrair texto de uma palavra Lê um arquivo .docx e retorna seu conteúdo de texto, opcionalmente limitado a um intervalo de páginas e livre de comentários, cabeçalhos/rodapés ou alterações rastreadas não resolvidas. Aceita entrada via Dados Binários. Base64 Corda, ou URLIdeal para migração de conteúdo, limpeza editorial, indexação de mecanismos de busca e alimentação de texto de documentos em fluxos de trabalho de mineração ou análise de texto.
Autenticando seu API Solicitar
Todo PDF4me nó em n8n requer um válido Credencial para se conectar comCrie ou selecione um que contenha o seu PDF4me API chave para que o fluxo de trabalho possa autenticar solicitações de extração com segurança.
Fatos importantes que você não deve perder

PDF4me Painel de parâmetros do nó "Extrair texto da palavra" em n8n
Quais parâmetros são necessários para extrair texto de uma palavra?
Obrigatório: Tipo de dados de entrada e nome do documento, além do campo correspondente ao tipo de entrada escolhido (Campo binário de entrada, Base64 Conteúdo da palavra ou URL da palavra). Número da página inicial, número da página final, nome do campo binário de saída e as três opções de extração são opcionais.
| Parâmetro | Obrigatório | O que faz | Exemplo |
|---|---|---|---|
| Input Data Type | Required | Format of the source Word document. Choose Binary Data (from a previous node), Base64 String, or URL. | Binary Data |
| Input Binary Field | Conditional | Name of the binary property on the incoming n8n item that holds the Word file. Required when Input Data Type is Binary Data. | data |
| Base64 Word Content | Conditional | Base64-encoded Word content. Required when Input Data Type is Base64 String. | UEsDBBQAAAAIAA... |
| Word URL | Conditional | Publicly reachable HTTPS URL to the source Word file. Required when Input Data Type is URL. | https://example.com/document.docx |
| Document Name | Required | Filename of the input Word file, including the .docx extension, used for format detection. | document.docx |
| Start Page Number | Optional | First page to include in extraction. Leave unset to start from page 1. | 1 |
| End Page Number | Optional | Last page to include in extraction. Leave unset to extract through the last page. | 3 |
| Remove Comments | Optional | Strips reviewer comments from the extracted text when enabled. | true |
| Remove Header/Footer | Optional | Excludes running headers and footers when enabled, leaving only body content. | true |
| Accept Changes | Optional | Finalizes all tracked changes before extraction when enabled, so text reflects the edited version. | true |
| Output Binary Field Name | Optional | Name of the binary property the output item exposes. Default is data. | data |
Opções avançadas
{ "outputDataFormat": "json" }, sobrepostas aos campos individuais acima.Campos de saída
| Campo | Tipo | O que contém |
|---|---|---|
success | Boolean | True when extraction succeeded. Use to route error-handling branches. |
fileName | String | Generated filename for the extracted content file, typically ending in .json. |
mimeType | String | MIME type of the output, typically application/json or text/plain. |
fileSize | Number | Size of the extracted content file in bytes. |
docName | String | Original filename of the input Word document, kept for audit and tracking. |
message | String | Human-readable status message for the extraction result. |
Binary (data) | Binary | The extracted text content under Output Binary Field Name (default data). Pass into a downstream node to read or store the text. |
Como faço para configurar a extração de texto do Word? n8n?
- Adicionar PDF4me para o seu n8n fluxo de trabalho e escolha o Extrair texto do Word Ação.
- Em Credencial para se conectar com, selecione o seu PDF4me credencial ou clique Criar nova credencial e cole o seu API chave.
- Definir Tipo de dados de entrada para Dados binários (padrão), Base64 Corda, ou URL e forneça o campo de origem correspondente.
- Definir Nome do documento com o
.docxextensão. - Opcionalmente configurado Número da página inicial e Número da página final Limitar a extração a um intervalo de páginas.
- Definir Remover comentários, Remover cabeçalho/rodapé, e Aceitar alterações conforme necessário para uma extração de versão limpa ou editada.
- Execute o nó e direcione o texto extraído para seu pipeline de conteúdo, índice de pesquisa ou fluxo de trabalho de análise.
Configurações típicas
Exemplos de fluxo de trabalhoCommon n8n workflow patterns using Extract Text From Word.
- Um gatilho do Google Drive é acionado quando um documento antigo do Word é adicionado a uma pasta de migração.
- PDF4me A extração de texto do Word é executada com as opções Remover Cabeçalho/Rodapé e Remover Comentários ativadas para uma extração limpa, contendo apenas o corpo do texto.
- O texto extraído é publicado em um CMS headless como uma nova entrada de conteúdo.
- Um manuscrito revisado, com as alterações e comentários registrados, é enviado por meio de um formulário.
- PDF4me A opção "Extrair texto do Word" é executada com as opções "Aceitar alterações" e "Remover comentários" ativadas, resultando em uma versão final limpa.
- O texto finalizado é enviado para um processo de revisão ou publicação.
- Um nó Loop Over Items itera sobre documentos do Word a partir de um SharePoint biblioteca de documentos.
- PDF4me A função "Extrair Texto do Word" processa cada arquivo com as opções de extração padrão.
- O texto extraído é indexado em um mecanismo de busca como o Elasticsearch ou o Algolia.
- Um fluxo de trabalho precisa apenas do resumo executivo de um relatório extenso.
- PDF4me A função "Extrair Texto do Word" utiliza o número da página inicial 1 e o número da página final 2 para limitar a extração às páginas de resumo.
- O texto resumido extraído é enviado para uma etapa de sumarização ou análise de texto.
Dicas práticas
Folha de dicas
| Campo | Valor |
|---|---|
| Action | Extract Text From Word |
| Input Data Type | Binary Data |
| Input Binary Field | data |
| Document Name | document.docx |
| Start Page Number | 1 (optional) |
| End Page Number | (optional, defaults to last page) |
| Remove Comments | true |
| Remove Header/Footer | true |
| Accept Changes | true |
| Credentials | PDF4me API credential |