Pular para o conteúdo principal

Extrair texto de uma palavra em n8n

Extrair texto do Word é um n8n nó por PDF4me que extrai conteúdo de texto limpo de um arquivo .docx, com opções para remover comentários, cabeçalhos, rodapés e finalizar as alterações controladas antes da extração. Use-o para migração de conteúdo, mineração de texto ou para alimentar análises subsequentes com texto de documentos sem a necessidade de copiar e colar manualmente.

O que este nó faz

PDF4meExtrair texto de uma palavra Lê um arquivo .docx e retorna seu conteúdo de texto, opcionalmente limitado a um intervalo de páginas e livre de comentários, cabeçalhos/rodapés ou alterações rastreadas não resolvidas. Aceita entrada via Dados Binários. Base64 Corda, ou URLIdeal para migração de conteúdo, limpeza editorial, indexação de mecanismos de busca e alimentação de texto de documentos em fluxos de trabalho de mineração ou análise de texto.

Artigos relacionados no blogue
Ainda não há nenhuma publicação no blogue sobre esta funcionalidade — em breve.
Entretanto, explore o blogue da PDF4me para encontrar tutoriais e fluxos de trabalho para todas as plataformas.
Visite o blogue

Autenticando seu API Solicitar

Todo PDF4me nó em n8n requer um válido Credencial para se conectar comCrie ou selecione um que contenha o seu PDF4me API chave para que o fluxo de trabalho possa autenticar solicitações de extração com segurança.

Fatos importantes que você não deve perder

Apenas 2 campos são realmente obrigatórios.
O documento do Word (através do Tipo de Dados de Entrada) e o Nome do Documento, o intervalo de páginas e as três opções de limpeza possuem valores padrão funcionais, seguindo o mesmo padrão dos documentos já verificados. Make versão desta ação.
A opção Aceitar Alterações é executada antes da extração, não depois.
A opção "Aceitar alterações" finaliza todas as alterações rastreadas no documento, garantindo que o texto extraído reflita a versão editada. Desative-a se precisar de um texto que corresponda logicamente ao documento original antes da edição.
A saída é um arquivo binário, não uma string simples.
O texto extraído é retornado como um arquivo binário no campo Nome do arquivo binário de saída, normalmente JSONPasse-o para um nó subsequente para ler, analisar ou armazenar o conteúdo de texto real.
O nó n8n "Extrair Texto do Word" está configurado com a ação "Extrair Texto do Word", o tipo de dados de entrada "Dados Binários", o campo de entrada "dados binários", o nome do documento "document.docx", a página inicial "1", a página final "3" e as opções de extração "Remover Comentários", "Remover Cabeçalho/Rodapé" e "Aceitar Alterações" ativadas.

PDF4me Painel de parâmetros do nó "Extrair texto da palavra" em n8n

Quais parâmetros são necessários para extrair texto de uma palavra?

Obrigatório: Tipo de dados de entrada e nome do documento, além do campo correspondente ao tipo de entrada escolhido (Campo binário de entrada, Base64 Conteúdo da palavra ou URL da palavra). Número da página inicial, número da página final, nome do campo binário de saída e as três opções de extração são opcionais.

ParâmetroObrigatórioO que fazExemplo
Input Data TypeRequiredFormat of the source Word document. Choose Binary Data (from a previous node), Base64 String, or URL.Binary Data
Input Binary FieldConditionalName of the binary property on the incoming n8n item that holds the Word file. Required when Input Data Type is Binary Data.data
Base64 Word ContentConditionalBase64-encoded Word content. Required when Input Data Type is Base64 String.UEsDBBQAAAAIAA...
Word URLConditionalPublicly reachable HTTPS URL to the source Word file. Required when Input Data Type is URL.https://example.com/document.docx
Document NameRequiredFilename of the input Word file, including the .docx extension, used for format detection.document.docx
Start Page NumberOptionalFirst page to include in extraction. Leave unset to start from page 1.1
End Page NumberOptionalLast page to include in extraction. Leave unset to extract through the last page.3
Remove CommentsOptionalStrips reviewer comments from the extracted text when enabled.true
Remove Header/FooterOptionalExcludes running headers and footers when enabled, leaving only body content.true
Accept ChangesOptionalFinalizes all tracked changes before extraction when enabled, so text reflects the edited version.true
Output Binary Field NameOptionalName of the binary property the output item exposes. Default is data.data

Opções avançadas

Perfis personalizados (opcional)
A JSON-tipo bloco de parâmetros predefinidos para configurações de extração especializadas, como { "outputDataFormat": "json" }, sobrepostas aos campos individuais acima.

Campos de saída

CampoTipoO que contém
successBooleanTrue when extraction succeeded. Use to route error-handling branches.
fileNameStringGenerated filename for the extracted content file, typically ending in .json.
mimeTypeStringMIME type of the output, typically application/json or text/plain.
fileSizeNumberSize of the extracted content file in bytes.
docNameStringOriginal filename of the input Word document, kept for audit and tracking.
messageStringHuman-readable status message for the extraction result.
Binary (data)BinaryThe extracted text content under Output Binary Field Name (default data). Pass into a downstream node to read or store the text.

Como faço para configurar a extração de texto do Word? n8n?

  1. Adicionar PDF4me para o seu n8n fluxo de trabalho e escolha o Extrair texto do Word Ação.
  2. Em Credencial para se conectar com, selecione o seu PDF4me credencial ou clique Criar nova credencial e cole o seu API chave.
  3. Definir Tipo de dados de entrada para Dados binários (padrão), Base64 Corda, ou URL e forneça o campo de origem correspondente.
  4. Definir Nome do documento com o .docx extensão.
  5. Opcionalmente configurado Número da página inicial e Número da página final Limitar a extração a um intervalo de páginas.
  6. Definir Remover comentários, Remover cabeçalho/rodapé, e Aceitar alterações conforme necessário para uma extração de versão limpa ou editada.
  7. Execute o nó e direcione o texto extraído para seu pipeline de conteúdo, índice de pesquisa ou fluxo de trabalho de análise.

Configurações típicas

Exemplos de fluxo de trabalhoCommon n8n workflow patterns using Extract Text From Word.
Migração de conteúdo para um CMS
  1. Um gatilho do Google Drive é acionado quando um documento antigo do Word é adicionado a uma pasta de migração.
  2. PDF4me A extração de texto do Word é executada com as opções Remover Cabeçalho/Rodapé e Remover Comentários ativadas para uma extração limpa, contendo apenas o corpo do texto.
  3. O texto extraído é publicado em um CMS headless como uma nova entrada de conteúdo.
Revisão editorial após análise
  1. Um manuscrito revisado, com as alterações e comentários registrados, é enviado por meio de um formulário.
  2. PDF4me A opção "Extrair texto do Word" é executada com as opções "Aceitar alterações" e "Remover comentários" ativadas, resultando em uma versão final limpa.
  3. O texto finalizado é enviado para um processo de revisão ou publicação.
Índice de pesquisa construído a partir de uma biblioteca de documentos
  1. Um nó Loop Over Items itera sobre documentos do Word a partir de um SharePoint biblioteca de documentos.
  2. PDF4me A função "Extrair Texto do Word" processa cada arquivo com as opções de extração padrão.
  3. O texto extraído é indexado em um mecanismo de busca como o Elasticsearch ou o Algolia.
Extração em nível de seção para relatórios extensos
  1. Um fluxo de trabalho precisa apenas do resumo executivo de um relatório extenso.
  2. PDF4me A função "Extrair Texto do Word" utiliza o número da página inicial 1 e o número da página final 2 para limitar a extração às páginas de resumo.
  3. O texto resumido extraído é enviado para uma etapa de sumarização ou análise de texto.

Dicas práticas

Only Input and Document Name are required
Page range and the three cleanup toggles all have working defaults; set them only when your workflow needs the behavior to differ.
Use page range for large documents
Set Start Page Number and End Page Number to extract only the section you need instead of processing an entire long document.
Accept Changes changes the output text
With Accept Changes on, deleted text in tracked changes will not appear in the extraction; with it off, the pre-edit text may still be present.
Output is binary, read it downstream
The extracted text arrives as a binary file, not a plain n8n string field; use a node that reads binary content to access the actual text.
Document Name still matters with Binary Data
The extension drives format detection regardless of input type; keep it accurate even when the file itself comes from a previous node.
Remove Header/Footer helps content analysis
Running headers and footers (page numbers, document titles) can pollute text-mining results; strip them for cleaner analysis.

Folha de dicas

CampoValor
ActionExtract Text From Word
Input Data TypeBinary Data
Input Binary Fielddata
Document Namedocument.docx
Start Page Number1 (optional)
End Page Number(optional, defaults to last page)
Remove Commentstrue
Remove Header/Footertrue
Accept Changestrue
CredentialsPDF4me API credential

Perguntas frequentes

Which fields are required for Extract Text From Word?+
Two: the Word document input (via Input Data Type) and Document Name. Start Page Number, End Page Number, Remove Comments, Remove Header/Footer, and Accept Changes are all optional; the node applies sensible defaults.
What do Remove Comments, Remove Header/Footer, and Accept Changes do?+
Remove Comments strips reviewer comments from the extracted text. Remove Header/Footer excludes running headers and footers so only body content comes through. Accept Changes finalizes tracked changes before extraction, so the text reflects the edited version rather than the original with revision marks.
Can I extract text from only part of the document?+
Yes. Set Start Page Number and End Page Number to limit extraction to a specific page range, leave them unset to extract the entire document.
What format is the extracted text returned in?+
A binary file (typically JSON) exposed under Output Binary Field Name, alongside metadata fields like fileName, fileSize, and success. Pass the binary into a downstream node to read or store the text, similar to how the general-purpose Python approach in this Word text-extraction guide returns structured content rather than a raw string.
Does Accept Changes run before or after extraction?+
Before. Setting Accept Changes finalizes every tracked change in the document first, so the extracted text reflects the edited version, the same distinction raised in Microsoft Q&A discussions on extracting text from Word documents about edited versus original content.

Ações relacionadas

Mesma tarefa em outras plataformas

Obtenha ajuda