Pular para o conteúdo principal

Extrair texto do Word em MakeRecuperação de texto limpo com PDF4me

PDF4me Extrair texto do Word é um Make Módulo que extrai o conteúdo de texto de um documento do Word, com controle de intervalo de páginas e opções para remover comentários, cabeçalhos e rodapés, além de finalizar as alterações controladas. Use-o para fornecer texto limpo a índices de pesquisa, serviços de tradução ou fluxos de trabalho de mineração de texto sem precisar abrir o Word.

O que este módulo faz

PDF4me Extrair texto do Word Retorna o conteúdo de texto de um arquivo .docx como um único campo de Texto Extraído, opcionalmente limitado a um intervalo de páginas e limpo removendo comentários, cabeçalhos/rodapés ou aceitando alterações controladas. Uma única ação substitui a abertura manual do documento para copiar seu texto.

Artigos relacionados no blogue
Ainda não há nenhuma publicação no blogue sobre esta funcionalidade — em breve.
Entretanto, explore o blogue da PDF4me para encontrar tutoriais e fluxos de trabalho para todas as plataformas.
Visite o blogue

Como faço para autenticar minha conta? Make Cenário?

Todo PDF4me módulo em Make requer um válido ConexãoCrie ou selecione um que contenha o seu PDF4me API chave para que o cenário possa autenticar solicitações de extração de texto com segurança.

Fatos importantes que você não deve perder

A opção Aceitar Alterações é executada antes da extração, não depois.
A opção "Aceitar alterações" finaliza todas as alterações controladas no documento, garantindo que o texto extraído reflita a versão editada. Desative-a se precisar que o texto com as marcas de revisão ainda estejam logicamente presentes no documento original.
O intervalo de páginas é opcional e não obrigatório.
Os campos Número da Página Inicial e Número da Página Final restringem a extração a um subconjunto de páginas. Deixe ambos em branco para extrair o documento inteiro em uma única chamada.
O campo de buffer do documento está rotulado como Arquivo JSON.
Apesar do nome, o arquivo JSON contém o conteúdo binário mapeado do documento Word, não o conteúdo em si. JSON texto. Mapeie-o exatamente como um buffer de arquivo em qualquer outro PDF4me módulo.
Configure o módulo "Extrair Texto do Word" do PDF4me com a conexão definida, o arquivo mapeado com o nome do arquivo Word e o arquivo JSON mapeado, a página inicial número 1, a página final número 10 e as opções "Remover Comentários", "Remover Cabeçalho e Rodapé" e "Aceitar Alterações" ativadas.

Defina o arquivo para o mapa, conecte o nome do arquivo Word e o arquivo JSON do módulo anterior e, em seguida, defina um intervalo de páginas opcional e as opções de limpeza.

Parâmetros

Obrigatório: A conexão e o arquivo devem sempre ser fornecidos. O nome do arquivo Word e o arquivo JSON são obrigatórios quando o arquivo for um mapa. O intervalo de páginas e as opções de limpeza são opcionais.

ParâmetroObrigatórioO que fazExemplo
ConnectionRequiredPDF4me API connection. Click Add and paste your API key if connecting for the first time.TestUser01
FileRequiredRadio button picking how the source Word document arrives. Pick a quick storage option (Dropbox - Download a File) or choose Map to bind Word File Name and Json File from any prior module.Map
Word File NameConditionalSub-field of File, shown when Map is selected. Filename of the source document including its .docx extension.annual_report.docx
Json FileConditionalSub-field of File, shown when Map is selected. Binary content of the Word document, mapped from the prior module Data output despite the Json label.[Word Buffer]
Start Page NumberOptional1-based page number where extraction begins. Leave blank to start from the first page.1
End Page NumberOptional1-based page number where extraction ends. Leave blank to extract through the last page.10
Remove CommentsOptionalStrips reviewer comments from the extracted text when enabled.Yes
Remove Header FooterOptionalExcludes running headers and footers from the extracted text when enabled, leaving only body content.Yes
Accept ChangesOptionalFinalizes all tracked changes before extraction when enabled, so the text reflects the edited version.Yes

Campos de saída

CampoTipoO que contém
Extracted TextStringComplete text content from the Word document, filtered by the page range and cleanup options selected.

Como faço para configurar a extração de texto do Word? Make?

  1. Adicionar PDF4meExtrair texto do Word para o seu Make cenário.
  2. Selecione Conexão (ou clique) Adicionar para criar um com o seu PDF4me API chave).
  3. Sob Arquivo, escolher Mapa e fio Nome do arquivo Word e Arquivo JSON de um módulo anterior (Dropbox, Google Drive ou anexo de e-mail).
  4. Opcionalmente configurado Número da página inicial e Número da página final Limitar a extração a um intervalo de páginas.
  5. Alternar Remover comentários, Remover cabeçalho e rodapé, e Aceitar alterações conforme necessário. Execute o cenário; o texto extraído retorna como Texto extraído.

Configurações típicas

Exemplos de fluxo de trabalhoCommon Make scenario patterns using Extract Text from Word.
Índice de pesquisa de cláusulas contratuais
  1. Um gatilho é acionado quando um contrato assinado é inserido no repositório.
  2. O aplicativo Get File baixa o contrato do Word já assinado.
  3. A opção "Extrair texto do Word" é executada com as opções "Aceitar alterações" e "Remover comentários" ativadas para obter uma versão final limpa.
  4. O texto extraído é gravado em um banco de dados pesquisável ou em um índice de texto completo.
  5. As etapas subsequentes de expressão regular ou PNL (Processamento de Linguagem Natural) extraem termos-chave, datas e partes envolvidas.
Preparação da tradução
  1. Um documento é marcado para tradução em um sistema de acompanhamento de projetos.
  2. A função Obter Arquivo recupera o arquivo Word de origem.
  3. A extração de texto do Word é executada com a opção "Remover cabeçalho e rodapé" ativada para isolar o conteúdo do corpo da palavra.
  4. O texto limpo é enviado para tradução. API.
  5. O texto traduzido é reconstruído em um novo documento e arquivado junto com o original.
Migração de conteúdo legado
  1. Um documento Word antigo é recuperado de uma pasta de arquivo para migração.
  2. A função Extrair Texto do Word recupera todo o conteúdo do texto em uma única chamada.
  3. O cenário analisa títulos e parágrafos do texto retornado.
  4. Uma etapa de criação de entrada no CMS importa o conteúdo para a nova plataforma.
  5. O documento original está marcado como migrado no arquivo.

Dicas práticas

Enable Accept Changes for a final-version extract
If the source document still has open tracked changes, leaving Accept Changes off can pull ambiguous or duplicated text. Turn it on whenever you want the clean, finalized wording.
Use the page range for large documents
Setting Start Page Number and End Page Number avoids pulling an entire multi-hundred-page manual when you only need a specific section.
Remove Header Footer before search indexing
Repeated headers and footers pollute keyword frequency in search indexes and NLP pipelines. Strip them for cleaner downstream analysis.
Map Json File like any other buffer
The label is misleading, it is not a JSON string. Map the binary Data output from the prior module the same way you would for any PDF4me file input.
Pair with Parse JSON only after your own restructuring
Extracted Text is plain text, not structured JSON. If you need individual fields, run your own regex or AI parsing step against Extracted Text first.

Folha de dicas

CampoValor
ModuleExtract Text from Word
ConnectionPDF4me API key
Document sourceFile = Map (Word File Name + Json File)
Page rangeStart Page Number / End Page Number (optional)
Cleanup togglesRemove Comments / Remove Header Footer / Accept Changes
OutputExtracted Text (String)

Perguntas frequentes

How do I extract text from a Word document in Make?+
Add the PDF4me Extract Text from Word module, connect your API key, set File to Map and supply Word File Name and Json File from a prior module, then run the scenario. The module returns the document text as a single Extracted Text field.
Can I extract text from only part of the document?+
Yes. Set Start Page Number and End Page Number to a 1-based page range. Leave both blank to extract the entire document.
What do Remove Comments, Remove Header Footer, and Accept Changes do?+
Remove Comments strips reviewer comments from the extracted text. Remove Header Footer excludes running headers and footers so only body content comes through. Accept Changes finalizes tracked changes before extraction, so the text reflects the edited version rather than the original with revision marks.
Why is the document content field called Json File?+
Json File is the exact label PDF4me's Make module uses for the mapped binary content of the Word document, even though the value itself is a document buffer rather than JSON text. Map it the same way you would map a file buffer in any other PDF4me module.
What text mining and NLP tasks pair well with this module?+
The extracted text feeds directly into sentiment analysis, keyword extraction, translation services, or full-text search indexing. See <a href="https://learn.microsoft.com/en-us/office/open-xml/word/structure-of-a-wordprocessingml-document" target="_blank" rel="noopener noreferrer">Microsoft's WordprocessingML document structure reference</a> for how text content is organized inside a .docx file.

Casos de uso e aplicações industriais

  • Análise de ContratoExtrair texto para análise de contratos
  • Pesquisa JurídicaExtrair precedentes de documentos legais
  • Revisão de ConformidadeExtrair texto para verificações de conformidade
  • DescobertaExtrair conteúdo para descoberta eletrônica

Ações relacionadas

Mesma tarefa em outras plataformas

Obtenha ajuda