Extrair texto do Word em MakeRecuperação de texto limpo com PDF4me
PDF4me Extrair texto do Word é um Make Módulo que extrai o conteúdo de texto de um documento do Word, com controle de intervalo de páginas e opções para remover comentários, cabeçalhos e rodapés, além de finalizar as alterações controladas. Use-o para fornecer texto limpo a índices de pesquisa, serviços de tradução ou fluxos de trabalho de mineração de texto sem precisar abrir o Word.
O que este módulo faz
PDF4me Extrair texto do Word Retorna o conteúdo de texto de um arquivo .docx como um único campo de Texto Extraído, opcionalmente limitado a um intervalo de páginas e limpo removendo comentários, cabeçalhos/rodapés ou aceitando alterações controladas. Uma única ação substitui a abertura manual do documento para copiar seu texto.
Como faço para autenticar minha conta? Make Cenário?
Todo PDF4me módulo em Make requer um válido ConexãoCrie ou selecione um que contenha o seu PDF4me API chave para que o cenário possa autenticar solicitações de extração de texto com segurança.
Fatos importantes que você não deve perder

Defina o arquivo para o mapa, conecte o nome do arquivo Word e o arquivo JSON do módulo anterior e, em seguida, defina um intervalo de páginas opcional e as opções de limpeza.
Parâmetros
Obrigatório: A conexão e o arquivo devem sempre ser fornecidos. O nome do arquivo Word e o arquivo JSON são obrigatórios quando o arquivo for um mapa. O intervalo de páginas e as opções de limpeza são opcionais.
| Parâmetro | Obrigatório | O que faz | Exemplo |
|---|---|---|---|
| Connection | Required | PDF4me API connection. Click Add and paste your API key if connecting for the first time. | TestUser01 |
| File | Required | Radio button picking how the source Word document arrives. Pick a quick storage option (Dropbox - Download a File) or choose Map to bind Word File Name and Json File from any prior module. | Map |
| Word File Name | Conditional | Sub-field of File, shown when Map is selected. Filename of the source document including its .docx extension. | annual_report.docx |
| Json File | Conditional | Sub-field of File, shown when Map is selected. Binary content of the Word document, mapped from the prior module Data output despite the Json label. | [Word Buffer] |
| Start Page Number | Optional | 1-based page number where extraction begins. Leave blank to start from the first page. | 1 |
| End Page Number | Optional | 1-based page number where extraction ends. Leave blank to extract through the last page. | 10 |
| Remove Comments | Optional | Strips reviewer comments from the extracted text when enabled. | Yes |
| Remove Header Footer | Optional | Excludes running headers and footers from the extracted text when enabled, leaving only body content. | Yes |
| Accept Changes | Optional | Finalizes all tracked changes before extraction when enabled, so the text reflects the edited version. | Yes |
Campos de saída
| Campo | Tipo | O que contém |
|---|---|---|
Extracted Text | String | Complete text content from the Word document, filtered by the page range and cleanup options selected. |
Como faço para configurar a extração de texto do Word? Make?
- Adicionar PDF4me → Extrair texto do Word para o seu Make cenário.
- Selecione Conexão (ou clique) Adicionar para criar um com o seu PDF4me API chave).
- Sob Arquivo, escolher Mapa e fio Nome do arquivo Word e Arquivo JSON de um módulo anterior (Dropbox, Google Drive ou anexo de e-mail).
- Opcionalmente configurado Número da página inicial e Número da página final Limitar a extração a um intervalo de páginas.
- Alternar Remover comentários, Remover cabeçalho e rodapé, e Aceitar alterações conforme necessário. Execute o cenário; o texto extraído retorna como Texto extraído.
Configurações típicas
Exemplos de fluxo de trabalhoCommon Make scenario patterns using Extract Text from Word.
- Um gatilho é acionado quando um contrato assinado é inserido no repositório.
- O aplicativo Get File baixa o contrato do Word já assinado.
- A opção "Extrair texto do Word" é executada com as opções "Aceitar alterações" e "Remover comentários" ativadas para obter uma versão final limpa.
- O texto extraído é gravado em um banco de dados pesquisável ou em um índice de texto completo.
- As etapas subsequentes de expressão regular ou PNL (Processamento de Linguagem Natural) extraem termos-chave, datas e partes envolvidas.
- Um documento é marcado para tradução em um sistema de acompanhamento de projetos.
- A função Obter Arquivo recupera o arquivo Word de origem.
- A extração de texto do Word é executada com a opção "Remover cabeçalho e rodapé" ativada para isolar o conteúdo do corpo da palavra.
- O texto limpo é enviado para tradução. API.
- O texto traduzido é reconstruído em um novo documento e arquivado junto com o original.
- Um documento Word antigo é recuperado de uma pasta de arquivo para migração.
- A função Extrair Texto do Word recupera todo o conteúdo do texto em uma única chamada.
- O cenário analisa títulos e parágrafos do texto retornado.
- Uma etapa de criação de entrada no CMS importa o conteúdo para a nova plataforma.
- O documento original está marcado como migrado no arquivo.
Dicas práticas
Folha de dicas
| Campo | Valor |
|---|---|
| Module | Extract Text from Word |
| Connection | PDF4me API key |
| Document source | File = Map (Word File Name + Json File) |
| Page range | Start Page Number / End Page Number (optional) |
| Cleanup toggles | Remove Comments / Remove Header Footer / Accept Changes |
| Output | Extracted Text (String) |
Perguntas frequentes
Casos de uso e aplicações industriais
- Legal & Compliance
- Content Management
- Translation & Localization
- Research & Analytics
- Análise de ContratoExtrair texto para análise de contratos
- Pesquisa JurídicaExtrair precedentes de documentos legais
- Revisão de ConformidadeExtrair texto para verificações de conformidade
- DescobertaExtrair conteúdo para descoberta eletrônica
- Migração de CMSExtrair texto para sistemas de gerenciamento de conteúdo
- Base de conhecimento: Criar repositórios de conhecimento pesquisáveis
- Digitalização de ArquivosExtrair texto de documentos antigos
- Reutilização de conteúdoRecuperar conteúdo para reutilização
- Preparação para TraduçãoExtrair texto para serviços de tradução
- Conteúdo multilínguePreparar texto para localização
- Processamento de linguagemExtrair texto para análise de PNL
- Globalização de ConteúdoProcessar texto para mercados internacionais
- Mineração de textoExtrair texto para mineração de dados
- Análise de SentimentosAnalisar o sentimento do documento
- Análise de Conteúdo: Estude os temas e tópicos dos documentos
- Dados de pesquisaExtrair conteúdo de pesquisa para análise.