Extrair texto do Word
Extrair → Extrair texto do Word
O Extrair texto do Word API Extrai texto de um documento do Word (.doc, .docx). Você envia o documento como Base64 (docContent), docName, StartPageNumber, EndPageNumber, RemoveComments, RemoveHeaderFooter, AcceptChangese opcionalmente async. O API retornos JSON ou um arquivo de texto com o texto extraído. Use o testador abaixo para experimentá-lo; mais detalhes estão nas seções a seguir.
Experimente a opção Extrair Texto do Word API
:::nota Referência rápida
Ponto final: POST /api/v2/ExtractTextFromWord · Obrigatório: api-key, docContent, docName, StartPageNumber, EndPageNumber, RemoveComments, RemoveHeaderFooter, AcceptChanges
:::
Use o formulário abaixo para enviar sua API chave, documento do Word (Base64), intervalo de páginas e opções (remover comentários, cabeçalho/rodapé, aceitar alterações controladas). A resposta é JSON ou texto com conteúdo extraído. Nenhum código é necessário, preencha os campos e clique. Enviar solicitação.
Visão geral, parâmetros e casos de uso
- Overview
- Parameters
- Use cases
O que é extrair texto de um documento Word?
Este endpoint extrai texto de um documento do Word (.doc, .docx). Você especifica um intervalo de páginas (StartPageNumber, EndPageNumber) e opções: RemoveComments (comentários em tira), RemoveHeaderFooter (cabeçalhos/rodapés de tiras), AcceptChanges (aplicar alterações controladas). O API retornos JSON ou um arquivo de texto com o texto extraído. Use-o quando precisar de texto simples do Word para pesquisa, análise ou migração.
Principais características
- Intervalo de páginas: StartPageNumber e EndPageNumber Limitar a extração a páginas específicas.
- Filtragem de conteúdo: RemoveComments, RemoveHeaderFooter, AcceptChanges controlar o que está incluído.
- FormatosSuporta formatos .doc e .docx (Base64).
- Assíncrono: Usar async Para documentos grandes.
:::dica Ideal para Use quando precisar de texto simples do Word (por exemplo, para pesquisa, migração ou análise). Para PDF uso de extração Extrair recursos ou Extrair texto por expressão. :::
API parâmetros
| Parâmetro | Tipo | Obrigatório | Descrição |
|---|---|---|---|
| api-key | corda | Sim | Seu PDF4me API chave, Base64 codificado. Obtenha-o do painel. |
| docContent | base64 | Sim | Conteúdo do documento Word (Base64). .doc, .docx. |
| docName | corda | Sim | Nome do arquivo Word (ex.: saída). |
| StartPageNumber | inteiro | Sim | Número da página inicial. |
| EndPageNumber | inteiro | Sim | Número da página final. |
| RemoveComments | booleano | Sim | Remover comentários do texto extraído. |
| RemoveHeaderFooter | booleano | Sim | Remover cabeçalho/rodapé do texto extraído. |
| AcceptChanges | booleano | Sim | Aceitar alterações controladas no documento. |
| async | booleano | Não | Ativar o processamento assíncrono. |
Quando usar Extrair Texto do Word
- Migração de conteúdoExtrair texto do Word para importação em CMS, pesquisa ou bancos de dados.
- AnáliseObtenha texto simples para PNL (Processamento de Linguagem Natural), indexação de pesquisa ou geração de relatórios.
- Específico da páginaExtrair apenas um intervalo de páginas (por exemplo, apêndice, seções específicas).
Para esquemas de requisição/resposta e exemplos de código, consulte Extrair texto do Word no PDF4me API documentos.
Pré-requisitos
Antes de usar este endpoint, certifique-se de que você possui:
- Um válido PDF4me API chave (Adquira o seu API Chave)
- Um documento do Word (.docx ou .doc) em Base64 formato
Formato de resposta
O API retorna um JSON resposta ou arquivo de texto com o conteúdo extraído do intervalo de páginas especificado.