Pular para o conteúdo principal

Extrair texto do Word - Analisador de conteúdo API

PDF4me Extrair texto do Word Permite extrair conteúdo de texto de documentos do Word com opções de intervalo de páginas e filtragem de conteúdo. API O serviço processa arquivos do Word e extrai o conteúdo de texto de documentos do Word com opções personalizáveis. API recebe conteúdo de documento Word através de REST API chamadas, utilizando Base64 Codificação para transmissão segura. Com suporte para seleção de intervalo de páginas, remoção de comentários, filtragem de cabeçalho/rodapé e aceitação de alterações, esta solução é ideal para fluxos de trabalho de processamento de documentos e análise de conteúdo.

Artigos relacionados no blogue
Ainda não há nenhuma publicação no blogue sobre esta funcionalidade — em breve.
Entretanto, explore o blogue da PDF4me para encontrar tutoriais e fluxos de trabalho para todas as plataformas.
Visite o blogue

Autenticando seu API Solicitar

Para acessar o PDF4me REST APIPara que uma solicitação seja aceita, é necessário incluir as credenciais de autenticação adequadas. A autenticação garante a segurança da comunicação e valida sua identidade como usuário autorizado do sistema. REST API.

Principais características

  • Suporte para documentos do WordExtrair texto de documentos do Microsoft Word (.doc, .docx)
  • Seleção de intervalo de páginasProcessar intervalos de páginas específicos ou documentos inteiros com números de página inicial e final personalizados.
  • Filtragem de conteúdoRemova comentários, cabeçalhos, rodapés e o controle de alterações para uma extração de texto limpa.
  • Base64 CodificaçãoTransmissão segura de conteúdo de arquivos usando Base64 codificação
  • Simple API IntegraçãoRESTful API Projetado para fluxos de trabalho automatizados de processamento de documentos do Word.

REST API Ponto final

O PDF4me REST API usa padrão HTTP Métodos para interagir com recursos. Todas as operações de extração de texto do Word são realizadas por meio de um único ponto de extremidade:

  • Método: POST
  • Ponto final: /api/v2/ExtractTextFromWord

REST API Parâmetros

Lista completa de parâmetros para a função Extrair Texto do Word REST APIOs parâmetros estão organizados por categoria para melhor compreensão e implementação.

Importante: Os parâmetros marcados com um asterisco (*) são obrigatórios e devem ser fornecidos para o API para funcionar corretamente.

Parâmetros obrigatórios

ParâmetroTipoDescriçãoExemplo
docName*StringNome do arquivo Word de origem (sem extensão ou com extensão .docx/.doc)output
docContent*Base64 (String)O conteúdo do documento Word de entrada em Base64 formatoJVBERi...
StartPageNumber*IntegerNúmero da página inicial para extração de texto1
EndPageNumber*IntegerNúmero da página final para extração de texto3
RemoveComments*BooleanEscolha se deseja remover os comentários do texto extraído: verdadeiroRemover comentários, falsoIncluir comentáriostrue
RemoveHeaderFooter*BooleanEscolha se deseja remover cabeçalhos e rodapés: verdadeiroRemover cabeçalhos/rodapés, falsoIncluir cabeçalhos/rodapéstrue
AcceptChanges*BooleanEscolha se deseja aceitar as alterações controladas: verdadeiroAceitar alterações, falsoRejeitar alteraçõestrue

Parâmetros opcionais

ParâmetroTipoDescriçãoExemplo
asyncBooleanAtive o processamento assíncrono. Quando true, o API retornos 202 Accepted com um Location cabeçalho para consultar o resultadofalse

Saída

O PDF4me Extrair texto do Word REST API Retorna respostas diferentes dependendo do modo de processamento. API Retorna o texto extraído como um JSON resposta ou arquivo de texto.

Processamento síncrono (padrão)

Quando async é false ou não fornecido, o API Retorna o texto extraído imediatamente.

Código de status: 200 OK

Formato da resposta:

{
"extractedText": "Extracted text content from Word document pages 1 to 3...",
"fileName": "output.txt"
}

Ou como um arquivo de texto:

Extracted text content from Word document pages 1 to 3...

A resposta contém o conteúdo textual extraído do intervalo de páginas especificado.

Exemplo de solicitação

Cabeçalho

Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY

Observação:

  • Adquira o seu API chave do PDF4me Painel
  • O API a chave deve ser Base64 codificado e prefixado com "Básico" no Authorization cabeçalho
  • Exemplo: Se o seu API chave é abc123, codifique-o para Base64 e usar Authorization: Basic YWJjMTIz

Carga útil

Solicitação básica:

{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output",
"StartPageNumber": 1,
"EndPageNumber": 3,
"RemoveComments": true,
"RemoveHeaderFooter": true,
"AcceptChanges": true
}

Com processamento assíncrono:

{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output",
"StartPageNumber": 1,
"EndPageNumber": 3,
"RemoveComments": true,
"RemoveHeaderFooter": true,
"AcceptChanges": true,
"async": true
}

Exemplos de código

O PDF4me Extrair texto do Word REST API Fornece exemplos de código em várias linguagens de programação. Escolha a linguagem que melhor se adapta ao seu ambiente de desenvolvimento:

C# (CSharp) Exemplo

Completo C# Implementação para extrair texto de documentos do Word:

Recursos de extração de texto Word

Processamento de Documentos

  • Suporte ao formato WordSuporte completo para os formatos de documento .doc e .docx do Microsoft Word.
  • Preservação de FormatoMantém a formatação e a estrutura do texto durante a extração.
  • Documentos complexosLida com documentos complexos do Word que contêm tabelas, imagens e conteúdo incorporado.
  • Processamento profissionalExtração de texto de alta qualidade com preservação precisa do conteúdo.
  • Entrada flexívelSuporte para diversas versões e formatos de documentos do Word.

Processamento de página

  • Seleção de intervalo de páginasExtrair texto de intervalos de páginas específicos com números de página inicial e final.
  • Segmentação flexívelProcessar páginas individuais, intervalos de páginas ou documentos inteiros.
  • Processamento personalizadoSuporte para qualquer combinação de páginas com controle preciso.
  • Processamento em loteGerencie várias páginas de forma eficiente em uma única tela. API ligações
  • Layout profissionalExtração de texto consistente em todas as páginas de destino.

Filtragem de conteúdo

  • Remoção de comentáriosOpção para excluir comentários e anotações do texto extraído.
  • Filtragem de cabeçalho/rodapéRemova cabeçalhos e rodapés para extrair conteúdo de forma limpa.
  • Rastreamento de alteraçõesAceitar ou rejeitar alterações controladas durante a extração de texto.
  • Limpeza de conteúdoOpções avançadas de filtragem para necessidades específicas de extração de texto.
  • Resultados profissionaisSaída de texto limpa e formatada com preservação precisa do conteúdo.

Casos de uso e aplicações industriais

Casos de uso para empresas e negócios

  • Análise de DocumentosExtrair conteúdo textual de documentos do Word para análise e processamento.
  • Gestão de ConteúdoExtrair texto de documentos do Word para sistemas de gerenciamento de conteúdo
  • Processamento de relatóriosExtrair texto de relatórios do Word para processamento e análise automatizados.
  • Inteligência de NegóciosExtrair texto de documentos comerciais do Word para análise de dados.

Obtenha ajuda