Extrair texto do Word - Analisador de conteúdo API
PDF4me Extrair texto do Word Permite extrair conteúdo de texto de documentos do Word com opções de intervalo de páginas e filtragem de conteúdo. API O serviço processa arquivos do Word e extrai o conteúdo de texto de documentos do Word com opções personalizáveis. API recebe conteúdo de documento Word através de REST API chamadas, utilizando Base64 Codificação para transmissão segura. Com suporte para seleção de intervalo de páginas, remoção de comentários, filtragem de cabeçalho/rodapé e aceitação de alterações, esta solução é ideal para fluxos de trabalho de processamento de documentos e análise de conteúdo.
Autenticando seu API Solicitar
Para acessar o PDF4me REST APIPara que uma solicitação seja aceita, é necessário incluir as credenciais de autenticação adequadas. A autenticação garante a segurança da comunicação e valida sua identidade como usuário autorizado do sistema. REST API.
Principais características
- Suporte para documentos do WordExtrair texto de documentos do Microsoft Word (.doc, .docx)
- Seleção de intervalo de páginasProcessar intervalos de páginas específicos ou documentos inteiros com números de página inicial e final personalizados.
- Filtragem de conteúdoRemova comentários, cabeçalhos, rodapés e o controle de alterações para uma extração de texto limpa.
- Base64 CodificaçãoTransmissão segura de conteúdo de arquivos usando Base64 codificação
- Simple API IntegraçãoRESTful API Projetado para fluxos de trabalho automatizados de processamento de documentos do Word.
REST API Ponto final
O PDF4me REST API usa padrão HTTP Métodos para interagir com recursos. Todas as operações de extração de texto do Word são realizadas por meio de um único ponto de extremidade:
- Método: POST
- Ponto final:
/api/v2/ExtractTextFromWord
REST API Parâmetros
Lista completa de parâmetros para a função Extrair Texto do Word REST APIOs parâmetros estão organizados por categoria para melhor compreensão e implementação.
Importante: Os parâmetros marcados com um asterisco (*) são obrigatórios e devem ser fornecidos para o API para funcionar corretamente.
Parâmetros obrigatórios
| Parâmetro | Tipo | Descrição | Exemplo |
|---|---|---|---|
| docName* | String | Nome do arquivo Word de origem (sem extensão ou com extensão .docx/.doc) | output |
| docContent* | Base64 (String) | O conteúdo do documento Word de entrada em Base64 formato | JVBERi... |
| StartPageNumber* | Integer | Número da página inicial para extração de texto | 1 |
| EndPageNumber* | Integer | Número da página final para extração de texto | 3 |
| RemoveComments* | Boolean | Escolha se deseja remover os comentários do texto extraído: verdadeiroRemover comentários, falsoIncluir comentários | true |
| RemoveHeaderFooter* | Boolean | Escolha se deseja remover cabeçalhos e rodapés: verdadeiroRemover cabeçalhos/rodapés, falsoIncluir cabeçalhos/rodapés | true |
| AcceptChanges* | Boolean | Escolha se deseja aceitar as alterações controladas: verdadeiroAceitar alterações, falsoRejeitar alterações | true |
Parâmetros opcionais
| Parâmetro | Tipo | Descrição | Exemplo |
|---|---|---|---|
| async | Boolean | Ative o processamento assíncrono. Quando true, o API retornos 202 Accepted com um Location cabeçalho para consultar o resultado | false |
Saída
O PDF4me Extrair texto do Word REST API Retorna respostas diferentes dependendo do modo de processamento. API Retorna o texto extraído como um JSON resposta ou arquivo de texto.
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
Processamento síncrono (padrão)
Quando async é false ou não fornecido, o API Retorna o texto extraído imediatamente.
Código de status: 200 OK
Formato da resposta:
{
"extractedText": "Extracted text content from Word document pages 1 to 3...",
"fileName": "output.txt"
}
Ou como um arquivo de texto:
Extracted text content from Word document pages 1 to 3...
A resposta contém o conteúdo textual extraído do intervalo de páginas especificado.
Processamento assíncrono
Quando async é true, o API Processa o documento de forma assíncrona.
Resposta inicial:
Código de status: 202 Accepted
Cabeçalhos de resposta:
Location: https://api.pdf4me.com/api/v2/ExtractTextFromWordStatus/{operationId}
Corpo da resposta:
{
"traceId": "operation-trace-id"
}
Votação para apuração dos resultados:
Use o Location cabeçalho URL Para verificar a conclusão da pesquisa:
const response = await fetch(locationUrl, {
headers: { 'Authorization': 'Basic ' + apiKey }
});
// Continue polling until status code is 200
if (response.status === 200) {
const result = await response.json();
// Process extracted text
}
Respostas de erro
| Código de status | Descrição | Exemplo de resposta |
|---|---|---|
| 400 Bad Request | Parâmetros de solicitação inválidos ou campos obrigatórios ausentes | {"error": "Missing required parameter: docContent"} |
| 401 Unauthorized | Inválido ou ausente API chave | {"error": "Unauthorized"} |
| 408 Tempo limite da solicitação | Tempo limite de processamento da solicitação | {"error": "Request timeout"} |
| 500 Internal Server Error | Erro do servidor durante o processamento | {"error": "Internal server error"} |
Entendendo a Resposta
A resposta da extração de texto pode estar em dois formatos:
- JSON FormatoContém
extractedText(string) efileName(corda) - Formato de textoArquivo de texto simples com o conteúdo extraído.
Detalhes dos parâmetros:
- StartPageNumber e EndPageNumberDefina o intervalo de páginas (indexação baseada em 1)
- RemoveComments: Quando
trueRemove todos os comentários do documento Word antes da extração. - RemoveHeaderFooter: Quando
trueRemove cabeçalhos e rodapés de cada página antes da extração. - AcceptChanges: Quando
true, aceita todas as alterações rastreadas no documento do Word antes da extração
Formatos do Word suportados:
.docx(Word 2007 e versões posteriores).doc(Palavra 97-2003)
Exemplo de solicitação
Cabeçalho
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
Observação:
- Adquira o seu API chave do PDF4me Painel
- O API a chave deve ser Base64 codificado e prefixado com "Básico" no Authorization cabeçalho
- Exemplo: Se o seu API chave é
abc123, codifique-o para Base64 e usarAuthorization: Basic YWJjMTIz
Carga útil
Solicitação básica:
{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output",
"StartPageNumber": 1,
"EndPageNumber": 3,
"RemoveComments": true,
"RemoveHeaderFooter": true,
"AcceptChanges": true
}
Com processamento assíncrono:
{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output",
"StartPageNumber": 1,
"EndPageNumber": 3,
"RemoveComments": true,
"RemoveHeaderFooter": true,
"AcceptChanges": true,
"async": true
}
Exemplos de código
O PDF4me Extrair texto do Word REST API Fornece exemplos de código em várias linguagens de programação. Escolha a linguagem que melhor se adapta ao seu ambiente de desenvolvimento:
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
C# (CSharp) Exemplo
Completo C# Implementação para extrair texto de documentos do Word:
Java Amostra
Java Implementação com tratamento completo de erros e processamento de respostas:
JavaScript Amostra
Node.js e compatível com navegadores JavaScript Implementação:
Google Apps Script Amostra
Google Apps Script implementação para Google Workspace integração:
Recursos de extração de texto Word
Processamento de Documentos
- Suporte ao formato WordSuporte completo para os formatos de documento .doc e .docx do Microsoft Word.
- Preservação de FormatoMantém a formatação e a estrutura do texto durante a extração.
- Documentos complexosLida com documentos complexos do Word que contêm tabelas, imagens e conteúdo incorporado.
- Processamento profissionalExtração de texto de alta qualidade com preservação precisa do conteúdo.
- Entrada flexívelSuporte para diversas versões e formatos de documentos do Word.
Processamento de página
- Seleção de intervalo de páginasExtrair texto de intervalos de páginas específicos com números de página inicial e final.
- Segmentação flexívelProcessar páginas individuais, intervalos de páginas ou documentos inteiros.
- Processamento personalizadoSuporte para qualquer combinação de páginas com controle preciso.
- Processamento em loteGerencie várias páginas de forma eficiente em uma única tela. API ligações
- Layout profissionalExtração de texto consistente em todas as páginas de destino.
Filtragem de conteúdo
- Remoção de comentáriosOpção para excluir comentários e anotações do texto extraído.
- Filtragem de cabeçalho/rodapéRemova cabeçalhos e rodapés para extrair conteúdo de forma limpa.
- Rastreamento de alteraçõesAceitar ou rejeitar alterações controladas durante a extração de texto.
- Limpeza de conteúdoOpções avançadas de filtragem para necessidades específicas de extração de texto.
- Resultados profissionaisSaída de texto limpa e formatada com preservação precisa do conteúdo.
Casos de uso e aplicações industriais
- Business & Enterprise
- Legal & Professional Services
- Education & Research
- Government & Compliance
- Technology & Development
Casos de uso para empresas e negócios
- Análise de DocumentosExtrair conteúdo textual de documentos do Word para análise e processamento.
- Gestão de ConteúdoExtrair texto de documentos do Word para sistemas de gerenciamento de conteúdo
- Processamento de relatóriosExtrair texto de relatórios do Word para processamento e análise automatizados.
- Inteligência de NegóciosExtrair texto de documentos comerciais do Word para análise de dados.
Casos de uso de serviços jurídicos e profissionais
- Processamento de Documentos LegaisExtrair texto de documentos jurídicos do Word para gestão de casos.
- Análise de ContratoExtrair texto de contratos e documentos legais
- Gestão de CasosExtrair texto de documentos jurídicos para sistemas de gestão de processos
- Pesquisa JurídicaExtrair texto de documentos jurídicos para fins de pesquisa e análise.
Casos de uso em educação e pesquisa
- Pesquisa acadêmicaExtrair texto de documentos acadêmicos do Word para pesquisa e análise.
- Documentos de pesquisaExtrair texto de artigos de pesquisa e documentos acadêmicos.
- Conteúdo EducacionalExtrair texto de documentos educacionais do Word
- Análise AcadêmicaExtrair texto de documentos acadêmicos para análise.
Casos de uso para governo e conformidade
- Monitoramento de ConformidadeExtrair texto de documentos de conformidade do Word para fins de monitoramento e auditoria.
- Documentação regulamentarExtrair texto de documentos regulamentares do Word
- Relatórios governamentaisExtrair texto de documentos do governo em formato Word.
- Registros PúblicosExtrair texto de documentos do Word de registros públicos
Casos de uso de tecnologia e desenvolvimento
- Migração de dadosConverter o conteúdo de documentos do Word para outros formatos para migração de dados.
- Processamento de conteúdoExtrair texto de documentos do Word para integração de sistemas
- API IntegraçãoExtrair texto de documentos do Word para API processamento
- Extração de dadosExtrair texto de documentos do Word para processamento de dados.