Pular para o conteúdo principal

Extrair recursos - Extrator de texto e imagem API

PDF4me Extrair recursos Permite extrair conteúdo de texto e imagens incorporadas de PDF documentos. Isto API processos de serviço PDF arquivos e extrai recursos de texto e imagem de PDF documentos. O API recebe PDF conteúdo através de REST API chamadas, utilizando Base64 Codificação para transmissão segura. Com suporte para extração seletiva de texto e imagens, esta solução é ideal para fluxos de trabalho de processamento de conteúdo e plataformas de extração de dados.

Artigos relacionados no blogue
Ainda não há nenhuma publicação no blogue sobre esta funcionalidade — em breve.
Entretanto, explore o blogue da PDF4me para encontrar tutoriais e fluxos de trabalho para todas as plataformas.
Visite o blogue

Autenticando seu API Solicitar

Para acessar o PDF4me REST APIPara que uma solicitação seja aceita, é necessário incluir as credenciais de autenticação adequadas. A autenticação garante a segurança da comunicação e valida sua identidade como usuário autorizado do sistema. REST API.

Principais características

  • Extração de textoExtrair todo o conteúdo de texto de PDF documentos
  • Extração de ImagensRecuperar todas as imagens e elementos visuais de PDF documentos
  • Extração SeletivaEscolha extrair apenas texto, apenas imagens ou ambos, de acordo com suas necessidades.
  • Base64 CodificaçãoTransmissão segura de conteúdo de arquivos usando Base64 codificação
  • Simple API IntegraçãoRESTful API Projetado para fluxos de trabalho automatizados de extração de conteúdo.

REST API Ponto final

O PDF4me REST API usa padrão HTTP Métodos para interagir com recursos. Todas as operações de extração de recursos são realizadas por meio de um único ponto de extremidade:

  • Método: POST
  • Ponto final: /api/v2/ExtractResources

REST API Parâmetros

Lista completa de parâmetros para Extrair Recursos REST APIOs parâmetros estão organizados por categoria para melhor compreensão e implementação.

Importante: Os parâmetros marcados com um asterisco (*) são obrigatórios e devem ser fornecidos para o API para funcionar corretamente.

Parâmetros obrigatórios

ParâmetroTipoDescriçãoExemplo
docContent*Base64 (String)O conteúdo da entrada PDF arquivo codificado em Base64 formato para extração de recursos e processamento de análise de conteúdoJVBERi...
docName*StringFonte PDF Nome do arquivo com a extensão .pdf adequada para identificação do documento e processamento de extração de recursos.sample.pdf
extractText*BooleanEscolha se deseja extrair o conteúdo do texto. PDF: verdadeiroExtrair todo o conteúdo de texto com formatação, falsoIgnorar extração de texto para processamento somente de imagenstrue
extractImages*BooleanEscolha se deseja extrair imagens do PDF: verdadeiroExtrair imagens e elementos visuais, falsoIgnore a extração de imagens para um processamento mais rápido apenas de texto.true

Parâmetros opcionais

ParâmetroTipoDescriçãoExemplo
asyncBooleanAtive o processamento assíncrono. Quando true, o API retornos 202 Accepted com um Location cabeçalho para consultar o resultadotrue

Saída

O PDF4me Extrair recursos REST API Retorna respostas diferentes dependendo do modo de processamento. API Retorna o texto e as imagens extraídos como um JSON resposta.

Processamento síncrono (padrão)

Quando async é false ou não fornecido, o API Retorna os recursos extraídos imediatamente.

Código de status: 200 OK

Formato da resposta:

{
"textList": ["extracted text content...", "more text..."],
"imageList": [
{
"fileName": "image1.png",
"imageContent": "base64-encoded-image-content..."
},
{
"fileName": "image2.jpg",
"imageContent": "base64-encoded-image-content..."
}
]
}

A resposta contém o texto extraído como uma matriz de strings e as imagens extraídas como uma matriz de objetos com nomes de arquivo e Base64-conteúdo codificado.

Exemplo de solicitação

Cabeçalho

Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY

Observação:

  • Adquira o seu API chave do PDF4me Painel
  • O API a chave deve ser Base64 codificado e prefixado com "Básico" no Authorization cabeçalho
  • Exemplo: Se o seu API chave é abc123, codifique-o para Base64 e usar Authorization: Basic YWJjMTIz

Carga útil

Solicitação básica:

{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "sample.pdf",
"extractText": true,
"extractImages": true
}

Com processamento assíncrono:

{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "sample.pdf",
"extractText": true,
"extractImages": true,
"async": true
}

Exemplos de código

O PDF4me Extrair recursos REST API Fornece exemplos de código em várias linguagens de programação. Escolha a linguagem que melhor se adapta ao seu ambiente de desenvolvimento:

C# (CSharp) Exemplo

Completo C# implementação para extrair recursos de PDF:

Recursos de extração de imagens

  • Imagens de alta qualidadeExtrair imagens com resolução e qualidade originais.
  • Vários formatosSuporte para vários formatos de imagem (JPG, PNG, GIF, etc.)
  • Gráficos vetoriaisExtrair gráficos e diagramas vetoriais escaláveis
  • Preservação de MetadadosManter as propriedades e os metadados da imagem.

Processamento Avançado

  • Extração SeletivaEscolha entre extração somente de texto, somente de imagem ou combinada.
  • Processamento em loteProcessar múltiplos PDFs e extrair recursos de forma eficiente.
  • Análise de ConteúdoAnalisar e categorizar os tipos de conteúdo extraídos.
  • Resultados profissionaisExtração de alta qualidade adequada para aplicações empresariais.

Casos de uso e aplicações industriais

Casos de uso para gerenciamento e processamento de documentos

  • Digitalização de conteúdoExtrair texto e imagens de documentos digitalizados para arquivos digitais.
  • Análise de Documentos: Analisar PDF conteúdo para extração e processamento de informações
  • Migração de dadosExtrair conteúdo durante a migração de documentos e atualizações do sistema.
  • Indexação de conteúdoCriar índices pesquisáveis a partir de PDF conteúdo de texto e imagem

Obtenha ajuda