Extrair recursos - Extrator de texto e imagem API
PDF4me Extrair recursos Permite extrair conteúdo de texto e imagens incorporadas de PDF documentos. Isto API processos de serviço PDF arquivos e extrai recursos de texto e imagem de PDF documentos. O API recebe PDF conteúdo através de REST API chamadas, utilizando Base64 Codificação para transmissão segura. Com suporte para extração seletiva de texto e imagens, esta solução é ideal para fluxos de trabalho de processamento de conteúdo e plataformas de extração de dados.
Autenticando seu API Solicitar
Para acessar o PDF4me REST APIPara que uma solicitação seja aceita, é necessário incluir as credenciais de autenticação adequadas. A autenticação garante a segurança da comunicação e valida sua identidade como usuário autorizado do sistema. REST API.
Principais características
- Extração de textoExtrair todo o conteúdo de texto de PDF documentos
- Extração de ImagensRecuperar todas as imagens e elementos visuais de PDF documentos
- Extração SeletivaEscolha extrair apenas texto, apenas imagens ou ambos, de acordo com suas necessidades.
- Base64 CodificaçãoTransmissão segura de conteúdo de arquivos usando Base64 codificação
- Simple API IntegraçãoRESTful API Projetado para fluxos de trabalho automatizados de extração de conteúdo.
REST API Ponto final
O PDF4me REST API usa padrão HTTP Métodos para interagir com recursos. Todas as operações de extração de recursos são realizadas por meio de um único ponto de extremidade:
- Método: POST
- Ponto final:
/api/v2/ExtractResources
REST API Parâmetros
Lista completa de parâmetros para Extrair Recursos REST APIOs parâmetros estão organizados por categoria para melhor compreensão e implementação.
Importante: Os parâmetros marcados com um asterisco (*) são obrigatórios e devem ser fornecidos para o API para funcionar corretamente.
Parâmetros obrigatórios
| Parâmetro | Tipo | Descrição | Exemplo |
|---|---|---|---|
| docContent* | Base64 (String) | O conteúdo da entrada PDF arquivo codificado em Base64 formato para extração de recursos e processamento de análise de conteúdo | JVBERi... |
| docName* | String | Fonte PDF Nome do arquivo com a extensão .pdf adequada para identificação do documento e processamento de extração de recursos. | sample.pdf |
| extractText* | Boolean | Escolha se deseja extrair o conteúdo do texto. PDF: verdadeiroExtrair todo o conteúdo de texto com formatação, falsoIgnorar extração de texto para processamento somente de imagens | true |
| extractImages* | Boolean | Escolha se deseja extrair imagens do PDF: verdadeiroExtrair imagens e elementos visuais, falsoIgnore a extração de imagens para um processamento mais rápido apenas de texto. | true |
Parâmetros opcionais
| Parâmetro | Tipo | Descrição | Exemplo |
|---|---|---|---|
| async | Boolean | Ative o processamento assíncrono. Quando true, o API retornos 202 Accepted com um Location cabeçalho para consultar o resultado | true |
Saída
O PDF4me Extrair recursos REST API Retorna respostas diferentes dependendo do modo de processamento. API Retorna o texto e as imagens extraídos como um JSON resposta.
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
Processamento síncrono (padrão)
Quando async é false ou não fornecido, o API Retorna os recursos extraídos imediatamente.
Código de status: 200 OK
Formato da resposta:
{
"textList": ["extracted text content...", "more text..."],
"imageList": [
{
"fileName": "image1.png",
"imageContent": "base64-encoded-image-content..."
},
{
"fileName": "image2.jpg",
"imageContent": "base64-encoded-image-content..."
}
]
}
A resposta contém o texto extraído como uma matriz de strings e as imagens extraídas como uma matriz de objetos com nomes de arquivo e Base64-conteúdo codificado.
Processamento assíncrono
Quando async é true, o API Processa o documento de forma assíncrona.
Resposta inicial:
Código de status: 202 Accepted
Cabeçalhos de resposta:
Location: https://api.pdf4me.com/api/v2/ExtractResourcesStatus/{operationId}
Corpo da resposta:
{
"traceId": "operation-trace-id"
}
Votação para apuração dos resultados:
Use o Location cabeçalho URL Para verificar a conclusão da pesquisa:
const response = await fetch(locationUrl, {
headers: { 'Authorization': 'Basic ' + apiKey }
});
// Continue polling until status code is 200
if (response.status === 200) {
const result = await response.json();
// Process extracted resources
}
Respostas de erro
| Código de status | Descrição | Exemplo de resposta |
|---|---|---|
| 400 Bad Request | Parâmetros de solicitação inválidos ou campos obrigatórios ausentes | {"error": "Missing required parameter: docContent"} |
| 401 Unauthorized | Inválido ou ausente API chave | {"error": "Unauthorized"} |
| 408 Tempo limite da solicitação | Tempo limite de processamento da solicitação | {"error": "Request timeout"} |
| 500 Internal Server Error | Erro do servidor durante o processamento | {"error": "Internal server error"} |
Entendendo o JSON Resposta
A resposta de extração de recursos é uma JSON objeto contendo:
- lista de texto: Array de strings contendo conteúdo de texto extraído (se
extractTextétrue) - lista de imagens: Array de objetos de imagem (se
extractImagesétrue) - nome_do_arquivo: O nome do arquivo de imagem extraído
- conteúdo da imagem: Base64-conteúdo codificado da imagem
Decodificando Base64 Conteúdo da imagem:
Para decodificar e salvar Base64-imagens codificadas:
// JavaScript
const decoded = atob(base64String);
const blob = new Blob([decoded], { type: 'image/png' });
const url = URL.createObjectURL(blob);
# Python
import base64
image_data = base64.b64decode(base64_string)
with open('extracted_image.png', 'wb') as f:
f.write(image_data)
Exemplo de solicitação
Cabeçalho
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
Observação:
- Adquira o seu API chave do PDF4me Painel
- O API a chave deve ser Base64 codificado e prefixado com "Básico" no Authorization cabeçalho
- Exemplo: Se o seu API chave é
abc123, codifique-o para Base64 e usarAuthorization: Basic YWJjMTIz
Carga útil
Solicitação básica:
{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "sample.pdf",
"extractText": true,
"extractImages": true
}
Com processamento assíncrono:
{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "sample.pdf",
"extractText": true,
"extractImages": true,
"async": true
}
Exemplos de código
O PDF4me Extrair recursos REST API Fornece exemplos de código em várias linguagens de programação. Escolha a linguagem que melhor se adapta ao seu ambiente de desenvolvimento:
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
Java Amostra
Java Implementação com tratamento completo de erros e processamento de respostas:
JavaScript Amostra
Node.js e compatível com navegadores JavaScript Implementação:
Google Apps Script Amostra
Google Apps Script implementação para Google Workspace integração:
Recursos de extração de imagens
- Imagens de alta qualidadeExtrair imagens com resolução e qualidade originais.
- Vários formatosSuporte para vários formatos de imagem (JPG, PNG, GIF, etc.)
- Gráficos vetoriaisExtrair gráficos e diagramas vetoriais escaláveis
- Preservação de MetadadosManter as propriedades e os metadados da imagem.
Processamento Avançado
- Extração SeletivaEscolha entre extração somente de texto, somente de imagem ou combinada.
- Processamento em loteProcessar múltiplos PDFs e extrair recursos de forma eficiente.
- Análise de ConteúdoAnalisar e categorizar os tipos de conteúdo extraídos.
- Resultados profissionaisExtração de alta qualidade adequada para aplicações empresariais.
Casos de uso e aplicações industriais
- Document Management & Processing
- Business & Finance
- Legal & Compliance
- Healthcare & Medical
- Education & Research
- Marketing & Content
Casos de uso para gerenciamento e processamento de documentos
- Digitalização de conteúdoExtrair texto e imagens de documentos digitalizados para arquivos digitais.
- Análise de Documentos: Analisar PDF conteúdo para extração e processamento de informações
- Migração de dadosExtrair conteúdo durante a migração de documentos e atualizações do sistema.
- Indexação de conteúdoCriar índices pesquisáveis a partir de PDF conteúdo de texto e imagem
Casos de uso em negócios e finanças
- Processamento de faturasExtrair texto e imagens de faturas para processamento automatizado.
- Análise do relatórioExtrair dados e gráficos de relatórios e demonstrações financeiras.
- Gestão de ContratosExtrair elementos de texto e visuais de contratos e acordos.
- Documentação de ConformidadeProcessar documentos regulatórios e extrair as informações necessárias.
Casos de uso para questões legais e de conformidade
- Processamento de Documentos LegaisExtrair texto e evidências de documentos legais.
- Gestão de CasosExtrair conteúdo de processos e documentos jurídicos.
- Conformidade regulatóriaProcessar documentos de conformidade e extrair os dados necessários.
- Coleta de EvidênciasExtrair texto e imagens para fins de comprovação e documentação legal.
Casos de uso na área da saúde e medicina
- Registros médicosExtrair texto e imagens de prontuários de pacientes e relatórios médicos.
- Dados de pesquisaProcessar documentos de pesquisa e extrair dados e gráficos.
- Ensaios clínicosExtrair informações de documentos de estudos clínicos
- Imagens médicasExtrair imagens médicas e conteúdo de diagnóstico de PDFs
Casos de uso em educação e pesquisa
- Artigos acadêmicosExtrair texto e figuras de artigos e publicações de pesquisa.
- Conteúdo EducacionalProcessar livros didáticos e materiais educacionais
- Dados de pesquisaExtrair dados e gráficos de documentos de pesquisa.
- Digitalização de BibliotecasDigitalizar acervos de bibliotecas e extrair conteúdo pesquisável.
Casos de uso de marketing e conteúdo
- Criação de conteúdoExtrair texto e imagens para marketing de conteúdo e mídias sociais.
- Ativos da marcaExtrair logotipos e elementos de marca de PDF documentos
- Recursos de designExtrair elementos de design e gráficos para projetos criativos
- Reutilização de conteúdoExtrair conteúdo para reutilização em diferentes formatos e plataformas.