Extrair tabela de PDF - Analisador de Dados API
PDF4me Extrair tabela de PDF Permite extrair estruturas de tabelas e dados de PDF documentos. Isto API processos de serviço PDF arquiva e extrai o conteúdo, a estrutura e os dados das tabelas. PDF documentos. O API recebe PDF conteúdo através de REST API chamadas, utilizando Base64 Codificação para transmissão segura. Com suporte para saída de dados estruturados e análise de tabelas, esta solução é ideal para fluxos de trabalho de processamento de dados e plataformas de inteligência de negócios.
Autenticando seu API Solicitar
Para acessar o PDF4me REST APIPara que uma solicitação seja aceita, é necessário incluir as credenciais de autenticação adequadas. A autenticação garante a segurança da comunicação e valida sua identidade como usuário autorizado do sistema. REST API.
Principais características
- Extração de tabelaExtrair estruturas de tabelas e dados de PDF documentos
- Saída de dados estruturadosRecupere dados de tabelas em formatos organizados e estruturados para facilitar a integração.
- Preservação da estrutura da tabelaManter o layout da tabela, cabeçalhos, linhas e relações entre colunas.
- Base64 CodificaçãoTransmissão segura de conteúdo de arquivos usando Base64 codificação
- Simple API IntegraçãoRESTful API Projetado para fluxos de trabalho automatizados de extração de tabelas.
REST API Ponto final
O PDF4me REST API usa padrão HTTP Métodos para interagir com recursos. Todas as operações de extração de tabelas são realizadas por meio de um único ponto de extremidade:
- Método: POST
- Ponto final:
/api/v2/ExtractTableFromPdf
REST API Parâmetros
Lista completa de parâmetros para a função Extrair Tabela de PDF REST APIOs parâmetros estão organizados por categoria para melhor compreensão e implementação.
Importante: Os parâmetros marcados com um asterisco (*) são obrigatórios e devem ser fornecidos para o API para funcionar corretamente.
Parâmetros obrigatórios
| Parâmetro | Tipo | Descrição | Exemplo |
|---|---|---|---|
| docName* | String | Fonte PDF Nome do arquivo com a extensão .pdf adequada para identificação do documento e processamento de extração da tabela. | output.pdf |
| docContent* | Base64 (String) | O conteúdo da entrada PDF arquivo codificado em Base64 formato para análise de tabelas e processamento de extração de dados | JVBERi... |
Parâmetros opcionais
| Parâmetro | Tipo | Descrição | Exemplo |
|---|---|---|---|
| async | Boolean | Ative o processamento assíncrono. Quando true, o API retornos 202 Accepted com um Location cabeçalho para consultar o resultado | true |
Saída
O PDF4me Extrair tabela de PDF REST API Retorna respostas diferentes dependendo do modo de processamento. API Retorna os dados extraídos da tabela como um JSON resposta.
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
Processamento síncrono (padrão)
Quando async é false ou não fornecido, o API Retorna imediatamente os dados da tabela extraídos.
Código de status: 200 OK
Formato da resposta:
{
"tables": [
{
"rows": [
["Header 1", "Header 2", "Header 3"],
["Data 1", "Data 2", "Data 3"],
["Data 4", "Data 5", "Data 6"]
],
"columns": 3,
"rows": 3
}
]
}
A resposta contém uma matriz de tabelas, cada uma com linhas, colunas e dados de células.
Processamento assíncrono
Quando async é true, o API Processa o documento de forma assíncrona.
Resposta inicial:
Código de status: 202 Accepted
Cabeçalhos de resposta:
Location: https://api.pdf4me.com/api/v2/ExtractTableFromPdfStatus/{operationId}
Corpo da resposta:
{
"traceId": "operation-trace-id"
}
Votação para apuração dos resultados:
Use o Location cabeçalho URL Para verificar a conclusão da pesquisa:
const response = await fetch(locationUrl, {
headers: { 'Authorization': 'Basic ' + apiKey }
});
// Continue polling until status code is 200
if (response.status === 200) {
const result = await response.json();
// Process extracted table data
}
Respostas de erro
| Código de status | Descrição | Exemplo de resposta |
|---|---|---|
| 400 Bad Request | Parâmetros de solicitação inválidos ou campos obrigatórios ausentes | {"error": "Missing required parameter: docContent"} |
| 401 Unauthorized | Inválido ou ausente API chave | {"error": "Unauthorized"} |
| 408 Tempo limite da solicitação | Tempo limite de processamento da solicitação | {"error": "Request timeout"} |
| 500 Internal Server Error | Erro do servidor durante o processamento | {"error": "Internal server error"} |
Entendendo o JSON Resposta
A resposta da extração da tabela é uma JSON objeto contendo:
- tabelas: Array de objetos de tabela
- linhas: Array de matrizes representando linhas de tabela (cada linha é uma matriz de valores de células)
- colunasNúmero de colunas na tabela
- linhasNúmero de linhas na tabela
Estrutura da tabela:
Cada tabela é representada como uma matriz bidimensional onde:
- A matriz externa representa as linhas.
- As matrizes internas representam as células em cada linha.
- A primeira linha geralmente contém os cabeçalhos das colunas.
Exemplo de solicitação
Cabeçalho
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
Observação:
- Adquira o seu API chave do PDF4me Painel
- O API a chave deve ser Base64 codificado e prefixado com "Básico" no Authorization cabeçalho
- Exemplo: Se o seu API chave é
abc123, codifique-o para Base64 e usarAuthorization: Basic YWJjMTIz
Carga útil
Solicitação básica:
{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output.pdf"
}
Com processamento assíncrono:
{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output.pdf",
"async": true
}
Exemplos de código
O PDF4me Extrair tabela de PDF REST API Fornece exemplos de código em várias linguagens de programação. Escolha a linguagem que melhor se adapta ao seu ambiente de desenvolvimento:
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
Java Amostra
Java Implementação com tratamento completo de erros e processamento de respostas:
JavaScript Amostra
Node.js e compatível com navegadores JavaScript Implementação:
Google Apps Script Amostra
Google Apps Script implementação para Google Workspace integração:
Funcionalidades de Extração de Tabelas
Capacidades de Extração de Dados
- Recuperação completa da mesaExtrair todos os dados da tabela de PDF documentos com preservação de estrutura precisa
- Reconhecimento de cabeçalhoIdentificar e preservar cabeçalhos de tabela, nomes de colunas e rótulos de linhas.
- Extração do conteúdo celularExtrair o conteúdo de células individuais com os tipos de dados e formatação adequados.
- Análise da estrutura da tabelaManter o layout da tabela, os relacionamentos e a estrutura hierárquica.
Processamento Avançado
- Suporte para várias mesasProcessar várias tabelas em uma única operação. PDF documento
- Manipulação complexa de mesasExtrair tabelas com células mescladas, linhas que abrangem vários campos e layouts complexos.
- Preservação de FormatoManter a formatação, o estilo e a aparência visual originais da tabela.
- Validação de dadosGarantir a integridade e a precisão dos dados durante o processo de extração.
Recursos profissionais
- Saída EstruturadaGere dados organizados e estruturados para facilitar a integração.
- Processamento em loteProcessar múltiplos PDFs e extrair tabelas de forma eficiente
- Garantia de QualidadeGarantir a precisão e a confiabilidade da extração para aplicações comerciais.
- Integração EmpresarialIntegração perfeita com sistemas de gerenciamento de dados existentes.
Casos de uso e aplicações industriais
- Business Intelligence & Analytics
- Document Management & Processing
- Data Migration & Integration
- Research & Analysis
- Compliance & Regulatory
- Healthcare & Medical
Casos de uso de Business Intelligence e Analytics
- Relatórios financeirosExtrair tabelas financeiras de relatórios para análise de dados e elaboração de relatórios.
- Métricas de desempenhoTabelas de KPIs de processo e painéis de desempenho para inteligência de negócios.
- Armazenamento de dadosExtrair dados estruturados de documentos para alimentar o data warehouse.
- Análise de NegóciosConverter PDF converter tabelas em formatos de dados analisáveis para obter insights.
Casos de uso para gerenciamento e processamento de documentos
- Processamento de faturasExtrair itens de linha e tabelas de preços de faturas para processamento automatizado.
- Análise de ContratoExtrair tabelas de termos e condições de documentos legais.
- Digitalização de relatóriosConverter relatórios em papel em dados digitais pesquisáveis.
- Gestão de ConteúdoExtrair dados estruturados de documentos para sistemas de gerenciamento de conteúdo.
Casos de uso de migração e integração de dados
- Migração de sistemasExtrair dados de tabelas durante migrações de sistema e transferências de dados.
- Conversão de dados legadosConverter documentos históricos em formatos de dados modernos.
- API IntegraçãoExtrair dados para integração com sistemas de terceiros e APIs
- População do banco de dados: Preencher bancos de dados com dados estruturados de PDF documentos
Casos de uso de pesquisa e análise
- Pesquisa acadêmicaExtrair tabelas de dados de artigos de pesquisa e publicações acadêmicas.
- Pesquisa de mercadoResultados da pesquisa de mercado e tabelas de análise de mercado:
- Dados científicosExtrair dados experimentais e resultados de pesquisa de documentos científicos.
- Análise EstatísticaConverter PDF tabelas em ferramentas de análise estatística
Casos de uso de conformidade e regulamentação
- Relatórios regulatóriosExtrair dados de conformidade de documentos e relatórios regulatórios.
- Suporte de auditoriaProcessar tabelas financeiras e trilhas de auditoria para verificação de conformidade.
- Descoberta legalExtrair dados estruturados de documentos jurídicos para processos de descoberta de provas.
- Análise de PolíticasExtrair tabelas de políticas e requisitos regulamentares para análise.
Casos de uso na área da saúde e medicina
- Registros médicosExtrair tabelas de dados de pacientes a partir de relatórios e registros médicos.
- Ensaios clínicosProcessar dados de pesquisa e resultados de ensaios clínicos
- Reclamações de segurosExtrair tabelas de faturamento e informações de sinistros
- Pesquisa médicaConverter dados de pesquisa médica em formatos analisáveis.