Extraer tabla de PDF - Analizador de datos API
PDF4me Extraer tabla de PDF le permite extraer estructuras de tablas y datos de PDF documentos. Este API procesos de servicio PDF archivos y extrae el contenido, la estructura y los datos de las tablas. PDF Los documentos. El API recibe PDF contenido a través de REST API llamadas, utilizando Base64 Codificación para una transmisión segura. Con soporte para la salida de datos estructurados y el análisis de tablas, esta solución es ideal para flujos de trabajo de procesamiento de datos y plataformas de inteligencia empresarial.
Autenticando su API Pedido
Para acceder al PDF4me REST APICada solicitud debe incluir las credenciales de autenticación adecuadas. La autenticación garantiza una comunicación segura y valida su identidad como usuario autorizado del sistema. REST API.
Características principales
- Extracción de tabla: Extraer estructuras de tablas y datos de PDF documentos
- Salida de datos estructurados: Recuperar datos de tablas en formatos organizados y estructurados para una fácil integración.
- Preservación de la estructura de la tablaMantener el diseño de la tabla, los encabezados, las filas y las relaciones entre columnas.
- Base64 Codificación: Transmisión segura del contenido de los archivos mediante Base64 codificación
- Simple API Integración: RESTful API Diseñado para flujos de trabajo automatizados de extracción de tablas.
REST API Punto final
El PDF4me REST API utiliza estándar HTTP métodos para interactuar con los recursos. Todas las operaciones de extracción de tablas se realizan a través de un único punto final:
- Método: POST
- Punto final:
/api/v2/ExtractTableFromPdf
REST API Parámetros
Lista completa de parámetros para la función Extraer tabla de PDF REST APILos parámetros están organizados por categoría para una mejor comprensión e implementación.
Importante: Los parámetros marcados con un asterisco (*) son obligatorios y deben proporcionarse para la API para que funcione correctamente.
Parámetros requeridos
| Parámetro | Tipo | Descripción | Ejemplo |
|---|---|---|---|
| docName* | String | Fuente PDF Nombre de archivo con la extensión .pdf adecuada para la identificación del documento y el procesamiento de extracción de tablas. | output.pdf |
| docContent* | Base64 (String) | El contenido de la entrada PDF archivo codificado en Base64 formato para el análisis de tablas y el procesamiento de extracción de datos | JVBERi... |
Parámetros opcionales
| Parámetro | Tipo | Descripción | Ejemplo |
|---|---|---|---|
| async | Boolean | Habilitar el procesamiento asíncrono. Cuando true, el API devoluciones 202 Accepted con un Location encabezado para sondear el resultado | true |
Producción
El PDF4me Extraer tabla de PDF REST API devuelve diferentes respuestas según el modo de procesamiento. API devuelve los datos de la tabla extraídos como un JSON respuesta.
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
Procesamiento síncrono (predeterminado)
Cuando async es false o no proporcionado, el API Devuelve inmediatamente los datos de la tabla extraída.
Código de estado: 200 OK
Formato de respuesta:
{
"tables": [
{
"rows": [
["Header 1", "Header 2", "Header 3"],
["Data 1", "Data 2", "Data 3"],
["Data 4", "Data 5", "Data 6"]
],
"columns": 3,
"rows": 3
}
]
}
La respuesta contiene una serie de tablas, cada una con filas, columnas y datos de celdas.
Procesamiento asíncrono
Cuando async es true, el API procesa el documento de forma asíncrona.
Respuesta inicial:
Código de estado: 202 Accepted
Encabezados de respuesta:
Location: https://api.pdf4me.com/api/v2/ExtractTableFromPdfStatus/{operationId}
Cuerpo de la respuesta:
{
"traceId": "operation-trace-id"
}
Encuesta para obtener resultados:
Utilice el Location encabezado URL para consultar la finalización:
const response = await fetch(locationUrl, {
headers: { 'Authorization': 'Basic ' + apiKey }
});
// Continue polling until status code is 200
if (response.status === 200) {
const result = await response.json();
// Process extracted table data
}
Respuestas de error
| Código de estado | Descripción | Ejemplo de respuesta |
|---|---|---|
| 400 Bad Request | Parámetros de solicitud no válidos o campos obligatorios faltantes. | {"error": "Missing required parameter: docContent"} |
| 401 Unauthorized | Inválido o faltante API llave | {"error": "Unauthorized"} |
| 408 Tiempo de espera de solicitud agotado | Tiempo de espera agotado para el procesamiento de la solicitud. | {"error": "Request timeout"} |
| 500 Internal Server Error | Error del servidor durante el procesamiento | {"error": "Internal server error"} |
Comprender el JSON Respuesta
La respuesta de extracción de la tabla es una JSON objeto que contiene:
- tablas: Array de objetos de tabla
- filas: Array de matrices que representan filas de tabla (cada fila es una matriz de valores de celda)
- columnas: Número de columnas en la tabla
- filas: Número de filas en la tabla
Estructura de la tabla:
Cada tabla se representa como una matriz bidimensional donde:
- La matriz exterior representa las filas.
- Las matrices internas representan las celdas de cada fila.
- La primera fila normalmente contiene los encabezados de columna.
Ejemplo de solicitud
Encabezamiento
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
Nota:
- Consigue tu API clave del PDF4me Panel
- El API La clave debe ser Base64 codificado y prefijado con "Basic" en el Authorization encabezado
- Ejemplo: Si su API La clave es
abc123, codificarlo a Base64 y usarAuthorization: Basic YWJjMTIz
Carga útil
Solicitud básica:
{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output.pdf"
}
Con procesamiento asíncrono:
{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output.pdf",
"async": true
}
Ejemplos de código
El PDF4me Extraer tabla de PDF REST API Proporciona ejemplos de código en varios lenguajes de programación. Elija el lenguaje que mejor se adapte a su entorno de desarrollo:
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
Java Muestra
Java Implementación con manejo completo de errores y procesamiento de respuestas:
JavaScript Muestra
Node.js y compatible con navegadores JavaScript implementación:
Google Apps Script Muestra
Google Apps Script implementación para Google Workspace integración:
Características de extracción de tablas
Capacidades de extracción de datos
- Recuperación completa de la mesa: Extraer todos los datos de la tabla de PDF documentos con preservación precisa de la estructura
- Reconocimiento de encabezado: Identificar y conservar los encabezados de tabla, los nombres de columna y las etiquetas de fila.
- Extracción del contenido celular: Extraer el contenido de celdas individuales con los tipos de datos y el formato adecuados.
- Análisis de la estructura de la tablaMantener el diseño de la tabla, las relaciones y la estructura jerárquica.
Procesamiento avanzado
- Compatibilidad con múltiples mesas: Procesar varias tablas dentro de una sola PDF documento
- Manejo complejo de tablas: Extraer tablas con celdas combinadas, filas que abarcan varias columnas y diseños complejos.
- Preservación del formato: Mantener el formato, el estilo y la apariencia visual originales de la tabla.
- Validación de datosGarantizar la integridad y precisión de los datos durante el proceso de extracción.
Características profesionales
- Salida estructuradaGenerar datos organizados y estructurados para una fácil integración.
- Procesamiento por lotes: Procesar múltiples PDFs y extraer tablas de manera eficiente
- Seguro de calidadGarantizar la precisión y fiabilidad de la extracción para aplicaciones empresariales.
- Integración empresarialIntegración perfecta con los sistemas de gestión de datos existentes.
Casos de uso y aplicaciones en la industria
- Business Intelligence & Analytics
- Document Management & Processing
- Data Migration & Integration
- Research & Analysis
- Compliance & Regulatory
- Healthcare & Medical
Casos de uso de inteligencia empresarial y análisis de datos
- Información financieraExtraer tablas financieras de informes para análisis de datos e informes.
- Métricas de rendimiento: Tablas de KPI de proceso y paneles de rendimiento para inteligencia empresarial
- Almacenamiento de datosExtraer datos estructurados de documentos para alimentar el almacén de datos.
- Análisis de negocio: Convertir PDF convertir tablas en formatos de datos analizables para obtener información valiosa.
Casos de uso para la gestión y el procesamiento de documentos
- Procesamiento de facturas: Extraer partidas y tablas de precios de las facturas para su procesamiento automatizado.
- Análisis de contratos: Extraer tablas de términos y condiciones de documentos legales
- Digitalización de informes: Convertir informes en papel en datos digitales que se puedan buscar.
- Gestión de contenidosExtraer datos estructurados de documentos para sistemas de gestión de contenido.
Casos de uso de migración e integración de datos
- Migración de sistemas: Extraer datos de tablas durante migraciones de sistemas y transferencias de datos.
- Conversión de datos heredadosConvertir documentos históricos a formatos de datos modernos.
- API Integración: Extraer datos para su integración con sistemas de terceros y APIs
- Población de la base de datos: Rellenar bases de datos con datos estructurados de PDF documentos
Casos de uso de investigación y análisis
- Investigación académicaExtraer tablas de datos de artículos de investigación y publicaciones académicas.
- Investigación de mercadoTablas de resultados de encuestas de procesos y análisis de mercado
- Datos científicos: Extraer datos experimentales y resultados de investigación de documentos científicos.
- Análisis estadístico: Convertir PDF tablas en herramientas de análisis estadístico
Casos de uso relacionados con el cumplimiento normativo y la normativa
- Informes regulatoriosExtraer datos de cumplimiento de documentos e informes regulatorios.
- Soporte de auditoría: Procesar tablas financieras y registros de auditoría para la verificación del cumplimiento
- Descubrimiento legal: Extraer datos estructurados de documentos legales para procesos de descubrimiento
- Análisis de políticas: Extraer tablas de políticas y requisitos reglamentarios para su análisis.
Casos de uso en el sector sanitario y médico
- Registros médicos: Extraer tablas de datos de pacientes de informes y registros médicos.
- Ensayos clínicosProcesar datos de investigación y resultados de ensayos clínicos.
- Reclamaciones de seguros: Extraer tablas de facturación e información de reclamaciones
- Investigación médicaConvertir datos de investigación médica a formatos analizables.