Extraire le tableau de PDF - Analyseur de données API
PDF4me Extraire le tableau de PDF permet d'extraire les structures de table et les données de PDF documents. Ceci API processus de service PDF fichiers et extrait le contenu, la structure et les données des tableaux à partir de PDF documents. Les API reçoit PDF contenu via REST API appels, utilisant Base64 Encodage pour une transmission sécurisée. Grâce à la prise en charge de la sortie de données structurées et de l'analyse de tableaux, cette solution est idéale pour les flux de travail de traitement de données et les plateformes de veille stratégique.
Authentification de votre API Demande
Pour accéder au PDF4me REST APIChaque requête doit inclure des informations d'authentification valides. L'authentification garantit la sécurité des communications et confirme votre identité en tant qu'utilisateur autorisé. REST API.
Caractéristiques principales
- Extraction de tableExtraire les structures de table et les données de PDF documents
- Sortie de données structuréesRécupérer les données tabulaires dans des formats organisés et structurés pour une intégration facile.
- Préservation de la structure du tableau: Maintenir la mise en page du tableau, les en-têtes, les lignes et les relations entre les colonnes
- Base64 Encodage: Sécuriser la transmission du contenu des fichiers à l'aide de Base64 encodage
- Simple API Intégration: RESTful API conçu pour les flux de travail automatisés d'extraction de tables
REST API Point de terminaison
Le PDF4me REST API utilise la norme HTTP méthodes d'interaction avec les ressources. Toutes les opérations d'extraction de tables sont effectuées via un point de terminaison unique :
- Méthode: POST
- Point final :
/api/v2/ExtractTableFromPdf
REST API Paramètres
Liste complète des paramètres pour l'extraction de table à partir de PDF REST APILes paramètres sont organisés par catégorie pour une meilleure compréhension et une mise en œuvre plus aisée.
Important: Les paramètres marqués d'un astérisque (*) sont obligatoires et doivent être fournis pour le API pour fonctionner correctement.
Paramètres requis
| Paramètre | Taper | Description | Exemple |
|---|---|---|---|
| docName* | String | Source PDF Nom de fichier avec l'extension .pdf appropriée pour l'identification du document et le traitement d'extraction des tableaux | output.pdf |
| docContent* | Base64 (String) | Le contenu de l'entrée PDF fichier encodé en Base64 format pour l'analyse de tableaux et le traitement d'extraction de données | JVBERi... |
Paramètres optionnels
| Paramètre | Taper | Description | Exemple |
|---|---|---|---|
| async | Boolean | Activer le traitement asynchrone. Lorsque true, le API retours 202 Accepted avec un Location en-tête pour l'interrogation du résultat | true |
Sortir
Le PDF4me Extraire le tableau de PDF REST API renvoie des réponses différentes selon le mode de traitement. API renvoie les données extraites du tableau sous forme de JSON réponse.
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
Traitement synchrone (par défaut)
Quand async est false ou non fourni, le API renvoie immédiatement les données extraites du tableau.
Code d'état : 200 OK
Format de réponse :
{
"tables": [
{
"rows": [
["Header 1", "Header 2", "Header 3"],
["Data 1", "Data 2", "Data 3"],
["Data 4", "Data 5", "Data 6"]
],
"columns": 3,
"rows": 3
}
]
}
La réponse contient un tableau de tableaux, chacun comportant des lignes, des colonnes et des données de cellules.
Traitement asynchrone
Quand async est true, le API traite le document de manière asynchrone.
Réponse initiale :
Code d'état : 202 Accepted
En-têtes de réponse :
Location: https://api.pdf4me.com/api/v2/ExtractTableFromPdfStatus/{operationId}
Corps de la réponse :
{
"traceId": "operation-trace-id"
}
Sondage pour les résultats :
Utilisez le Location en-tête URL sondage pour vérifier l'achèvement :
const response = await fetch(locationUrl, {
headers: { 'Authorization': 'Basic ' + apiKey }
});
// Continue polling until status code is 200
if (response.status === 200) {
const result = await response.json();
// Process extracted table data
}
Réponses d'erreur
| Code d'état | Description | Exemple de réponse |
|---|---|---|
| 400 Bad Request | Paramètres de requête invalides ou champs obligatoires manquants | {"error": "Missing required parameter: docContent"} |
| 401 Unauthorized | Invalide ou manquant API clé | {"error": "Unauthorized"} |
| 408 Délai d'attente dépassé | Délai de traitement de la requête dépassé | {"error": "Request timeout"} |
| 500 Internal Server Error | Erreur serveur lors du traitement | {"error": "Internal server error"} |
Comprendre le JSON Réponse
La réponse d'extraction de tableau est une JSON objet contenant :
- tables: Array des objets de table
- rangées: Array des tableaux représentant les lignes du tableau (chaque ligne est un tableau de valeurs de cellules)
- colonnes: Nombre de colonnes dans le tableau
- rangées: Nombre de lignes dans le tableau
Structure du tableau :
Chaque tableau est représenté sous forme de tableau bidimensionnel où :
- Le tableau extérieur représente les lignes
- Les tableaux internes représentent les cellules de chaque ligne
- La première ligne contient généralement les en-têtes de colonnes.
Exemple de requête
En-tête
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
Note:
- Obtenez votre API clé de la PDF4me Tableau de bord
- Le API La clé doit être Base64 encodé et préfixé par « Basic » dans le Authorization en-tête
- Exemple : Si votre API La clé est
abc123, encodez-le en Base64 et utiliserAuthorization: Basic YWJjMTIz
Charge utile
Demande de base :
{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output.pdf"
}
Avec le traitement asynchrone :
{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output.pdf",
"async": true
}
Exemples de code
Le PDF4me Extraire le tableau de PDF REST API propose des exemples de code dans plusieurs langages de programmation. Choisissez le langage qui convient le mieux à votre environnement de développement :
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
C# Exemple (CSharp)
Complet C# implémentation pour l'extraction de tables à partir de PDF:
Java Échantillon
Java implémentation avec gestion complète des erreurs et traitement des réponses :
JavaScript Échantillon
Node.js et compatible avec les navigateurs JavaScript mise en œuvre:
Python Échantillon
Python implémentation avec la bibliothèque requests et JSON manutention:
Google Apps Script Échantillon
Google Apps Script mise en œuvre pour Google Workspace intégration :
Caractéristiques d'extraction de table
Capacités d'extraction de données
- Récupération complète de la tableExtraire toutes les données du tableau à partir de PDF documents avec préservation de structure précise
- Reconnaissance d'en-têteIdentifier et conserver les en-têtes de tableau, les noms de colonnes et les étiquettes de lignes
- Extraction du contenu cellulaireExtraire le contenu de chaque cellule en respectant les types de données et la mise en forme appropriés.
- Analyse de la structure du tableau: Maintenir la mise en page, les relations et la structure hiérarchique des tables
Traitement avancé
- Prise en charge multi-tables: Traiter plusieurs tables au sein d'une seule PDF document
- Manipulation de tables complexesExtraire des tableaux avec des cellules fusionnées, des lignes superposées et des mises en page complexes
- Préservation du formatConserver la mise en forme, le style et l'apparence visuelle d'origine du tableau
- Validation des donnéesGarantir l'intégrité et l'exactitude des données lors du processus d'extraction
Fonctionnalités professionnelles
- Sortie structuréeGénérer des données organisées et structurées pour une intégration facile
- Traitement par lots: Traitement multiple PDFs et extraire efficacement les tables
- Assurance qualitéGarantir la précision et la fiabilité de l'extraction pour les applications métier
- Intégration d'entrepriseIntégration transparente avec les systèmes de gestion de données existants
Cas d'utilisation et applications industrielles
- Business Intelligence & Analytics
- Document Management & Processing
- Data Migration & Integration
- Research & Analysis
- Compliance & Regulatory
- Healthcare & Medical
Cas d'utilisation de la veille stratégique et de l'analyse de données
- Information financièreExtraire les tableaux financiers des rapports à des fins d'analyse et de reporting des données.
- Indicateurs de performanceTableaux de bord des indicateurs clés de performance (KPI) et des processus pour l'analyse décisionnelle
- Entrepôt de donnéesExtraire des données structurées des documents pour alimenter l'entrepôt de données
- Analyse commerciale: Convertir PDF convertir les tableaux en formats de données analysables pour en tirer des enseignements
Cas d'utilisation de la gestion et du traitement des documents
- Traitement des facturesExtraire les lignes de commande et les tableaux de prix des factures pour un traitement automatisé
- Analyse de contratExtraire les tableaux de conditions générales des documents juridiques
- Numérisation des rapportsConvertir les rapports papier en données numériques consultables
- Gestion de contenuExtraire des données structurées à partir de documents pour les systèmes de gestion de contenu
Cas d'utilisation de la migration et de l'intégration de données
- Migration du systèmeExtraire les données des tables lors des migrations de systèmes et des transferts de données
- Conversion des données existantesConvertir des documents historiques en formats de données modernes
- API IntégrationExtraire des données pour l'intégration avec des systèmes tiers et APIs
- Population de la base de données: Remplir les bases de données avec des données structurées provenant de PDF documents
Cas d'utilisation en recherche et analyse
- Recherche universitaireExtraire des tableaux de données à partir d'articles de recherche et de publications académiques
- Étude de marché: Résultats de l'enquête de processus et tableaux d'analyse de marché
- Données scientifiquesExtraire des données expérimentales et des résultats de recherche à partir de documents scientifiques
- Analyse statistique: Convertir PDF tableaux dans les outils d'analyse statistique
Cas d'utilisation en matière de conformité et de réglementation
- Déclarations réglementairesExtraire les données de conformité des documents et rapports réglementaires
- Soutien à l'audit: Traiter les tableaux financiers et les pistes d'audit à des fins de vérification de la conformité
- Découverte légaleExtraire des données structurées de documents juridiques pour les procédures de découverte
- Analyse des politiquesExtraire les tableaux de politiques et les exigences réglementaires à des fins d'analyse.
Cas d'utilisation dans le domaine de la santé et du médical
- Dossiers médicauxExtraire les tableaux de données patient à partir des rapports et dossiers médicaux.
- Essais cliniquesTraiter les données de recherche et les résultats des essais cliniques
- Réclamations d'assuranceExtraire les tableaux de facturation et les informations de réclamation
- Recherche médicaleConvertir les données de recherche médicale en formats analysables