Extraire la pièce jointe de PDF - Récupération de fichiers API
PDF4me Extraire la pièce jointe de PDF vous permet d'extraire toutes les pièces jointes intégrées dans PDF documents. Ceci API processus de service PDF fichiers et extrait les fichiers, documents et ressources intégrés de PDF documents. Les API reçoit PDF contenu via REST API appels, utilisant Base64 Encodage pour une transmission sécurisée. Avec prise en charge de l'extraction de plusieurs types de fichiers. PDF Cette solution est idéale pour les systèmes de gestion documentaire et les flux de travail d'extraction de fichiers.
Authentification de votre API Demande
Pour accéder au PDF4me REST APIChaque requête doit inclure des informations d'authentification valides. L'authentification garantit la sécurité des communications et confirme votre identité en tant qu'utilisateur autorisé. REST API.
Caractéristiques principales
- Extraction de fichiersExtraire tous les fichiers, documents et ressources intégrés depuis PDF documents
- Plusieurs types de fichiersPrise en charge de divers formats de pièces jointes, notamment le texte, les images, les documents et les archives
- Extraction par lotsExtraire plusieurs pièces jointes d'un seul PDF document en une seule opération
- Base64 Encodage: Sécuriser la transmission du contenu des fichiers à l'aide de Base64 encodage
- Simple API Intégration: RESTful API conçu pour les flux de travail automatisés d'extraction de documents
REST API Point de terminaison
Le PDF4me REST API utilise la norme HTTP méthodes d'interaction avec les ressources. Toutes les opérations d'extraction de pièces jointes sont effectuées via un point de terminaison unique :
- Méthode: POST
- Point final :
/api/v2/ExtractAttachmentFromPdf
REST API Paramètres
Liste complète des paramètres pour l'extraction de pièces jointes. PDF REST APILes paramètres sont organisés par catégorie pour une meilleure compréhension et une mise en œuvre plus aisée.
Important: Les paramètres marqués d'un astérisque (*) sont obligatoires et doivent être fournis pour le API pour fonctionner correctement.
Paramètres requis
| Paramètre | Taper | Description | Exemple |
|---|---|---|---|
| docContent* | Base64 (String) | Le contenu de l'entrée PDF fichier encodé en Base64 format pour l'extraction des pièces jointes et le traitement de récupération des fichiers | JVBERi... |
| docName* | String | Source PDF Nom de fichier avec l'extension .pdf appropriée pour l'identification du document et le traitement d'extraction des pièces jointes | output.pdf |
Paramètres optionnels
| Paramètre | Taper | Description | Exemple |
|---|---|---|---|
| async | Boolean | Activer le traitement asynchrone. Lorsque true, le API retours 202 Accepted avec un Location en-tête pour l'interrogation du résultat | true |
Sortir
Le PDF4me Extraire la pièce jointe de PDF REST API renvoie des réponses différentes selon le mode de traitement. API renvoie les données de pièce jointe extraites sous forme de JSON réponse ou comme un ZIP déposer contenant toutes les pièces jointes extraites.
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
Traitement synchrone (par défaut)
Quand async est false ou non fourni, le API renvoie immédiatement les résultats de l'extraction des pièces jointes.
Code d'état : 200 OK
Format de réponse :
{
"outputDocuments": [
{
"fileName": "attachment1.txt",
"streamFile": "base64-encoded-file-content..."
},
{
"fileName": "attachment2.pdf",
"streamFile": "base64-encoded-file-content..."
}
]
}
La réponse contient un tableau de pièces jointes extraites, chacune avec un fileName et streamFile (Base64-contenu encodé).
Traitement asynchrone
Quand async est true, le API traite le document de manière asynchrone.
Réponse initiale :
Code d'état : 202 Accepted
En-têtes de réponse :
Location: https://api.pdf4me.com/api/v2/ExtractAttachmentFromPdfStatus/{operationId}
Corps de la réponse :
{
"traceId": "operation-trace-id"
}
Sondage pour les résultats :
Utilisez le Location en-tête URL sondage pour vérifier l'achèvement :
const response = await fetch(locationUrl, {
headers: { 'Authorization': 'Basic ' + apiKey }
});
// Continue polling until status code is 200
if (response.status === 200) {
const result = await response.json();
// Process extracted attachments
}
Réponses d'erreur
| Code d'état | Description | Exemple de réponse |
|---|---|---|
| 400 Bad Request | Paramètres de requête invalides ou champs obligatoires manquants | {"error": "Missing required parameter: docContent"} |
| 401 Unauthorized | Invalide ou manquant API clé | {"error": "Unauthorized"} |
| 408 Délai d'attente dépassé | Délai de traitement de la requête dépassé | {"error": "Request timeout"} |
| 500 Internal Server Error | Erreur serveur lors du traitement | {"error": "Internal server error"} |
Comprendre le JSON Réponse
La réponse d'extraction est une JSON objet contenant un tableau de pièces jointes extraites :
- Documents de sortie: Array des objets de pièces jointes extraits
- nom de fichier: Le nom du fichier extrait
- fluxFichier: Base64-contenu encodé du fichier extrait
Alternative: ZIP Réponse du fichier
Dans certains cas, le API peut retourner un ZIP fichier contenant toutes les pièces jointes extraites au lieu de JSON. Le ZIP Le fichier peut être téléchargé et extrait pour accéder aux fichiers individuels.
Décodage Base64 Contenu:
Pour décoder le Base64-contenu de fichier encodé à partir de streamFile:
// JavaScript
const decoded = atob(base64String);
const blob = new Blob([decoded], { type: 'application/octet-stream' });
# Python
import base64
decoded = base64.b64decode(base64_string)
with open('extracted_file.txt', 'wb') as f:
f.write(decoded)
Exemple de requête
En-tête
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
Note:
- Obtenez votre API clé de la PDF4me Tableau de bord
- Le API La clé doit être Base64 encodé et préfixé par « Basic » dans le Authorization en-tête
- Exemple : Si votre API La clé est
abc123, encodez-le en Base64 et utiliserAuthorization: Basic YWJjMTIz
Charge utile
Demande de base :
{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output.pdf"
}
Avec le traitement asynchrone :
{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output.pdf",
"async": true
}
Exemples de code
Le PDF4me Extraire la pièce jointe de PDF REST API propose des exemples de code dans plusieurs langages de programmation. Choisissez le langage qui convient le mieux à votre environnement de développement :
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
Java Échantillon
Java implémentation avec gestion complète des erreurs et traitement des réponses :
JavaScript Échantillon
Node.js et compatible avec les navigateurs JavaScript mise en œuvre:
Python Échantillon
Python implémentation avec la bibliothèque requests et JSON manutention:
Google Script Échantillon
Google Apps Script mise en œuvre pour Google Workspace intégration :
Fonctionnalités d'extraction des pièces jointes
Capacités de récupération de fichiers
- Extraction complèteExtraire tous les fichiers et ressources intégrés de PDF documents
- Détection du type de fichierIdentification automatique des types et formats de fichiers intégrés
- Préservation des métadonnéesConserver les noms de fichiers originaux, les dates de création et les propriétés
- Assurance qualitéGarantir l'intégrité des fichiers et une extraction correcte sans corruption
Traitement des documents
- PDF Analyse: Analyse approfondie de PDF structure permettant de localiser les fixations encastrées
- Identification des ressourcesDétection intelligente de différents types de fichiers intégrés
- Extraction par lots: Traiter plusieurs pièces jointes à partir d'une seule PDF en une seule opération
- Traitement sécuriséExtraction sécurisée avec vérification de l'intégrité des fichiers
Fonctionnalités avancées
- Prise en charge de plusieurs formatsExtraire des documents, des images, des archives et des fichiers multimédias
- Organisation des fichiers: Veillez à maintenir une nomenclature et une organisation correctes des fichiers lors de l'extraction.
- Validation du contenu: Vérifier l'intégrité et l'intégralité du fichier extrait
- Résultats professionnelsExtraction de haute qualité adaptée aux applications d'entreprise
Cas d'utilisation et applications industrielles
- Document Management & Recovery
- Legal & Compliance
- Business & Finance
- Technical & Engineering
- Healthcare & Medical
Cas d'utilisation de la gestion et de la récupération de documents
- Récupération d'archivesExtraire des fichiers de documents PDF archivés pour la récupération de données
- Gestion de contenuRécupérer les ressources intégrées des systèmes de gestion de documents
- Organisation des fichiersExtraire et organiser les fichiers de packages PDF complexes
- Migration de donnéesExtraire les pièces jointes lors des processus de migration de documents
Cas d'utilisation juridiques et de conformité
- Récupération de preuvesExtraire les pièces justificatives et les preuves à partir des fichiers PDF juridiques
- Documentation de conformité: Récupérer les documents et certificats réglementaires
- Soutien à l'auditExtraire les pistes d'audit et les documents justificatifs
- Découverte légaleRécupérer les fichiers intégrés pour les procédures de découverte de preuves juridiques
Cas d'utilisation en affaires et en finance
- Traitement des facturesExtraire les pièces justificatives des factures PDF
- Gestion des contratsRécupérer les annexes et les avenants au contrat
- Information financièreExtraire les feuilles de calcul et les rapports justificatifs
- Analyse de documentsAnalyser le contenu intégré à des fins de veille stratégique
Cas d'utilisation techniques et d'ingénierie
- Documentation techniqueExtraire des exemples de code, des spécifications et des diagrammes
- Fichiers de projetRécupérer les ressources et les documents de soutien du projet
- Ressources de conceptionExtraire les images, les fichiers CAO et les ressources de conception
- Données de rechercheRécupérer des ensembles de données et des documents de recherche à partir de fichiers PDF
Cas d'utilisation dans le domaine de la santé et du médical
- Dossiers médicauxExtraire les dossiers des patients et la documentation médicale
- Données de rechercheRécupérer les données des essais cliniques et les documents de recherche
- Dossiers de conformitéExtraire les documents réglementaires et les certifications
- Soins aux patientsRécupérer les images et rapports médicaux à l'appui