Extraction de ressources - Extracteur de texte et d'images API
PDF4me Extraction des ressources permet d'extraire le contenu textuel et les images intégrées de PDF documents. Ceci API processus de service PDF fichiers et extrait des ressources textuelles et d'images à partir de PDF documents. Les API reçoit PDF contenu via REST API appels, utilisant Base64 Encodage pour une transmission sécurisée. Grâce à la prise en charge de l'extraction sélective de texte et d'images, cette solution est idéale pour les flux de travail de traitement de contenu et les plateformes d'extraction de données.
Authentification de votre API Demande
Pour accéder au PDF4me REST APIChaque requête doit inclure des informations d'authentification valides. L'authentification garantit la sécurité des communications et confirme votre identité en tant qu'utilisateur autorisé. REST API.
Caractéristiques principales
- Extraction de texteExtraire tout le contenu textuel de PDF documents
- Extraction d'imagesRécupérer toutes les images et tous les éléments visuels de PDF documents
- Extraction sélectiveChoisissez d'extraire uniquement le texte, uniquement les images ou les deux, selon vos besoins.
- Base64 Encodage: Sécuriser la transmission du contenu des fichiers à l'aide de Base64 encodage
- Simple API Intégration: RESTful API conçu pour les flux de travail d'extraction de contenu automatisés
REST API Point de terminaison
Le PDF4me REST API utilise la norme HTTP méthodes d'interaction avec les ressources. Toutes les opérations d'extraction de ressources sont effectuées via un point de terminaison unique :
- Méthode: POST
- Point final :
/api/v2/ExtractResources
REST API Paramètres
Liste complète des paramètres pour l'extraction des ressources REST APILes paramètres sont organisés par catégorie pour une meilleure compréhension et une mise en œuvre plus aisée.
Important: Les paramètres marqués d'un astérisque (*) sont obligatoires et doivent être fournis pour le API pour fonctionner correctement.
Paramètres requis
| Paramètre | Taper | Description | Exemple |
|---|---|---|---|
| docContent* | Base64 (String) | Le contenu de l'entrée PDF fichier encodé en Base64 format pour l'extraction des ressources et le traitement de l'analyse du contenu | JVBERi... |
| docName* | String | Source PDF Nom de fichier avec l'extension .pdf appropriée pour l'identification du document et le traitement d'extraction des ressources | sample.pdf |
| extractText* | Boolean | Choisissez si vous souhaitez extraire le contenu textuel du PDF: vraiExtraire tout le contenu textuel avec la mise en forme, FAUXIgnorer l'extraction de texte pour le traitement d'images uniquement | true |
| extractImages* | Boolean | Choisissez si vous souhaitez extraire des images de la PDF: vraiExtraire les images et les éléments visuels, FAUX: Ignorer l'extraction d'images pour un traitement plus rapide du texte seul | true |
Paramètres optionnels
| Paramètre | Taper | Description | Exemple |
|---|---|---|---|
| async | Boolean | Activer le traitement asynchrone. Lorsque true, le API retours 202 Accepted avec un Location en-tête pour l'interrogation du résultat | true |
Sortir
Le PDF4me Extraction des ressources REST API renvoie des réponses différentes selon le mode de traitement. API renvoie le texte et les images extraits sous forme de JSON réponse.
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
Traitement synchrone (par défaut)
Quand async est false ou non fourni, le API renvoie immédiatement les ressources extraites.
Code d'état : 200 OK
Format de réponse :
{
"textList": ["extracted text content...", "more text..."],
"imageList": [
{
"fileName": "image1.png",
"imageContent": "base64-encoded-image-content..."
},
{
"fileName": "image2.jpg",
"imageContent": "base64-encoded-image-content..."
}
]
}
La réponse contient le texte extrait sous forme de tableau de chaînes de caractères et les images extraites sous forme de tableau d'objets avec des noms de fichiers et Base64-contenu encodé.
Traitement asynchrone
Quand async est true, le API traite le document de manière asynchrone.
Réponse initiale :
Code d'état : 202 Accepted
En-têtes de réponse :
Location: https://api.pdf4me.com/api/v2/ExtractResourcesStatus/{operationId}
Corps de la réponse :
{
"traceId": "operation-trace-id"
}
Sondage pour les résultats :
Utilisez le Location en-tête URL sondage pour vérifier l'achèvement :
const response = await fetch(locationUrl, {
headers: { 'Authorization': 'Basic ' + apiKey }
});
// Continue polling until status code is 200
if (response.status === 200) {
const result = await response.json();
// Process extracted resources
}
Réponses d'erreur
| Code d'état | Description | Exemple de réponse |
|---|---|---|
| 400 Bad Request | Paramètres de requête invalides ou champs obligatoires manquants | {"error": "Missing required parameter: docContent"} |
| 401 Unauthorized | Invalide ou manquant API clé | {"error": "Unauthorized"} |
| 408 Délai d'attente dépassé | Délai de traitement de la requête dépassé | {"error": "Request timeout"} |
| 500 Internal Server Error | Erreur serveur lors du traitement | {"error": "Internal server error"} |
Comprendre le JSON Réponse
La réponse d'extraction des ressources est une JSON objet contenant :
- liste de textes: Array de chaînes contenant du contenu textuel extrait (si
extractTextesttrue) - liste d'images: Array d'objets image (si
extractImagesesttrue) - nom de fichier: Le nom du fichier image extrait
- contenu de l'image: Base64-contenu encodé de l'image
Décodage Base64 Contenu de l'image :
Pour décoder et sauvegarder Base64-images encodées :
// JavaScript
const decoded = atob(base64String);
const blob = new Blob([decoded], { type: 'image/png' });
const url = URL.createObjectURL(blob);
# Python
import base64
image_data = base64.b64decode(base64_string)
with open('extracted_image.png', 'wb') as f:
f.write(image_data)
Exemple de requête
En-tête
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
Note:
- Obtenez votre API clé de la PDF4me Tableau de bord
- Le API La clé doit être Base64 encodé et préfixé par « Basic » dans le Authorization en-tête
- Exemple : Si votre API La clé est
abc123, encodez-le en Base64 et utiliserAuthorization: Basic YWJjMTIz
Charge utile
Demande de base :
{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "sample.pdf",
"extractText": true,
"extractImages": true
}
Avec le traitement asynchrone :
{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "sample.pdf",
"extractText": true,
"extractImages": true,
"async": true
}
Exemples de code
Le PDF4me Extraction des ressources REST API propose des exemples de code dans plusieurs langages de programmation. Choisissez le langage qui convient le mieux à votre environnement de développement :
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
C# Exemple (CSharp)
Complet C# implémentation pour l'extraction de ressources à partir de PDF:
Java Échantillon
Java implémentation avec gestion complète des erreurs et traitement des réponses :
JavaScript Échantillon
Node.js et compatible avec les navigateurs JavaScript mise en œuvre:
Python Échantillon
Python implémentation avec la bibliothèque requests et JSON manutention:
Google Apps Script Échantillon
Google Apps Script mise en œuvre pour Google Workspace intégration :
Fonctionnalités d'extraction d'images
- Images de haute qualitéExtraire les images en conservant leur résolution et qualité d'origine.
- Formats multiples: Prise en charge de différents formats d'image (JPG, PNG, GIF, etc.)
- Graphiques vectorielsExtraire des graphiques et des diagrammes vectoriels évolutifs
- Préservation des métadonnées: Conserver les propriétés et les métadonnées de l'image
Traitement avancé
- Extraction sélectiveChoisissez entre l'extraction de texte uniquement, d'images uniquement ou l'extraction combinée.
- Traitement par lots: Traitement multiple PDFs et extraire les ressources efficacement
- Analyse de contenuAnalyser et catégoriser les types de contenu extraits
- Résultats professionnelsExtraction de haute qualité adaptée aux applications d'entreprise
Cas d'utilisation et applications industrielles
- Document Management & Processing
- Business & Finance
- Legal & Compliance
- Healthcare & Medical
- Education & Research
- Marketing & Content
Cas d'utilisation de la gestion et du traitement des documents
- Numérisation du contenuExtraire le texte et les images des documents numérisés pour les archives numériques
- Analyse de documents: Analyser PDF contenu pour l'extraction et le traitement des informations
- Migration de donnéesExtraire le contenu lors de la migration de documents et des mises à jour système
- Indexation du contenu: Créer des index consultables à partir de PDF contenu texte et image
Cas d'utilisation en affaires et en finance
- Traitement des facturesExtraire le texte et les images des factures pour un traitement automatisé
- Analyse du rapportExtraire des données et des graphiques des rapports et états financiers
- Gestion des contratsExtraire le texte et les éléments visuels des contrats et accords
- Documentation de conformité: Traiter les documents réglementaires et extraire les informations requises
Cas d'utilisation juridiques et de conformité
- Traitement des documents juridiquesExtraire le texte et les preuves des documents juridiques
- Gestion de casExtraire le contenu des dossiers et des mémoires juridiques
- Conformité réglementaire: Traiter les documents de conformité et extraire les données requises
- Collecte de preuvesExtraire du texte et des images à des fins de preuve et de documentation juridiques.
Cas d'utilisation dans le domaine de la santé et du médical
- Dossiers médicauxExtraire le texte et les images des dossiers des patients et des rapports médicaux
- Données de recherche: Traiter les documents de recherche et extraire les données et les graphiques
- Essais cliniquesExtraire des informations des documents d'études cliniques
- Imagerie médicaleExtraire des images médicales et du contenu diagnostique de PDFs
Cas d'utilisation dans le domaine de l'éducation et de la recherche
- Articles académiquesExtraire du texte et des figures à partir d'articles et de publications de recherche
- Contenu éducatif: Traiter les manuels scolaires et le matériel pédagogique
- Données de rechercheExtraire des données et des graphiques à partir de documents de recherche
- Numérisation de la bibliothèque: Numériser les collections de la bibliothèque et extraire le contenu consultable
Cas d'utilisation en marketing et contenu
- Création de contenuExtraire du texte et des images pour le marketing de contenu et les réseaux sociaux
- Actifs de marqueExtraire les logos et les éléments de marque de PDF documents
- Ressources de conceptionExtraire des éléments de design et des graphismes pour des projets créatifs
- Réutilisation du contenuExtraire du contenu pour le réutiliser dans différents formats et sur différentes plateformes