Aller au contenu principal

Extraction de ressources - Extracteur de texte et d'images API

PDF4me Extraction des ressources permet d'extraire le contenu textuel et les images intégrées de PDF documents. Ceci API processus de service PDF fichiers et extrait des ressources textuelles et d'images à partir de PDF documents. Les API reçoit PDF contenu via REST API appels, utilisant Base64 Encodage pour une transmission sécurisée. Grâce à la prise en charge de l'extraction sélective de texte et d'images, cette solution est idéale pour les flux de travail de traitement de contenu et les plateformes d'extraction de données.

Articles de blog connexes
Il n'y a pas encore d'article de blog consacré à cette fonctionnalité — à venir prochainement.
En attendant, n'hésitez pas à consulter le blog de PDF4me pour découvrir des tutoriels et des procédures de travail adaptés à toutes les plateformes.
Consultez le blog

Authentification de votre API Demande

Pour accéder au PDF4me REST APIChaque requête doit inclure des informations d'authentification valides. L'authentification garantit la sécurité des communications et confirme votre identité en tant qu'utilisateur autorisé. REST API.

Caractéristiques principales

  • Extraction de texteExtraire tout le contenu textuel de PDF documents
  • Extraction d'imagesRécupérer toutes les images et tous les éléments visuels de PDF documents
  • Extraction sélectiveChoisissez d'extraire uniquement le texte, uniquement les images ou les deux, selon vos besoins.
  • Base64 Encodage: Sécuriser la transmission du contenu des fichiers à l'aide de Base64 encodage
  • Simple API Intégration: RESTful API conçu pour les flux de travail d'extraction de contenu automatisés

REST API Point de terminaison

Le PDF4me REST API utilise la norme HTTP méthodes d'interaction avec les ressources. Toutes les opérations d'extraction de ressources sont effectuées via un point de terminaison unique :

  • Méthode: POST
  • Point final : /api/v2/ExtractResources

REST API Paramètres

Liste complète des paramètres pour l'extraction des ressources REST APILes paramètres sont organisés par catégorie pour une meilleure compréhension et une mise en œuvre plus aisée.

Important: Les paramètres marqués d'un astérisque (*) sont obligatoires et doivent être fournis pour le API pour fonctionner correctement.

Paramètres requis

ParamètreTaperDescriptionExemple
docContent*Base64 (String)Le contenu de l'entrée PDF fichier encodé en Base64 format pour l'extraction des ressources et le traitement de l'analyse du contenuJVBERi...
docName*StringSource PDF Nom de fichier avec l'extension .pdf appropriée pour l'identification du document et le traitement d'extraction des ressourcessample.pdf
extractText*BooleanChoisissez si vous souhaitez extraire le contenu textuel du PDF: vraiExtraire tout le contenu textuel avec la mise en forme, FAUXIgnorer l'extraction de texte pour le traitement d'images uniquementtrue
extractImages*BooleanChoisissez si vous souhaitez extraire des images de la PDF: vraiExtraire les images et les éléments visuels, FAUX: Ignorer l'extraction d'images pour un traitement plus rapide du texte seultrue

Paramètres optionnels

ParamètreTaperDescriptionExemple
asyncBooleanActiver le traitement asynchrone. Lorsque true, le API retours 202 Accepted avec un Location en-tête pour l'interrogation du résultattrue

Sortir

Le PDF4me Extraction des ressources REST API renvoie des réponses différentes selon le mode de traitement. API renvoie le texte et les images extraits sous forme de JSON réponse.

Traitement synchrone (par défaut)

Quand async est false ou non fourni, le API renvoie immédiatement les ressources extraites.

Code d'état : 200 OK

Format de réponse :

{
"textList": ["extracted text content...", "more text..."],
"imageList": [
{
"fileName": "image1.png",
"imageContent": "base64-encoded-image-content..."
},
{
"fileName": "image2.jpg",
"imageContent": "base64-encoded-image-content..."
}
]
}

La réponse contient le texte extrait sous forme de tableau de chaînes de caractères et les images extraites sous forme de tableau d'objets avec des noms de fichiers et Base64-contenu encodé.

Exemple de requête

En-tête

Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY

Note:

  • Obtenez votre API clé de la PDF4me Tableau de bord
  • Le API La clé doit être Base64 encodé et préfixé par « Basic » dans le Authorization en-tête
  • Exemple : Si votre API La clé est abc123, encodez-le en Base64 et utiliser Authorization: Basic YWJjMTIz

Charge utile

Demande de base :

{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "sample.pdf",
"extractText": true,
"extractImages": true
}

Avec le traitement asynchrone :

{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "sample.pdf",
"extractText": true,
"extractImages": true,
"async": true
}

Exemples de code

Le PDF4me Extraction des ressources REST API propose des exemples de code dans plusieurs langages de programmation. Choisissez le langage qui convient le mieux à votre environnement de développement :

C# Exemple (CSharp)

Complet C# implémentation pour l'extraction de ressources à partir de PDF:

Fonctionnalités d'extraction d'images

  • Images de haute qualitéExtraire les images en conservant leur résolution et qualité d'origine.
  • Formats multiples: Prise en charge de différents formats d'image (JPG, PNG, GIF, etc.)
  • Graphiques vectorielsExtraire des graphiques et des diagrammes vectoriels évolutifs
  • Préservation des métadonnées: Conserver les propriétés et les métadonnées de l'image

Traitement avancé

  • Extraction sélectiveChoisissez entre l'extraction de texte uniquement, d'images uniquement ou l'extraction combinée.
  • Traitement par lots: Traitement multiple PDFs et extraire les ressources efficacement
  • Analyse de contenuAnalyser et catégoriser les types de contenu extraits
  • Résultats professionnelsExtraction de haute qualité adaptée aux applications d'entreprise

Cas d'utilisation et applications industrielles

Cas d'utilisation de la gestion et du traitement des documents

  • Numérisation du contenuExtraire le texte et les images des documents numérisés pour les archives numériques
  • Analyse de documents: Analyser PDF contenu pour l'extraction et le traitement des informations
  • Migration de donnéesExtraire le contenu lors de la migration de documents et des mises à jour système
  • Indexation du contenu: Créer des index consultables à partir de PDF contenu texte et image

Obtenez de l'aide