Aller au contenu principal

Extraction de texte par expression - Recherche RegEx API

PDF4me Extraire du texte par expression vous permet d'extraire un texte spécifique de PDF documents utilisant des expressions régulières. Ceci API processus de service PDF fichiers et extrait le texte correspondant à des modèles/expressions spécifiques à partir de PDF documents. Les API reçoit PDF contenu et modèles d'expressions régulières à travers REST API appels, utilisant Base64 Encodage pour une transmission sécurisée. Grâce à la prise en charge des expressions régulières complexes et au ciblage flexible des pages, cette solution est idéale pour les flux de travail de traitement de documents et d'extraction de données.

Articles de blog connexes
Il n'y a pas encore d'article de blog consacré à cette fonctionnalité — à venir prochainement.
En attendant, n'hésitez pas à consulter le blog de PDF4me pour découvrir des tutoriels et des procédures de travail adaptés à toutes les plateformes.
Consultez le blog

Authentification de votre API Demande

Pour accéder au PDF4me REST APIChaque requête doit inclure des informations d'authentification valides. L'authentification garantit la sécurité des communications et confirme votre identité en tant qu'utilisateur autorisé. REST API.

Caractéristiques principales

  • Prise en charge des expressions régulièresExtraire du texte à l'aide de modèles d'expressions régulières pour une correspondance de texte précise
  • Ciblage de page flexible: Traiter des pages spécifiques ou des documents entiers avec des séquences de pages personnalisées
  • Correspondance de motifs: Prise en charge des expressions régulières complexes et de la reconnaissance de formes
  • Base64 Encodage: Sécuriser la transmission du contenu des fichiers à l'aide de Base64 encodage
  • Simple API Intégration: RESTful API conçu pour les flux de travail d'extraction de texte automatisés

REST API Point de terminaison

Le PDF4me REST API utilise la norme HTTP méthodes d'interaction avec les ressources. Toutes les opérations d'extraction de texte par expression sont effectuées via un point d'accès unique :

  • Méthode: POST
  • Point final : /api/v2/ExtractTextByExpression

REST API Paramètres

Liste complète des paramètres pour l'extraction de texte par expression REST APILes paramètres sont organisés par catégorie pour une meilleure compréhension et une mise en œuvre plus aisée.

Important: Les paramètres marqués d'un astérisque (*) sont obligatoires et doivent être fournis pour le API pour fonctionner correctement.

Paramètres requis

ParamètreTaperDescriptionExemple
docContent*Base64 (String)Le contenu de l'entrée PDF fichier dans Base64 formatJVBERi...
docName*StringSource PDF nom de fichier avec l'extension appropriéeoutput.pdf
expression*StringModèle d'expression régulière pour l'extraction de texte. Prend en charge la syntaxe standard des expressions régulières, y compris les groupes, les quantificateurs et les ancres.% ou [A-Za-z]+
pageSequence*StringIndiquez les pages à traiter. Utilisez « 1- » pour toutes les pages, « 1-3 » pour une plage de pages ou « 1,2,3 » pour des pages spécifiques.1-3

Paramètres optionnels

ParamètreTaperDescriptionExemple
asyncBooleanActiver le traitement asynchrone. Lorsque true, le API retours 202 Accepted avec un Location en-tête pour l'interrogation du résultattrue

Sortir

Le PDF4me Extraire du texte par expression REST API renvoie des réponses différentes selon le mode de traitement. API renvoie les correspondances de texte extraites sous forme de JSON réponse.

Traitement synchrone (par défaut)

Quand async est false ou non fourni, le API renvoie immédiatement les correspondances textuelles extraites.

Code d'état : 200 OK

Format de réponse :

{
"textList": ["extracted text 1", "extracted text 2", "extracted text 3"]
}

La réponse contient un tableau de chaînes de caractères correspondant au modèle d'expression régulière spécifié.

Exemple de requête

En-tête

Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY

Note:

  • Obtenez votre API clé de la PDF4me Tableau de bord
  • Le API La clé doit être Base64 encodé et préfixé par « Basic » dans le Authorization en-tête
  • Exemple : Si votre API La clé est abc123, encodez-le en Base64 et utiliser Authorization: Basic YWJjMTIz

Charge utile

Demande de base :

{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output.pdf",
"expression": "%",
"pageSequence": "1-3"
}

Avec le traitement asynchrone :

{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output.pdf",
"expression": "\\d+",
"pageSequence": "1-3",
"async": true
}

Exemples de code

Le PDF4me Extraire du texte par expression REST API propose des exemples de code dans plusieurs langages de programmation. Choisissez le langage qui convient le mieux à votre environnement de développement :

C# Exemple (CSharp)

Complet C# implémentation pour extraire du texte par expression à partir de PDF:

Fonctionnalités d'extraction de texte

Traitement des expressions régulières

  • Correspondance de motifsPrise en charge complète de la syntaxe et des modèles d'expressions régulières standard.
  • Motifs complexesPrise en charge des fonctionnalités avancées des expressions régulières, notamment les groupes, les quantificateurs et les ancres.
  • Expressions personnaliséesCréation de modèles flexibles pour des besoins spécifiques d'extraction de texte
  • Validation de modèlesValidation intégrée de la syntaxe et de la compatibilité des expressions régulières
  • Résultats professionnelsExtraction de texte fiable avec correspondance de modèles précise

Traitement de la page

  • Ciblage de pageExtraire du texte de pages spécifiques ou de documents entiers
  • Séquences de pagesPrise en charge des plages de pages personnalisées et de la sélection de pages individuelles
  • Traitement flexible: Traiter toute combinaison de pages avec un contrôle précis
  • Traitement par lotsGérer efficacement plusieurs pages en une seule API appels
  • Mise en page professionnelleExtraction de texte cohérente sur toutes les pages cibles

Fonctionnalités avancées

  • Analyse de texteAnalyse et identification complètes des modèles de texte
  • Filtrage personnaliséOptions de filtrage avancées pour des besoins spécifiques d'extraction de texte
  • Extraction professionnelleExtraction de texte de haute qualité avec une visibilité claire
  • Modèles flexibles: Prise en charge de tout modèle d'expression régulière et des exigences de correspondance de texte

Cas d'utilisation et applications industrielles

Cas d'utilisation des services juridiques et professionnels

  • Analyse de documentsExtraire des modèles de données spécifiques à partir de contrats, de factures et de documents juridiques
  • Analyse de contratExtraire les termes clés et les modèles de données des contrats juridiques
  • Surveillance de la conformitéExtraire les informations réglementaires et les données de conformité des documents
  • Extraction de données juridiquesExtraire des modèles de données spécifiques à partir de documents juridiques

Obtenez de l'aide