Extraction de texte par expression - Recherche RegEx API
PDF4me Extraire du texte par expression vous permet d'extraire un texte spécifique de PDF documents utilisant des expressions régulières. Ceci API processus de service PDF fichiers et extrait le texte correspondant à des modèles/expressions spécifiques à partir de PDF documents. Les API reçoit PDF contenu et modèles d'expressions régulières à travers REST API appels, utilisant Base64 Encodage pour une transmission sécurisée. Grâce à la prise en charge des expressions régulières complexes et au ciblage flexible des pages, cette solution est idéale pour les flux de travail de traitement de documents et d'extraction de données.
Authentification de votre API Demande
Pour accéder au PDF4me REST APIChaque requête doit inclure des informations d'authentification valides. L'authentification garantit la sécurité des communications et confirme votre identité en tant qu'utilisateur autorisé. REST API.
Caractéristiques principales
- Prise en charge des expressions régulièresExtraire du texte à l'aide de modèles d'expressions régulières pour une correspondance de texte précise
- Ciblage de page flexible: Traiter des pages spécifiques ou des documents entiers avec des séquences de pages personnalisées
- Correspondance de motifs: Prise en charge des expressions régulières complexes et de la reconnaissance de formes
- Base64 Encodage: Sécuriser la transmission du contenu des fichiers à l'aide de Base64 encodage
- Simple API Intégration: RESTful API conçu pour les flux de travail d'extraction de texte automatisés
REST API Point de terminaison
Le PDF4me REST API utilise la norme HTTP méthodes d'interaction avec les ressources. Toutes les opérations d'extraction de texte par expression sont effectuées via un point d'accès unique :
- Méthode: POST
- Point final :
/api/v2/ExtractTextByExpression
REST API Paramètres
Liste complète des paramètres pour l'extraction de texte par expression REST APILes paramètres sont organisés par catégorie pour une meilleure compréhension et une mise en œuvre plus aisée.
Important: Les paramètres marqués d'un astérisque (*) sont obligatoires et doivent être fournis pour le API pour fonctionner correctement.
Paramètres requis
| Paramètre | Taper | Description | Exemple |
|---|---|---|---|
| docContent* | Base64 (String) | Le contenu de l'entrée PDF fichier dans Base64 format | JVBERi... |
| docName* | String | Source PDF nom de fichier avec l'extension appropriée | output.pdf |
| expression* | String | Modèle d'expression régulière pour l'extraction de texte. Prend en charge la syntaxe standard des expressions régulières, y compris les groupes, les quantificateurs et les ancres. | % ou [A-Za-z]+ |
| pageSequence* | String | Indiquez les pages à traiter. Utilisez « 1- » pour toutes les pages, « 1-3 » pour une plage de pages ou « 1,2,3 » pour des pages spécifiques. | 1-3 |
Paramètres optionnels
| Paramètre | Taper | Description | Exemple |
|---|---|---|---|
| async | Boolean | Activer le traitement asynchrone. Lorsque true, le API retours 202 Accepted avec un Location en-tête pour l'interrogation du résultat | true |
Sortir
Le PDF4me Extraire du texte par expression REST API renvoie des réponses différentes selon le mode de traitement. API renvoie les correspondances de texte extraites sous forme de JSON réponse.
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
Traitement synchrone (par défaut)
Quand async est false ou non fourni, le API renvoie immédiatement les correspondances textuelles extraites.
Code d'état : 200 OK
Format de réponse :
{
"textList": ["extracted text 1", "extracted text 2", "extracted text 3"]
}
La réponse contient un tableau de chaînes de caractères correspondant au modèle d'expression régulière spécifié.
Traitement asynchrone
Quand async est true, le API traite le document de manière asynchrone.
Réponse initiale :
Code d'état : 202 Accepted
En-têtes de réponse :
Location: https://api.pdf4me.com/api/v2/ExtractTextByExpressionStatus/{operationId}
Corps de la réponse :
{
"traceId": "operation-trace-id"
}
Sondage pour les résultats :
Utilisez le Location en-tête URL sondage pour vérifier l'achèvement :
const response = await fetch(locationUrl, {
headers: { 'Authorization': 'Basic ' + apiKey }
});
// Continue polling until status code is 200
if (response.status === 200) {
const result = await response.json();
// Process extracted text matches
}
Réponses d'erreur
| Code d'état | Description | Exemple de réponse |
|---|---|---|
| 400 Bad Request | Paramètres de requête invalides, champs obligatoires manquants ou expression régulière invalide. | {"error": "Missing required parameter: expression"} |
| 401 Unauthorized | Invalide ou manquant API clé | {"error": "Unauthorized"} |
| 408 Délai d'attente dépassé | Délai de traitement de la requête dépassé | {"error": "Request timeout"} |
| 500 Internal Server Error | Erreur serveur lors du traitement | {"error": "Internal server error"} |
Comprendre le JSON Réponse
La réponse d'extraction de texte est une JSON objet contenant :
- liste de textes: Array des chaînes contenant toutes les correspondances textuelles qui correspondent au modèle d'expression régulière spécifié
Formats de séquence de pages :
"1-"Traiter toutes les pages, de la page 1 à la fin."1-3": Traiter les pages 1, 2 et 3"1,2,3": Pages spécifiques au processus 1, 2 et 3
Exemples d'expressions :
"%": Symboles de pourcentage de correspondance"\\d+": Faites correspondre un ou plusieurs chiffres"[a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\\.[a-zA-Z]{2,}": Faire correspondre les adresses e-mail"https?://[^\\s]+": Correspondance des URL
Exemple de requête
En-tête
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
Note:
- Obtenez votre API clé de la PDF4me Tableau de bord
- Le API La clé doit être Base64 encodé et préfixé par « Basic » dans le Authorization en-tête
- Exemple : Si votre API La clé est
abc123, encodez-le en Base64 et utiliserAuthorization: Basic YWJjMTIz
Charge utile
Demande de base :
{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output.pdf",
"expression": "%",
"pageSequence": "1-3"
}
Avec le traitement asynchrone :
{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output.pdf",
"expression": "\\d+",
"pageSequence": "1-3",
"async": true
}
Exemples de code
Le PDF4me Extraire du texte par expression REST API propose des exemples de code dans plusieurs langages de programmation. Choisissez le langage qui convient le mieux à votre environnement de développement :
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
C# Exemple (CSharp)
Complet C# implémentation pour extraire du texte par expression à partir de PDF:
Java Échantillon
Java implémentation avec gestion complète des erreurs et traitement des réponses :
JavaScript Échantillon
Node.js et compatible avec les navigateurs JavaScript mise en œuvre:
Python Échantillon
Python implémentation avec la bibliothèque requests et JSON manutention:
Google Apps Script Échantillon
Google Apps Script mise en œuvre pour Google Workspace intégration :
Fonctionnalités d'extraction de texte
Traitement des expressions régulières
- Correspondance de motifsPrise en charge complète de la syntaxe et des modèles d'expressions régulières standard.
- Motifs complexesPrise en charge des fonctionnalités avancées des expressions régulières, notamment les groupes, les quantificateurs et les ancres.
- Expressions personnaliséesCréation de modèles flexibles pour des besoins spécifiques d'extraction de texte
- Validation de modèlesValidation intégrée de la syntaxe et de la compatibilité des expressions régulières
- Résultats professionnelsExtraction de texte fiable avec correspondance de modèles précise
Traitement de la page
- Ciblage de pageExtraire du texte de pages spécifiques ou de documents entiers
- Séquences de pagesPrise en charge des plages de pages personnalisées et de la sélection de pages individuelles
- Traitement flexible: Traiter toute combinaison de pages avec un contrôle précis
- Traitement par lotsGérer efficacement plusieurs pages en une seule API appels
- Mise en page professionnelleExtraction de texte cohérente sur toutes les pages cibles
Fonctionnalités avancées
- Analyse de texteAnalyse et identification complètes des modèles de texte
- Filtrage personnaliséOptions de filtrage avancées pour des besoins spécifiques d'extraction de texte
- Extraction professionnelleExtraction de texte de haute qualité avec une visibilité claire
- Modèles flexibles: Prise en charge de tout modèle d'expression régulière et des exigences de correspondance de texte
Cas d'utilisation et applications industrielles
- Legal & Professional Services
- Finance & Banking
- Business & Enterprise
- Education & Research
- Government & Compliance
Cas d'utilisation des services juridiques et professionnels
- Analyse de documentsExtraire des modèles de données spécifiques à partir de contrats, de factures et de documents juridiques
- Analyse de contratExtraire les termes clés et les modèles de données des contrats juridiques
- Surveillance de la conformitéExtraire les informations réglementaires et les données de conformité des documents
- Extraction de données juridiquesExtraire des modèles de données spécifiques à partir de documents juridiques
Cas d'utilisation dans le secteur financier et bancaire
- Traitement des facturesExtraire les données de facture et les valeurs des champs à l'aide de la correspondance de modèles
- Rapports financiersExtraire des indicateurs et des points de données spécifiques de PDF rapports
- Surveillance de la conformitéExtraire les informations réglementaires et les données de conformité des documents
- Exploration de données financièresExtraire des données structurées à partir de documents financiers
Cas d'utilisation en entreprise
- Exploration de donnéesIdentifier et extraire des données structurées à partir de données non structurées PDF documents
- Traitement du contenuExtraire des modèles de texte spécifiques pour la gestion et l'analyse de contenu
- Traitement des formulairesExtraire les données de formulaire et les valeurs de champ à l'aide de la correspondance de modèles
- Veille stratégiqueExtraire les indicateurs clés de performance et les métriques commerciales à partir de PDF rapports
Cas d'utilisation dans le domaine de l'éducation et de la recherche
- Applications de rechercheExtraire des modèles de données spécifiques à partir d'articles de recherche et de documents académiques
- Extraction de données académiquesExtraire des données structurées à partir d'articles de recherche
- Analyse de rechercheExtraire des indicateurs spécifiques à partir de documents académiques
- Traitement du contenu éducatifExtraire des modèles textuels à partir de documents éducatifs
Cas d'utilisation gouvernementaux et de conformité
- Surveillance de la conformitéExtraire les informations réglementaires et les données de conformité des documents
- Extraction de données réglementairesExtraire des données structurées à partir de documents réglementaires
- Rapports gouvernementauxExtraire des indicateurs spécifiques des rapports gouvernementaux
- Archives publiquesExtraire des modèles de données à partir de documents et de registres publics.