Extraire du texte par expression en utilisant n8n action
PDF4me Extraire du texte par expression extrait un contenu textuel spécifique de PDF documents utilisant la correspondance de modèles et le filtrage basé sur des expressions à travers n8n Flux de travail automatisés. Processus PDFs loin n8n déclencheurs, données binaires, chaînes base64 ou publiques URLCette solution permet de localiser et d'extraire du texte à l'aide de caractères génériques (%), d'expressions régulières, de champs de données spécifiques, d'un ciblage par page et de règles d'extraction flexibles avec une sortie structurée. Elle est idéale pour l'extraction de numéros de factures, la capture de champs de données, la recherche de texte par modèle, l'extraction automatisée de données, l'analyse syntaxique de documents et les flux de travail d'analyse de contenu nécessitant un ciblage précis du texte, une correspondance flexible et une intégration transparente.
Installation
Ajoutez le PDF4me Ajoutez le nœud « Extraire le texte par expression » à votre n8n Suivez le flux de travail et configurez les paramètres requis. Pour les instructions de configuration initiale, consultez notre documentation. n8n Guide d'intégration.
Prérequis :
- PDF4me API informations d'identification
- n8n accès au flux de travail
Configuration:
- Ajouter PDF4me nœud vers flux de travail
- Sélectionnez l'action « Extraire le texte par expression ».
- Configurer les paramètres d'entrée (voir ci-dessous)

Paramètres
Liste complète des paramètres de l'action Extraire du texte par expression. Configurez ces paramètres pour contrôler l'extraction de texte.
Important: Les paramètres marqués d'un astérisque (***) sont obligatoires et doivent être fournis pour que l'action fonctionne correctement.
| Paramètre | Taper | Description | Exemple |
|---|---|---|---|
| Type de données d'entrée*** | String | PDF Sélection du format d'entrée • Choisissez le format de votre PDF saisie de données • PDF4me prend en charge plusieurs types d'entrée • Options : Données binaires, Base64 Chaîne, ou URL | Binary Data |
| Champ binaire d'entrée | Binaire | Binaire PDF Entrée de fichier (Obligatoire si données binaires) • Référence PDF fichier du précédent n8n Téléchargement de nœud ou de fichier • PDF4me processus binaires PDF fichiers avec détection automatique du format • Obligatoire lorsque le type de données d'entrée est « Données binaires » | {{ $binary.data }} |
| Contenu PDF Base64 | String | Base64 Encodé PDF Saisir (Obligatoire si Base64 Chaîne) • Fournir PDF contenu sous forme de chaîne encodée en base64 • PDF4me décode et traite automatiquement le PDF contenu • Obligatoire lorsque le type de données d'entrée est «Base64 Chaîne" | JVBER... |
| URL du PDF | String | Publique PDF URL Saisir (Obligatoire si URL) • Fournir une autorisation publique/ouverte URL au PDF déposer • PDF4me télécharge et traite le fichier depuis URL • Obligatoire lorsque le type de données d'entrée est «URL" | https://abc.com/document.pdf |
| Nom du document*** | String | Nom du fichier d'entrée • Spécifiez le nom de l'entrée PDF déposer • Utilisé pour la détection de format et l'optimisation du traitement • Doit inclure l'extension .pdf | document.pdf |
| Expression*** | String | Modèle d'extraction de texte • Définir le modèle ou l'expression correspondant au contenu du texte • Prend en charge les expressions régulières, les caractères génériques et les expressions personnalisées • Utiliser % pour la correspondance avec caractères génériques ou des modèles d'expressions régulières spécifiques | % |
| Séquence de pages*** | String | Spécifications de la plage de pages • Définir les pages à traiter pour l'extraction de texte • Utilisez « tout » pour l’ensemble du document ou des numéros/plages de pages spécifiques. • Exemples : « 1, 3, 5 » (spécifique), « 1-5 » (intervalle), « 1- » (de la page 1 à la fin) | 1- |
Options avancées
Les paramètres suivants sont disponibles dans la section Options avancées et sont facultatifs :
| Paramètre | Taper | Description | Exemple |
|---|---|---|---|
| Profils personnalisés | String | Profils de configuration personnalisés • Définir des options supplémentaires à l'aide de profils personnalisés • JSON-format contenant des paramètres prédéfinis • Permet d'accéder aux paramètres avancés de traitement d'extraction • Optionnel pour les besoins spécifiques | { "outputDataFormat": "json" } |
Sortir
Paramètres de sortie
| Paramètre | Taper | Description | Exemple |
|---|---|---|---|
| nom de fichier | String | PDF4me nom de fichier généré - Le nom complet du fichier du document traité avec succès, avec l'extension et l'horodatage appropriés. PDF4me garantit une dénomination unique et valide la conformité du format de fichier pour une intégration transparente avec les processus en aval | text_extraction_results_1756999697398.json |
| type mime | String | PDF4me MIME type identificateur - La norme MIME type pour le fichier de contenu extrait, généralement application/json pour les données structurées ou application/zip pour plusieurs fichiers. Cela garantit une gestion et une reconnaissance correctes des fichiers sur tous les systèmes et applications. | application/json |
| taille du fichier | Nombre | PDF4me taille du fichier en octets - La taille exacte du fichier de contenu extrait, en octets, est fournie pour la planification du stockage, l'optimisation de la bande passante et le suivi des transferts de fichiers. Elle est essentielle pour la gestion documentaire en entreprise et l'automatisation des flux de travail. | 106 |
| succès | Boolean | PDF4me indicateur d'état d'extraction - Indicateur booléen signalant la réussite ou l'échec du processus d'extraction de texte. Retourne true pour des extractions réussies et false pour toute erreur, permettant une gestion robuste des erreurs dans les flux de travail automatisés | true |
| message | String | PDF4me message d'état d'extraction Message descriptif indiquant le résultat de l'extraction de texte. Fournit des messages d'état clairs en cas d'extraction réussie et des informations d'erreur détaillées pour le dépannage. | Text extraction by expression completed successfully |
| Nom du document | String | PDF4me Référence du nom du document original - Le nom du fichier d'entrée d'origine PDF Fichier traité. Cette référence est conservée à des fins d'audit, de débogage et de suivi de la source du contenu extrait dans les flux de travail d'entreprise. | document.pdf |
| expression | String | PDF4me expression d'extraction utilisée - Le modèle ou l'expression utilisé(e) pour l'extraction de texte. Ce champ affiche l'expression exacte appliquée lors du processus d'extraction à des fins de vérification et de débogage. | % |
| séquence de pages | String | PDF4me plage de pages traitées - Plage de pages traitée lors de l'extraction de texte. Ce champ indique les pages analysées pour l'expression spécifiée, utile pour la vérification et le dépannage. | 1-2 |
N8N Réponse à l'action
Le PDF4me Extraire du texte par expression API renvoie une réponse pouvant être affichée dans plusieurs formats. Choisissez l'affichage qui correspond le mieux à vos besoins :
- JSON
- Table
- Schema
- Binary
JSON Format de réponse
Le cru JSON réponse de la API:
{
"fileName": "text_extraction_results_1756999697398.json",
"mimeType": "application/json",
"fileSize": 106,
"success": true,
"message": "Text extraction by expression completed successfully",
"docName": "document.pdf",
"expression": "%",
"pageSequence": "1-2"
}
Vue tableau
Données de réponse présentées sous forme de tableau structuré :
| Paramètre | Valeur |
|---|---|
| fileName | text_extraction_results_1756999697398.json |
| mimeType | application/json |
| fileSize | 106 |
| success | true |
| docName | document.pdf |
| message | Text extraction by expression completed successfully |
| expression | % |
| pageSequence | 1-2 |
Vue schématique
Structure des données et types de réponses :
fileName: AB text_extraction_results_1756999697398.json
mimeType: AB application/json
fileSize: # 106
success: ✓ true
docName: AB document.pdf
message: AB Text extraction by expression completed successfully
expression: AB %
pageSequence: AB 1-2
Indicateurs de type :
AB= String#= Nombre✓= Boolean
Vue des données binaires
Les données et métadonnées extraites du texte :
data
─────────────────────────────────────────
File Name: text_extraction_results_1756999697398.json
File Extension: json
Mime Type: application/json
File Size: 106 bytes
Cas d'utilisation
Exploration de données et extraction d'informations
- Extraire des modèles de données spécifiques, des informations de contact et des données structurées à partir de PDF documents utilisant des expressions personnalisées pour l'exploration de données et l'intelligence d'affaires
- Traiter les documents juridiques, les contrats et les registres officiels en extrayant des clauses, des termes et des informations juridiques spécifiques à l'aide d'expressions ciblées.
- Transformez les rapports financiers, les factures et les documents comptables en extrayant des données financières, des montants et des informations transactionnelles spécifiques à l'aide d'expressions personnalisées.
Analyse et recherche de contenu
- Extraire des données de recherche, des citations et des informations académiques de PDF documents utilisant des expressions personnalisées pour la recherche universitaire et l'analyse de contenu
- Traiter les articles scientifiques, les documents de recherche et les publications techniques en extrayant des données, des mesures et des résultats de recherche spécifiques à l'aide d'expressions ciblées.
- Transformez les rapports d'activité, les études de marché et les analyses sectorielles en extrayant des indicateurs, des statistiques et des données commerciales spécifiques à l'aide d'expressions personnalisées.
Traitement de la conformité et de la réglementation
- Extraire les données de conformité, les informations réglementaires et les détails d'audit de PDF documents utilisant des expressions personnalisées pour le traitement de la conformité réglementaire et des audits
- Traiter les documents de contrôle qualité, les rapports d'inspection et les documents de certification en extrayant les données de conformité spécifiques, les normes et les informations réglementaires.
- Transformez les documents officiels, les permis et les déclarations réglementaires en extrayant des données réglementaires spécifiques, des indicateurs de conformité et des informations officielles à l'aide d'expressions personnalisées.