Aller au contenu principal

Extraire du texte par expression en utilisant n8n action

PDF4me Extraire du texte par expression extrait un contenu textuel spécifique de PDF documents utilisant la correspondance de modèles et le filtrage basé sur des expressions à travers n8n Flux de travail automatisés. Processus PDFs loin n8n déclencheurs, données binaires, chaînes base64 ou publiques URLCette solution permet de localiser et d'extraire du texte à l'aide de caractères génériques (%), d'expressions régulières, de champs de données spécifiques, d'un ciblage par page et de règles d'extraction flexibles avec une sortie structurée. Elle est idéale pour l'extraction de numéros de factures, la capture de champs de données, la recherche de texte par modèle, l'extraction automatisée de données, l'analyse syntaxique de documents et les flux de travail d'analyse de contenu nécessitant un ciblage précis du texte, une correspondance flexible et une intégration transparente.

Articles de blog connexes
Il n'y a pas encore d'article de blog consacré à cette fonctionnalité — à venir prochainement.
En attendant, n'hésitez pas à consulter le blog de PDF4me pour découvrir des tutoriels et des procédures de travail adaptés à toutes les plateformes.
Consultez le blog

Installation

Ajoutez le PDF4me Ajoutez le nœud « Extraire le texte par expression » à votre n8n Suivez le flux de travail et configurez les paramètres requis. Pour les instructions de configuration initiale, consultez notre documentation. n8n Guide d'intégration.

Prérequis :

  • PDF4me API informations d'identification
  • n8n accès au flux de travail

Configuration:

  1. Ajouter PDF4me nœud vers flux de travail
  2. Sélectionnez l'action « Extraire le texte par expression ».
  3. Configurer les paramètres d'entrée (voir ci-dessous)
Configuration d'extraction de texte par expression

Paramètres

Liste complète des paramètres de l'action Extraire du texte par expression. Configurez ces paramètres pour contrôler l'extraction de texte.

Important: Les paramètres marqués d'un astérisque (***) sont obligatoires et doivent être fournis pour que l'action fonctionne correctement.

ParamètreTaperDescriptionExemple
Type de données d'entrée***StringPDF Sélection du format d'entrée
• Choisissez le format de votre PDF saisie de données
PDF4me prend en charge plusieurs types d'entrée
• Options : Données binaires, Base64 Chaîne, ou URL
Binary Data
Champ binaire d'entréeBinaireBinaire PDF Entrée de fichier (Obligatoire si données binaires)
• Référence PDF fichier du précédent n8n Téléchargement de nœud ou de fichier
PDF4me processus binaires PDF fichiers avec détection automatique du format
• Obligatoire lorsque le type de données d'entrée est « Données binaires »
{{ $binary.data }}
Contenu PDF Base64StringBase64 Encodé PDF Saisir (Obligatoire si Base64 Chaîne)
• Fournir PDF contenu sous forme de chaîne encodée en base64
PDF4me décode et traite automatiquement le PDF contenu
• Obligatoire lorsque le type de données d'entrée est «Base64 Chaîne"
JVBER...
URL du PDFStringPublique PDF URL Saisir (Obligatoire si URL)
• Fournir une autorisation publique/ouverte URL au PDF déposer
PDF4me télécharge et traite le fichier depuis URL
• Obligatoire lorsque le type de données d'entrée est «URL"
https://abc.com/document.pdf
Nom du document***StringNom du fichier d'entrée
• Spécifiez le nom de l'entrée PDF déposer
• Utilisé pour la détection de format et l'optimisation du traitement
• Doit inclure l'extension .pdf
document.pdf
Expression***StringModèle d'extraction de texte
• Définir le modèle ou l'expression correspondant au contenu du texte
• Prend en charge les expressions régulières, les caractères génériques et les expressions personnalisées
• Utiliser % pour la correspondance avec caractères génériques ou des modèles d'expressions régulières spécifiques
%
Séquence de pages***StringSpécifications de la plage de pages
• Définir les pages à traiter pour l'extraction de texte
• Utilisez « tout » pour l’ensemble du document ou des numéros/plages de pages spécifiques.
• Exemples : « 1, 3, 5 » (spécifique), « 1-5 » (intervalle), « 1- » (de la page 1 à la fin)
1-

Options avancées

Les paramètres suivants sont disponibles dans la section Options avancées et sont facultatifs :

ParamètreTaperDescriptionExemple
Profils personnalisésStringProfils de configuration personnalisés
• Définir des options supplémentaires à l'aide de profils personnalisés
JSON-format contenant des paramètres prédéfinis
• Permet d'accéder aux paramètres avancés de traitement d'extraction
• Optionnel pour les besoins spécifiques
{ "outputDataFormat": "json" }

Sortir

Paramètres de sortie

ParamètreTaperDescriptionExemple
nom de fichierStringPDF4me nom de fichier généré - Le nom complet du fichier du document traité avec succès, avec l'extension et l'horodatage appropriés. PDF4me garantit une dénomination unique et valide la conformité du format de fichier pour une intégration transparente avec les processus en avaltext_extraction_results_1756999697398.json
type mimeStringPDF4me MIME type identificateur - La norme MIME type pour le fichier de contenu extrait, généralement application/json pour les données structurées ou application/zip pour plusieurs fichiers. Cela garantit une gestion et une reconnaissance correctes des fichiers sur tous les systèmes et applications.application/json
taille du fichierNombrePDF4me taille du fichier en octets - La taille exacte du fichier de contenu extrait, en octets, est fournie pour la planification du stockage, l'optimisation de la bande passante et le suivi des transferts de fichiers. Elle est essentielle pour la gestion documentaire en entreprise et l'automatisation des flux de travail.106
succèsBooleanPDF4me indicateur d'état d'extraction - Indicateur booléen signalant la réussite ou l'échec du processus d'extraction de texte. Retourne true pour des extractions réussies et false pour toute erreur, permettant une gestion robuste des erreurs dans les flux de travail automatiséstrue
messageStringPDF4me message d'état d'extraction Message descriptif indiquant le résultat de l'extraction de texte. Fournit des messages d'état clairs en cas d'extraction réussie et des informations d'erreur détaillées pour le dépannage.Text extraction by expression completed successfully
Nom du documentStringPDF4me Référence du nom du document original - Le nom du fichier d'entrée d'origine PDF Fichier traité. Cette référence est conservée à des fins d'audit, de débogage et de suivi de la source du contenu extrait dans les flux de travail d'entreprise.document.pdf
expressionStringPDF4me expression d'extraction utilisée - Le modèle ou l'expression utilisé(e) pour l'extraction de texte. Ce champ affiche l'expression exacte appliquée lors du processus d'extraction à des fins de vérification et de débogage.%
séquence de pagesStringPDF4me plage de pages traitées - Plage de pages traitée lors de l'extraction de texte. Ce champ indique les pages analysées pour l'expression spécifiée, utile pour la vérification et le dépannage.1-2

N8N Réponse à l'action

Le PDF4me Extraire du texte par expression API renvoie une réponse pouvant être affichée dans plusieurs formats. Choisissez l'affichage qui correspond le mieux à vos besoins :

JSON Format de réponse

Le cru JSON réponse de la API:

{
"fileName": "text_extraction_results_1756999697398.json",
"mimeType": "application/json",
"fileSize": 106,
"success": true,
"message": "Text extraction by expression completed successfully",
"docName": "document.pdf",
"expression": "%",
"pageSequence": "1-2"
}

Cas d'utilisation

Exploration de données et extraction d'informations

  • Extraire des modèles de données spécifiques, des informations de contact et des données structurées à partir de PDF documents utilisant des expressions personnalisées pour l'exploration de données et l'intelligence d'affaires
  • Traiter les documents juridiques, les contrats et les registres officiels en extrayant des clauses, des termes et des informations juridiques spécifiques à l'aide d'expressions ciblées.
  • Transformez les rapports financiers, les factures et les documents comptables en extrayant des données financières, des montants et des informations transactionnelles spécifiques à l'aide d'expressions personnalisées.

Analyse et recherche de contenu

  • Extraire des données de recherche, des citations et des informations académiques de PDF documents utilisant des expressions personnalisées pour la recherche universitaire et l'analyse de contenu
  • Traiter les articles scientifiques, les documents de recherche et les publications techniques en extrayant des données, des mesures et des résultats de recherche spécifiques à l'aide d'expressions ciblées.
  • Transformez les rapports d'activité, les études de marché et les analyses sectorielles en extrayant des indicateurs, des statistiques et des données commerciales spécifiques à l'aide d'expressions personnalisées.

Traitement de la conformité et de la réglementation

  • Extraire les données de conformité, les informations réglementaires et les détails d'audit de PDF documents utilisant des expressions personnalisées pour le traitement de la conformité réglementaire et des audits
  • Traiter les documents de contrôle qualité, les rapports d'inspection et les documents de certification en extrayant les données de conformité spécifiques, les normes et les informations réglementaires.
  • Transformez les documents officiels, les permis et les déclarations réglementaires en extrayant des données réglementaires spécifiques, des indicateurs de conformité et des informations officielles à l'aide d'expressions personnalisées.

Obtenez de l'aide