Aller au contenu principal

Extraire des ressources de PDF en utilisant n8n action

PDF4me Extraction des ressources extrait le contenu textuel et les images intégrées de PDF documents par n8n Flux de travail automatisés. Processus PDFs loin n8n déclencheurs, données binaires, chaînes base64 ou publiques URLCette solution permet d'extraire automatiquement du texte, des images, des graphiques et des éléments visuels grâce à un ciblage précis par page, des options d'extraction sélectives (texte uniquement, images uniquement ou les deux) et une mise en forme structurée des résultats. Elle est idéale pour la réutilisation de contenu, l'extraction d'images, l'analyse de texte, la numérisation de documents, la migration de contenu et les processus de récupération de ressources qui exigent une extraction de contenu précise, un ciblage flexible et une intégration transparente.

Articles de blog connexes
Il n'y a pas encore d'article de blog consacré à cette fonctionnalité — à venir prochainement.
En attendant, n'hésitez pas à consulter le blog de PDF4me pour découvrir des tutoriels et des procédures de travail adaptés à toutes les plateformes.
Consultez le blog

Installation

Ajoutez le PDF4me Ajoutez le nœud « Extraire les ressources » à votre n8n Suivez le flux de travail et configurez les paramètres requis. Pour les instructions de configuration initiale, consultez notre documentation. n8n Guide d'intégration.

Prérequis :

  • PDF4me API informations d'identification
  • n8n accès au flux de travail

Configuration:

  1. Ajouter PDF4me nœud vers flux de travail
  2. Sélectionnez l'action « Extraire les ressources ».
  3. Configurer les paramètres d'entrée (voir ci-dessous)
Configuration d'extraction des ressources

Paramètres

Liste complète des paramètres de l'action Extraire les ressources. Configurez ces paramètres pour contrôler l'extraction des ressources.

Important: Les paramètres marqués d'un astérisque (***) sont obligatoires et doivent être fournis pour que l'action fonctionne correctement.

ParamètreTaperDescriptionExemple
Type de données d'entrée***StringPDF Sélection du format d'entrée
• Choisissez le format de votre PDF saisie de données
PDF4me prend en charge plusieurs types d'entrée
• Options : Données binaires, Base64 Chaîne, ou URL
Binary Data
Champ binaire d'entréeBinaireBinaire PDF Entrée de fichier (Obligatoire si données binaires)
• Référence PDF fichier du précédent n8n Téléchargement de nœud ou de fichier
PDF4me processus binaires PDF fichiers avec détection automatique du format
• Obligatoire lorsque le type de données d'entrée est « Données binaires »
{{ $binary.data }}
Contenu PDF Base64StringBase64 Encodé PDF Saisir (Obligatoire si Base64 Chaîne)
• Fournir PDF contenu sous forme de chaîne encodée en base64
PDF4me décode et traite automatiquement le PDF contenu
• Obligatoire lorsque le type de données d'entrée est «Base64 Chaîne"
JVBERi0x...
URL du PDFStringPublique PDF URL Saisir (Obligatoire si URL)
• Fournir une autorisation publique/ouverte URL au PDF déposer
PDF4me télécharge et traite le fichier depuis URL
• Obligatoire lorsque le type de données d'entrée est «URL"
https://abc.com/xyz.pdf
Nom du document***StringNom du fichier d'entrée
• Spécifiez le nom de l'entrée PDF déposer
• Utilisé pour la détection de format et l'optimisation du traitement
• Doit inclure l'extension .pdf
document.pdf
Extraire le texteBooleanActiver/désactiver l'extraction de texte
• Activer ou désactiver l'extraction du contenu textuel
• Lorsqu'elle est activée, extrait tout le contenu textuel lisible
• Préserve les informations de formatage
true
Extraire des imagesBooleanActiver/désactiver l'extraction d'images
• Activer ou désactiver l'extraction d'images
• Lorsqu'elle est activée, extrait toutes les images et tous les graphiques intégrés.
• Éléments visuels enregistrés dans des fichiers séparés
true

Options avancées

Les paramètres suivants sont disponibles dans la section Options avancées et sont facultatifs :

ParamètreTaperDescriptionExemple
PagesStringSpécifications de la plage de pages
• Définir les pages à traiter pour l'extraction des ressources
• Utilisez « all » pour l’ensemble du document, des numéros spécifiques ou des plages de valeurs.
• Exemples : « 1, 3, 5 » (pages spécifiques), « 1-5, 10-15 » (plages)
all
Profils personnalisésStringProfils de configuration personnalisés
• Définir des options supplémentaires à l'aide de profils personnalisés
JSON-format contenant des paramètres prédéfinis
• Permet d'accéder aux paramètres avancés de traitement d'extraction
• Optionnel pour les besoins spécifiques
{ "outputDataFormat": "json" }

Sortir

Paramètres de sortie

ParamètreTaperDescriptionExemple
nom de fichierStringPDF4me nom de fichier généré - Le nom complet du fichier du document traité avec succès, avec l'extension et l'horodatage appropriés. PDF4me garantit une dénomination unique et valide la conformité du format de fichier pour une intégration transparente avec les processus en avalextracted_resources_1756999816629.json
type mimeStringPDF4me MIME type identificateur - La norme MIME type pour le fichier de contenu extrait, généralement application/json pour les données structurées ou application/zip pour plusieurs fichiers. Cela garantit une gestion et une reconnaissance correctes des fichiers sur tous les systèmes et applications.application/json
taille du fichierNombrePDF4me taille du fichier en octets - La taille exacte du fichier de contenu extrait, en octets, est fournie pour la planification du stockage, l'optimisation de la bande passante et le suivi des transferts de fichiers. Elle est essentielle pour la gestion documentaire en entreprise et l'automatisation des flux de travail.1945
succèsBooleanPDF4me indicateur d'état d'extraction - Indicateur booléen signalant la réussite ou l'échec du processus d'extraction de ressources. Retourne true pour des extractions réussies et false pour toute erreur, permettant une gestion robuste des erreurs dans les flux de travail automatiséstrue
messageStringPDF4me message d'état d'extraction Message descriptif indiquant le résultat de l'extraction des ressources. Fournit des messages d'état clairs en cas d'extraction réussie et des informations d'erreur détaillées pour le dépannage.Resource extraction completed successfully
Nom du documentStringPDF4me Référence du nom du document original - Le nom du fichier d'entrée d'origine PDF Fichier traité. Cette référence est conservée à des fins d'audit, de débogage et de suivi de la source du contenu extrait dans les flux de travail d'entreprise.document.pdf

N8N Réponse à l'action

Le PDF4me Extraction des ressources API renvoie une réponse pouvant être affichée dans plusieurs formats. Choisissez l'affichage qui correspond le mieux à vos besoins :

JSON Format de réponse

Le cru JSON réponse de la API:

{
"fileName": "extracted_resources_1756999816629.json",
"mimeType": "application/json",
"fileSize": 1945,
"success": true,
"message": "Resource extraction completed successfully",
"docName": "document.pdf"
}

Cas d'utilisation

Systèmes de gestion de contenuExtraire le texte et les images de PDF documents pour les référentiels de contenu centralisés, permettant la création de bases de données consultables de contenu documentaire.

Pipelines de traitement des donnéesExtraire automatiquement des données structurées à partir de PDF rapports, factures et formulaires destinés à l'intégration avec les outils de veille stratégique et les plateformes d'analyse.

Analyse de documents: Traiter de grands volumes de PDF documents permettant d'extraire des informations spécifiques à des fins de contrôle de la conformité, de recherche et de production de rapports automatisés.

Numérisation des archivesConvertir l'ancien PDF archivage en données structurées et consultables pour les systèmes modernes de gestion de contenu et de découverte des connaissances.

Obtenez de l'aide