Extraire des ressources de PDF en utilisant n8n action
PDF4me Extraction des ressources extrait le contenu textuel et les images intégrées de PDF documents par n8n Flux de travail automatisés. Processus PDFs loin n8n déclencheurs, données binaires, chaînes base64 ou publiques URLCette solution permet d'extraire automatiquement du texte, des images, des graphiques et des éléments visuels grâce à un ciblage précis par page, des options d'extraction sélectives (texte uniquement, images uniquement ou les deux) et une mise en forme structurée des résultats. Elle est idéale pour la réutilisation de contenu, l'extraction d'images, l'analyse de texte, la numérisation de documents, la migration de contenu et les processus de récupération de ressources qui exigent une extraction de contenu précise, un ciblage flexible et une intégration transparente.
Installation
Ajoutez le PDF4me Ajoutez le nœud « Extraire les ressources » à votre n8n Suivez le flux de travail et configurez les paramètres requis. Pour les instructions de configuration initiale, consultez notre documentation. n8n Guide d'intégration.
Prérequis :
- PDF4me API informations d'identification
- n8n accès au flux de travail
Configuration:
- Ajouter PDF4me nœud vers flux de travail
- Sélectionnez l'action « Extraire les ressources ».
- Configurer les paramètres d'entrée (voir ci-dessous)

Paramètres
Liste complète des paramètres de l'action Extraire les ressources. Configurez ces paramètres pour contrôler l'extraction des ressources.
Important: Les paramètres marqués d'un astérisque (***) sont obligatoires et doivent être fournis pour que l'action fonctionne correctement.
| Paramètre | Taper | Description | Exemple |
|---|---|---|---|
| Type de données d'entrée*** | String | PDF Sélection du format d'entrée • Choisissez le format de votre PDF saisie de données • PDF4me prend en charge plusieurs types d'entrée • Options : Données binaires, Base64 Chaîne, ou URL | Binary Data |
| Champ binaire d'entrée | Binaire | Binaire PDF Entrée de fichier (Obligatoire si données binaires) • Référence PDF fichier du précédent n8n Téléchargement de nœud ou de fichier • PDF4me processus binaires PDF fichiers avec détection automatique du format • Obligatoire lorsque le type de données d'entrée est « Données binaires » | {{ $binary.data }} |
| Contenu PDF Base64 | String | Base64 Encodé PDF Saisir (Obligatoire si Base64 Chaîne) • Fournir PDF contenu sous forme de chaîne encodée en base64 • PDF4me décode et traite automatiquement le PDF contenu • Obligatoire lorsque le type de données d'entrée est «Base64 Chaîne" | JVBERi0x... |
| URL du PDF | String | Publique PDF URL Saisir (Obligatoire si URL) • Fournir une autorisation publique/ouverte URL au PDF déposer • PDF4me télécharge et traite le fichier depuis URL • Obligatoire lorsque le type de données d'entrée est «URL" | https://abc.com/xyz.pdf |
| Nom du document*** | String | Nom du fichier d'entrée • Spécifiez le nom de l'entrée PDF déposer • Utilisé pour la détection de format et l'optimisation du traitement • Doit inclure l'extension .pdf | document.pdf |
| Extraire le texte | Boolean | Activer/désactiver l'extraction de texte • Activer ou désactiver l'extraction du contenu textuel • Lorsqu'elle est activée, extrait tout le contenu textuel lisible • Préserve les informations de formatage | true |
| Extraire des images | Boolean | Activer/désactiver l'extraction d'images • Activer ou désactiver l'extraction d'images • Lorsqu'elle est activée, extrait toutes les images et tous les graphiques intégrés. • Éléments visuels enregistrés dans des fichiers séparés | true |
Options avancées
Les paramètres suivants sont disponibles dans la section Options avancées et sont facultatifs :
| Paramètre | Taper | Description | Exemple |
|---|---|---|---|
| Pages | String | Spécifications de la plage de pages • Définir les pages à traiter pour l'extraction des ressources • Utilisez « all » pour l’ensemble du document, des numéros spécifiques ou des plages de valeurs. • Exemples : « 1, 3, 5 » (pages spécifiques), « 1-5, 10-15 » (plages) | all |
| Profils personnalisés | String | Profils de configuration personnalisés • Définir des options supplémentaires à l'aide de profils personnalisés • JSON-format contenant des paramètres prédéfinis • Permet d'accéder aux paramètres avancés de traitement d'extraction • Optionnel pour les besoins spécifiques | { "outputDataFormat": "json" } |
Sortir
Paramètres de sortie
| Paramètre | Taper | Description | Exemple |
|---|---|---|---|
| nom de fichier | String | PDF4me nom de fichier généré - Le nom complet du fichier du document traité avec succès, avec l'extension et l'horodatage appropriés. PDF4me garantit une dénomination unique et valide la conformité du format de fichier pour une intégration transparente avec les processus en aval | extracted_resources_1756999816629.json |
| type mime | String | PDF4me MIME type identificateur - La norme MIME type pour le fichier de contenu extrait, généralement application/json pour les données structurées ou application/zip pour plusieurs fichiers. Cela garantit une gestion et une reconnaissance correctes des fichiers sur tous les systèmes et applications. | application/json |
| taille du fichier | Nombre | PDF4me taille du fichier en octets - La taille exacte du fichier de contenu extrait, en octets, est fournie pour la planification du stockage, l'optimisation de la bande passante et le suivi des transferts de fichiers. Elle est essentielle pour la gestion documentaire en entreprise et l'automatisation des flux de travail. | 1945 |
| succès | Boolean | PDF4me indicateur d'état d'extraction - Indicateur booléen signalant la réussite ou l'échec du processus d'extraction de ressources. Retourne true pour des extractions réussies et false pour toute erreur, permettant une gestion robuste des erreurs dans les flux de travail automatisés | true |
| message | String | PDF4me message d'état d'extraction Message descriptif indiquant le résultat de l'extraction des ressources. Fournit des messages d'état clairs en cas d'extraction réussie et des informations d'erreur détaillées pour le dépannage. | Resource extraction completed successfully |
| Nom du document | String | PDF4me Référence du nom du document original - Le nom du fichier d'entrée d'origine PDF Fichier traité. Cette référence est conservée à des fins d'audit, de débogage et de suivi de la source du contenu extrait dans les flux de travail d'entreprise. | document.pdf |
N8N Réponse à l'action
Le PDF4me Extraction des ressources API renvoie une réponse pouvant être affichée dans plusieurs formats. Choisissez l'affichage qui correspond le mieux à vos besoins :
- JSON
- Table
- Schema
- Binary
JSON Format de réponse
Le cru JSON réponse de la API:
{
"fileName": "extracted_resources_1756999816629.json",
"mimeType": "application/json",
"fileSize": 1945,
"success": true,
"message": "Resource extraction completed successfully",
"docName": "document.pdf"
}
Vue tableau
Données de réponse présentées sous forme de tableau structuré :
| Paramètre | Valeur |
|---|---|
| fileName | extracted_resources_1756999816629.json |
| mimeType | application/json |
| fileSize | 1945 |
| success | true |
| docName | document.pdf |
| message | Resource extraction completed successfully |
Vue schématique
Structure des données et types de réponses :
fileName: AB extracted_resources_1756999816629.json
mimeType: AB application/json
fileSize: # 1945
success: ✓ true
docName: AB document.pdf
message: AB Resource extraction completed successfully
Indicateurs de type :
AB= String#= Nombre✓= Boolean
Vue des données binaires
Les données et métadonnées extraites :
data
─────────────────────────────────────────
File Name: extracted_resources_1756999816629.json
File Extension: json
Mime Type: application/json
File Size: 1.9 KB
Cas d'utilisation
Systèmes de gestion de contenuExtraire le texte et les images de PDF documents pour les référentiels de contenu centralisés, permettant la création de bases de données consultables de contenu documentaire.
Pipelines de traitement des donnéesExtraire automatiquement des données structurées à partir de PDF rapports, factures et formulaires destinés à l'intégration avec les outils de veille stratégique et les plateformes d'analyse.
Analyse de documents: Traiter de grands volumes de PDF documents permettant d'extraire des informations spécifiques à des fins de contrôle de la conformité, de recherche et de production de rapports automatisés.
Numérisation des archivesConvertir l'ancien PDF archivage en données structurées et consultables pour les systèmes modernes de gestion de contenu et de découverte des connaissances.