Aller au contenu principal

Extraire des ressources de PDF dans Make

Que fait ce module ?

PDF4me, Extraire les ressources extrait toutes les images et le contenu textuel intégrés d'un PDF et les renvoie sous forme de données structurées dans votre Make scénario. Basculer Extraire des images pour récupérer chaque image intégrée au document sous forme de nom, Base64Fichier encodé. Basculer Extraire le texte pour récupérer le contenu textuel complet sous forme de chaîne de caractères brute. Les deux opérations peuvent être exécutées simultanément dans un seul appel de module. Utilisez les images extraites pour créer des bibliothèques de ressources, utilisez le texte extrait pour l'analyse, l'indexation de recherche ou la traduction, le tout sans ouvrir le fichier. PDF manuellement.

Articles de blog connexes
Il n'y a pas encore d'article de blog consacré à cette fonctionnalité — à venir prochainement.
En attendant, n'hésitez pas à consulter le blog de PDF4me pour découvrir des tutoriels et des procédures de travail adaptés à toutes les plateformes.
Consultez le blog

Authentification de votre API Demande

Chaque PDF4me module dans Make nécessite un numéro valide ConnexionCréez ou sélectionnez-en un qui contient votre PDF4me API clé permettant au scénario d'authentifier les demandes d'extraction de manière sécurisée.

Informations importantes à ne pas manquer

Le tableau d'images nécessite un itérateur pour être traité individuellement.
Le résultat « Images » est un tableau, un élément par image intégrée. Pour télécharger ou traiter chaque image séparément, ajoutez un Make Itérateur Utilisez le module immédiatement après Extraire les ressources et pointez-le vers le tableau Images. Chaque itération vous donne une image avec un Nom champ (nom de fichier) et un Données champ (contenu Base64). Sans itérateur, vous ne pouvez pas accéder aux images individuelles en aval.
Les données d'image sont Base64, décodez avant de télécharger
Chaque image Données Le champ est encodé en Base64. Modules de stockage cloud (Dropbox, Google Drive, SharePoint) s'attendent à des données binaires, pas Base64 texte. Utilisez Makeintégré toBinary(Données, 'base64') fonction permettant de convertir le champ de données en binaire avant de le transmettre à un module de téléchargement. Nom Ce champ vous donne le nom de fichier d'origine avec son extension (par exemple, image_001.png).
L'extraction de texte fonctionne sur les systèmes natifs PDFs, non scanné
L'option Extraire le texte récupère le texte consultable intégré dans le PDF structure. Numérisé PDFs Ces fichiers étant basés sur l'image, ils ne contiennent pas de couche de texte intégrée. Par conséquent, la sortie « Texte » sera vide ou minimale pour les documents numérisés. Pour extraire le texte des pages numérisées, exécutez une commande. PDF OCR Commencez par créer un calque de texte, puis utilisez l'outil Extraire les ressources pour récupérer le texte. L'extraction d'images fonctionne sur tous les modules. PDFs y compris les versions numérisées.
Configurez le module Extraire les ressources de PDF4me en affichant la connexion définie sur « Ma connexion PDF4me », le nom du fichier mappé à l'étape 1, le document mappé à partir des données de l'étape 1, l'extraction des images activée et l'extraction du texte activée.

Les options « Extraire les images » et « Extraire le texte » sont indépendantes ; activez-en une, les deux ou une seule selon vos besoins. Les images sont renvoyées sous forme de tableau ; le texte est renvoyé sous forme de chaîne de caractères.

Paramètres

Requis: Les champs Connexion, Nom du fichier, Document, Extraire les images et Extraire le texte sont obligatoires. Activez au moins l'option Extraire les images ou Extraire le texte ; si vous n'en activez aucune, aucun contenu ne sera renvoyé.

ParamètreRequisCe que cela faitExemple
ConnectionYesPDF4me API connection. Click Add and paste your API key if connecting for the first time.My PDF4me connection
File NameYesFilename of the source PDF including .pdf extension. Map from the prior module's file name output.catalog.pdf
DocumentYesBinary content of the source PDF. Map from the prior module's data output: Dropbox, Google Drive, HTTP, or email attachment.1. Data
Extract ImagesYesToggle to extract all embedded images. Set to Yes to retrieve images as a named Base64 array. Set to No to skip image extraction. Can be combined with Extract Text.Yes
Extract TextYesToggle to extract all text content. Set to Yes to retrieve the full document text as a plain string. Set to No to skip text extraction. Works on native PDFs only: not scanned.Yes

Champs de sortie

ChampTaperDescription
TextesStringTexte intégral extrait de PDF sous forme de chaîne de caractères simple. Vide si Extraire le texte est défini sur Non ou le PDF est scanné.
ImagesArrayTableau de toutes les images intégrées. Chaque élément possède un Nom (nom de fichier avec extension) et Données (Base64-contenu d'image encodé). Tableau vide si Extraire les images est Non.

Configuration rapide

  1. Ajouter PDF4meExtraction des ressources à votre Make Scénario après une étape de téléchargement de fichier.
  2. Sélectionner Connexion (ou cliquez Ajouter pour en créer un avec votre API clé).
  3. Carte Nom de fichier et Document du module précédent.
  4. Ensemble Extraire des images et/ou Extraire le texte à Oui selon vos besoins.
  5. Si vous extrayez des images, ajoutez un Itérateur module pointant vers le Images tableau. À l'intérieur de l'itérateur, utilisez toBinary(Data, 'base64') décoder chaque image et l'acheminer vers un module de téléchargement.
  6. Si vous extrayez du texte, mappez le Textes champ directement dans une ligne Google Sheets, insertion dans une base de données ou HTTP Corps du message.

Exemples de flux de travail

Exemples de flux de travailCommon Make scenario patterns using Extract Resources.
Constituer une bibliothèque d'images à partir du catalogue de produits PDFs
  1. Le dossier de surveillance Dropbox se déclenche lorsqu'un nouveau catalogue PDF est téléchargé.
  2. La fonction « Télécharger un fichier » de Dropbox récupère le fichier. PDF binaire.
  3. L'option « Extraire les ressources » s'exécute avec l'option « Extraire les images » activée et l'option « Extraire le texte » désactivée.
  4. L'itérateur parcourt le tableau Images, une image par itération.
  5. Chaque itération décode le champ Données avec toBinary(Données, 'base64') et télécharge l'image dans un dossier « Images du produit » de Google Drive en utilisant le champ Nom comme nom de fichier.
Index du texte contractuel pour la recherche en texte intégral
  1. La fonction « Surveiller les fichiers » de Google Drive se déclenche lorsqu'un nouveau contrat est signé. PDF est ajouté au dossier « Contrats ».
  2. Google Drive : Obtenir un fichier télécharge le fichier binaire.
  3. L'option « Extraire les ressources » s'exécute avec l'option « Extraire le texte » définie sur « Oui » et l'option « Extraire les images » définie sur « Non ».
  4. Le texte généré est enregistré dans une table Airtable, avec le nom du fichier et la date de téléchargement.
  5. Le contrat est désormais consultable en texte intégral dans Airtable, aucun copier-coller manuel n'est nécessaire.
Migration de l'héritage PDFs, texte dans la base de données, images dans la médiathèque
  1. Une ligne Google Sheets avec un PDF L'URL déclenche le scénario pour chaque document hérité de la liste de migration.
  2. Un HTTP le module télécharge le PDF à partir de l'URL.
  3. L'extraction des ressources s'exécute avec les options Extraire le texte et Extraire les images activées.
  4. Le champ Textes est inséré dans un MySQL Enregistrement de base de données pour la recherche en texte intégral.
  5. Un itérateur télécharge chaque image extraite vers un SharePoint bibliothèque multimédia, achevant la migration de contenu sans jamais ouvrir la PDFs manuellement.

Foire aux questions

How do I save each extracted image to cloud storage?+
Add a Make Iterator module after Extract Resources and point it at the Images array output. Each iteration yields one image object with a Name field (original filename with extension, e.g. image_001.png) and a Data field (Base64-encoded content). Convert Data to binary using Make's toBinary(Data, 'base64') function, then pipe the binary into a Dropbox Upload a File, Google Drive Upload a File, or SharePoint module: using the Name field as the destination filename.
Can I extract only images, only text, or both?+
The two toggles are fully independent. Set Extract Images to Yes and Extract Text to No to retrieve only images. Set Extract Text to Yes and Extract Images to No for text only. Enable both to retrieve everything in a single module call: PDF4me processes the document once and returns both outputs together, which is more efficient than running the module twice.
Will text extraction work on scanned PDFs?+
Scanned PDFs are essentially images of pages: they contain no embedded text layer. The Extract Text toggle retrieves text from the PDF's internal text structure, which only exists in digitally created (native) PDFs. For scanned documents, the Texts output will be empty or contain only minimal metadata. Run a PDF OCR module first to add a text layer to the scanned PDF, then use Extract Resources to pull the text.
What image formats are returned: PNG, JPG, or something else?+
The format depends on how each image is stored inside the PDF. Most PDFs embed images as JPEG or PNG. The Name field in each Images array item includes the original extension (e.g. image_001.jpg or image_002.png) so you know the format before saving. The Data field is always Base64 regardless of the underlying format.
Does the module modify or damage the source PDF?+
No. Extract Resources is a read-only operation. It reads the PDF content and returns copies of the embedded text and images: the source file in Dropbox, Google Drive, SharePoint, or any other location is completely untouched. You can run Extract Resources on the same PDF multiple times without any side effects.

Modules associés

Obtenez de l'aide