Extraire des ressources de PDF dans Make
Que fait ce module ?
PDF4me, Extraire les ressources extrait toutes les images et le contenu textuel intégrés d'un PDF et les renvoie sous forme de données structurées dans votre Make scénario. Basculer Extraire des images pour récupérer chaque image intégrée au document sous forme de nom, Base64Fichier encodé. Basculer Extraire le texte pour récupérer le contenu textuel complet sous forme de chaîne de caractères brute. Les deux opérations peuvent être exécutées simultanément dans un seul appel de module. Utilisez les images extraites pour créer des bibliothèques de ressources, utilisez le texte extrait pour l'analyse, l'indexation de recherche ou la traduction, le tout sans ouvrir le fichier. PDF manuellement.
Authentification de votre API Demande
Chaque PDF4me module dans Make nécessite un numéro valide ConnexionCréez ou sélectionnez-en un qui contient votre PDF4me API clé permettant au scénario d'authentifier les demandes d'extraction de manière sécurisée.
Informations importantes à ne pas manquer
Nom champ (nom de fichier) et un Données champ (contenu Base64). Sans itérateur, vous ne pouvez pas accéder aux images individuelles en aval.Données Le champ est encodé en Base64. Modules de stockage cloud (Dropbox, Google Drive, SharePoint) s'attendent à des données binaires, pas Base64 texte. Utilisez Makeintégré toBinary(Données, 'base64') fonction permettant de convertir le champ de données en binaire avant de le transmettre à un module de téléchargement. Nom Ce champ vous donne le nom de fichier d'origine avec son extension (par exemple, image_001.png).
Les options « Extraire les images » et « Extraire le texte » sont indépendantes ; activez-en une, les deux ou une seule selon vos besoins. Les images sont renvoyées sous forme de tableau ; le texte est renvoyé sous forme de chaîne de caractères.
Paramètres
Requis: Les champs Connexion, Nom du fichier, Document, Extraire les images et Extraire le texte sont obligatoires. Activez au moins l'option Extraire les images ou Extraire le texte ; si vous n'en activez aucune, aucun contenu ne sera renvoyé.
| Paramètre | Requis | Ce que cela fait | Exemple |
|---|---|---|---|
| Connection | Yes | PDF4me API connection. Click Add and paste your API key if connecting for the first time. | My PDF4me connection |
| File Name | Yes | Filename of the source PDF including .pdf extension. Map from the prior module's file name output. | catalog.pdf |
| Document | Yes | Binary content of the source PDF. Map from the prior module's data output: Dropbox, Google Drive, HTTP, or email attachment. | 1. Data |
| Extract Images | Yes | Toggle to extract all embedded images. Set to Yes to retrieve images as a named Base64 array. Set to No to skip image extraction. Can be combined with Extract Text. | Yes |
| Extract Text | Yes | Toggle to extract all text content. Set to Yes to retrieve the full document text as a plain string. Set to No to skip text extraction. Works on native PDFs only: not scanned. | Yes |
Champs de sortie
| Champ | Taper | Description |
|---|---|---|
| Textes | String | Texte intégral extrait de PDF sous forme de chaîne de caractères simple. Vide si Extraire le texte est défini sur Non ou le PDF est scanné. |
| Images | Array | Tableau de toutes les images intégrées. Chaque élément possède un Nom (nom de fichier avec extension) et Données (Base64-contenu d'image encodé). Tableau vide si Extraire les images est Non. |
Configuration rapide
- Ajouter PDF4me → Extraction des ressources à votre Make Scénario après une étape de téléchargement de fichier.
- Sélectionner Connexion (ou cliquez Ajouter pour en créer un avec votre API clé).
- Carte Nom de fichier et Document du module précédent.
- Ensemble Extraire des images et/ou Extraire le texte à Oui selon vos besoins.
- Si vous extrayez des images, ajoutez un Itérateur module pointant vers le Images tableau. À l'intérieur de l'itérateur, utilisez
toBinary(Data, 'base64')décoder chaque image et l'acheminer vers un module de téléchargement. - Si vous extrayez du texte, mappez le Textes champ directement dans une ligne Google Sheets, insertion dans une base de données ou HTTP Corps du message.
Exemples de flux de travail
Exemples de flux de travailCommon Make scenario patterns using Extract Resources.
- Le dossier de surveillance Dropbox se déclenche lorsqu'un nouveau catalogue PDF est téléchargé.
- La fonction « Télécharger un fichier » de Dropbox récupère le fichier. PDF binaire.
- L'option « Extraire les ressources » s'exécute avec l'option « Extraire les images » activée et l'option « Extraire le texte » désactivée.
- L'itérateur parcourt le tableau Images, une image par itération.
- Chaque itération décode le champ Données avec
toBinary(Données, 'base64')et télécharge l'image dans un dossier « Images du produit » de Google Drive en utilisant le champ Nom comme nom de fichier.
- La fonction « Surveiller les fichiers » de Google Drive se déclenche lorsqu'un nouveau contrat est signé. PDF est ajouté au dossier « Contrats ».
- Google Drive : Obtenir un fichier télécharge le fichier binaire.
- L'option « Extraire les ressources » s'exécute avec l'option « Extraire le texte » définie sur « Oui » et l'option « Extraire les images » définie sur « Non ».
- Le texte généré est enregistré dans une table Airtable, avec le nom du fichier et la date de téléchargement.
- Le contrat est désormais consultable en texte intégral dans Airtable, aucun copier-coller manuel n'est nécessaire.
- Une ligne Google Sheets avec un PDF L'URL déclenche le scénario pour chaque document hérité de la liste de migration.
- Un HTTP le module télécharge le PDF à partir de l'URL.
- L'extraction des ressources s'exécute avec les options Extraire le texte et Extraire les images activées.
- Le champ Textes est inséré dans un MySQL Enregistrement de base de données pour la recherche en texte intégral.
- Un itérateur télécharge chaque image extraite vers un SharePoint bibliothèque multimédia, achevant la migration de contenu sans jamais ouvrir la PDFs manuellement.