Extraire les hyperliens de PDF dans Zapier
PDF4me Extraire les hyperliens de PDF est un Zapier action qui récupère tous les éléments cliquables URL hors d'un PDFLa couche d'annotation des liens, ainsi que le numéro de page où chaque lien apparaît, permet de vérifier les liens avant leur diffusion et de constituer une base de référence. URL base de données, ou alimenter un vérificateur de liens brisés sans ouvrir le fichier manuellement.
Que fait cette action ?
PDF4me Extraire les hyperliens de PDF récupère tous les éléments cliquables URL et la destination du lien intégrée dans PDF documents, à l'intérieur de vos Zapier Flux de travail. Utilisez le ciblage de pages pour analyser l'intégralité du document ou des pages spécifiques, et alimentez le flux de travail avec les données extraites. URLs dans Google Sheets pour les audits de liens, Airtable pour URL bases de données, vérificateurs de liens brisés, audits SEO, analyses de conformité, registres de migration de contenu, ou CRM systèmesRemplacez l'inspection manuelle des liens Adobe Acrobat par une extraction automatisée déclenchée par les chargements Dropbox, les pièces jointes Gmail, les soumissions de formulaires ou tout autre déclencheur Zap.
Authentification de votre API Demande
Pour accéder au PDF4me Web API à travers Zapier, chaque action doit être authentifiée. Cliquez Créer un nouveau compte La première fois, collez votre PDF4me API clé, les Zaps suivants réutilisent automatiquement la connexion.
Informations importantes à ne pas manquer
2 (pour la page 2 seulement) ou plages. Enregistre API prend du temps sur les documents volumineux et produit un résultat plus propre lorsque les liens se regroupent dans des sections connues (références, notes de bas de page, annexe).
Cartographier le PDF fichier, éventuellement limité à des pages spécifiques, et exécuter, le fichier extrait URLs sont disponibles dans le paquet de sortie, prêts pour le mappage en aval.
Paramètres
Requis: Le champ Fichier doit être associé à un PDF source. Spécifiez le nom du fichier et les pages (facultatifs), utilisez-les pour identifier la source ou restreindre la zone de recherche.
| Paramètre | Requis | Ce que cela fait | Exemple |
|---|---|---|---|
| File | Required | Input PDF from a previous Zap step. Map the file output of Dropbox, Google Drive, Gmail attachment, form trigger, or HTTP webhook. | 1. File: (Exists but not shown) |
| Specify File Name | Optional | Output file name identifier. Typically mapped from prior step (1. File Name + 1. File Ext). Used for audit reference in the response. | 1. File Name: drylab + 1. File Ext: .pdf |
| Pages | Optional | Page(s) to scan for hyperlinks. Use a single number (e.g. 2), comma-separated pages (1,2,3), ranges (1-10), or leave blank to scan all pages. | 2 |
Quelle valeur de pages dois-je utiliser ?
(vide)Document complet2page unique1,5,10Pages spécifiques1-10Plage de pagesChamps de sortie
| Champ | Taper | Ce qu'il contient |
|---|---|---|
Links / Hyperlinks | Array / Object | List of extracted URLs with page numbers and position metadata. Each entry contains the URL and where it was found in the document. |
File | String | Source file identifier echoed back for audit and tracking: useful when processing many PDFs through the same Zap. |
Comment configurer l'extraction des liens hypertextes à partir de PDF dans Zapier?
- Dans Zapier, cliquez + pour ajouter une nouvelle action et sélectionner PDF4me.
- Choisir Extraire les hyperliens de PDF comme événement d'action.
- Connectez votre PDF4me compte ou collez votre API appuyez sur la touche lorsque vous y êtes invité.
- Carte Déposer à la sortie binaire d'une étape précédente : nouveau fichier Dropbox, nouveau fichier Google Drive, pièce jointe Gmail ou charge utile webhook.
- Paramètre optionnel Spécifiez le nom du fichier par cartographie
File Name + File Extde l'étape précédente (utile pour suivre laquelle PDF le URLs (provient de). - Ensemble Pages pour limiter la numérisation à une page spécifique (par exemple,
2), pages séparées par des virgules (1,5,10), une gamme (1-10), ou laissez vide pour numériser toutes les pages. - Tester l'étape avec un échantillon PDF et vérifier les données extraites URLs L'affichage semble correct.
- Cartographiez les éléments extraits URLs actions en aval : Google Sheets (une ligne par URL), Airtable (base de données liée), Webhook par Zapier (vérification des liens brisés), ou Slack (alerte d'audit).
- Activez le Zap. Chaque nouveau PDF Votre déclencheur sera automatiquement scanné et son URLs poussé à destination.
Exemples de flux de travail
Exemples de flux de travailCommon Zapier workflow patterns using Extract Hyperlinks from PDF.
- Un dossier Google Drive est créé lorsqu'un nouveau client est créé. PDF est téléchargé pour examen.
- PDF4me La fonction Extraire les hyperliens analyse l'intégralité du document et renvoie tous les liens hypertextes. URLs.
- UN Zapier Le filtre vérifie la présence de domaines internes (intranet.company.com, internal-crm.com, dev.example.com). Si un domaine interne est détecté, le flux de travail est interrompu et Slack notifie l'auteur du document.
- Si seulement externe URLs sont détectés, le PDF Le document réussit l'audit et est téléchargé dans le dossier Dropbox partagé avec le client.
- Un journal Airtable enregistre le nom du document, le nombre de liens et le résultat de l'audit à des fins de reporting de conformité. Cela empêche la divulgation accidentelle d'informations internes. URLs dans les documents destinés aux clients.
- Un déclencheur Dropbox s'active lorsqu'un nouveau manuscrit, livre blanc ou rapport de recherche est téléchargé en vue de sa publication.
- PDF4me La fonction Extraire les hyperliens cible la section des références (pages = 25 à 30 pour un article typique).
- Chaque extrait URL est ajouté à une référence Airtable URLs" base avec titre du document, numéro de page et original URL.
- Un Zap programmé chaque nuit parcourt les enregistrements Airtable et exécute une HTTP requête HEAD contre chaque URL Pour vérifier l'état, les erreurs 404, les redirections ou les délais d'attente sont signalés dans une vue « Liens brisés ».
- Un résumé Google Sheets destiné aux auteurs met en évidence les documents contenant des références erronées, aidant ainsi les éditeurs à corriger les citations avant la publication finale.
- Une nouvelle brochure marketing ou une brochure d'une page PDF est téléchargé sur un SharePoint dossier avant le lancement de la campagne.
- PDF4me Extract Hyperlinks analyse l'intégralité PDF et renvoie chaque lien avec des références de page.
- UN Zapier L'étape Filtrer ou Coder valide chaque URL contient les paramètres UTM de la campagne (utm_source, utm_medium, utm_campaign) : tout lien sans UTM est signalé.
- Un fichier Google Sheets enregistre la brochure et les données extraites. URLset leur statut UTM. Le service marketing vérifie et corrige les paramètres de suivi manquants avant le lancement.
- Une fois tout URLs Une fois la validation UTM réussie, un message Slack confirme que la brochure est prête à être lancée et déclenche l'étape suivante du flux de travail de la campagne.