Aller au contenu principal

Extraire les hyperliens de PDF dans Zapier

PDF4me Extraire les hyperliens de PDF est un Zapier action qui récupère tous les éléments cliquables URL hors d'un PDFLa couche d'annotation des liens, ainsi que le numéro de page où chaque lien apparaît, permet de vérifier les liens avant leur diffusion et de constituer une base de référence. URL base de données, ou alimenter un vérificateur de liens brisés sans ouvrir le fichier manuellement.

Articles de blog connexes
Il n'y a pas encore d'article de blog consacré à cette fonctionnalité — à venir prochainement.
En attendant, n'hésitez pas à consulter le blog de PDF4me pour découvrir des tutoriels et des procédures de travail adaptés à toutes les plateformes.
Consultez le blog

Que fait cette action ?

PDF4me Extraire les hyperliens de PDF récupère tous les éléments cliquables URL et la destination du lien intégrée dans PDF documents, à l'intérieur de vos Zapier Flux de travail. Utilisez le ciblage de pages pour analyser l'intégralité du document ou des pages spécifiques, et alimentez le flux de travail avec les données extraites. URLs dans Google Sheets pour les audits de liens, Airtable pour URL bases de données, vérificateurs de liens brisés, audits SEO, analyses de conformité, registres de migration de contenu, ou CRM systèmesRemplacez l'inspection manuelle des liens Adobe Acrobat par une extraction automatisée déclenchée par les chargements Dropbox, les pièces jointes Gmail, les soumissions de formulaires ou tout autre déclencheur Zap.

Authentification de votre API Demande

Pour accéder au PDF4me Web API à travers Zapier, chaque action doit être authentifiée. Cliquez Créer un nouveau compte La première fois, collez votre PDF4me API clé, les Zaps suivants réutilisent automatiquement la connexion.

Informations importantes à ne pas manquer

Lit le PDF couche d'annotation, pas seulement du texte visible
L'action extrait les liens du PDFles annotations hypertextes structurées de , les mêmes liens cliquables qui s'activent lorsqu'un lecteur clique dans un PDF spectateur. Captures https URLs, adresses mailto:, ancres internes et liens téléphoniques tel:.
Ciblage par plage de pages : analysez uniquement ce qui compte.
Utilisez Pages pour cibler des pages spécifiques (par exemple, 2 (pour la page 2 seulement) ou plages. Enregistre API prend du temps sur les documents volumineux et produit un résultat plus propre lorsque les liens se regroupent dans des sections connues (références, notes de bas de page, annexe).
Indigène PDFs seulement, scanné PDFs besoin OCR d'abord
Numérisé ou photographié PDFs Il manque la couche d'annotation des hyperliens. Pour les documents sources numérisés, exécutez OCR Utilisez d'abord l'extraction de texte par expression avec un URL Un modèle d'expression régulière comme solution alternative.
Configuration de l'action Zapier PDF4me Extraire les hyperliens d'un PDF : champ Fichier, nom du fichier défini sur drylab.pdf et nombre de pages défini sur 2 pour l'extraction ciblée.

Cartographier le PDF fichier, éventuellement limité à des pages spécifiques, et exécuter, le fichier extrait URLs sont disponibles dans le paquet de sortie, prêts pour le mappage en aval.

Paramètres

Requis: Le champ Fichier doit être associé à un PDF source. Spécifiez le nom du fichier et les pages (facultatifs), utilisez-les pour identifier la source ou restreindre la zone de recherche.

ParamètreRequisCe que cela faitExemple
FileRequiredInput PDF from a previous Zap step. Map the file output of Dropbox, Google Drive, Gmail attachment, form trigger, or HTTP webhook.1. File: (Exists but not shown)
Specify File NameOptionalOutput file name identifier. Typically mapped from prior step (1. File Name + 1. File Ext). Used for audit reference in the response.1. File Name: drylab + 1. File Ext: .pdf
PagesOptionalPage(s) to scan for hyperlinks. Use a single number (e.g. 2), comma-separated pages (1,2,3), ranges (1-10), or leave blank to scan all pages.2

Quelle valeur de pages dois-je utiliser ?

(vide)Document complet
Laissez les pages vierges pour scanner chaque page, idéal pour les documents courts ou les audits complets.
2page unique
Une page spécifique, utile lorsque vous savez que les liens se regroupent sur une page connue (par exemple, les références sur la page 12).
1,5,10Pages spécifiques
Séparés par des virgules. Cibler plusieurs pages non contiguës, couverture, références, annexe.
1-10Plage de pages
Plage de texte avec tirets. Numérisez une section (chapitre, références) sans numériser l'intégralité du document.

Champs de sortie

ChampTaperCe qu'il contient
Links / HyperlinksArray / ObjectList of extracted URLs with page numbers and position metadata. Each entry contains the URL and where it was found in the document.
FileStringSource file identifier echoed back for audit and tracking: useful when processing many PDFs through the same Zap.

Comment configurer l'extraction des liens hypertextes à partir de PDF dans Zapier?

  1. Dans Zapier, cliquez + pour ajouter une nouvelle action et sélectionner PDF4me.
  2. Choisir Extraire les hyperliens de PDF comme événement d'action.
  3. Connectez votre PDF4me compte ou collez votre API appuyez sur la touche lorsque vous y êtes invité.
  4. Carte Déposer à la sortie binaire d'une étape précédente : nouveau fichier Dropbox, nouveau fichier Google Drive, pièce jointe Gmail ou charge utile webhook.
  5. Paramètre optionnel Spécifiez le nom du fichier par cartographie File Name + File Ext de l'étape précédente (utile pour suivre laquelle PDF le URLs (provient de).
  6. Ensemble Pages pour limiter la numérisation à une page spécifique (par exemple, 2), pages séparées par des virgules (1,5,10), une gamme (1-10), ou laissez vide pour numériser toutes les pages.
  7. Tester l'étape avec un échantillon PDF et vérifier les données extraites URLs L'affichage semble correct.
  8. Cartographiez les éléments extraits URLs actions en aval : Google Sheets (une ligne par URL), Airtable (base de données liée), Webhook par Zapier (vérification des liens brisés), ou Slack (alerte d'audit).
  9. Activez le Zap. Chaque nouveau PDF Votre déclencheur sera automatiquement scanné et son URLs poussé à destination.

Exemples de flux de travail

Exemples de flux de travailCommon Zapier workflow patterns using Extract Hyperlinks from PDF.
Audit des liens avant livraison → blocage des informations internes sensibles URLs
  1. Un dossier Google Drive est créé lorsqu'un nouveau client est créé. PDF est téléchargé pour examen.
  2. PDF4me La fonction Extraire les hyperliens analyse l'intégralité du document et renvoie tous les liens hypertextes. URLs.
  3. UN Zapier Le filtre vérifie la présence de domaines internes (intranet.company.com, internal-crm.com, dev.example.com). Si un domaine interne est détecté, le flux de travail est interrompu et Slack notifie l'auteur du document.
  4. Si seulement externe URLs sont détectés, le PDF Le document réussit l'audit et est téléchargé dans le dossier Dropbox partagé avec le client.
  5. Un journal Airtable enregistre le nom du document, le nombre de liens et le résultat de l'audit à des fins de reporting de conformité. Cela empêche la divulgation accidentelle d'informations internes. URLs dans les documents destinés aux clients.
Édition → référence URL base de données → audit des liens brisés
  1. Un déclencheur Dropbox s'active lorsqu'un nouveau manuscrit, livre blanc ou rapport de recherche est téléchargé en vue de sa publication.
  2. PDF4me La fonction Extraire les hyperliens cible la section des références (pages = 25 à 30 pour un article typique).
  3. Chaque extrait URL est ajouté à une référence Airtable URLs" base avec titre du document, numéro de page et original URL.
  4. Un Zap programmé chaque nuit parcourt les enregistrements Airtable et exécute une HTTP requête HEAD contre chaque URL Pour vérifier l'état, les erreurs 404, les redirections ou les délais d'attente sont signalés dans une vue « Liens brisés ».
  5. Un résumé Google Sheets destiné aux auteurs met en évidence les documents contenant des références erronées, aidant ainsi les éditeurs à corriger les citations avant la publication finale.
Audit des brochures marketing → UTM/suivi URL vérification
  1. Une nouvelle brochure marketing ou une brochure d'une page PDF est téléchargé sur un SharePoint dossier avant le lancement de la campagne.
  2. PDF4me Extract Hyperlinks analyse l'intégralité PDF et renvoie chaque lien avec des références de page.
  3. UN Zapier L'étape Filtrer ou Coder valide chaque URL contient les paramètres UTM de la campagne (utm_source, utm_medium, utm_campaign) : tout lien sans UTM est signalé.
  4. Un fichier Google Sheets enregistre la brochure et les données extraites. URLset leur statut UTM. Le service marketing vérifie et corrige les paramètres de suivi manquants avant le lancement.
  5. Une fois tout URLs Une fois la validation UTM réussie, un message Slack confirme que la brochure est prête à être lancée et déclenche l'étape suivante du flux de travail de la campagne.

Foire aux questions

What types of links does Extract Hyperlinks from PDF find?+
The action extracts all clickable hyperlinks present in the PDF: including external URLs (https links to websites), mailto: email links, internal document anchors (cross-references within the PDF), and tel: phone links, following the URI syntax defined in <a href="https://www.rfc-editor.org/rfc/rfc3986" target="_blank" rel="noopener noreferrer">RFC 3986</a>. Each extracted link includes the URL itself and metadata such as the page number where it appears and its position on the page. The action retrieves links that are part of the PDF's hyperlink annotation layer: these are the same clickable links that would activate when a reader clicks on the link text in a PDF reader like Adobe Reader, Chrome PDF Viewer, or Preview.
Can I extract links from specific pages or page ranges?+
Yes. The Pages field accepts a single page number (e.g. 2 to extract only from page 2), individual pages (1,2,3), or ranges (1-10). Leave the field blank or use a broader range to scan the whole document. Page-range targeting is useful when you know links are concentrated in a references section, footnotes, appendix, or specific chapter: saving API time and producing a cleaner output list focused on the section you care about.
Does the action find links in scanned PDFs or only in native PDFs?+
Extract Hyperlinks operates on the PDF's hyperlink annotation layer, defined as Link Annotations in <a href="https://www.pdfa.org/resource/iso-32000-pdf/" target="_blank" rel="noopener noreferrer">the ISO 32000 PDF specification</a>, the structured link data embedded in native digital PDFs (those created from Word, Google Docs, browser print, InDesign, web-to-PDF tools, or any application that creates clickable links). Scanned PDFs and photographed PDFs typically lack this annotation layer because the URLs are part of the image rather than clickable text annotations. To extract URLs from scanned PDFs, first run an OCR step to add a searchable text layer (use Convert PDF to Editable PDF Using OCR), then use Extract Text by Expression with a URL regex pattern (e.g. https?://[^\s]+) as an alternative extraction path.
How can I use the extracted URLs to check for broken links?+
Pipe the URL output from Extract Hyperlinks into a follow-up step in your Zap: a Webhook by Zapier HTTP request to each URL with method HEAD, an HTTP step to a link-checker service like brokenlinkcheck.com API, or a custom Code by Zapier step that requests each URL and reports the status code (200 OK, 404 Not Found, 301/302 redirect, timeout). Store results in Google Sheets or Airtable for periodic audit, or trigger a Slack alert when broken links are detected. This is a common compliance-and-quality workflow for publishers verifying citations, legal teams checking exhibits, and content marketing teams auditing campaign assets.
How does this compare to manually extracting links in Adobe Acrobat or other PDF tools?+
Adobe Acrobat Pro can list links one PDF at a time via Tools → Edit PDF → Link panel, but extracting links across many files requires custom JavaScript scripts or third-party plugins. Online tools like PDF24, Sejda, or various "PDF link extractor" web tools handle one-off extraction but lack automation and have free-tier file limits. The PDF4me Zapier action automates the same extraction at scale: every new PDF arriving in your trigger (Dropbox folder, Gmail attachment, webhook from your DMS) is automatically scanned for hyperlinks and the URLs are pushed to your spreadsheet, database, or audit tool. Ideal for ongoing publishing workflows, compliance scans, SEO audits of PDF content, content migration registries, and any pipeline where every PDF needs its links cataloged.

Actions connexes

Obtenez de l'aide