Aller au contenu principal

Comment extraire du texte de PDF numérisés avec Zapier : Regarder → OCR → Extraire (3 étapes)

· 12 minutes de lecture
SEO and Content Writer

Factures scannées, formulaires faxés ou captures d'écran enregistrées au format PDF : ils ressemblent à des documents, mais le texte n'est composé que de pixels. Impossible de le sélectionner, de le copier ou de l'intégrer à votre Zap. Solution : exécuter OCR en premier Pour rendre le PDF consultable, il faut ensuite extraire le texte. Voici un script Zap en trois étapes qui fait exactement cela, en utilisant Dropbox et PDF4me.

En un mot: Déposez un PDF dans Dropbox → Déclenche une action → La reconnaissance optique de caractères (OCR) le rend consultable → L'extraction de texte récupère le contenu. Texte intégralAssociez ce champ à Sheets, Airtable, à votre messagerie ou à tout autre système.

Ce que vous obtiendrez à la fin

Lorsqu'un fichier PDF arrive dans votre dossier Dropbox, Zap effectue une reconnaissance optique de caractères (si nécessaire) et extrait tout le texte dans un seul champ. Texte intégralVous pouvez ensuite intégrer ces données dans Google Sheets, Airtable, par e-mail ou pour toute autre étape. Le résultat comprend : Identifiant de trace pour le débogage et Informations sur le texte de la page pour plus de détails par page.

Extraction de texte à partir d'un PDF : texte intégral du document PDF d'exemple et lignes 1 à 10, identifiant de suivi, informations sur le texte de la page

Résultat du Zap : texte extrait, identifiant de trace et informations sur le texte de la page.


Pourquoi les PDF contenant des images ont besoin d'une reconnaissance optique de caractères (OCR) en premier lieu

Les PDF basés sur des images stockent le texte sous forme de pixels. Les outils d'extraction attendent une couche de texte et ne renvoient donc rien d'utile. Rendre les PDF consultables / OCR ajoute cette couche, puis Extraire du texte d'un PDF Vous pouvez tout lire. Ignorez l'étape de reconnaissance optique de caractères (OCR) uniquement si vos fichiers PDF contiennent déjà du texte sélectionnable (essayez de copier un mot dans un lecteur pour vérifier).


De quoi avez-vous besoin?

  • Zapier, Créer un compte Zapier et lancez un nouveau Zap.
  • Clé API PDF4me, Obtenez votre clé APIVous le connecterez lorsque vous ajouterez les actions PDF4me. Première fois ? Consultez Connectez PDF4me à Zapier.
  • DropboxNous utilisons Nouveau fichier dans le dossier comme déclencheur. Toute application de stockage qui se déclenche lors de la création de nouveaux fichiers convient également.

Le Zap en 3 étapes

  1. Nouveau fichier dans le dossier (Dropbox) : Montres /pdf4metest/ExtractText toutes les 2 minutes.
  2. Rendre les PDF consultables / OCR (PDF4me) : Transforme les PDF contenant des images en documents consultables.
  3. Extraire du texte d'un PDF (PDF4me) : Intègre le texte dans Texte intégral, Identifiant de trace, et Informations sur le texte de la page.
Flux de travail Zapier : Dropbox : Nouveau fichier dans un dossier (2 min) → PDF4me : Rendre le PDF consultable/OCR → PDF4me : Extraire le texte du PDF

Saisir: Un PDF basé sur une image (par exemple, Image To PDF.pdf) avec un contenu tel que « Exemple de document PDF » et des lignes numérotées. Sortir: Tout le texte dans Texte intégral, prêt pour la prochaine étape.

Exemple de document PDF : entrée basée sur une image avec 10 lignes numérotées

Exemple d'entrée : un PDF contenant des images qui nécessite une reconnaissance optique de caractères (OCR) avant l'extraction.


Étape 1 : Nouveau fichier dans le dossier (Déclencheur).

Zap jusqu'à présent : Déclencheur uniquement.

  1. Ajouter DropboxNouveau fichier dans le dossier comme déclencheur.
  2. Espace: Défaut (ou choisissez votre espace).
  3. Dossier *: /pdf4metest/ExtractText (ou votre dossier cible).
  4. Inclure les fichiers des sous-dossiers ?: FAUX (ou Vrai pour les dossiers imbriqués).
  5. Inclure le contenu du fichier ?: OuiLa réponse doit être « Oui » pour que le contenu du fichier soit transmis aux étapes suivantes.
  6. Inclure le lien de partage ?: Oui (facultatif).
  7. Cliquez Continuer et testez le déclencheur.
Nouveau fichier dans le dossier : Espace par défaut, Dossier /pdf4metest/ExtractText, Inclure le contenu du fichier : Oui, Inclure le lien de partage : Oui

Important: Ensemble Inclure le contenu du fichier ? à OuiSi la réponse est non, Zapier transmet une référence au lieu du fichier, et les étapes d'OCR et d'extraction échoueront.


Étape 2 : Rendre le PDF consultable / OCR (Action).

Zap jusqu'à présent : Déclencheur → Rendre le PDF consultable / OCR.

  1. Ajouter PDF4meRendre les PDF consultables / OCR.
  2. Déposer *: Carte 1. Fichier à partir du déclencheur Dropbox. Utilisez le champ contenant le contenu réel du fichier, et non « Fichier : (Existe mais non affiché) ».
  3. Nom de fichier: Carte 1. Nom du fichier et 1. Extension de fichier (par exemple Image To PDF + .pdf).
  4. Type de qualité *: Standard pour la plupart des fichiers PDF.
  5. Définir le processus comme asynchrone: FAUX Le Zap attend donc que la reconnaissance optique de caractères (OCR) soit terminée.
  6. Cliquez Continuer et test.
Rendre le PDF consultable / OCR : Fichier de l’étape 1, Nom du fichier Image vers PDF.pdf, Type de qualité Standard, Définir le processus sur Asynchrone : Non

L'étape OCR génère un PDF consultable. L'étape d'extraction utilise ce fichier.


Étape 3 : Extraire le texte du PDF (Action).

Zap jusqu'à présent : Déclencheur → OCR → Extraire le texte.

  1. Ajouter PDF4meExtraire du texte d'un PDF.
  2. Déposer *: Carte 2. URL du fichier à partir de l'étape OCR (le PDF traité).
  3. Nom de fichier: Carte 2. Nom complet du fichier (par exemple Image To PDF.pdf).
  4. Mode d'extraction *: Document complet pour tout le texte d'un seul champ, ou Page par page pour le rendu par page.
  5. Cliquez Continuer et test.
Extraction de texte d'un PDF : URL et nom complet du fichier issus de la reconnaissance optique de caractères (OCR), mode d'extraction : document complet

Sortir: L'action se termine Texte intégral (tout le texte extrait), Identifiant de trace (par exemple 5e4ba591-94c4-4b6c-ac3f-ca062d483981), et Informations sur le texte de la pagePour un exemple de PDF comme celui ci-dessus, vous verrez « Exemple de document PDF » suivi des lignes 1 à 10. Texte intégral.


Tableau de référence rapide

ÉtapeParamètres clésNotes
DéclenchementDossier : /pdf4metest/ExtractTextInclure le contenu du fichier : Oui
OCRType de qualité : StandardUtilisez le mode Expert pour les analyses de mauvaise qualité (plus d'appels API).
OCRDéfinir le processus comme asynchrone : FauxMaintient la synchronisation du Zap
ExtraitMode d'extraction : Document completTout le texte dans un seul champ
SortirTexte intégralAssociez cela aux étapes suivantes

Pour plus de détails sur les paramètres, consultez Extraire du texte d'un PDF : Zapier et OCR PDF, Zapier.


Dépannage.

"Fichier : (Existe mais n'est pas affiché)"

Cette option transmet souvent une référence au lieu du fichier. Choisissez le champ qui contient le contenu du fichier. Voir Conseils pour Zapier et Power Automate pour la gestion des fichiers.

« Fichier vide » ou aucun texte extrait

Assurer Inclure le contenu du fichier ? est Oui dans le déclencheur, et que vous mappez l'étape OCR URL du fichier (ou fichier de sortie) dans l'étape Extraction, et non un chemin d'accès ou des métadonnées.

Erreurs 401, 402 ou autres erreurs d'API

Dépannage de PDF4me couvre 401 (clé API), 402 (crédits), et plus encore.


Essayez l'API vous-même.

Tester l'API Extract Text sans créer de Zap :


Prochaines étapes.

C'est bon.
  • Déposez un fichier PDF de test dans votre dossier et exécutez le Zap. Vérifiez le résultat de l'étape d'extraction. Texte intégral.
  • Ajoutez une étape après l'extraction, par exemple « Ajouter la ligne à Google Sheets », « Envoyer un e-mail » ou « Mettre à jour Airtable », et mappez-la. Texte intégral dedans.
  • Activez Zap pour qu'il s'exécute lorsque de nouveaux fichiers PDF apparaissent dans le dossier.