Comment extraire du texte de PDF numérisés avec Zapier : Regarder → OCR → Extraire (3 étapes)

Factures scannées, formulaires faxés ou captures d'écran enregistrées au format PDF : ils ressemblent à des documents, mais le texte n'est composé que de pixels. Impossible de le sélectionner, de le copier ou de l'intégrer à votre Zap. Solution : exécuter OCR en premier Pour rendre le PDF consultable, il faut ensuite extraire le texte. Voici un script Zap en trois étapes qui fait exactement cela, en utilisant Dropbox et PDF4me.
En un mot: Déposez un PDF dans Dropbox → Déclenche une action → La reconnaissance optique de caractères (OCR) le rend consultable → L'extraction de texte récupère le contenu. Texte intégralAssociez ce champ à Sheets, Airtable, à votre messagerie ou à tout autre système.
Ce que vous obtiendrez à la fin
Lorsqu'un fichier PDF arrive dans votre dossier Dropbox, Zap effectue une reconnaissance optique de caractères (si nécessaire) et extrait tout le texte dans un seul champ. Texte intégralVous pouvez ensuite intégrer ces données dans Google Sheets, Airtable, par e-mail ou pour toute autre étape. Le résultat comprend : Identifiant de trace pour le débogage et Informations sur le texte de la page pour plus de détails par page.

Résultat du Zap : texte extrait, identifiant de trace et informations sur le texte de la page.
Pourquoi les PDF contenant des images ont besoin d'une reconnaissance optique de caractères (OCR) en premier lieu
Les PDF basés sur des images stockent le texte sous forme de pixels. Les outils d'extraction attendent une couche de texte et ne renvoient donc rien d'utile. Rendre les PDF consultables / OCR ajoute cette couche, puis Extraire du texte d'un PDF Vous pouvez tout lire. Ignorez l'étape de reconnaissance optique de caractères (OCR) uniquement si vos fichiers PDF contiennent déjà du texte sélectionnable (essayez de copier un mot dans un lecteur pour vérifier).
De quoi avez-vous besoin?
- Zapier, Créer un compte Zapier et lancez un nouveau Zap.
- Clé API PDF4me, Obtenez votre clé APIVous le connecterez lorsque vous ajouterez les actions PDF4me. Première fois ? Consultez Connectez PDF4me à Zapier.
- DropboxNous utilisons Nouveau fichier dans le dossier comme déclencheur. Toute application de stockage qui se déclenche lors de la création de nouveaux fichiers convient également.
Le Zap en 3 étapes
- Nouveau fichier dans le dossier (Dropbox) : Montres
/pdf4metest/ExtractTexttoutes les 2 minutes. - Rendre les PDF consultables / OCR (PDF4me) : Transforme les PDF contenant des images en documents consultables.
- Extraire du texte d'un PDF (PDF4me) : Intègre le texte dans Texte intégral, Identifiant de trace, et Informations sur le texte de la page.

Saisir: Un PDF basé sur une image (par exemple, Image To PDF.pdf) avec un contenu tel que « Exemple de document PDF » et des lignes numérotées. Sortir: Tout le texte dans Texte intégral, prêt pour la prochaine étape.

Exemple d'entrée : un PDF contenant des images qui nécessite une reconnaissance optique de caractères (OCR) avant l'extraction.
Étape 1 : Nouveau fichier dans le dossier (Déclencheur).
Zap jusqu'à présent : Déclencheur uniquement.
- Ajouter Dropbox → Nouveau fichier dans le dossier comme déclencheur.
- Espace: Défaut (ou choisissez votre espace).
- Dossier *:
/pdf4metest/ExtractText(ou votre dossier cible). - Inclure les fichiers des sous-dossiers ?: FAUX (ou Vrai pour les dossiers imbriqués).
- Inclure le contenu du fichier ?: OuiLa réponse doit être « Oui » pour que le contenu du fichier soit transmis aux étapes suivantes.
- Inclure le lien de partage ?: Oui (facultatif).
- Cliquez Continuer et testez le déclencheur.

Important: Ensemble Inclure le contenu du fichier ? à OuiSi la réponse est non, Zapier transmet une référence au lieu du fichier, et les étapes d'OCR et d'extraction échoueront.
Étape 2 : Rendre le PDF consultable / OCR (Action).
Zap jusqu'à présent : Déclencheur → Rendre le PDF consultable / OCR.
- Ajouter PDF4me → Rendre les PDF consultables / OCR.
- Déposer *: Carte 1. Fichier à partir du déclencheur Dropbox. Utilisez le champ contenant le contenu réel du fichier, et non « Fichier : (Existe mais non affiché) ».
- Nom de fichier: Carte 1. Nom du fichier et 1. Extension de fichier (par exemple
Image To PDF+.pdf). - Type de qualité *: Standard pour la plupart des fichiers PDF.
- Définir le processus comme asynchrone: FAUX Le Zap attend donc que la reconnaissance optique de caractères (OCR) soit terminée.
- Cliquez Continuer et test.

L'étape OCR génère un PDF consultable. L'étape d'extraction utilise ce fichier.
Étape 3 : Extraire le texte du PDF (Action).
Zap jusqu'à présent : Déclencheur → OCR → Extraire le texte.
- Ajouter PDF4me → Extraire du texte d'un PDF.
- Déposer *: Carte 2. URL du fichier à partir de l'étape OCR (le PDF traité).
- Nom de fichier: Carte 2. Nom complet du fichier (par exemple
Image To PDF.pdf). - Mode d'extraction *: Document complet pour tout le texte d'un seul champ, ou Page par page pour le rendu par page.
- Cliquez Continuer et test.

Sortir: L'action se termine Texte intégral (tout le texte extrait), Identifiant de trace (par exemple 5e4ba591-94c4-4b6c-ac3f-ca062d483981), et Informations sur le texte de la pagePour un exemple de PDF comme celui ci-dessus, vous verrez « Exemple de document PDF » suivi des lignes 1 à 10. Texte intégral.
Tableau de référence rapide
| Étape | Paramètres clés | Notes |
|---|---|---|
| Déclenchement | Dossier : /pdf4metest/ExtractText | Inclure le contenu du fichier : Oui |
| OCR | Type de qualité : Standard | Utilisez le mode Expert pour les analyses de mauvaise qualité (plus d'appels API). |
| OCR | Définir le processus comme asynchrone : Faux | Maintient la synchronisation du Zap |
| Extrait | Mode d'extraction : Document complet | Tout le texte dans un seul champ |
| Sortir | Texte intégral | Associez cela aux étapes suivantes |
Pour plus de détails sur les paramètres, consultez Extraire du texte d'un PDF : Zapier et OCR PDF, Zapier.
Dépannage.
Cette option transmet souvent une référence au lieu du fichier. Choisissez le champ qui contient le contenu du fichier. Voir Conseils pour Zapier et Power Automate pour la gestion des fichiers.
Assurer Inclure le contenu du fichier ? est Oui dans le déclencheur, et que vous mappez l'étape OCR URL du fichier (ou fichier de sortie) dans l'étape Extraction, et non un chemin d'accès ou des métadonnées.
Dépannage de PDF4me couvre 401 (clé API), 402 (crédits), et plus encore.
Essayez l'API vous-même.
Tester l'API Extract Text sans créer de Zap :
Prochaines étapes.
- Déposez un fichier PDF de test dans votre dossier et exécutez le Zap. Vérifiez le résultat de l'étape d'extraction.
Texte intégral. - Ajoutez une étape après l'extraction, par exemple « Ajouter la ligne à Google Sheets », « Envoyer un e-mail » ou « Mettre à jour Airtable », et mappez-la. Texte intégral dedans.
- Activez Zap pour qu'il s'exécute lorsque de nouveaux fichiers PDF apparaissent dans le dossier.