Extraction de texte à partir de PDF dans Power Automate : y compris les documents numérisés et les images

Vous avez des fichiers PDF dans Dropbox, SharePoint ou par e-mail ; certains sont en texte brut, d’autres sont numérisés ou composés d’images, et vous avez besoin de les exporter de manière fiable. Le problème : Les PDF basés sur des images ne contiennent pas de texte sélectionnable.Ils ont d'abord besoin d'une reconnaissance optique de caractères (OCR). Une fois qu'ils sont consultables, PDF4me Extraire du texte et des images attire tout un appel: pas de deuxième lecture, pas de crédits API gaspillés.
Ce guide vous présente un flux de travail qui gère les deux : déclenchement → obtenir le contenu du fichier (Dropbox) → Convertir un PDF en PDF modifiable grâce à la reconnaissance optique de caractères (OCR) (pour les documents numérisés) → Extraire du texte et des images (PDF4me). Vous obtenez la structure de sortie exacte ainsi que des liens pour dépanner et tester l'API vous-même.
Pourquoi un seul appel compte.
Lorsque vous créez des flux qui divisent des documents, renomment des fichiers ou acheminent du contenu, vous avez souvent besoin d'extraire le texte et les images de chaque PDF. Relire chaque document en boucle consomme beaucoup d'appels API et ralentit les flux. Extraire du texte et des images Renvoie le contenu textuel et les images intégrées dans une seule réponse. Vous obtenez tout ce dont vous avez besoin : texte, noms de fichiers image et données d’image encodées en Base64. Les actions suivantes peuvent ainsi renommer, acheminer ou archiver les fichiers sans lecture supplémentaire.
Pour un conseil : Besoin de diviser les PDF par code-barres et de renommer chaque fichier en fonction de son code-barres ? Utilisez Fractionner le PDF par code-barres: il retourne code-barresTexte La réponse est identique pour chaque division, vous pouvez donc renommer sans un second appel. Consultez notre Fractionner un PDF par code-barres dans Power Automate guide.
De quoi avez-vous besoin?
- Power Automate, Ouvrir Power Automate, connectez-vous et créez un nouveau flux cloud (instantané ou automatisé).
- Clé API PDF4me, Obtenez votre clé APIVous établirez une connexion en ajoutant les actions PDF4me. Première fois ? Consultez Connectez PDF4me à Power Automate.
- DropboxNous l'utilisons pour Récupérer le contenu du fichierSharePoint, OneDrive ou tout autre connecteur permettant d'accéder au contenu des fichiers fonctionne également.
Aperçu du flux (4 étapes).
- Déclencher manuellement un flux: Démarrer le flux à la demande (ou utiliser Lorsqu'un fichier est créé (dans Dropbox pour l'automatisation).
- Récupérer le contenu du fichier à l'aide du chemin d'accès (Dropbox) : Récupère le PDF à partir d’un chemin comme
/pdf4metest/extracttext/image to pdf.pdf. - PDF : Convertir un PDF en PDF modifiable grâce à la reconnaissance optique de caractères (OCR) (PDF4me) : Convertit les PDF numérisés/contenant des images en texte consultable. Ignorez cette étape si vos PDF sont déjà consultables.
- PDF : Extraire le texte et les images (PDF4me) : Renvoie le texte intégral et toutes les images intégrées dans une seule réponse.

Saisir: Un PDF (à base d'images ou de texte). Sortir: Contenu textuel dans texts tableau et images dans images tableau avec fileName et streamFile (Base64).

Exemple d'entrée : PDF contenant une image avec du texte extractible après OCR
Étape 1 : Déclencher + Obtenir le contenu du fichier.
Flux jusqu'à présent : Déclencheur → Obtenir le contenu du fichier.
- Ajouter Déclencher manuellement un flux (ou Lorsqu'un fichier est créé (dans Dropbox pour l'automatisation).
- Ajouter Dropbox → Récupérer le contenu du fichier à l'aide du chemin d'accès.
- Paramètres :
- Chemin du fichier *, Saisissez le chemin d'accès à votre fichier PDF, par exemple :
/pdf4metest/extracttext/image to pdf.pdfUtilisez l'icône du dossier pour naviguer si nécessaire. - Paramètres avancés → Déduire le type de contenu: Définir sur Oui.
- Connexion: Assurer Connecté à Dropbox.
Le résultat est le contenu du fichier (binaire). Associez-le à Contenu du fichier dans l'action OCR (et plus tard dans Extraire du texte et des images).
Attention : Assurez-vous de cartographier le terrain réel. Contenu du fichier Le résultat doit correspondre au fichier binaire, et non à son chemin d'accès ou à ses métadonnées. Power Automate propose parfois plusieurs options dans la liste déroulante ; choisissez celle qui contient le fichier binaire.

Étape 2 : Convertir le PDF en PDF modifiable à l'aide de la reconnaissance optique de caractères (pour les PDF basés sur des images).
Flux jusqu'à présent : Déclencheur → Obtenir le contenu du fichier → Convertir le PDF en PDF modifiable à l'aide de la reconnaissance optique de caractères (OCR).
Si votre PDF est un fichier numérisé ou composé d'images, ajoutez cette étape pour que le texte soit consultable avant l'extraction. Si votre PDF contient déjà du texte sélectionnable, essayez de copier un mot dans un lecteur ; vous pouvez ensuite passer à l'étape 3 et transmettre directement le contenu du fichier à l'outil d'extraction de texte et d'images.
- Ajouter PDF4me → PDF : Convertir un PDF en PDF modifiable grâce à la reconnaissance optique de caractères (OCR).
- Paramètres :
- Contenu du fichier *, Carte Récupérer le contenu du fichier à l'aide du chemin d'accès sortie (le fichier binaire PDF).
- Nom de fichier *, Entrez un nom tel que
Test.pdfou le nom du fichier source. - Type de qualité: Brouillon pour les PDF normaux (1 appel API par fichier) ou Haut pour les PDF scannés/basés sur des images (2 appels API par page).
- OCR uniquement en cas de besoin: FAUX toujours exécuter la reconnaissance optique de caractères (OCR), ou Oui ignorer cette étape si le PDF est déjà consultable (cela permet d'économiser des appels API).
- Langue: Définir sur la langue du document source (par exemple,
en) si nécessaire pour une meilleure précision de la reconnaissance optique de caractères (OCR). - Est-ce asynchrone ?: Non pour les flux synchrones (recommandé pour les flux).
- Connexion: Connecté à PDF4me PDF.

Étape 3 : Extraire le texte et les images.
Flux jusqu'à présent : … → Convertir un PDF en PDF modifiable à l'aide de la reconnaissance optique de caractères (OCR) → Extraire le texte et les images.
- Ajouter PDF4me → PDF : Extraire le texte et les images.
- Paramètres :
- Contenu du fichier *, Mapper la sortie de PDF, Convertir un PDF en PDF modifiable grâce à la reconnaissance optique de caractères (OCR) (ou directement à partir de Récupérer le contenu du fichier (si vous avez ignoré la reconnaissance optique de caractères).
- Nom de fichier *, Entrez un nom tel que
New.pdfou le nom du fichier source. - Extraire le texte: Oui extraire du texte.
- Extraire des images: Oui pour extraire les images intégrées (ou Non (si vous n'avez besoin que du texte).
- Connexion: Connecté à PDF4me PDF.

Sortir: L'action se termine corps avec:
- textes: Tableau de chaînes de caractères contenant tout le texte extrait (sauts de ligne comme
\n). - images: Tableau d'objets :
fileName(par exemplepage001_image001.jpg) etstreamFile(Base64). Utilisez-les dans les actions suivantes pour enregistrer ou traiter les images.

Référence des paramètres et des résultats.
Voici un récapitulatif rapide du matériel utilisé. Adaptez-le à votre configuration.
| Étape | Paramètre | Valeur | Notes |
|---|---|---|---|
| Récupérer le fichier | Chemin du fichier | /pdf4metest/extrairetexte/... | Votre chemin Dropbox |
| Récupérer le fichier | Déduire le type de contenu | Oui | Permet à Power Automate de gérer le fichier |
| OCR | Type de qualité | Brouillon | Utiliser Haut pour les documents numérisés complexes |
| OCR | OCR uniquement en cas de besoin | FAUX | Réglé sur Oui pour économiser les appels API si le texte est déjà consultable |
| Extrait | Extraire du texte / des images | Oui / Oui | Désactivez ce dont vous n'avez pas besoin pour accélérer les choses. |
| Sortir | corps.textes | Tableau de chaînes de caractères | Tout le texte extrait |
| Sortir | images du corps | nom_de_fichier, fichier_flux | Données d'image Base64 pour chaque image |
Pour plus de détails sur les paramètres, consultez Extraction de texte et d'images : Power Automate et Convertir un PDF en PDF modifiable grâce à la reconnaissance optique de caractères (OCR).
Dépannage.
Il arrive parfois que les choses tournent mal. Voici ce qui y remédie généralement :
Cela signifie généralement que le mauvais champ a été mappé. Utilisez celui qui contient la valeur réelle. contenu du fichier, et non le chemin d'accès ou une référence. Le menu déroulant de Power Automate peut s'avérer complexe dans ce cas. Voir Conseils pour Zapier et Power Automate pour le Base64 et la gestion des fichiers.
L'extraction de texte et d'images nécessite un PDF. Si votre source est une image, convertissez-la d'abord avec Convertir en PDF, puis transmettez le résultat.
Vérifier Dépannage de PDF4me pour les erreurs 401 (clé API), 402 (crédits) et les correctifs spécifiques à la plateforme.
Essayez l'API de manière interactive.
Testez l'API Extract Text and Images sans Power Automate grâce à notre Tests d'API: Téléchargez un PDF et consultez la réponse :
Prochaines étapes.
- Déposez un fichier PDF de test dans votre dossier et exécutez le processus, vérifiez le corps sortie pour
textesetimages. - Alimentation
textesdans Compose, Parse JSON ou Conditions ; utiliserimagesavec Créer un fichier ou toute autre action de stockage. - Échanger Déclenchement manuel pour Lorsqu'un fichier est créé (Dropbox) et reliez le chemin d'accès au fichier du déclencheur à Récupérer le contenu du fichier pour une automatisation sans intervention.