Convertir un PDF en fichier texte dans Power Automate : Transformez vos contrats numérisés en un corpus SharePoint consultable avec PDF4me

PDF4me Extraire du texte et des images Cette action Power Automate renvoie la couche texte d'un PDF sous forme de tableau. Associée à la reconnaissance optique de caractères (OCR) en amont et à une jointure Compose en aval, cette opération transforme chaque PDF déposé dans une bibliothèque SharePoint en un document correspondant. .txt Fichier prêt pour la recherche par IA.
Recherchez comment faire cela et le premier résultat est celui de Microsoft. Référence des actions PDF, qui décrit Power Automate Ordinateur de bureau Ces actions n'existent pas dans un flux cloud. Ce détail explique pourquoi les deux résultats suivants sont une discussion Reddit et une discussion de la communauté Power Platform où des utilisateurs posent la même question sans obtenir de réponse claire. Ce flux constitue la réponse directe et s'exécute entièrement dans le cloud sur des connecteurs de niveau standard.
Un fichier PDF est ajouté à une bibliothèque SharePoint. Un déclencheur signale ce nouvel élément, l'outil « Obtenir le contenu du fichier » récupère ses octets, et PDF4me effectue une reconnaissance optique de caractères (OCR) uniquement si nécessaire avant d'extraire le texte sous forme de tableau. Une simple expression « Composer » concatène ce tableau en une chaîne de caractères, et SharePoint enregistre le résultat dans un fichier texte brut. Six actions, aucun connecteur premium, et l'ensemble du processus s'achève en une douzaine de secondes.
Questions et réponses basées sur le pourquoi
Pourquoi écrire un fichier .txt au lieu d'utiliser directement le texte dans le flux ? Une chaîne de caractères au sein d'un flux est conservée pendant toute la durée de son exécution. Un fichier dans une bibliothèque est durable, indexable et accessible par tout système auquel vous le destinez ultérieurement, qu'il s'agisse de la recherche SharePoint, d'une base de données vectorielle ou d'un chatbot récupérant le contexte.
Pourquoi faut-il deux actions pour obtenir un seul fichier ? Le déclencheur « propriétés uniquement » est volontairement léger. Il signale l'apparition d'un élément et vous fournit ses métadonnées, notamment un identifiant, mais pas le contenu du fichier. Le déclencheur « Obtenir le contenu du fichier » remplace cet identifiant par le document lui-même. Cette séparation permet de maintenir la rapidité du déclencheur et de filtrer les métadonnées avant même de télécharger quoi que ce soit.
Pourquoi utiliser la reconnaissance optique de caractères (OCR) alors que la plupart des fichiers PDF contiennent déjà du texte ? Parce qu'on ne peut pas le distinguer visuellement. Un contrat scanné et un contrat numérique natif sont indiscernables dans un dossier. L'action de reconnaissance optique de caractères (OCR) OCR uniquement en cas de besoin Ce paramètre examine chaque fichier et ignore ceux qui contiennent déjà une couche de texte ; vous ne payez donc que là où cela est nécessaire.
Pourquoi une étape de composition est-elle nécessaire ? Extraction de texte et d'images texts Sous forme de tableau, généralement une entrée par page. Écrire un tableau directement dans un fichier génère des crochets JSON et des guillemets échappés. Compose assemble les entrées en un texte propre avant toute écriture sur le disque.
Ce que vous obtiendrez
Saisir: Tout fichier PDF déposé dans une bibliothèque de documents SharePoint, qu'il soit numérisé ou nativement numérique, ne nécessite aucune convention de nommage. Sortir: un fichier texte brut par PDF dans une seconde bibliothèque, contenant l'intégralité du contenu lisible du document.

RagInput. Déposez un PDF ici et le processus démarre.

RagText. Un fichier texte brut par PDF, prêt à être indexé.
Voici ce qui ressort de l'autre côté pour l'exemple de contrat, exactement tel qu'il est écrit sur le disque :
MASTER SERVICES AGREEMENT
Between Initech LLC and Umbrella Inc.
Effective date: 1 January 2026. Auto-renews annually.
Liability cap: USD 100000. Confidentiality: 5 years.
CLEAN TEST MARKER: PDF4ME-CLEAN-TEST-2026.
Notez les espaces en début de texte. La reconnaissance optique de caractères (OCR) préserve les espaces blancs de la mise en page, ce qui convient parfaitement à la recherche et à l'alimentation d'un modèle de langage. Supprimez-les ultérieurement si l'analyseur syntaxique en aval est plus exigeant.
Ce dont vous avez besoin
- Power Automate. Ouvrir Power AutomateIl s'agit d'un flux cloud. Tout ici est de niveau standard, sans connecteur premium ni passerelle.
- Clé API PDF4me. Obtenez votre clé APIConnectez-le la première fois que vous ajoutez une action PDF4me.
- Un site SharePoint avec deux dossiersUn dossier pour les fichiers PDF en entrée et un autre pour le texte en sortie. Créez-les tous les deux avant la compilation, afin que les sélecteurs de dossiers aient des répertoires de destination.
- Un PDF de test. exemple-de-contrat.pdf. Un court contrat de services avec une ligne de repère que vous pouvez rechercher.
Commencez par prendre les échantillons. Une fois le flux enregistré, téléchargez le PDF dans votre dossier d'entrée, puis comparez le contenu du dossier de sortie avec le fichier texte attendu.
Aperçu du flux
- Lors de la création d'un fichier (propriétés uniquement) (Déclencheur SharePoint) limité à
/Shared Documents/RagInput. - Récupérer le contenu du fichier en utilisant la gâchette
Identifier. - PDF - Convertir un PDF en PDF modifiable grâce à la reconnaissance optique de caractères (OCR) de qualité
Draftet la reconnaissance optique de caractères (OCR) uniquement lorsque nécessairetrue. - PDF - Extraire le texte et les images avec Extraction de texte
Yeset extraire des imagesNo. - Composer gérer un
join()sur le retourtextstableau. - Créer un fichier Écriture (SharePoint)
.txtdans/Shared Documents/RagText.
Aperçu complet du flux

L'épreuve OCR est la seule à accuser un retard important, avec un temps de 11 secondes. Les cinq autres épreuves se terminent en moins d'une demi-seconde chacune.
Étape 1 : Comment surveiller une bibliothèque SharePoint pour détecter les nouveaux fichiers PDF ?
Flux jusqu'à présent : Rien pour l'instant, voici le déclencheur.
Utiliser Lors de la création d'un fichier (propriétés uniquement)Cette fonction se déclenche lors de la création de nouveaux éléments et renvoie leurs métadonnées. Limitez-la à un seul dossier, car une surveillance globale de la bibliothèque est déclenchée à chaque ajout effectué dans ce dossier.
- Créez un Flux cloud automatisé et choisir Lors de la création d'un fichier (propriétés uniquement).
- Configure:
- Adresse du site:
https://ynoox1.sharepoint.com/sites/PDF4meSharepoints - Nom de la bibliothèque: prendre Documents à partir du menu déroulant
- Adresse du site:
- Ouvrir Paramètres avancés, ajouter Dossier, et le régler sur
/Shared Documents/RagInput.
Configuration du déclencheur SharePoint

Le nom de la bibliothèque correspond à la bibliothèque elle-même, Documents. Le paramètre Dossier situé en dessous permet de limiter le déclenchement à un dossier spécifique à l'intérieur de celle-ci.
Conseil. Vous trouverez également un déclencheur appelé Lorsqu'un fichier est créé dans un dossierCette méthode renvoie directement les octets du fichier et vous évite l'étape suivante. Elle est obsolète ; privilégiez donc la combinaison de propriétés uniquement présentée ici pour toute application que vous souhaitez continuer à exécuter.
Étape 2 : Pourquoi avez-vous besoin de récupérer le contenu du fichier après le déclenchement ?
Flux jusqu'à présent : Déclencheur SharePoint.
Le déclencheur « propriétés uniquement » transmet les métadonnées, et non le document. L'option « Obtenir le contenu du fichier » échange les données du déclencheur. Identifier pour les octets réels dont PDF4me a besoin.
- Ajouter SharePoint > Récupérer le contenu du fichier.
- Configure:
- Adresse du site: le même site que le déclencheur
- Identifiant de fichier:
Identifierà partir du déclencheur
- Ouvrir Paramètres avancés et ensemble Déduire le type de contenu à
Yes.
Obtenir la configuration du contenu du fichier

Infer content type Yes permet de transmettre à l'action suivante de véritables octets PDF au lieu d'un blob générique.
L'identifiant est le point de jonction entre les deux étapes. Utilisez la gâchette Identifiant Le champ concerné, et non le nom du fichier ou son chemin d'accès, est l'identifiant. Les noms se répètent d'un dossier à l'autre et changent lorsqu'un document est renommé. L'identifiant, lui, reste inchangé.
Étape 3 : Pourquoi effectuer une reconnaissance optique de caractères (OCR) avant d’extraire le texte ?
Flux jusqu'à présent : Déclencheur SharePoint plus Récupérer le contenu du fichier.
Une page numérisée est une image. Il n'y a pas de texte à extraire tant que la reconnaissance optique de caractères (OCR) n'y a pas ajouté de couche de texte. Cette fonction effectue cette opération et est suffisamment intelligente pour ne pas toucher aux PDF déjà lisibles.
- Ajouter PDF - Convertir un PDF en PDF modifiable grâce à la reconnaissance optique de caractères (OCR).
- Configure:
- Contenu du fichier:
File Contentdepuis Récupérer le contenu du fichier - Nom de fichier: le jeton du nom de fichier du déclencheur
- Type de qualité:
Draft - OCR uniquement en cas de besoin:
true - Langue: laissez vide sauf si vos documents ne sont pas en anglais
- Est-ce asynchrone ?:
No
- Contenu du fichier:
Paramètres OCR
| Paramètre | Valeur utilisée ici | Ce qu'il contrôle |
|---|---|---|
| Contenu du fichier | File Content à partir de Obtenir le contenu du fichier | Les octets du PDF à traiter. |
| Nom de fichier | jeton de nom de fichier déclencheur | Nom de la source, utilisé pour l'identification du traitement. |
| Type de qualité | Draft | Effort de reconnaissance. Draft est suffisamment rapide et précis pour des numérisations nettes. Passez à High pour des originaux de mauvaise qualité. |
| OCR uniquement en cas de besoin | true | Ignore les fichiers qui contiennent déjà une couche de texte ; les PDF natifs numériques sont donc traités sans problème. |
| Langue | vide | Indice pour le moteur de reconnaissance. Laisser vide pour l'anglais. |
| Est-ce asynchrone ? | No | Attendre le résultat en temps réel. Passer à Yes pour les documents très volumineux. |

Le type de qualité est ici défini sur Brouillon. Sur une numérisation propre, la qualité est aussi bonne qu'avec le type Élevé, mais le temps de lecture est réduit.
Conseil. C'est l'étape lente : 11 secondes pour la course ci-dessus contre une demi-seconde pour tout le reste. Commencez par Draft, vérifiez le fichier texte et ne passez qu'à High Si des caractères incorrects sont renvoyés, augmenter la qualité de documents qui n'en avaient pas besoin est le moyen le plus simple de ralentir le processus.
Étape 4 : Comment la fonction Extract Text and Images renvoie-t-elle le texte ?
Flux jusqu'à présent : Déclencheur SharePoint plus Récupération du contenu du fichier plus OCR.
Cette action lit la couche de texte et la renvoie sous forme de tableau appelé textsOrientez-le vers la sortie OCR, et non vers « Obtenir le contenu du fichier », sinon les pages numérisées seront vides.
- Ajouter PDF - Extraire le texte et les images.
- Configure:
- Contenu du fichier:
File Contentde la action OCR - Nom de fichier: le jeton du nom de fichier du déclencheur
- Extraire le texte:
Yes - Extraire des images:
No
- Contenu du fichier:
Paramètres d'extraction de texte et d'images
| Paramètre | Valeur utilisée ici | Ce qu'il contrôle |
|---|---|---|
| Contenu du fichier | File Content à partir de l'étape OCR | Le PDF consultable. Réutiliser la copie du contenu du fichier est l'erreur la plus fréquente. |
| Nom de fichier | jeton de nom de fichier déclencheur | Nom de la source, conservé à des fins d'identification. |
| Extraire le texte | Yes | Renvoie le texts tableau. |
| Extraire des images | No | Ignorer les images intégrées. Définir Yes uniquement si vous en avez besoin, ce qui rend la réponse beaucoup plus importante. |

Observez les icônes. Le contenu du fichier porte la marque PDF4me car il provient d'une reconnaissance optique de caractères (OCR). Le nom du fichier porte la marque SharePoint car il provient du déclencheur.
Étape 5 : Comment transformer le tableau de textes en une seule chaîne de caractères ?
Flux jusqu'à présent : Déclencheur SharePoint + Récupération du contenu des fichiers + OCR + Extraction de texte et d'images.
texts est un tableau. Un fichier a besoin d'une chaîne de caractères. Un expression de jointure fait le lien entre les deux.
- Ajouter un Composer action.
- Dans Entrées, passez à l'éditeur d'expressions et collez :
join(body('PDF_-_Extract_Text_and_Images')?['texts'], decodeUriComponent('%0A'))
- Cliquez Mise à jour.
Le decodeUriComponent('%0A') Voici comment insérer un saut de ligne littéral dans une expression Power Automate. Il n'existe pas de séquence d'échappement ; c'est donc la convention.
Configuration de composition

Le nom de l'action dans la fonction body() utilise des tirets bas pour les espaces et les traits d'union. Si vous renommez l'action, cette expression ne fonctionnera plus.
C'est cette ligne qui détermine si le résultat est lisible. Ignorez l'étape Compose et transmettez directement le tableau à Create file ; le fichier texte contiendra alors des crochets JSON et des guillemets échappés au lieu du document.
Étape 6 : Comment enregistrer le texte au format .txt dans SharePoint ?
Flux jusqu'à présent : Déclencheur SharePoint + Obtenir le contenu du fichier + OCR + Extraire le texte et les images + Composer.
La dernière étape consiste à écrire la chaîne de caractères concaténée dans une seconde bibliothèque.
- Ajouter SharePoint > Créer un fichier.
- Configure:
- Adresse du site: même site que le déclencheur
- Chemin du dossier:
/Shared Documents/RagText - Nom de fichier: le jeton du nom de fichier du déclencheur suivi du texte littéral
.txt - Contenu du fichier: le Composer jeton de sortie
SharePoint Créer une configuration de fichier

Le contenu du fichier correspond à la sortie de la fonction Composer, reconnaissable à l'icône violette d'opération sur les données, et non à un élément provenant de PDF4me. Le texte est déjà assemblé à ce stade.
Conseil. Le jeton du nom de fichier du déclencheur contient déjà le .pdf extension, donc ajout .txt produit contract.pdf.txt, comme l'indique le dossier de sortie ci-dessus. Cela n'a aucune incidence et permet de garder le lien vers la source bien visible. Si vous préférez avoir contract.txt, enveloppez le jeton dans remplacer() et échanger .pdf pour .txt au lieu d'ajouter.
Exécutez le flux et vérifiez
- Sauvegarder le flux en haut à droite.
- Télécharger
contract-sample.pdfdans le dossier d'entrée. Le déclencheur effectue une interrogation, veuillez patienter une minute. - Ouvrez le flux historique d'exécution Vérifiez que les six actions sont bien validées par une coche verte. La reconnaissance optique de caractères (OCR) sera l'étape la plus lente.
- Ouvrir
/Shared Documents/RagText. UN.txtLe fichier devrait se trouver là. Ouvrez-le et recherchezPDF4ME-CLEAN-TEST-2026Si ce marqueur est présent, la reconnaissance optique de caractères (OCR) et l'extraction ont fonctionné de bout en bout.
Qu'avez-vous construit concrètement ? Un pipeline d'ingestion de documents. Chaque PDF qui arrive dans la bibliothèque est automatiquement converti en texte brut, une étape indispensable, bien que peu attrayante, pour toute application de lecture de documents à grande échelle : recherche SharePoint, index vectoriel, chatbot de recherche assistée ou simple recherche plein texte. Si vous n'avez besoin que du texte au sein du flux, et non de son stockage sur disque, la conversion la plus courte est préférable. Extraire du texte à partir de PDF dans Power Automate La procédure pas à pas couvre ce point avec Dropbox.
Variantes courantes que vous pouvez ajouter sans reconstruction
.jsonLa plupart des plateformes de stockage de fichiers vectoriels privilégient les métadonnées en plus du contenu.| Flux de nuages comparé aux alternatives | Fonctionne sans surveillance | Gère les PDF numérisés | Niveau de connexion |
|---|---|---|---|
| PDF4me dans un flux cloud Power Automate | Oui | Oui, la reconnaissance optique de caractères est intégrée au flux de travail. | Standard |
| Actions PDF de bureau Power Automate | Uniquement lorsque la machine est allumée | Aucune reconnaissance optique de caractères (OCR) dans les actions de base | Standard, plus une machine |
| Traitement des formulaires par AI Builder | Oui | Oui | Premium, crédit au compteur |
Questions fréquentes
Power Automate peut-il extraire du texte d'un PDF ?
Pas de manière autonome dans un flux cloud. Les actions PDF de la documentation Microsoft appartiennent à Power Automate Desktop et ne sont pas disponibles dans les flux cloud, ce qui explique pourquoi de nombreuses discussions communautaires sur ce sujet restent sans réponse. L'ajout du connecteur PDF4me donne à un flux cloud une véritable fonctionnalité. Extraire du texte et des images action qui renvoie le texte du document sous forme de tableau.
L'extraction complète ne constitue qu'une seule opération. Les cinq étapes précédentes consistent simplement à déplacer le fichier en entrée et le texte en sortie.
Comment extraire du texte d'un PDF à l'aide de Power Automate ?
Déclenchez l'événement sur le nouveau fichier, récupérez ses octets avec Récupérer le contenu du fichier, courir Convertir un PDF en PDF modifiable grâce à la reconnaissance optique de caractères (OCR) Les pages numérisées reçoivent donc une couche de texte, puis sont exécutées. Extraire du texte et des images avec l'option Extraire le texte définie sur YesCela renvoie un texts tableau. Combinez-le avec une expression Compose si vous souhaitez du texte plutôt qu'un tableau.
Indiquez à l'étape d'extraction le résultat de la reconnaissance optique de caractères (OCR) plutôt que le fichier téléchargé. La réutilisation de la copie téléchargée explique pourquoi les documents numérisés ne renvoient aucun fichier.
Power Automate peut-il effectuer une reconnaissance optique de caractères (OCR) ?
Un flux cloud ne dispose pas de fonction OCR native. AI Builder en propose une avec une licence premium à la consommation, et Power Automate Desktop possède son propre moteur OCR installé sur une machine. PDF4me Convertir un PDF en PDF modifiable grâce à la reconnaissance optique de caractères (OCR) L'action s'exécute dans un flux cloud de niveau standard sans intervention d'une machine.
C'est OCR uniquement en cas de besoin Il est utile de connaître ce paramètre. Réglé sur trueIl inspecte chaque fichier et ignore la reconnaissance optique de caractères (OCR) lorsqu'une couche de texte existe déjà, de sorte qu'une bibliothèque mixte ne supporte pas le coût sur chaque document.
Pourquoi la fonction d'extraction de texte à partir d'un PDF de Power Automate ne fonctionne-t-elle pas ?
Dans la quasi-totalité des cas, trois causes sont à l'origine de la plupart des problèmes. Soit le document est une numérisation et n'a jamais été traité par reconnaissance optique de caractères (OCR), il n'y a donc aucun texte à extraire. Soit l'étape d'extraction lit le fichier téléchargé au lieu du résultat de l'OCR, ce qui produit le même résultat vide avec un document numérisé. Soit le texte est arrivé correctement, mais a été enregistré dans le fichier sous forme de tableau brut, ce qui lui donne l'apparence de JSON plutôt que d'un document.
Ouvrez l'historique d'exécution et examinez directement le résultat de l'extraction de texte et d'images. texts Le problème se situe en aval, dans les fonctions Composer ou Créer un fichier, car le contenu est présent.
Comment convertir gratuitement un PDF en fichier texte ?
Pour un document unique, n'importe quel convertisseur en ligne fera l'affaire. L'intérêt de ce processus réside dans le volume et la répétitivité : il s'exécute automatiquement pour chaque fichier déposé dans le dossier, gère les numérisations et ne nécessite aucune intervention humaine. L'offre gratuite de PDF4me couvre un nombre conséquent de documents par mois, et tous les connecteurs utilisés ici sont de la version standard ; aucune licence Power Automate premium n'est donc requise.
Dépannage
L'option « Extraire le texte et les images » lit le mauvais fichier. Son contenu doit provenir de l'action OCR (icône PDF4me) et non de l'option « Obtenir le contenu du fichier ». Sur un PDF numérique natif, les deux options fonctionnent, c'est pourquoi ce problème n'apparaît généralement qu'après la réception d'une numérisation.
Le fichier créé reçoit les données brutes. texts tableau. Son contenu doit correspondre au jeton de sortie de Compose. Si Compose est présent mais renvoie toujours un tableau, vérifiez que l'expression de jointure comporte bien les deux arguments : le tableau et le séparateur.
L'identifiant de fichier est associé au mauvais jeton. Il a besoin de celui du déclencheur. IdentifiantIl ne s'agit ni du nom du fichier, ni du chemin d'accès, ni de l'identifiant de l'élément. Ces éléments semblent interchangeables dans la liste de contenu dynamique, mais ils ne le sont pas.
Le dossier de sortie se trouve dans le dossier surveillé par le déclencheur ; ainsi, chaque nouveau fichier texte lance une nouvelle exécution. Conservez RagInput et RagText séparés, comme des dossiers frères plutôt qu'imbriqués.
Prochaines étapes
Extraire du texte et des images dans Power Automate
Convertir un PDF en PDF modifiable grâce à la reconnaissance optique de caractères (OCR)
Obtenez votre clé API
Le même schéma en six étapes (surveiller un dossier, récupérer, OCR, extraire, aplatir, enregistrer) transforme n'importe quelle bibliothèque de documents en un corpus lisible par machine.