Fractionner un PDF par texte dans Power Automate : transformez un lot numérisé en fichiers séparés avec PDF4me

PDF4me Diviser un PDF par texte Il s'agit d'une action Power Automate qui découpe un PDF en plusieurs fichiers à chaque emplacement d'un marqueur de texte. Ce flux surveille un dossier SharePoint et divise chaque nouvelle numérisation en fonction d'un marqueur de texte. Serial#: Le logiciel analyse les données, puis les transfère vers Dropbox. Une analyse par lots génère trois fichiers nommés, sans sélection manuelle de page.
Quiconque utilise un scanner connaît le problème : on dépose une pile de documents dans le chargeur, on lance la numérisation une seule fois, et on obtient un unique PDF contenant vingt enregistrements sans rapport entre eux. Tous les outils de fractionnement en ligne présents sur la première page de Google se feront un plaisir de résoudre ce problème, à condition qu'une personne télécharge le fichier, navigue entre les pages et télécharge les morceaux. C'est acceptable ponctuellement. Mais cela devient problématique lorsque le scanner est utilisé quotidiennement. Ce processus élimine complètement l'intervention humaine.
Une numérisation est enregistrée dans une bibliothèque SharePoint. PDF4me lit la couche texte, repère chaque page commençant un nouvel enregistrement et renvoie un tableau de fichiers PDF distincts. Une boucle « Pour chaque » parcourt ce tableau et dépose chaque fichier dans Dropbox. Quatre actions seulement, aucune expression à écrire, et l'ensemble du processus s'exécute en moins de six secondes.
Questions et réponses basées sur le pourquoi
Pourquoi segmenter en fonction du texte plutôt que du nombre de pages ? Le comptage des pages n'est précis que si tous les enregistrements ont la même longueur. Or, les lots réels ne sont pas uniformes. Une facture peut occuper une page, la suivante quatre. Un marqueur de texte est associé à l'enregistrement, garantissant ainsi une répartition correcte quelles que soient les variations de longueur.
Pourquoi un PDF a-t-il besoin d'une couche de texte ? Cette fonction recherche le texte à l'intérieur du document, et non les pixels. Une photo ou une numérisation à plat sans reconnaissance optique de caractères (OCR) ne contient aucun texte à analyser ; par conséquent, chaque correspondance renvoie un résultat vide. Lancez d'abord la reconnaissance optique de caractères : le même processus s'applique aux documents papier originaux.
Pourquoi une boucle For each après la division ? L'action renvoie un tableau, et non un fichier unique. Power Automate ne peut pas écrire un tableau en une seule opération ; la boucle transforme donc « trois documents » en trois appels distincts de création de fichier.
Pourquoi envoyer le résultat vers Dropbox et non vers SharePoint ? C'est surtout une question d'habitude, et cela permet de bien distinguer les dossiers d'entrée et de sortie pendant les tests. Remplacez la dernière action par « Créer un fichier SharePoint » et rien d'autre ne changera dans le flux.
Ce que vous obtiendrez
Saisir: un fichier PDF multi-enregistrements déposé dans une bibliothèque de documents SharePoint, où chaque enregistrement commence par une ligne contenant Serial#: SPTEST-A, Serial#: SPTEST-B, et ainsi de suite. Sortir: Un fichier PDF par enregistrement dans un dossier Dropbox, chaque fichier contenant exactement les pages correspondant à cet enregistrement.

Le dossier SharePoint surveillé. Tout élément déposé ici déclenche une exécution.

Un document scanné de trois pages en entrée, trois fichiers PDF numérotés séparément en sortie.
Ce dont vous avez besoin
- Power Automate. Ouvrir Power AutomateUne licence Microsoft 365 standard couvre tout ce qui est utilisé ici. Il s'agit d'un flux cloud, et non de Power Automate Desktop.
- Clé API PDF4me. Obtenez votre clé APIConnectez-le la première fois que vous ajoutez une action PDF4me.
- Un site SharePoint et un compte DropboxCréez un dossier d'entrée dans une bibliothèque de documents SharePoint et un dossier de sortie dans Dropbox avant de créer le flux, afin que les deux sélecteurs aient un emplacement où pointer.
- Un PDF de test avec des marqueurs de texte répétitifs. scan-batch-sample.pdfTrois pages, chacune s'ouvrant sur sa propre ligne de numéro de série.
Commencez par prendre les échantillons. Téléchargez le PDF d'entrée et chargez-le dans votre dossier d'entrée SharePoint une fois le flux enregistré. Les trois fichiers de sortie attendus s'y trouvent également ; vous pouvez ainsi les comparer à ceux produits par votre propre exécution.
Aperçu du flux
- Lorsqu'un fichier est créé dans un dossier (Déclencheur SharePoint) pointant vers
/Shared Documents/ScanSplitInput. - PDF - Diviser un PDF par texte (PDF4me) avec le texte de recherche
Serial#:(.*)et type divisébefore. - Pour chaque itérer
body/splitedDocuments. - Créer un fichier (Dropbox) écriture dans
/ScanSplitOutput.
Aperçu complet du flux

Le flux complet comprend quatre actions. Pour chaque compteur affichant « 1 sur 3 », la division effectue son travail.
Étape 1 : Comment surveiller un dossier SharePoint pour détecter de nouvelles analyses ?
Flux jusqu'à présent : Rien pour l'instant, voici le déclencheur.
Le déclencheur s'active dès qu'un fichier apparaît dans un dossier spécifique de la bibliothèque de documents. Choisissez ce dossier avec précision. Si vous le définissez comme la racine d'une bibliothèque partagée, chaque chargement, même sans lien avec le dossier initial, déclenchera une exécution.
- Créer un nouveau Flux cloud automatisé et recherchez dans la liste des déclencheurs Lorsqu'un fichier est créé dans un dossier.
- Configure:
- Adresse du site: votre site, par exemple
PDF4me Sharepoints - https://ynoox1.sharepoint.com/sites/PDF4meSharepoints - ID du dossier:
/Shared Documents/ScanSplitInput
- Adresse du site: votre site, par exemple
- Ouvrir Paramètres avancés et allumez Déduire le type de contenu, puis réglez-le sur
Yes.
Configuration du déclencheur SharePoint

L'option « Inférer le type de contenu défini sur Oui » permet au déclencheur de vous fournir de véritables octets PDF plutôt qu'un blob générique.
Conseil. Ce déclencheur est marqué comme obsolète dans le sélecteur. Il fonctionne toujours et c'est celui présenté ici, mais pour un nouveau flux de production, il est préférable de… Lors de la création d'un fichier (propriétés uniquement) suivi de Récupérer le contenu du fichierLe reste du flux est identique, car les deux itinéraires se terminent par la réception des octets du fichier. Microsoft répertorie chaque déclencheur et son statut dans le Référence du connecteur SharePoint.
Étape 2 : Comment la fonction « Split PDF by Text » décide-t-elle où couper ?
Flux jusqu'à présent : Déclencheur SharePoint.
C'est cette action qui effectue le véritable travail. Elle lit la couche texte du document, trouve chaque page contenant votre texte de recherche et découpe le document à ces pages. Le reste n'est que du traitement technique.
- Ajoutez une nouvelle étape et recherchez PDF - Diviser un PDF par texte.
- Configure:
- Contenu du fichier:
File Contentà partir du déclencheur - Nom de fichier:
x-ms-file-name-encodedà partir du déclencheur - Texte:
Serial#:(.*) - Type divisé:
before - Nommer les fichiers fractionnés:
NameAsPerOrder
- Contenu du fichier:
- Connectez votre compte PDF4me lorsque le système vous y invite.
Fractionner un PDF par paramètres de texte
| Paramètre | Valeur utilisée ici | Ce qu'il contrôle |
|---|---|---|
| Contenu du fichier | File Content à partir du déclencheur | Les octets du PDF à extraire. Il doit s'agir d'un véritable PDF avec une couche de texte consultable. |
| Nom de fichier | x-ms-file-name-encoded | Nom source utilisé pour l'identification du traitement et comme base pour les noms de sortie. |
| Texte | Serial#:(.*) | Le marqueur qui initie un nouvel enregistrement. La correspondance est sensible à la casse, donc serial#: ne trouverait rien. |
| Type divisé | before | Coupe juste avant chaque page correspondante, de sorte que la page de repère ouvre son propre document. Utiliser after fermer plutôt la précédente. |
| Nommer les fichiers fractionnés | NameAsPerOrder | Numérote les produits dans l'ordre où ils ont été coupés, produisant name 1.pdf, name 2.pdf, name 3.pdf. |

Le type de fractionnement avant correspond à la différence entre un marqueur ouvrant son enregistrement et fermant celui situé au-dessus. Si ce paramètre est inversé, chaque fichier sera décalé d'une page.
Conseil. Choisissez un marqueur qui ne peut apparaître nulle part ailleurs dans le document. Serial#: est sûr. Un mot simple comme Invoice Non, car cela correspondra également à l'expression « Total de la facture » située à mi-page et sera également divisé à cet endroit.
Étape 3 : Pourquoi avez-vous besoin d’une boucle For each ici ?
Flux jusqu'à présent : Déclencheur SharePoint et fractionnement du PDF par texte.
L'action split renvoie un tableau appelé splitedDocumentsChaque entrée correspond à un fichier de sortie. Power Automate ne permet pas d'écrire l'intégralité d'un tableau en une seule opération ; il est donc nécessaire de parcourir le tableau entrée par entrée.
- Ajouter un Contrôle agir et choisir Pour chaque.
- Configure:
- Sélectionnez une sortie parmi les étapes précédentes:
body/splitedDocumentsà partir de l'action Fractionner le PDF par texte
- Sélectionnez une sortie parmi les étapes précédentes:
- Laissez le niveau de concurrence de la boucle à sa valeur par défaut. Ces fichiers sont petits et l'ordre est plus facile à lire lorsque les exécutions restent séquentielles. Microsoft documente les limites de concurrence et d'imbrication dans le Appliquer à chaque référence.
Pour chaque configuration

Un seul jeton correspond à la configuration complète. Si Power Automate a automatiquement intégré votre action « Créer un fichier » dans une boucle, cela a déjà été fait pour vous.
C'est cette ligne de code qui détermine si le flux fonctionne. Si vous orientez la boucle vers autre chose que corps/documents divisés, l'action Créer un fichier à l'intérieur s'exécutera soit une fois avec une charge utile incorrecte, soit pas du tout.
Étape 4 : Comment enregistrer chaque fichier fractionné dans Dropbox ?
Flux jusqu'à présent : Déclencheur SharePoint plus Fractionner le PDF par texte plus Pour chaque.
À l'intérieur de la boucle, chaque itération expose le fichier divisé actuel via deux jetons : fileName et streamFileTracez-les en ligne droite.
- À l'intérieur de Pour chaque bloc, ajoutez un Dropbox agir et choisir Créer un fichier.
- Configure:
- Chemin du dossier:
/ScanSplitOutput - Nom de fichier:
fileName - Contenu du fichier:
streamFile
- Chemin du dossier:
- Connectez votre compte Dropbox lorsque vous y êtes invité.
Configuration de création de fichiers Dropbox

Les variables fileName et streamFile proviennent de l'élément de boucle actuel, et non du déclencheur. Ces deux jetons comportent l'icône PDF4me.
Conseil. Veillez à ce que le dossier de sortie soit différent du dossier d'entrée. Réécrire les fichiers fractionnés dans le dossier surveillé par le déclencheur crée une boucle qui se redéclenche à sa propre sortie, ce qui représente une méthode coûteuse pour détecter le problème.
Exécutez le flux et vérifiez
- Sauvegarder le flux en haut à droite.
- Télécharger
scan-batch-sample.pdfLe déclencheur surveille le dossier SharePoint. Il effectue des interrogations régulières ; veuillez donc patienter une minute plutôt que de vous attendre à une exécution instantanée. - Ouvrez le flux historique d'exécution et vérifiez que les quatre actions sont bien validées par une coche verte. Le bloc « Pour chaque » affiche un compteur qui devrait indiquer : 1 sur 3 pour le fichier d'exemple.
- Ouvrir
/ScanSplitOutputDans Dropbox, vous devriez voir trois fichiers PDF numérotés 1, 2 et 3, contenant chacun exactement un enregistrement de numéro de série.
Qu'avez-vous construit concrètement ? Un séparateur de documents prenant en compte le contenu. Les quatre mêmes actions fonctionnent sur tout lot où chaque enregistrement s'identifie par une chaîne de caractères cohérente, qu'il s'agisse d'un numéro de facture, d'un identifiant patient, d'une référence de dossier ou d'un titre de chapitre. La même action PDF4me existe dans Faire, Zapier et n8nLe modèle se déplace donc d'une plateforme à l'autre, seules les étapes de déclenchement et de stockage changeant.
Variantes courantes que vous pouvez ajouter sans reconstruction
| Flux de nuages comparé aux alternatives | Fonctionne sans surveillance | Divisions sur le contenu | Nécessite un ordinateur de bureau |
|---|---|---|---|
| PDF4me dans un flux cloud Power Automate | Oui | Oui, sur n'importe quel marqueur de texte | Non |
| séparateur manuel en ligne | Non, chaque fichier est téléchargé par un humain. | Parfois, par sélecteur de page | Non |
| Power Automate Desktop | Uniquement lorsque la machine est allumée | Cela dépend des actions installées | Oui |
Questions fréquentes
Comment diviser un PDF dans Power Automate ?
Ajoutez le PDF - Diviser un PDF par texte action de PDF4me vers un flux cloud, mapper les octets du PDF en Contenu du fichier, et donnez-lui un Texte valeur à rechercher. L'action renvoie un tableau de fichiers PDF distincts. body/splitedDocumentsIntégrez une action de stockage telle que Dropbox. Créer un fichier dans un Pour chaque Parcourez ce tableau et chaque élément est enregistré.
Aucune expression écrite n'est requise. Les quatre actions présentées dans cet article constituent l'intégralité du déroulement.
Power Automate peut-il diviser un PDF en fonction de son contenu ?
Oui, c'est exactement le rôle de ce flux. Power Automate ne propose pas de fonction native de fractionnement de PDF ; la reconnaissance du contenu est donc assurée par le connecteur PDF4me. Ce dernier analyse la couche texte du document et effectue le fractionnement à chaque occurrence de votre chaîne de recherche, ce qui signifie que le fractionnement suit les enregistrements plutôt qu'un nombre fixe de pages.
La seule condition requise est la présence d'une véritable couche de texte. Un document numérisé qui n'a jamais été traité par reconnaissance optique de caractères (OCR) n'est, pour la recherche, que de simples images de mots.
Comment diviser un PDF en plusieurs fichiers dans Power Automate ?
La division en elle-même est une seule action, mais en extraire plusieurs fichiers en nécessite deux. Fractionner le PDF par texte produit le tableau, et un Pour chaque La boucle transforme ce tableau en un appel à la fonction Créer un fichier par document. Omettre cette boucle est la raison la plus fréquente pour laquelle on obtient un seul fichier de sortie au lieu de plusieurs.
Dans l'exemple présenté ici, une analyse de trois enregistrements produit trois fichiers nommés sharepoint-trigger-test 1.pdf à travers sharepoint-trigger-test 3.pdf, parce que Nommer les fichiers fractionnés était prévu NameAsPerOrder.
La fonction de fractionnement de PDF fonctionne-t-elle dans Power Automate Desktop ?
Ce flux est un flux cloud, et c'est voulu. Il s'exécute sur l'infrastructure Microsoft dès qu'un fichier est ajouté à SharePoint, sans qu'aucune machine ne nécessite d'être maintenue sous tension ni qu'aucune passerelle ne soit à gérer. Power Automate Desktop peut appeler la même API PDF4me, mais cela implique alors la mise en service d'une machine planifiée et sa disponibilité.
Si vos documents sont déjà stockés sur SharePoint, OneDrive ou Dropbox, le flux cloud est la solution la plus simple.
Est-il possible de diviser un PDF par signet plutôt que par texte ?
Pas avec cette action. Fractionner le PDF par texte Correspondances uniquement au niveau du texte. Si vos documents sources contiennent des signets fiables, les équivalents PDF4me les plus proches sont : PDF fractionné par numéro de page, ou Fractionner le PDF par code-barres lorsque des feuilles de séparation sont utilisées.
En pratique, un marqueur de texte est plus fiable qu'un signet sur un document numérisé, car les scanners ne créent pas de signets mais préservent ce qui était imprimé sur la page.
Dépannage
L'action « Créer un fichier » se trouve en dehors de la boucle « Pour chaque », ou la boucle pointe vers le mauvais jeton. Ouvrez la boucle et vérifiez qu'elle contient : corps/documents divisés, et vérifiez que l'instruction Create file se trouve bien à l'intérieur des limites de la boucle et non en dessous.
Aucune page ne correspondait au texte recherché ; il n’y avait donc rien à extraire. Vérifiez d’abord la casse, car la correspondance est sensible à la casse. Ouvrez ensuite le PDF et essayez de sélectionner le texte du marqueur avec votre curseur. S’il ne se surligne pas, le document ne contient pas de calque de texte et nécessite une reconnaissance optique de caractères (OCR) pour que cette action puisse être effectuée.
Le type de fractionnement est défini sur une valeur incorrecte. avant, la page contenant le marqueur commence un nouveau document. Avec aprèsCela met fin à la précédente. Inversez le paramètre et relancez.
Le dossier de sortie est le même que celui surveillé par le déclencheur ; chaque fichier fractionné lance donc une nouvelle exécution. Indiquez à l'option « Créer un fichier » un dossier distinct, ici Dropbox. /ScanSplitOutput le chemin, et le cycle s'arrête.
Prochaines étapes
Fractionner un PDF par texte dans Power Automate
Référence de l'API Split PDF by Text
Obtenez votre clé API
Le même schéma en quatre étapes (surveiller un dossier, diviser selon un marqueur, parcourir le tableau, enregistrer chaque élément) permet de traiter n'importe quel lot de documents qui doit être divisé en plusieurs parties.