Aller au contenu principal

Convertir un PDF en fichier texte dans Power Automate : Transformez vos contrats numérisés en un corpus SharePoint consultable avec PDF4me

· 29 minutes de lecture
SEO and Content Writer

PDF4me Extraire du texte et des images Cette action Power Automate renvoie la couche texte d'un PDF sous forme de tableau. Associée à la reconnaissance optique de caractères (OCR) en amont et à une jointure Compose en aval, cette opération transforme chaque PDF déposé dans une bibliothèque SharePoint en un document correspondant. .txt Fichier prêt pour la recherche par IA.

Recherchez comment faire cela et le premier résultat est celui de Microsoft. Référence des actions PDF, qui décrit Power Automate Ordinateur de bureau Ces actions n'existent pas dans un flux cloud. Ce détail explique pourquoi les deux résultats suivants sont une discussion Reddit et une discussion de la communauté Power Platform où des utilisateurs posent la même question sans obtenir de réponse claire. Ce flux constitue la réponse directe et s'exécute entièrement dans le cloud sur des connecteurs de niveau standard.

Aperçu du flux
1. When a file is created (properties only)
SharePoint trigger on the library, scoped to the RagInput folder. Returns metadata, not bytes.
2. Get file content
Fetches the actual PDF bytes using the identifier the trigger handed over.
3. Convert PDF to editable PDF using OCR
Adds a text layer to scans. OCR Only When Needed skips PDFs that already have one.
4. Extract Text and Images
Returns the text as an array. Extract Images stays No.
5. Compose
join() flattens the texts array into one newline separated string.
6. Create file
SharePoint writes the string to /Shared Documents/RagText as .txt.
La version courte

Un fichier PDF est ajouté à une bibliothèque SharePoint. Un déclencheur signale ce nouvel élément, l'outil « Obtenir le contenu du fichier » récupère ses octets, et PDF4me effectue une reconnaissance optique de caractères (OCR) uniquement si nécessaire avant d'extraire le texte sous forme de tableau. Une simple expression « Composer » concatène ce tableau en une chaîne de caractères, et SharePoint enregistre le résultat dans un fichier texte brut. Six actions, aucun connecteur premium, et l'ensemble du processus s'achève en une douzaine de secondes.

Questions et réponses basées sur le pourquoi

Pourquoi écrire un fichier .txt au lieu d'utiliser directement le texte dans le flux ? Une chaîne de caractères au sein d'un flux est conservée pendant toute la durée de son exécution. Un fichier dans une bibliothèque est durable, indexable et accessible par tout système auquel vous le destinez ultérieurement, qu'il s'agisse de la recherche SharePoint, d'une base de données vectorielle ou d'un chatbot récupérant le contexte.

Pourquoi faut-il deux actions pour obtenir un seul fichier ? Le déclencheur « propriétés uniquement » est volontairement léger. Il signale l'apparition d'un élément et vous fournit ses métadonnées, notamment un identifiant, mais pas le contenu du fichier. Le déclencheur « Obtenir le contenu du fichier » remplace cet identifiant par le document lui-même. Cette séparation permet de maintenir la rapidité du déclencheur et de filtrer les métadonnées avant même de télécharger quoi que ce soit.

Pourquoi utiliser la reconnaissance optique de caractères (OCR) alors que la plupart des fichiers PDF contiennent déjà du texte ? Parce qu'on ne peut pas le distinguer visuellement. Un contrat scanné et un contrat numérique natif sont indiscernables dans un dossier. L'action de reconnaissance optique de caractères (OCR) OCR uniquement en cas de besoin Ce paramètre examine chaque fichier et ignore ceux qui contiennent déjà une couche de texte ; vous ne payez donc que là où cela est nécessaire.

Pourquoi une étape de composition est-elle nécessaire ? Extraction de texte et d'images texts Sous forme de tableau, généralement une entrée par page. Écrire un tableau directement dans un fichier génère des crochets JSON et des guillemets échappés. Compose assemble les entrées en un texte propre avant toute écriture sur le disque.


Ce que vous obtiendrez

Saisir: Tout fichier PDF déposé dans une bibliothèque de documents SharePoint, qu'il soit numérisé ou nativement numérique, ne nécessite aucune convention de nommage. Sortir: un fichier texte brut par PDF dans une seconde bibliothèque, contenant l'intégralité du contenu lisible du document.

Bibliothèque de documents SharePoint affichant le dossier RagInput contenant les fichiers rag-test.pdf, rag-test2.pdf et services-agreement.pdf, tous modifiés par le compte Flow de Pdf4me

RagInput. Déposez un PDF ici et le processus démarre.

Bibliothèque de documents SharePoint affichant le dossier RagText contenant les fichiers rag-test.pdf.txt et rag-test2.pdf.txt générés par le flux

RagText. Un fichier texte brut par PDF, prêt à être indexé.

Voici ce qui ressort de l'autre côté pour l'exemple de contrat, exactement tel qu'il est écrit sur le disque :

MASTER SERVICES AGREEMENT
Between Initech LLC and Umbrella Inc.
Effective date: 1 January 2026. Auto-renews annually.
Liability cap: USD 100000. Confidentiality: 5 years.
CLEAN TEST MARKER: PDF4ME-CLEAN-TEST-2026.

Notez les espaces en début de texte. La reconnaissance optique de caractères (OCR) préserve les espaces blancs de la mise en page, ce qui convient parfaitement à la recherche et à l'alimentation d'un modèle de langage. Supprimez-les ultérieurement si l'analyseur syntaxique en aval est plus exigeant.


Ce dont vous avez besoin

  • Power Automate. Ouvrir Power AutomateIl s'agit d'un flux cloud. Tout ici est de niveau standard, sans connecteur premium ni passerelle.
  • Clé API PDF4me. Obtenez votre clé APIConnectez-le la première fois que vous ajoutez une action PDF4me.
  • Un site SharePoint avec deux dossiersUn dossier pour les fichiers PDF en entrée et un autre pour le texte en sortie. Créez-les tous les deux avant la compilation, afin que les sélecteurs de dossiers aient des répertoires de destination.
  • Un PDF de test. exemple-de-contrat.pdf. Un court contrat de services avec une ligne de repère que vous pouvez rechercher.

Commencez par prendre les échantillons. Une fois le flux enregistré, téléchargez le PDF dans votre dossier d'entrée, puis comparez le contenu du dossier de sortie avec le fichier texte attendu.


Aperçu du flux

  1. Lors de la création d'un fichier (propriétés uniquement) (Déclencheur SharePoint) limité à /Shared Documents/RagInput.
  2. Récupérer le contenu du fichier en utilisant la gâchette Identifier.
  3. PDF - Convertir un PDF en PDF modifiable grâce à la reconnaissance optique de caractères (OCR) de qualité Draft et la reconnaissance optique de caractères (OCR) uniquement lorsque nécessaire true.
  4. PDF - Extraire le texte et les images avec Extraction de texte Yes et extraire des images No.
  5. Composer gérer un join() sur le retour texts tableau.
  6. Créer un fichier Écriture (SharePoint) .txt dans /Shared Documents/RagText.

Aperçu complet du flux

L'historique d'exécution de Power Automate affiche six actions exécutées successivement : SharePoint : Propriétés uniquement lors de la création d'un fichier (0,3 seconde), Récupération du contenu du fichier (0,2 seconde), PDF : Conversion d'un PDF en PDF modifiable par OCR (11 secondes), PDF : Extraction du texte et des images (0,4 seconde), Composition (0 seconde) et SharePoint : Création du fichier (0,3 seconde).

L'épreuve OCR est la seule à accuser un retard important, avec un temps de 11 secondes. Les cinq autres épreuves se terminent en moins d'une demi-seconde chacune.


Étape 1 : Comment surveiller une bibliothèque SharePoint pour détecter les nouveaux fichiers PDF ?

Flux jusqu'à présent : Rien pour l'instant, voici le déclencheur.

Utiliser Lors de la création d'un fichier (propriétés uniquement)Cette fonction se déclenche lors de la création de nouveaux éléments et renvoie leurs métadonnées. Limitez-la à un seul dossier, car une surveillance globale de la bibliothèque est déclenchée à chaque ajout effectué dans ce dossier.

  1. Créez un Flux cloud automatisé et choisir Lors de la création d'un fichier (propriétés uniquement).
  2. Configure:
    • Adresse du site: https://ynoox1.sharepoint.com/sites/PDF4meSharepoints
    • Nom de la bibliothèque: prendre Documents à partir du menu déroulant
  3. Ouvrir Paramètres avancés, ajouter Dossier, et le régler sur /Shared Documents/RagInput.

Configuration du déclencheur SharePoint

Power Automate : lors de la création d'un fichier, le panneau des propriétés s'affiche uniquement avec l'adresse du site définie sur PDF4me SharePoint, le nom de la bibliothèque défini sur Documents et le paramètre avancé du dossier défini sur /Shared Documents/RagInput.

Le nom de la bibliothèque correspond à la bibliothèque elle-même, Documents. Le paramètre Dossier situé en dessous permet de limiter le déclenchement à un dossier spécifique à l'intérieur de celle-ci.

Conseil. Vous trouverez également un déclencheur appelé Lorsqu'un fichier est créé dans un dossierCette méthode renvoie directement les octets du fichier et vous évite l'étape suivante. Elle est obsolète ; privilégiez donc la combinaison de propriétés uniquement présentée ici pour toute application que vous souhaitez continuer à exécuter.


Étape 2 : Pourquoi avez-vous besoin de récupérer le contenu du fichier après le déclenchement ?

Flux jusqu'à présent : Déclencheur SharePoint.

Le déclencheur « propriétés uniquement » transmet les métadonnées, et non le document. L'option « Obtenir le contenu du fichier » échange les données du déclencheur. Identifier pour les octets réels dont PDF4me a besoin.

  1. Ajouter SharePoint > Récupérer le contenu du fichier.
  2. Configure:
    • Adresse du site: le même site que le déclencheur
    • Identifiant de fichier: Identifier à partir du déclencheur
  3. Ouvrir Paramètres avancés et ensemble Déduire le type de contenu à Yes.

Obtenir la configuration du contenu du fichier

Panneau d'actions SharePoint « Obtenir le contenu du fichier » avec l'adresse du site définie sur le site SharePoint PDF4me, l'identificateur de fichier mappé sur le jeton d'identification du déclencheur et l'option « Déduire le type de contenu » définie sur Oui

Infer content type Yes permet de transmettre à l'action suivante de véritables octets PDF au lieu d'un blob générique.

L'identifiant est le point de jonction entre les deux étapes. Utilisez la gâchette Identifiant Le champ concerné, et non le nom du fichier ou son chemin d'accès, est l'identifiant. Les noms se répètent d'un dossier à l'autre et changent lorsqu'un document est renommé. L'identifiant, lui, reste inchangé.


Étape 3 : Pourquoi effectuer une reconnaissance optique de caractères (OCR) avant d’extraire le texte ?

Flux jusqu'à présent : Déclencheur SharePoint plus Récupérer le contenu du fichier.

Une page numérisée est une image. Il n'y a pas de texte à extraire tant que la reconnaissance optique de caractères (OCR) n'y a pas ajouté de couche de texte. Cette fonction effectue cette opération et est suffisamment intelligente pour ne pas toucher aux PDF déjà lisibles.

  1. Ajouter PDF - Convertir un PDF en PDF modifiable grâce à la reconnaissance optique de caractères (OCR).
  2. Configure:
    • Contenu du fichier: File Content depuis Récupérer le contenu du fichier
    • Nom de fichier: le jeton du nom de fichier du déclencheur
    • Type de qualité: Draft
    • OCR uniquement en cas de besoin: true
    • Langue: laissez vide sauf si vos documents ne sont pas en anglais
    • Est-ce asynchrone ?: No

Paramètres OCR

ParamètreValeur utilisée iciCe qu'il contrôle
Contenu du fichierFile Content à partir de Obtenir le contenu du fichierLes octets du PDF à traiter.
Nom de fichierjeton de nom de fichier déclencheurNom de la source, utilisé pour l'identification du traitement.
Type de qualitéDraftEffort de reconnaissance. Draft est suffisamment rapide et précis pour des numérisations nettes. Passez à High pour des originaux de mauvaise qualité.
OCR uniquement en cas de besointrueIgnore les fichiers qui contiennent déjà une couche de texte ; les PDF natifs numériques sont donc traités sans problème.
LanguevideIndice pour le moteur de reconnaissance. Laisser vide pour l'anglais.
Est-ce asynchrone ?NoAttendre le résultat en temps réel. Passer à Yes pour les documents très volumineux.
PDF4me Convertir un PDF en PDF modifiable à l'aide de la reconnaissance optique de caractères (OCR) : panneau d'actions avec « Contenu du fichier », « Nom du fichier » (à partir du déclencheur), « Type de qualité : Brouillon », « OCR uniquement si nécessaire » (vrai), langue (vide), et « Asynchrone : Non ».

Le type de qualité est ici défini sur Brouillon. Sur une numérisation propre, la qualité est aussi bonne qu'avec le type Élevé, mais le temps de lecture est réduit.

Conseil. C'est l'étape lente : 11 secondes pour la course ci-dessus contre une demi-seconde pour tout le reste. Commencez par Draft, vérifiez le fichier texte et ne passez qu'à High Si des caractères incorrects sont renvoyés, augmenter la qualité de documents qui n'en avaient pas besoin est le moyen le plus simple de ralentir le processus.


Étape 4 : Comment la fonction Extract Text and Images renvoie-t-elle le texte ?

Flux jusqu'à présent : Déclencheur SharePoint plus Récupération du contenu du fichier plus OCR.

Cette action lit la couche de texte et la renvoie sous forme de tableau appelé textsOrientez-le vers la sortie OCR, et non vers « Obtenir le contenu du fichier », sinon les pages numérisées seront vides.

  1. Ajouter PDF - Extraire le texte et les images.
  2. Configure:
    • Contenu du fichier: File Content de la action OCR
    • Nom de fichier: le jeton du nom de fichier du déclencheur
    • Extraire le texte: Yes
    • Extraire des images: No

Paramètres d'extraction de texte et d'images

ParamètreValeur utilisée iciCe qu'il contrôle
Contenu du fichierFile Content à partir de l'étape OCRLe PDF consultable. Réutiliser la copie du contenu du fichier est l'erreur la plus fréquente.
Nom de fichierjeton de nom de fichier déclencheurNom de la source, conservé à des fins d'identification.
Extraire le texteYesRenvoie le texts tableau.
Extraire des imagesNoIgnorer les images intégrées. Définir Yes uniquement si vous en avez besoin, ce qui rend la réponse beaucoup plus importante.
Panneau d'actions PDF4me Extraire le texte et les images avec le contenu du fichier mappé à partir de l'action OCR PDF4me, le nom du fichier provenant du déclencheur SharePoint, l'extraction du texte définie sur Oui et l'extraction des images sur Non

Observez les icônes. Le contenu du fichier porte la marque PDF4me car il provient d'une reconnaissance optique de caractères (OCR). Le nom du fichier porte la marque SharePoint car il provient du déclencheur.


Étape 5 : Comment transformer le tableau de textes en une seule chaîne de caractères ?

Flux jusqu'à présent : Déclencheur SharePoint + Récupération du contenu des fichiers + OCR + Extraction de texte et d'images.

texts est un tableau. Un fichier a besoin d'une chaîne de caractères. Un expression de jointure fait le lien entre les deux.

  1. Ajouter un Composer action.
  2. Dans Entrées, passez à l'éditeur d'expressions et collez :
join(body('PDF_-_Extract_Text_and_Images')?['texts'], decodeUriComponent('%0A'))
  1. Cliquez Mise à jour.

Le decodeUriComponent('%0A') Voici comment insérer un saut de ligne littéral dans une expression Power Automate. Il n'existe pas de séquence d'échappement ; c'est donc la convention.

Configuration de composition

Action Compose de Power Automate avec l'éditeur d'expressions ouvert affichant la jointure des tableaux de textes « Extraire le texte et les images du PDF » avec decodeUriComponent pourcentage zéro A comme séparateur

Le nom de l'action dans la fonction body() utilise des tirets bas pour les espaces et les traits d'union. Si vous renommez l'action, cette expression ne fonctionnera plus.

C'est cette ligne qui détermine si le résultat est lisible. Ignorez l'étape Compose et transmettez directement le tableau à Create file ; le fichier texte contiendra alors des crochets JSON et des guillemets échappés au lieu du document.


Étape 6 : Comment enregistrer le texte au format .txt dans SharePoint ?

Flux jusqu'à présent : Déclencheur SharePoint + Obtenir le contenu du fichier + OCR + Extraire le texte et les images + Composer.

La dernière étape consiste à écrire la chaîne de caractères concaténée dans une seconde bibliothèque.

  1. Ajouter SharePoint > Créer un fichier.
  2. Configure:
    • Adresse du site: même site que le déclencheur
    • Chemin du dossier: /Shared Documents/RagText
    • Nom de fichier: le jeton du nom de fichier du déclencheur suivi du texte littéral .txt
    • Contenu du fichier: le Composer jeton de sortie

SharePoint Créer une configuration de fichier

Action de création de fichier SharePoint avec l'adresse du site PDF4me SharePoint, le chemin du dossier /Shared Documents/RagText, le nom du fichier construit à partir du jeton de nom de fichier du déclencheur plus .txt, et le contenu du fichier défini sur le jeton de sortie Composer

Le contenu du fichier correspond à la sortie de la fonction Composer, reconnaissable à l'icône violette d'opération sur les données, et non à un élément provenant de PDF4me. Le texte est déjà assemblé à ce stade.

Conseil. Le jeton du nom de fichier du déclencheur contient déjà le .pdf extension, donc ajout .txt produit contract.pdf.txt, comme l'indique le dossier de sortie ci-dessus. Cela n'a aucune incidence et permet de garder le lien vers la source bien visible. Si vous préférez avoir contract.txt, enveloppez le jeton dans remplacer() et échanger .pdf pour .txt au lieu d'ajouter.


Exécutez le flux et vérifiez

  1. Sauvegarder le flux en haut à droite.
  2. Télécharger contract-sample.pdf dans le dossier d'entrée. Le déclencheur effectue une interrogation, veuillez patienter une minute.
  3. Ouvrez le flux historique d'exécution Vérifiez que les six actions sont bien validées par une coche verte. La reconnaissance optique de caractères (OCR) sera l'étape la plus lente.
  4. Ouvrir /Shared Documents/RagText. UN .txt Le fichier devrait se trouver là. Ouvrez-le et recherchez PDF4ME-CLEAN-TEST-2026Si ce marqueur est présent, la reconnaissance optique de caractères (OCR) et l'extraction ont fonctionné de bout en bout.

Qu'avez-vous construit concrètement ? Un pipeline d'ingestion de documents. Chaque PDF qui arrive dans la bibliothèque est automatiquement converti en texte brut, une étape indispensable, bien que peu attrayante, pour toute application de lecture de documents à grande échelle : recherche SharePoint, index vectoriel, chatbot de recherche assistée ou simple recherche plein texte. Si vous n'avez besoin que du texte au sein du flux, et non de son stockage sur disque, la conversion la plus courte est préférable. Extraire du texte à partir de PDF dans Power Automate La procédure pas à pas couvre ce point avec Dropbox.


Variantes courantes que vous pouvez ajouter sans reconstruction

Filtrer avant de télécharger
Comme le déclencheur renvoie d'abord les métadonnées, vous pouvez ajouter une condition sur le nom du fichier ou une colonne avant l'exécution de la récupération du contenu du fichier. Les chargements de fichiers autres que PDF sont alors gratuits.
Conservez également le PDF consultable
Ajoutez un deuxième fichier de création qui enregistre le résultat de la reconnaissance optique de caractères (OCR). Vous obtenez ainsi, en une seule opération, une copie texte pour les machines et un PDF consultable pour les humains.
Écrivez du JSON au lieu de texte brut
Modifiez l'expression Compose pour créer un objet contenant le nom du fichier, la date et le texte, puis enregistrez-le sous le nom .jsonLa plupart des plateformes de stockage de fichiers vectoriels privilégient les métadonnées en plus du contenu.
Flux de nuages comparé aux alternatives
Consultez le tableau comparatif ci-dessous pour voir en quoi cela diffère de Power Automate Desktop et d'AI Builder.
Flux de nuages comparé aux alternativesFonctionne sans surveillanceGère les PDF numérisésNiveau de connexion
PDF4me dans un flux cloud Power AutomateOuiOui, la reconnaissance optique de caractères est intégrée au flux de travail.Standard
Actions PDF de bureau Power AutomateUniquement lorsque la machine est alluméeAucune reconnaissance optique de caractères (OCR) dans les actions de baseStandard, plus une machine
Traitement des formulaires par AI BuilderOuiOuiPremium, crédit au compteur

Questions fréquentes

Power Automate peut-il extraire du texte d'un PDF ?

Pas de manière autonome dans un flux cloud. Les actions PDF de la documentation Microsoft appartiennent à Power Automate Desktop et ne sont pas disponibles dans les flux cloud, ce qui explique pourquoi de nombreuses discussions communautaires sur ce sujet restent sans réponse. L'ajout du connecteur PDF4me donne à un flux cloud une véritable fonctionnalité. Extraire du texte et des images action qui renvoie le texte du document sous forme de tableau.

L'extraction complète ne constitue qu'une seule opération. Les cinq étapes précédentes consistent simplement à déplacer le fichier en entrée et le texte en sortie.

Comment extraire du texte d'un PDF à l'aide de Power Automate ?

Déclenchez l'événement sur le nouveau fichier, récupérez ses octets avec Récupérer le contenu du fichier, courir Convertir un PDF en PDF modifiable grâce à la reconnaissance optique de caractères (OCR) Les pages numérisées reçoivent donc une couche de texte, puis sont exécutées. Extraire du texte et des images avec l'option Extraire le texte définie sur YesCela renvoie un texts tableau. Combinez-le avec une expression Compose si vous souhaitez du texte plutôt qu'un tableau.

Indiquez à l'étape d'extraction le résultat de la reconnaissance optique de caractères (OCR) plutôt que le fichier téléchargé. La réutilisation de la copie téléchargée explique pourquoi les documents numérisés ne renvoient aucun fichier.

Power Automate peut-il effectuer une reconnaissance optique de caractères (OCR) ?

Un flux cloud ne dispose pas de fonction OCR native. AI Builder en propose une avec une licence premium à la consommation, et Power Automate Desktop possède son propre moteur OCR installé sur une machine. PDF4me Convertir un PDF en PDF modifiable grâce à la reconnaissance optique de caractères (OCR) L'action s'exécute dans un flux cloud de niveau standard sans intervention d'une machine.

C'est OCR uniquement en cas de besoin Il est utile de connaître ce paramètre. Réglé sur trueIl inspecte chaque fichier et ignore la reconnaissance optique de caractères (OCR) lorsqu'une couche de texte existe déjà, de sorte qu'une bibliothèque mixte ne supporte pas le coût sur chaque document.

Pourquoi la fonction d'extraction de texte à partir d'un PDF de Power Automate ne fonctionne-t-elle pas ?

Dans la quasi-totalité des cas, trois causes sont à l'origine de la plupart des problèmes. Soit le document est une numérisation et n'a jamais été traité par reconnaissance optique de caractères (OCR), il n'y a donc aucun texte à extraire. Soit l'étape d'extraction lit le fichier téléchargé au lieu du résultat de l'OCR, ce qui produit le même résultat vide avec un document numérisé. Soit le texte est arrivé correctement, mais a été enregistré dans le fichier sous forme de tableau brut, ce qui lui donne l'apparence de JSON plutôt que d'un document.

Ouvrez l'historique d'exécution et examinez directement le résultat de l'extraction de texte et d'images. texts Le problème se situe en aval, dans les fonctions Composer ou Créer un fichier, car le contenu est présent.

Comment convertir gratuitement un PDF en fichier texte ?

Pour un document unique, n'importe quel convertisseur en ligne fera l'affaire. L'intérêt de ce processus réside dans le volume et la répétitivité : il s'exécute automatiquement pour chaque fichier déposé dans le dossier, gère les numérisations et ne nécessite aucune intervention humaine. L'offre gratuite de PDF4me couvre un nombre conséquent de documents par mois, et tous les connecteurs utilisés ici sont de la version standard ; aucune licence Power Automate premium n'est donc requise.


Dépannage

Le fichier .txt est créé mais il est vide.

L'option « Extraire le texte et les images » lit le mauvais fichier. Son contenu doit provenir de l'action OCR (icône PDF4me) et non de l'option « Obtenir le contenu du fichier ». Sur un PDF numérique natif, les deux options fonctionnent, c'est pourquoi ce problème n'apparaît généralement qu'après la réception d'une numérisation.

Le résultat ressemble à ["ligne une","ligne deux"] au lieu de texte

Le fichier créé reçoit les données brutes. texts tableau. Son contenu doit correspondre au jeton de sortie de Compose. Si Compose est présent mais renvoie toujours un tableau, vérifiez que l'expression de jointure comporte bien les deux arguments : le tableau et le séparateur.

La récupération du contenu du fichier a échoué avec le message « fichier introuvable ».

L'identifiant de fichier est associé au mauvais jeton. Il a besoin de celui du déclencheur. IdentifiantIl ne s'agit ni du nom du fichier, ni du chemin d'accès, ni de l'identifiant de l'élément. Ces éléments semblent interchangeables dans la liste de contenu dynamique, mais ils ne le sont pas.

Le flux se déclenche sans cesse.

Le dossier de sortie se trouve dans le dossier surveillé par le déclencheur ; ainsi, chaque nouveau fichier texte lance une nouvelle exécution. Conservez RagInput et RagText séparés, comme des dossiers frères plutôt qu'imbriqués.


Prochaines étapes

Le même schéma en six étapes (surveiller un dossier, récupérer, OCR, extraire, aplatir, enregistrer) transforme n'importe quelle bibliothèque de documents en un corpus lisible par machine.