Saltar al contenido principal

Una publicación etiquetados con "extract-text-from-pdf"

Ver Todas las Etiquetas

Convierta archivos PDF a archivos de texto en Power Automate: Transforme contratos escaneados en un corpus de SharePoint con capacidad de búsqueda mediante PDF4me.

· 28 min de lectura
SEO and Content Writer

PDF4me Extraer texto e imágenes es una acción de Power Automate que devuelve la capa de texto de un PDF como una matriz. Combinado con OCR aguas arriba y una unión de composición aguas abajo, este flujo convierte cada PDF que se coloca en una biblioteca de SharePoint en un documento coincidente .txt Archivo listo para búsqueda por IA.

Si buscas cómo hacer esto, el primer resultado es el de Microsoft. Referencia de acciones PDF, que describe Power Automate De oficina acciones. No existen en un flujo en la nube. Ese detalle es la razón por la que los siguientes dos resultados son un hilo de Reddit y un hilo de la comunidad de Power Platform donde los usuarios hacen la misma pregunta sin obtener una respuesta directa. Este flujo es la respuesta directa y se ejecuta completamente en la nube con conectores de nivel estándar.

El flujo de un vistazo
1. When a file is created (properties only)
SharePoint trigger on the library, scoped to the RagInput folder. Returns metadata, not bytes.
2. Get file content
Fetches the actual PDF bytes using the identifier the trigger handed over.
3. Convert PDF to editable PDF using OCR
Adds a text layer to scans. OCR Only When Needed skips PDFs that already have one.
4. Extract Text and Images
Returns the text as an array. Extract Images stays No.
5. Compose
join() flattens the texts array into one newline separated string.
6. Create file
SharePoint writes the string to /Shared Documents/RagText as .txt.