Saltar al contenido principal

Convierta archivos PDF a archivos de texto en Power Automate: Transforme contratos escaneados en un corpus de SharePoint con capacidad de búsqueda mediante PDF4me.

· 28 min de lectura
SEO and Content Writer

PDF4me Extraer texto e imágenes es una acción de Power Automate que devuelve la capa de texto de un PDF como una matriz. Combinado con OCR aguas arriba y una unión de composición aguas abajo, este flujo convierte cada PDF que se coloca en una biblioteca de SharePoint en un documento coincidente .txt Archivo listo para búsqueda por IA.

Si buscas cómo hacer esto, el primer resultado es el de Microsoft. Referencia de acciones PDF, que describe Power Automate De oficina acciones. No existen en un flujo en la nube. Ese detalle es la razón por la que los siguientes dos resultados son un hilo de Reddit y un hilo de la comunidad de Power Platform donde los usuarios hacen la misma pregunta sin obtener una respuesta directa. Este flujo es la respuesta directa y se ejecuta completamente en la nube con conectores de nivel estándar.

El flujo de un vistazo
1. When a file is created (properties only)
SharePoint trigger on the library, scoped to the RagInput folder. Returns metadata, not bytes.
2. Get file content
Fetches the actual PDF bytes using the identifier the trigger handed over.
3. Convert PDF to editable PDF using OCR
Adds a text layer to scans. OCR Only When Needed skips PDFs that already have one.
4. Extract Text and Images
Returns the text as an array. Extract Images stays No.
5. Compose
join() flattens the texts array into one newline separated string.
6. Create file
SharePoint writes the string to /Shared Documents/RagText as .txt.
La versión corta

Un archivo PDF llega a una biblioteca de SharePoint. El desencadenador informa del nuevo elemento, la función Obtener contenido del archivo extrae sus bytes y PDF4me ejecuta el OCR solo si el archivo lo requiere, antes de extraer el texto como una matriz. Una expresión de composición de una sola línea une esa matriz en una sola cadena, y SharePoint escribe el resultado en el archivo contiguo como un archivo de texto plano. Seis acciones, sin conector premium, y todo el proceso finaliza en unos doce segundos.

Preguntas y respuestas basadas en el porqué

¿Por qué escribir un archivo .txt en lugar de simplemente usar el texto del flujo? Una cadena dentro de una ejecución de flujo permanece activa durante toda la duración de dicha ejecución. Un archivo en una biblioteca es persistente, indexable y legible por cualquier sistema al que se le apunte posteriormente, ya sea una búsqueda de SharePoint, una base de datos vectorial o un chatbot que extrae contexto.

¿Por qué se necesitan dos acciones para obtener un archivo? El activador que solo obtiene las propiedades es deliberadamente ligero. Informa que ha aparecido un elemento y proporciona sus metadatos, incluido un identificador, pero no los bytes. La función "Obtener contenido del archivo" intercambia ese identificador por el documento en sí. Separar ambos activadores mantiene la velocidad y permite filtrar los metadatos antes de descargar nada.

¿Para qué usar OCR si la mayoría de los PDF ya tienen texto? Porque no se puede distinguir a simple vista. Un contrato escaneado y uno digital original son indistinguibles en una lista de carpetas. La acción de OCR OCR solo cuando sea necesario Esta configuración inspecciona cada archivo y omite aquellos que ya contienen una capa de texto, por lo que solo pagas el costo donde se realiza alguna compra.

¿Por qué es necesario un paso de composición? Extraer texto e imágenes devuelve texts Como una matriz, generalmente una entrada por página. Escribir una matriz directamente en un archivo genera corchetes JSON y comillas escapadas. Compose une las entradas en prosa limpia antes de que nada se guarde en el disco.


Lo que obtendrás

Aporte: Cualquier archivo PDF que se añada a una biblioteca de documentos de SharePoint, ya sea escaneado o digital, sin necesidad de seguir ninguna convención de nomenclatura. Producción: Un archivo de texto plano por cada PDF en una segunda biblioteca, que contiene el contenido legible completo del documento.

Biblioteca de documentos de SharePoint que muestra la carpeta RagInput que contiene rag-test.pdf, rag-test2.pdf y services-agreement.pdf, todos modificados por la cuenta Pdf4me Flow.

RagInput. Arrastra un PDF aquí y el proceso comenzará.

Biblioteca de documentos de SharePoint que muestra la carpeta RagText que contiene rag-test.pdf.txt y rag-test2.pdf.txt generados por el flujo.

RagText. Un archivo de texto plano por PDF, listo para indexar.

Esto es lo que se obtiene al otro lado del contrato de muestra, exactamente como se grabó en el disco:

MASTER SERVICES AGREEMENT
Between Initech LLC and Umbrella Inc.
Effective date: 1 January 2026. Auto-renews annually.
Liability cap: USD 100000. Confidentiality: 5 years.
CLEAN TEST MARKER: PDF4ME-CLEAN-TEST-2026.

Tenga en cuenta los espacios iniciales. El OCR conserva los espacios en blanco del diseño, lo cual es adecuado para la búsqueda y para alimentar un modelo de lenguaje. Elimínelos posteriormente si un analizador posterior es exigente.


Lo que necesitas

  • Power Automate. Abrir Power AutomateEste es un flujo en la nube. Todo aquí es de nivel estándar, sin conector premium ni puerta de enlace.
  • Clave API de PDF4me. Obtén tu clave APIConéctalo la primera vez que añadas una acción de PDF4me.
  • Un sitio de SharePoint con dos carpetasUna carpeta para los archivos PDF de entrada y otra para el texto de salida. Crea ambas antes de compilar, para que los selectores de carpetas tengan dónde apuntar.
  • Un PDF de prueba. Ejemplo de contrato.pdf. Un breve contrato de servicios con una línea de referencia que puedes buscar.

Primero, toma las muestras. Una vez guardado el flujo, suba el PDF a su carpeta de entrada y, a continuación, compare el contenido de la carpeta de salida con el archivo de texto esperado.


El flujo de un vistazo

  1. Cuando se crea un archivo (solo propiedades) (Disparador de SharePoint) con alcance /Shared Documents/RagInput.
  2. Obtener el contenido del archivo usando el disparador Identifier.
  3. PDF - Convierta un PDF en un PDF editable mediante OCR. con calidad Draft y OCR solo cuando sea necesario true.
  4. PDF - Extraer texto e imágenes con texto extraído Yes y extraer imágenes No.
  5. Componer correr una join() sobre el regreso texts matriz.
  6. Crear archivo Escritura (SharePoint) .txt en /Shared Documents/RagText.

Descripción general del flujo completo

Historial de ejecución de Power Automate que muestra seis acciones que se completaron con éxito en orden: SharePoint Cuando se crea un archivo, solo propiedades a los 0,3 segundos, Obtener contenido del archivo a los 0,2 segundos, PDF Convertir PDF a PDF editable usando OCR a los 11 segundos, PDF Extraer texto e imágenes a los 0,4 segundos, Redactar a los 0 segundos y SharePoint Crear archivo a los 0,3 segundos.

OCR es el único equipo lento, con 11 segundos. Los otros cinco terminan en menos de medio segundo cada uno.


Paso 1: ¿Cómo se monitoriza una biblioteca de SharePoint para detectar nuevos archivos PDF?

Flujo hasta ahora: Nada todavía, este es el detonante.

Usar Cuando se crea un archivo (solo propiedades)Se activa con los elementos nuevos y devuelve sus metadatos. Limita su alcance a una sola carpeta, ya que una monitorización de toda la biblioteca se activa con cada carga que se realice en cualquier lugar de esa biblioteca.

  1. Crear un Flujo de nube automatizado y elegir Cuando se crea un archivo (solo propiedades).
  2. Configurar:
    • Dirección del sitio: https://ynoox1.sharepoint.com/sites/PDF4meSharepoints
    • Nombre de la biblioteca: elegir Documentos del menú desplegable
  3. Abierto Parámetros avanzados, agregar Carpetay configurarlo en /Shared Documents/RagInput.

Configuración del desencadenador de SharePoint

Power Automate Cuando se crea un archivo, solo se activa el panel de propiedades con la dirección del sitio establecida en PDF4me Sharepoints, el nombre de la biblioteca establecido en Documentos y el parámetro Carpeta avanzada establecido en /Shared Documents/RagInput

El nombre de la biblioteca es la propia biblioteca, Documentos. El parámetro Carpeta que aparece a continuación es el que limita el activador a una carpeta específica dentro de ella.

Consejo. También encontrarás un disparador llamado Cuando se crea un archivo en una carpeta, que devuelve directamente los bytes del archivo y le ahorra la siguiente acción. Está marcado como obsoleto, por lo que se recomienda usar solo las propiedades que se muestran aquí para cualquier cosa que desee mantener en ejecución.


Paso 2: ¿Por qué necesitas obtener el contenido del archivo después del activador?

Flujo hasta ahora: Disparador de SharePoint.

El disparador de solo propiedades entrega metadatos, no el documento. Obtener contenido del archivo intercambia el disparador. Identifier para los bytes reales que PDF4me necesita.

  1. Agregar SharePoint > Obtener el contenido del archivo.
  2. Configurar:
    • Dirección del sitio: el mismo sitio que el desencadenante
    • Identificador de archivo: Identifier desde el disparador
  3. Abierto Parámetros avanzados y establecer Inferir tipo de contenido a Yes.

Obtener la configuración del contenido del archivo

Panel de acciones Obtener contenido de archivo de SharePoint con Dirección del sitio establecida en el sitio PDF4me de SharePoint, Identificador de archivo asignado al token de identificador del desencadenador e Inferir tipo de contenido establecido en Sí

Inferir tipo de contenido Sí es lo que le entrega a la siguiente acción bytes PDF reales en lugar de un blob genérico.

El identificador es la unión entre los dos pasos. Utilice el disparador Identificador El campo, no el nombre del archivo ni la ruta. Los nombres se repiten en las carpetas y cambian cuando alguien renombra un documento. El identificador no.


Paso 3: ¿Por qué ejecutar el OCR antes de extraer el texto?

Flujo hasta ahora: Disparador de SharePoint más Obtener contenido de archivo.

Una página escaneada es una imagen. No hay texto que extraer hasta que el OCR le añade una capa de texto. Esta acción lo hace, y es lo suficientemente inteligente como para no dañar los PDF que ya son legibles.

  1. Agregar PDF - Convierta un PDF en un PDF editable mediante OCR..
  2. Configurar:
    • Contenido del archivo: File Content de Obtener el contenido del archivo
    • Nombre del archivo: el token del nombre de archivo del activador
    • Tipo de calidad: Draft
    • OCR solo cuando sea necesario: true
    • Idioma: dejar en blanco a menos que sus documentos no estén en inglés
    • ¿Es asíncrono?: No

Parámetros de OCR

ParámetroValor utilizado aquíLo que controla
Contenido del archivoFile Content Obtener contenido del archivoLos bytes del PDF a procesar.
Nombre del archivotoken de nombre de archivo de activaciónNombre de origen, utilizado para la identificación del procesamiento.
Tipo de calidadDraftEsfuerzo de reconocimiento. Draft es lo suficientemente rápido y preciso para escaneos limpios. Muévase a High para originales de mala calidad.
OCR solo cuando sea necesariotrueOmite los archivos que ya tienen una capa de texto, por lo que los PDF digitales se procesan directamente.
IdiomablancoSugerencia para el motor de reconocimiento. Déjelo en blanco para inglés.
¿Es asíncrono?NoEspera el resultado en línea. Cambiar a Yes para documentos muy grandes.
PDF4me Convierte PDF a PDF editable usando el panel de acciones OCR con Contenido del archivo desde Obtener contenido del archivo, Nombre del archivo desde el activador, Tipo de calidad Borrador, OCR Solo cuando sea necesario verdadero, Idioma en blanco y Es asíncrono No

Aquí, QualityType está configurado como Borrador. En un escaneo limpio, se lee igual de bien que Alto y requiere menos tiempo.

Consejo. Este es el paso lento, 11 segundos en la carrera anterior frente a medio segundo para todo lo demás. Empiece en Draft, revise el archivo de texto y solo pase a High Si los caracteres se devuelven incorrectos, la forma más sencilla de ralentizar este proceso es aumentar la calidad de los documentos que no lo necesitan.


Paso 4: ¿Cómo devuelve el texto la función Extraer texto e imágenes?

Flujo hasta ahora: Activador de SharePoint más Obtener contenido de archivo más OCR.

Esta acción lee la capa de texto y la devuelve como una matriz llamada textsApúntelo hacia la salida del OCR, no hacia la opción "Obtener contenido del archivo", o las páginas escaneadas aparecerán vacías.

  1. Agregar PDF - Extraer texto e imágenes.
  2. Configurar:
    • Contenido del archivo: File Content del Acción de la OCR
    • Nombre del archivo: el token del nombre de archivo del activador
    • Extraer texto: Yes
    • Extraer imágenes: No

Parámetros para extraer texto e imágenes

ParámetroValor utilizado aquíLo que controla
Contenido del archivoFile Content desde el paso OCREl PDF con capacidad de búsqueda. Reutilizar Obtener copia del contenido del archivo aquí es el error más común.
Nombre del archivotoken de nombre de archivo de activaciónNombre de la fuente, conservado para su identificación.
Extraer textoYesDevuelve el texts matriz.
Extraer imágenesNoOmitir imágenes incrustadas. Establecer Yes Solo si los necesitas, la respuesta será mucho mayor.
Panel de acciones PDF4me Extraer texto e imágenes con el contenido del archivo asignado desde la acción OCR de PDF4me, el nombre del archivo desde el desencadenador de SharePoint, Extraer texto configurado en Sí y Extraer imágenes configurado en No.

Fíjese en los iconos. El contenido del archivo lleva la marca PDF4me porque proviene del OCR. El nombre del archivo lleva la marca SharePoint porque proviene del desencadenador.


Paso 5: ¿Cómo se convierte la matriz de textos en una sola cadena?

Flujo hasta ahora: Activador de SharePoint más Obtener contenido de archivo más OCR más Extraer texto e imágenes.

texts es una matriz. Un archivo necesita una cadena. Uno unir expresión une los dos.

  1. Agregar un Componer acción.
  2. En Entradas, cambia al editor de expresiones y pega:
join(body('PDF_-_Extract_Text_and_Images')?['texts'], decodeUriComponent('%0A'))
  1. Haga clic Actualizar.

El decodeUriComponent('%0A') Así es como se escribe un salto de línea literal en una expresión de Power Automate. No hay secuencia de escape para ello, por lo que esta es la convención.

Componer configuración

Acción de composición de Power Automate con el editor de expresiones abierto que muestra la unión de la matriz de textos PDF Extract Text and Images con decodeUriComponent percent zero A como separador

El nombre de la acción dentro de body() usa guiones bajos para los espacios y guiones. Si se cambia el nombre de la acción, esta expresión deja de funcionar.

Esta es la única línea que decide si la salida es legible. Omita la opción Compose y pase la matriz directamente a Create file, y el archivo de texto contendrá corchetes JSON y comillas escapadas en lugar del documento.


Paso 6: ¿Cómo se guarda el texto como un archivo .txt en SharePoint?

Flujo hasta ahora: Activador de SharePoint más Obtener contenido de archivo más OCR más Extraer texto e imágenes más Redactar.

El último paso consiste en escribir la cadena resultante en una segunda biblioteca.

  1. Agregar SharePoint > Crear archivo.
  2. Configurar:
    • Dirección del sitio: mismo sitio que el desencadenante
    • Ruta de la carpeta: /Shared Documents/RagText
    • Nombre del archivo: el token del nombre de archivo del activador seguido del texto literal .txt
    • Contenido del archivo: el Componer token de salida

Configuración de creación de archivos de SharePoint

Acción de creación de archivo de SharePoint con la dirección del sitio PDF4me Sharepoints, ruta de carpeta /Shared Documents/RagText, nombre de archivo generado a partir del token de nombre de archivo del desencadenador más .txt, y contenido del archivo establecido en el token de salida de Compose.

El contenido del archivo es la salida de la función Compose, que lleva el icono morado de la operación de datos, no algo de PDF4me. El texto ya se ha compilado en este punto.

Consejo. El token del nombre de archivo del disparador ya contiene el .pdf extensión, por lo que se añade .txt produce contract.pdf.txt, que es lo que muestra la carpeta de salida anterior. Eso es inofensivo y mantiene el enlace a la fuente obvio. Si prefiere tener contract.txt, envuelve el token en reemplazar() y cambiar .pdf para .txt en lugar de añadir.


Ejecuta el flujo y verifica.

  1. Ahorrar el flujo en la parte superior derecha.
  2. Subir contract-sample.pdf en la carpeta de entrada. El activador realiza sondeos, así que espere un minuto.
  3. Abrir el flujo historial de ejecución y comprueba que las seis acciones tengan una marca de verificación verde. El OCR será el más lento.
  4. Abierto /Shared Documents/RagText. A .txt El archivo debería estar ahí. Ábrelo y busca PDF4ME-CLEAN-TEST-2026Si ese marcador está presente, tanto el OCR como la extracción funcionaron correctamente de principio a fin.

¿Qué construiste exactamente? Una canalización de ingesta de documentos. Cada PDF que llega a la biblioteca se convierte automáticamente en texto plano, lo cual es el requisito previo, aunque poco glamuroso, para cualquier sistema que lea documentos a gran escala: búsqueda en SharePoint, un índice vectorial, un chatbot de recuperación aumentada o grep de texto plano. Si solo necesita el texto dentro del flujo en lugar de en el disco, la canalización más corta Extraer texto de archivos PDF en Power Automate El tutorial explica eso con Dropbox.


Variaciones comunes que puedes agregar sin reconstruir

Filtra antes de descargar
Dado que el activador devuelve primero los metadatos, puede agregar una condición al nombre del archivo o a una columna antes de que se ejecute la función Obtener contenido del archivo. De esta manera, las cargas que no sean en formato PDF no tendrán ningún costo.
Conserva también el PDF con capacidad de búsqueda.
Agregue un segundo archivo de creación que guarde el resultado de la acción OCR. De esta manera, obtendrá una copia de texto para máquinas y un PDF con capacidad de búsqueda para humanos, todo en una sola ejecución.
Escribe JSON en lugar de texto plano.
Modifique la expresión Compose para crear un objeto con el nombre del archivo, la fecha y el texto, y luego guárdelo como .jsonLa mayoría de las tiendas de vectores prefieren los metadatos junto con el contenido.
Flujo en la nube frente a las alternativas
Consulte la tabla comparativa a continuación para ver las diferencias con Power Automate Desktop y con AI Builder.
Flujo en la nube frente a las alternativasFunciona sin supervisiónAdmite archivos PDF escaneados.Nivel de conector
PDF4me en un flujo de nube de Power AutomateSí, OCR integrado en el flujoEstándar
Acciones de PDF de Power Automate DesktopSolo mientras la máquina esté encendidaNo hay OCR en las acciones básicasEstándar, más una máquina
Procesamiento de formularios de AI BuilderPremium, con consumo de crédito

Preguntas frecuentes

¿Puede Power Automate extraer texto de un PDF?

No funciona por sí solo en un flujo en la nube. Las acciones de PDF en la documentación de Microsoft pertenecen a Power Automate Desktop y no están disponibles en flujos en la nube, razón por la cual tantos hilos de la comunidad sobre esta pregunta quedan sin resolver. Agregar el conector PDF4me le da a un flujo en la nube una verdadera funcionalidad. Extraer texto e imágenes Acción que devuelve el texto del documento como una matriz.

La extracción completa se realiza en una sola acción. Los cinco pasos siguientes consisten simplemente en introducir el archivo y extraer el texto.

¿Cómo extraer texto de un PDF usando Power Automate?

Activar en el nuevo archivo, obtener sus bytes con Obtener el contenido del archivo, correr Convierta un PDF a un PDF editable mediante OCR. así que las páginas escaneadas obtienen una capa de texto y luego se ejecutan. Extraer texto e imágenes con Extraer texto configurado en Yes. Eso devuelve un texts matriz. Únala con una expresión Compose si desea prosa en lugar de una matriz.

Dirige el paso de extracción a la salida de la acción OCR, en lugar de al archivo que descargaste. Reutilizar la copia descargada es la razón por la que los documentos escaneados aparecen vacíos.

¿Puede Power Automate realizar OCR?

Un flujo en la nube no tiene una acción OCR nativa. AI Builder ofrece una en una licencia premium con límite de crédito, y Power Automate Desktop tiene su propio motor OCR vinculado a una máquina. PDF4me Convierta un PDF a un PDF editable mediante OCR. La acción se ejecuta en un flujo de nube de nivel estándar sin la intervención de ninguna máquina.

Es OCR solo cuando sea necesario Es importante conocer la configuración. Establecer en trueInspecciona cada archivo y omite el OCR cuando ya existe una capa de texto, por lo que una biblioteca mixta no paga el costo en cada documento.

¿Por qué no funciona la función de extracción de texto de PDF de Power Automate?

Tres causas abarcan casi todos los casos. El documento es un escaneo que nunca pasó por OCR, por lo que realmente no hay texto que extraer. El paso de extracción lee el archivo descargado en lugar de la salida de OCR, lo que produce el mismo resultado vacío en la entrada escaneada. O bien, el texto llegó correctamente, pero se escribió en el archivo como una matriz sin formato, por lo que parece JSON en lugar de un documento.

Abra el historial de ejecución e inspeccione directamente la salida de Extraer texto e imágenes. Si texts Si el contenido está ahí, el problema se encuentra más adelante en la función Componer o Crear archivo.

¿Cómo convertir un PDF a un archivo de texto de forma gratuita?

Para un solo documento, cualquier convertidor en línea sirve. La razón para crear este flujo es el volumen y la repetición: se ejecuta automáticamente en cada archivo que llega a la carpeta, gestiona los escaneos y no requiere que nadie esté frente al teclado. El plan gratuito de PDF4me cubre una cantidad considerable de documentos al mes, y todos los conectores utilizados son estándar, por lo que no se requiere una licencia premium de Power Automate.


Solución de problemas

El archivo .txt se crea pero está vacío.

La función Extraer texto e imágenes está leyendo el archivo incorrecto. El contenido del archivo debe provenir de la acción OCR, que lleva el icono de PDF4me, no de Obtener contenido del archivo. En un PDF digital nativo, ambas opciones funcionan, por lo que este error suele aparecer solo cuando se recibe un escaneo real.

La salida se ve como ["línea uno","línea dos"] en lugar de texto

El archivo de creación está recibiendo el archivo sin procesar. texts matriz. Su contenido de archivo debe ser el token de salida de Compose. Si Compose está presente pero aún devuelve una matriz, verifique que la expresión de unión tenga ambos argumentos: la matriz y el separador.

La obtención del contenido del archivo falla con el mensaje "archivo no encontrado".

El identificador de archivo está asignado al token incorrecto. Necesita el disparador. IdentificadorNo se trata del nombre del archivo, la ruta ni el ID del elemento. Estos elementos parecen intercambiables en la lista de contenido dinámico, pero no lo son.

El flujo se sigue activando a sí mismo.

La carpeta de salida se encuentra dentro de la carpeta que supervisa el activador, por lo que cada nuevo archivo de texto inicia una nueva ejecución. Mantén RagInput y RagText separados, como carpetas hermanas en lugar de anidados.


Próximos pasos

El mismo patrón de seis pasos (monitorizar una carpeta, recuperar, OCR, extraer, aplanar, guardar) convierte cualquier biblioteca de documentos en un corpus legible por máquina.