Convierta archivos PDF a archivos de texto en Power Automate: Transforme contratos escaneados en un corpus de SharePoint con capacidad de búsqueda mediante PDF4me.

PDF4me Extraer texto e imágenes es una acción de Power Automate que devuelve la capa de texto de un PDF como una matriz. Combinado con OCR aguas arriba y una unión de composición aguas abajo, este flujo convierte cada PDF que se coloca en una biblioteca de SharePoint en un documento coincidente .txt Archivo listo para búsqueda por IA.
Si buscas cómo hacer esto, el primer resultado es el de Microsoft. Referencia de acciones PDF, que describe Power Automate De oficina acciones. No existen en un flujo en la nube. Ese detalle es la razón por la que los siguientes dos resultados son un hilo de Reddit y un hilo de la comunidad de Power Platform donde los usuarios hacen la misma pregunta sin obtener una respuesta directa. Este flujo es la respuesta directa y se ejecuta completamente en la nube con conectores de nivel estándar.
Un archivo PDF llega a una biblioteca de SharePoint. El desencadenador informa del nuevo elemento, la función Obtener contenido del archivo extrae sus bytes y PDF4me ejecuta el OCR solo si el archivo lo requiere, antes de extraer el texto como una matriz. Una expresión de composición de una sola línea une esa matriz en una sola cadena, y SharePoint escribe el resultado en el archivo contiguo como un archivo de texto plano. Seis acciones, sin conector premium, y todo el proceso finaliza en unos doce segundos.
Preguntas y respuestas basadas en el porqué
¿Por qué escribir un archivo .txt en lugar de simplemente usar el texto del flujo? Una cadena dentro de una ejecución de flujo permanece activa durante toda la duración de dicha ejecución. Un archivo en una biblioteca es persistente, indexable y legible por cualquier sistema al que se le apunte posteriormente, ya sea una búsqueda de SharePoint, una base de datos vectorial o un chatbot que extrae contexto.
¿Por qué se necesitan dos acciones para obtener un archivo? El activador que solo obtiene las propiedades es deliberadamente ligero. Informa que ha aparecido un elemento y proporciona sus metadatos, incluido un identificador, pero no los bytes. La función "Obtener contenido del archivo" intercambia ese identificador por el documento en sí. Separar ambos activadores mantiene la velocidad y permite filtrar los metadatos antes de descargar nada.
¿Para qué usar OCR si la mayoría de los PDF ya tienen texto? Porque no se puede distinguir a simple vista. Un contrato escaneado y uno digital original son indistinguibles en una lista de carpetas. La acción de OCR OCR solo cuando sea necesario Esta configuración inspecciona cada archivo y omite aquellos que ya contienen una capa de texto, por lo que solo pagas el costo donde se realiza alguna compra.
¿Por qué es necesario un paso de composición? Extraer texto e imágenes devuelve texts Como una matriz, generalmente una entrada por página. Escribir una matriz directamente en un archivo genera corchetes JSON y comillas escapadas. Compose une las entradas en prosa limpia antes de que nada se guarde en el disco.
Lo que obtendrás
Aporte: Cualquier archivo PDF que se añada a una biblioteca de documentos de SharePoint, ya sea escaneado o digital, sin necesidad de seguir ninguna convención de nomenclatura. Producción: Un archivo de texto plano por cada PDF en una segunda biblioteca, que contiene el contenido legible completo del documento.

RagInput. Arrastra un PDF aquí y el proceso comenzará.

RagText. Un archivo de texto plano por PDF, listo para indexar.
Esto es lo que se obtiene al otro lado del contrato de muestra, exactamente como se grabó en el disco:
MASTER SERVICES AGREEMENT
Between Initech LLC and Umbrella Inc.
Effective date: 1 January 2026. Auto-renews annually.
Liability cap: USD 100000. Confidentiality: 5 years.
CLEAN TEST MARKER: PDF4ME-CLEAN-TEST-2026.
Tenga en cuenta los espacios iniciales. El OCR conserva los espacios en blanco del diseño, lo cual es adecuado para la búsqueda y para alimentar un modelo de lenguaje. Elimínelos posteriormente si un analizador posterior es exigente.
Lo que necesitas
- Power Automate. Abrir Power AutomateEste es un flujo en la nube. Todo aquí es de nivel estándar, sin conector premium ni puerta de enlace.
- Clave API de PDF4me. Obtén tu clave APIConéctalo la primera vez que añadas una acción de PDF4me.
- Un sitio de SharePoint con dos carpetasUna carpeta para los archivos PDF de entrada y otra para el texto de salida. Crea ambas antes de compilar, para que los selectores de carpetas tengan dónde apuntar.
- Un PDF de prueba. Ejemplo de contrato.pdf. Un breve contrato de servicios con una línea de referencia que puedes buscar.
Primero, toma las muestras. Una vez guardado el flujo, suba el PDF a su carpeta de entrada y, a continuación, compare el contenido de la carpeta de salida con el archivo de texto esperado.
El flujo de un vistazo
- Cuando se crea un archivo (solo propiedades) (Disparador de SharePoint) con alcance
/Shared Documents/RagInput. - Obtener el contenido del archivo usando el disparador
Identifier. - PDF - Convierta un PDF en un PDF editable mediante OCR. con calidad
Drafty OCR solo cuando sea necesariotrue. - PDF - Extraer texto e imágenes con texto extraído
Yesy extraer imágenesNo. - Componer correr una
join()sobre el regresotextsmatriz. - Crear archivo Escritura (SharePoint)
.txten/Shared Documents/RagText.
Descripción general del flujo completo

OCR es el único equipo lento, con 11 segundos. Los otros cinco terminan en menos de medio segundo cada uno.
Paso 1: ¿Cómo se monitoriza una biblioteca de SharePoint para detectar nuevos archivos PDF?
Flujo hasta ahora: Nada todavía, este es el detonante.
Usar Cuando se crea un archivo (solo propiedades)Se activa con los elementos nuevos y devuelve sus metadatos. Limita su alcance a una sola carpeta, ya que una monitorización de toda la biblioteca se activa con cada carga que se realice en cualquier lugar de esa biblioteca.
- Crear un Flujo de nube automatizado y elegir Cuando se crea un archivo (solo propiedades).
- Configurar:
- Dirección del sitio:
https://ynoox1.sharepoint.com/sites/PDF4meSharepoints - Nombre de la biblioteca: elegir Documentos del menú desplegable
- Dirección del sitio:
- Abierto Parámetros avanzados, agregar Carpetay configurarlo en
/Shared Documents/RagInput.
Configuración del desencadenador de SharePoint

El nombre de la biblioteca es la propia biblioteca, Documentos. El parámetro Carpeta que aparece a continuación es el que limita el activador a una carpeta específica dentro de ella.
Consejo. También encontrarás un disparador llamado Cuando se crea un archivo en una carpeta, que devuelve directamente los bytes del archivo y le ahorra la siguiente acción. Está marcado como obsoleto, por lo que se recomienda usar solo las propiedades que se muestran aquí para cualquier cosa que desee mantener en ejecución.
Paso 2: ¿Por qué necesitas obtener el contenido del archivo después del activador?
Flujo hasta ahora: Disparador de SharePoint.
El disparador de solo propiedades entrega metadatos, no el documento. Obtener contenido del archivo intercambia el disparador. Identifier para los bytes reales que PDF4me necesita.
- Agregar SharePoint > Obtener el contenido del archivo.
- Configurar:
- Dirección del sitio: el mismo sitio que el desencadenante
- Identificador de archivo:
Identifierdesde el disparador
- Abierto Parámetros avanzados y establecer Inferir tipo de contenido a
Yes.
Obtener la configuración del contenido del archivo

Inferir tipo de contenido Sí es lo que le entrega a la siguiente acción bytes PDF reales en lugar de un blob genérico.
El identificador es la unión entre los dos pasos. Utilice el disparador Identificador El campo, no el nombre del archivo ni la ruta. Los nombres se repiten en las carpetas y cambian cuando alguien renombra un documento. El identificador no.
Paso 3: ¿Por qué ejecutar el OCR antes de extraer el texto?
Flujo hasta ahora: Disparador de SharePoint más Obtener contenido de archivo.
Una página escaneada es una imagen. No hay texto que extraer hasta que el OCR le añade una capa de texto. Esta acción lo hace, y es lo suficientemente inteligente como para no dañar los PDF que ya son legibles.
- Agregar PDF - Convierta un PDF en un PDF editable mediante OCR..
- Configurar:
- Contenido del archivo:
File Contentde Obtener el contenido del archivo - Nombre del archivo: el token del nombre de archivo del activador
- Tipo de calidad:
Draft - OCR solo cuando sea necesario:
true - Idioma: dejar en blanco a menos que sus documentos no estén en inglés
- ¿Es asíncrono?:
No
- Contenido del archivo:
Parámetros de OCR
| Parámetro | Valor utilizado aquí | Lo que controla |
|---|---|---|
| Contenido del archivo | File Content Obtener contenido del archivo | Los bytes del PDF a procesar. |
| Nombre del archivo | token de nombre de archivo de activación | Nombre de origen, utilizado para la identificación del procesamiento. |
| Tipo de calidad | Draft | Esfuerzo de reconocimiento. Draft es lo suficientemente rápido y preciso para escaneos limpios. Muévase a High para originales de mala calidad. |
| OCR solo cuando sea necesario | true | Omite los archivos que ya tienen una capa de texto, por lo que los PDF digitales se procesan directamente. |
| Idioma | blanco | Sugerencia para el motor de reconocimiento. Déjelo en blanco para inglés. |
| ¿Es asíncrono? | No | Espera el resultado en línea. Cambiar a Yes para documentos muy grandes. |

Aquí, QualityType está configurado como Borrador. En un escaneo limpio, se lee igual de bien que Alto y requiere menos tiempo.
Consejo. Este es el paso lento, 11 segundos en la carrera anterior frente a medio segundo para todo lo demás. Empiece en Draft, revise el archivo de texto y solo pase a High Si los caracteres se devuelven incorrectos, la forma más sencilla de ralentizar este proceso es aumentar la calidad de los documentos que no lo necesitan.
Paso 4: ¿Cómo devuelve el texto la función Extraer texto e imágenes?
Flujo hasta ahora: Activador de SharePoint más Obtener contenido de archivo más OCR.
Esta acción lee la capa de texto y la devuelve como una matriz llamada textsApúntelo hacia la salida del OCR, no hacia la opción "Obtener contenido del archivo", o las páginas escaneadas aparecerán vacías.
- Agregar PDF - Extraer texto e imágenes.
- Configurar:
- Contenido del archivo:
File Contentdel Acción de la OCR - Nombre del archivo: el token del nombre de archivo del activador
- Extraer texto:
Yes - Extraer imágenes:
No
- Contenido del archivo:
Parámetros para extraer texto e imágenes
| Parámetro | Valor utilizado aquí | Lo que controla |
|---|---|---|
| Contenido del archivo | File Content desde el paso OCR | El PDF con capacidad de búsqueda. Reutilizar Obtener copia del contenido del archivo aquí es el error más común. |
| Nombre del archivo | token de nombre de archivo de activación | Nombre de la fuente, conservado para su identificación. |
| Extraer texto | Yes | Devuelve el texts matriz. |
| Extraer imágenes | No | Omitir imágenes incrustadas. Establecer Yes Solo si los necesitas, la respuesta será mucho mayor. |

Fíjese en los iconos. El contenido del archivo lleva la marca PDF4me porque proviene del OCR. El nombre del archivo lleva la marca SharePoint porque proviene del desencadenador.
Paso 5: ¿Cómo se convierte la matriz de textos en una sola cadena?
Flujo hasta ahora: Activador de SharePoint más Obtener contenido de archivo más OCR más Extraer texto e imágenes.
texts es una matriz. Un archivo necesita una cadena. Uno unir expresión une los dos.
- Agregar un Componer acción.
- En Entradas, cambia al editor de expresiones y pega:
join(body('PDF_-_Extract_Text_and_Images')?['texts'], decodeUriComponent('%0A'))
- Haga clic Actualizar.
El decodeUriComponent('%0A') Así es como se escribe un salto de línea literal en una expresión de Power Automate. No hay secuencia de escape para ello, por lo que esta es la convención.
Componer configuración

El nombre de la acción dentro de body() usa guiones bajos para los espacios y guiones. Si se cambia el nombre de la acción, esta expresión deja de funcionar.
Esta es la única línea que decide si la salida es legible. Omita la opción Compose y pase la matriz directamente a Create file, y el archivo de texto contendrá corchetes JSON y comillas escapadas en lugar del documento.
Paso 6: ¿Cómo se guarda el texto como un archivo .txt en SharePoint?
Flujo hasta ahora: Activador de SharePoint más Obtener contenido de archivo más OCR más Extraer texto e imágenes más Redactar.
El último paso consiste en escribir la cadena resultante en una segunda biblioteca.
- Agregar SharePoint > Crear archivo.
- Configurar:
- Dirección del sitio: mismo sitio que el desencadenante
- Ruta de la carpeta:
/Shared Documents/RagText - Nombre del archivo: el token del nombre de archivo del activador seguido del texto literal
.txt - Contenido del archivo: el Componer token de salida
Configuración de creación de archivos de SharePoint

El contenido del archivo es la salida de la función Compose, que lleva el icono morado de la operación de datos, no algo de PDF4me. El texto ya se ha compilado en este punto.
Consejo. El token del nombre de archivo del disparador ya contiene el .pdf extensión, por lo que se añade .txt produce contract.pdf.txt, que es lo que muestra la carpeta de salida anterior. Eso es inofensivo y mantiene el enlace a la fuente obvio. Si prefiere tener contract.txt, envuelve el token en reemplazar() y cambiar .pdf para .txt en lugar de añadir.
Ejecuta el flujo y verifica.
- Ahorrar el flujo en la parte superior derecha.
- Subir
contract-sample.pdfen la carpeta de entrada. El activador realiza sondeos, así que espere un minuto. - Abrir el flujo historial de ejecución y comprueba que las seis acciones tengan una marca de verificación verde. El OCR será el más lento.
- Abierto
/Shared Documents/RagText. A.txtEl archivo debería estar ahí. Ábrelo y buscaPDF4ME-CLEAN-TEST-2026Si ese marcador está presente, tanto el OCR como la extracción funcionaron correctamente de principio a fin.
¿Qué construiste exactamente? Una canalización de ingesta de documentos. Cada PDF que llega a la biblioteca se convierte automáticamente en texto plano, lo cual es el requisito previo, aunque poco glamuroso, para cualquier sistema que lea documentos a gran escala: búsqueda en SharePoint, un índice vectorial, un chatbot de recuperación aumentada o grep de texto plano. Si solo necesita el texto dentro del flujo en lugar de en el disco, la canalización más corta Extraer texto de archivos PDF en Power Automate El tutorial explica eso con Dropbox.
Variaciones comunes que puedes agregar sin reconstruir
.jsonLa mayoría de las tiendas de vectores prefieren los metadatos junto con el contenido.| Flujo en la nube frente a las alternativas | Funciona sin supervisión | Admite archivos PDF escaneados. | Nivel de conector |
|---|---|---|---|
| PDF4me en un flujo de nube de Power Automate | Sí | Sí, OCR integrado en el flujo | Estándar |
| Acciones de PDF de Power Automate Desktop | Solo mientras la máquina esté encendida | No hay OCR en las acciones básicas | Estándar, más una máquina |
| Procesamiento de formularios de AI Builder | Sí | Sí | Premium, con consumo de crédito |
Preguntas frecuentes
¿Puede Power Automate extraer texto de un PDF?
No funciona por sí solo en un flujo en la nube. Las acciones de PDF en la documentación de Microsoft pertenecen a Power Automate Desktop y no están disponibles en flujos en la nube, razón por la cual tantos hilos de la comunidad sobre esta pregunta quedan sin resolver. Agregar el conector PDF4me le da a un flujo en la nube una verdadera funcionalidad. Extraer texto e imágenes Acción que devuelve el texto del documento como una matriz.
La extracción completa se realiza en una sola acción. Los cinco pasos siguientes consisten simplemente en introducir el archivo y extraer el texto.
¿Cómo extraer texto de un PDF usando Power Automate?
Activar en el nuevo archivo, obtener sus bytes con Obtener el contenido del archivo, correr Convierta un PDF a un PDF editable mediante OCR. así que las páginas escaneadas obtienen una capa de texto y luego se ejecutan. Extraer texto e imágenes con Extraer texto configurado en Yes. Eso devuelve un texts matriz. Únala con una expresión Compose si desea prosa en lugar de una matriz.
Dirige el paso de extracción a la salida de la acción OCR, en lugar de al archivo que descargaste. Reutilizar la copia descargada es la razón por la que los documentos escaneados aparecen vacíos.
¿Puede Power Automate realizar OCR?
Un flujo en la nube no tiene una acción OCR nativa. AI Builder ofrece una en una licencia premium con límite de crédito, y Power Automate Desktop tiene su propio motor OCR vinculado a una máquina. PDF4me Convierta un PDF a un PDF editable mediante OCR. La acción se ejecuta en un flujo de nube de nivel estándar sin la intervención de ninguna máquina.
Es OCR solo cuando sea necesario Es importante conocer la configuración. Establecer en trueInspecciona cada archivo y omite el OCR cuando ya existe una capa de texto, por lo que una biblioteca mixta no paga el costo en cada documento.
¿Por qué no funciona la función de extracción de texto de PDF de Power Automate?
Tres causas abarcan casi todos los casos. El documento es un escaneo que nunca pasó por OCR, por lo que realmente no hay texto que extraer. El paso de extracción lee el archivo descargado en lugar de la salida de OCR, lo que produce el mismo resultado vacío en la entrada escaneada. O bien, el texto llegó correctamente, pero se escribió en el archivo como una matriz sin formato, por lo que parece JSON en lugar de un documento.
Abra el historial de ejecución e inspeccione directamente la salida de Extraer texto e imágenes. Si texts Si el contenido está ahí, el problema se encuentra más adelante en la función Componer o Crear archivo.
¿Cómo convertir un PDF a un archivo de texto de forma gratuita?
Para un solo documento, cualquier convertidor en línea sirve. La razón para crear este flujo es el volumen y la repetición: se ejecuta automáticamente en cada archivo que llega a la carpeta, gestiona los escaneos y no requiere que nadie esté frente al teclado. El plan gratuito de PDF4me cubre una cantidad considerable de documentos al mes, y todos los conectores utilizados son estándar, por lo que no se requiere una licencia premium de Power Automate.
Solución de problemas
La función Extraer texto e imágenes está leyendo el archivo incorrecto. El contenido del archivo debe provenir de la acción OCR, que lleva el icono de PDF4me, no de Obtener contenido del archivo. En un PDF digital nativo, ambas opciones funcionan, por lo que este error suele aparecer solo cuando se recibe un escaneo real.
El archivo de creación está recibiendo el archivo sin procesar. texts matriz. Su contenido de archivo debe ser el token de salida de Compose. Si Compose está presente pero aún devuelve una matriz, verifique que la expresión de unión tenga ambos argumentos: la matriz y el separador.
El identificador de archivo está asignado al token incorrecto. Necesita el disparador. IdentificadorNo se trata del nombre del archivo, la ruta ni el ID del elemento. Estos elementos parecen intercambiables en la lista de contenido dinámico, pero no lo son.
La carpeta de salida se encuentra dentro de la carpeta que supervisa el activador, por lo que cada nuevo archivo de texto inicia una nueva ejecución. Mantén RagInput y RagText separados, como carpetas hermanas en lugar de anidados.
Próximos pasos
Extraer texto e imágenes en Power Automate
Convierta un PDF a un PDF editable mediante OCR.
Obtén tu clave API
El mismo patrón de seis pasos (monitorizar una carpeta, recuperar, OCR, extraer, aplanar, guardar) convierte cualquier biblioteca de documentos en un corpus legible por máquina.