Extraer recursos de PDF en Make
Lo que hace este módulo
PDF4me, Extraer recursos extrae todas las imágenes y el contenido de texto incrustados de un PDF y los devuelve como datos estructurados en su Make escenario. Alternar Extraer imágenes para recuperar cada imagen incrustada en el documento como una imagen nombrada, Base64Archivo codificado. Alternar Extraer texto para recuperar el contenido de texto completo como una cadena simple. Ambos pueden ejecutarse simultáneamente en una sola llamada de módulo. Utilice las imágenes extraídas para crear bibliotecas de activos, utilice el texto extraído para análisis, indexación de búsqueda o traducción, todo sin abrir el PDF manualmente.
Autenticando su API Pedido
Cada PDF4me módulo en Make requiere un válido Conexión. Crea o selecciona uno que contenga tu PDF4me API clave para que el escenario pueda autenticar las solicitudes de extracción de forma segura.
Datos importantes que no debes perderte
Nombre campo (nombre de archivo) y un Datos campo (contenido Base64). Sin un iterador, no se puede acceder a imágenes individuales posteriormente.Datos El campo está codificado en Base64. Los módulos de almacenamiento en la nube (Dropbox, Google Drive, SharePoint) esperan datos binarios, no Base64 texto. Usar Makeestá incorporado toBinary(Datos, 'base64') función para convertir el campo Datos a binario antes de enviarlo a un módulo de carga. Nombre El campo te da el nombre de archivo original con extensión (por ejemplo, imagen_001.png).
Las opciones "Extraer imágenes" y "Extraer texto" son independientes; active una, ambas o solo una según sus necesidades. Las imágenes se devuelven como una matriz; el texto se devuelve como una cadena de texto simple.
Parámetros
Requerido: Se deben proporcionar los siguientes parámetros: Conexión, Nombre de archivo, Documento, Extraer imágenes y Extraer texto. Configure al menos uno de los parámetros Extraer imágenes o Extraer texto en Sí; si no se selecciona ninguno, no se mostrará ningún contenido.
| Parámetro | Requerido | Lo que hace | Ejemplo |
|---|---|---|---|
| Connection | Yes | PDF4me API connection. Click Add and paste your API key if connecting for the first time. | My PDF4me connection |
| File Name | Yes | Filename of the source PDF including .pdf extension. Map from the prior module's file name output. | catalog.pdf |
| Document | Yes | Binary content of the source PDF. Map from the prior module's data output: Dropbox, Google Drive, HTTP, or email attachment. | 1. Data |
| Extract Images | Yes | Toggle to extract all embedded images. Set to Yes to retrieve images as a named Base64 array. Set to No to skip image extraction. Can be combined with Extract Text. | Yes |
| Extract Text | Yes | Toggle to extract all text content. Set to Yes to retrieve the full document text as a plain string. Set to No to skip text extraction. Works on native PDFs only: not scanned. | Yes |
Campos de salida
| Campo | Tipo | Descripción |
|---|---|---|
| Textos | String | Contenido de texto completo extraído de la PDF como una cadena simple. Vacío si Extraer texto está configurado en No o el PDF es escaneado. |
| Imágenes | Array | Matriz de todas las imágenes incrustadas. Cada elemento tiene una Nombre (nombre de archivo con extensión) y Datos (Base64-contenido de imagen codificado). Matriz vacía si Extraer imágenes es No. |
Configuración rápida
- Agregar PDF4me → Extraer recursos a tu Make escenario después de un paso de descarga de archivos.
- Seleccionar Conexión (o haga clic Agregar para crear uno con tu API llave).
- Mapa Nombre del archivo y Documento del módulo anterior.
- Colocar Extraer imágenes y/o Extraer texto a Sí dependiendo de lo que necesites.
- Si se extraen imágenes, agregue un Iterador módulo apuntando al Imágenes matriz. Dentro del iterador, use
toBinary(Data, 'base64')decodificar cada imagen y enviarla a un módulo de carga. - Si se extrae texto, mapee el Textos campo directamente en una fila de Google Sheets, inserción de base de datos o HTTP Cuerpo de la publicación.
Ejemplos de flujo de trabajo
Ejemplos de flujo de trabajoCommon Make scenario patterns using Extract Resources.
- Dropbox Watch Folder se activa cuando se agrega un nuevo catálogo. PDF está subido.
- Dropbox Descargar un archivo recupera el PDF binario.
- La opción Extract Resources se ejecuta con Extract Images configurada en Sí y Extract Text configurada en No.
- El iterador recorre el array de imágenes, una imagen por iteración.
- Cada iteración decodifica el campo de datos con
toBinary(Datos, 'base64')y sube la imagen a una carpeta de Google Drive llamada "Imágenes de productos" utilizando el campo Nombre como nombre de archivo.
- Google Drive Watch Files se activa cuando se crea un nuevo contrato. PDF se añade a la carpeta "Contratos".
- Google Drive Obtener un archivo descarga el binario.
- La opción Extract Resources se ejecuta con Extract Text configurado en Sí y Extract Images configurado en No.
- El contenido de los textos se guarda en un registro de Airtable junto con el nombre del archivo y la fecha de carga.
- Ahora, el contrato permite realizar búsquedas de texto completo en Airtable, sin necesidad de copiar y pegar manualmente.
- Una fila de Google Sheets con una PDF La URL activa el escenario para cada documento heredado en la lista de migración.
- Un HTTP Descargas del módulo PDF desde la URL.
- La función Extract Resources se ejecuta con Extract Text y Extract Images configurados en Sí.
- El campo Textos se inserta en un MySQL Registro de la base de datos para búsqueda de texto completo.
- Un iterador sube cada imagen extraída a un SharePoint biblioteca multimedia, completando la migración de contenido sin abrir nunca el PDFs manualmente.