Saltar al contenido principal

Extraer recursos de PDF en Make

Lo que hace este módulo

PDF4me, Extraer recursos extrae todas las imágenes y el contenido de texto incrustados de un PDF y los devuelve como datos estructurados en su Make escenario. Alternar Extraer imágenes para recuperar cada imagen incrustada en el documento como una imagen nombrada, Base64Archivo codificado. Alternar Extraer texto para recuperar el contenido de texto completo como una cadena simple. Ambos pueden ejecutarse simultáneamente en una sola llamada de módulo. Utilice las imágenes extraídas para crear bibliotecas de activos, utilice el texto extraído para análisis, indexación de búsqueda o traducción, todo sin abrir el PDF manualmente.

Entradas de blog relacionadas
Aún no hay ninguna entrada de blog sobre esta función; estará disponible próximamente.
Mientras tanto, echa un vistazo al blog de PDF4me para encontrar tutoriales y flujos de trabajo para todas las plataformas.
Visita el blog

Autenticando su API Pedido

Cada PDF4me módulo en Make requiere un válido Conexión. Crea o selecciona uno que contenga tu PDF4me API clave para que el escenario pueda autenticar las solicitudes de extracción de forma segura.

Datos importantes que no debes perderte

El array de imágenes necesita un iterador para procesarse individualmente.
La salida de Imágenes es una matriz, un elemento por imagen incrustada. Para cargar o procesar cada imagen por separado, agregue un Make Iterador Módulo inmediatamente después de Extraer recursos y apuntarlo al array Imágenes. Cada iteración te da una imagen con una Nombre campo (nombre de archivo) y un Datos campo (contenido Base64). Sin un iterador, no se puede acceder a imágenes individuales posteriormente.
Los datos de la imagen son Base64, decodificar antes de subir
Cada imagen Datos El campo está codificado en Base64. Los módulos de almacenamiento en la nube (Dropbox, Google Drive, SharePoint) esperan datos binarios, no Base64 texto. Usar Makeestá incorporado toBinary(Datos, 'base64') función para convertir el campo Datos a binario antes de enviarlo a un módulo de carga. Nombre El campo te da el nombre de archivo original con extensión (por ejemplo, imagen_001.png).
La extracción de texto funciona en sistemas nativos. PDFs, no escaneado
El interruptor Extraer texto recupera el texto que se puede buscar incrustado en el PDF Estructura. Escaneada PDFs son basados en imágenes, no contienen una capa de texto incrustada, por lo que la salida de texto estará vacía o será mínima en los documentos escaneados. Para extraer texto de las páginas escaneadas, ejecute un PDF OCR Primero, use el módulo para crear una capa de texto y luego use Extraer recursos para extraer el texto. La extracción de imágenes funciona en todos los casos. PDFs incluyendo las escaneadas.
Hacer que el módulo PDF4me Extract Resources muestre Conexión establecida en Mi conexión PDF4me, Nombre de archivo asignado desde el paso 1, Documento asignado desde los datos del paso 1, Extraer imágenes establecido en Sí, Extraer texto establecido en Sí

Las opciones "Extraer imágenes" y "Extraer texto" son independientes; active una, ambas o solo una según sus necesidades. Las imágenes se devuelven como una matriz; el texto se devuelve como una cadena de texto simple.

Parámetros

Requerido: Se deben proporcionar los siguientes parámetros: Conexión, Nombre de archivo, Documento, Extraer imágenes y Extraer texto. Configure al menos uno de los parámetros Extraer imágenes o Extraer texto en Sí; si no se selecciona ninguno, no se mostrará ningún contenido.

ParámetroRequeridoLo que haceEjemplo
ConnectionYesPDF4me API connection. Click Add and paste your API key if connecting for the first time.My PDF4me connection
File NameYesFilename of the source PDF including .pdf extension. Map from the prior module's file name output.catalog.pdf
DocumentYesBinary content of the source PDF. Map from the prior module's data output: Dropbox, Google Drive, HTTP, or email attachment.1. Data
Extract ImagesYesToggle to extract all embedded images. Set to Yes to retrieve images as a named Base64 array. Set to No to skip image extraction. Can be combined with Extract Text.Yes
Extract TextYesToggle to extract all text content. Set to Yes to retrieve the full document text as a plain string. Set to No to skip text extraction. Works on native PDFs only: not scanned.Yes

Campos de salida

CampoTipoDescripción
TextosStringContenido de texto completo extraído de la PDF como una cadena simple. Vacío si Extraer texto está configurado en No o el PDF es escaneado.
ImágenesArrayMatriz de todas las imágenes incrustadas. Cada elemento tiene una Nombre (nombre de archivo con extensión) y Datos (Base64-contenido de imagen codificado). Matriz vacía si Extraer imágenes es No.

Configuración rápida

  1. Agregar PDF4meExtraer recursos a tu Make escenario después de un paso de descarga de archivos.
  2. Seleccionar Conexión (o haga clic Agregar para crear uno con tu API llave).
  3. Mapa Nombre del archivo y Documento del módulo anterior.
  4. Colocar Extraer imágenes y/o Extraer texto a dependiendo de lo que necesites.
  5. Si se extraen imágenes, agregue un Iterador módulo apuntando al Imágenes matriz. Dentro del iterador, use toBinary(Data, 'base64') decodificar cada imagen y enviarla a un módulo de carga.
  6. Si se extrae texto, mapee el Textos campo directamente en una fila de Google Sheets, inserción de base de datos o HTTP Cuerpo de la publicación.

Ejemplos de flujo de trabajo

Ejemplos de flujo de trabajoCommon Make scenario patterns using Extract Resources.
Crea una biblioteca de imágenes a partir del catálogo de productos. PDFs
  1. Dropbox Watch Folder se activa cuando se agrega un nuevo catálogo. PDF está subido.
  2. Dropbox Descargar un archivo recupera el PDF binario.
  3. La opción Extract Resources se ejecuta con Extract Images configurada en Sí y Extract Text configurada en No.
  4. El iterador recorre el array de imágenes, una imagen por iteración.
  5. Cada iteración decodifica el campo de datos con toBinary(Datos, 'base64') y sube la imagen a una carpeta de Google Drive llamada "Imágenes de productos" utilizando el campo Nombre como nombre de archivo.
Indexar el texto del contrato para la búsqueda de texto completo.
  1. Google Drive Watch Files se activa cuando se crea un nuevo contrato. PDF se añade a la carpeta "Contratos".
  2. Google Drive Obtener un archivo descarga el binario.
  3. La opción Extract Resources se ejecuta con Extract Text configurado en Sí y Extract Images configurado en No.
  4. El contenido de los textos se guarda en un registro de Airtable junto con el nombre del archivo y la fecha de carga.
  5. Ahora, el contrato permite realizar búsquedas de texto completo en Airtable, sin necesidad de copiar y pegar manualmente.
Migrar el legado PDFsTexto a base de datos, imágenes a biblioteca multimedia
  1. Una fila de Google Sheets con una PDF La URL activa el escenario para cada documento heredado en la lista de migración.
  2. Un HTTP Descargas del módulo PDF desde la URL.
  3. La función Extract Resources se ejecuta con Extract Text y Extract Images configurados en Sí.
  4. El campo Textos se inserta en un MySQL Registro de la base de datos para búsqueda de texto completo.
  5. Un iterador sube cada imagen extraída a un SharePoint biblioteca multimedia, completando la migración de contenido sin abrir nunca el PDFs manualmente.

Preguntas frecuentes

How do I save each extracted image to cloud storage?+
Add a Make Iterator module after Extract Resources and point it at the Images array output. Each iteration yields one image object with a Name field (original filename with extension, e.g. image_001.png) and a Data field (Base64-encoded content). Convert Data to binary using Make's toBinary(Data, 'base64') function, then pipe the binary into a Dropbox Upload a File, Google Drive Upload a File, or SharePoint module: using the Name field as the destination filename.
Can I extract only images, only text, or both?+
The two toggles are fully independent. Set Extract Images to Yes and Extract Text to No to retrieve only images. Set Extract Text to Yes and Extract Images to No for text only. Enable both to retrieve everything in a single module call: PDF4me processes the document once and returns both outputs together, which is more efficient than running the module twice.
Will text extraction work on scanned PDFs?+
Scanned PDFs are essentially images of pages: they contain no embedded text layer. The Extract Text toggle retrieves text from the PDF's internal text structure, which only exists in digitally created (native) PDFs. For scanned documents, the Texts output will be empty or contain only minimal metadata. Run a PDF OCR module first to add a text layer to the scanned PDF, then use Extract Resources to pull the text.
What image formats are returned: PNG, JPG, or something else?+
The format depends on how each image is stored inside the PDF. Most PDFs embed images as JPEG or PNG. The Name field in each Images array item includes the original extension (e.g. image_001.jpg or image_002.png) so you know the format before saving. The Data field is always Base64 regardless of the underlying format.
Does the module modify or damage the source PDF?+
No. Extract Resources is a read-only operation. It reads the PDF content and returns copies of the embedded text and images: the source file in Dropbox, Google Drive, SharePoint, or any other location is completely untouched. You can run Extract Resources on the same PDF multiple times without any side effects.

Módulos relacionados

Obtén ayuda