Saltar al contenido principal

Extraer recursos de PDF usando n8n acción

PDF4me Extraer recursos extrae el contenido de texto y las imágenes incrustadas de PDF documentos a través de n8n Flujos de trabajo de automatización. Proceso PDFs lejos n8n disparadores, datos binarios, cadenas base64 o público URLPermite extraer automáticamente texto, imágenes, gráficos y elementos visuales con segmentación específica por página, opciones de extracción selectiva (solo texto, solo imágenes o ambas) y formato de salida estructurado. Esta solución es ideal para la reutilización de contenido, la extracción de imágenes, el análisis de texto, la digitalización de documentos, la migración de contenido y los flujos de trabajo de recuperación de recursos que requieren una extracción precisa de contenido con segmentación flexible e integración perfecta.

Entradas de blog relacionadas
Aún no hay ninguna entrada de blog sobre esta función; estará disponible próximamente.
Mientras tanto, echa un vistazo al blog de PDF4me para encontrar tutoriales y flujos de trabajo para todas las plataformas.
Visita el blog

Configuración

Añade el PDF4me Nodo "Extraer recursos" a su n8n flujo de trabajo y configure los parámetros necesarios. Para obtener instrucciones de configuración inicial, consulte nuestra n8n Guía de integración.

Requisitos previos:

  • PDF4me API credenciales
  • n8n acceso al flujo de trabajo

Configuración:

  1. Agregar PDF4me nodo a flujo de trabajo
  2. Seleccione la acción "Extraer recursos".
  3. Configure los parámetros de entrada (véase más abajo).
Configuración de extracción de recursos

Parámetros

Lista completa de parámetros para la acción Extraer recursos. Configure estos parámetros para controlar la extracción de recursos.

Importante: Los parámetros marcados con un asterisco (***) son obligatorios y deben proporcionarse para que la acción funcione correctamente.

ParámetroTipoDescripciónEjemplo
Tipo de datos de entrada***StringPDF Selección del formato de entrada
• Elija el formato de su PDF entrada de datos
PDF4me admite varios tipos de entrada
• Opciones: Datos binarios, Base64 Cuerda o URL
Binary Data
Campo binario de entradaBinarioBinario PDF Entrada de archivo (Obligatorio si se trata de datos binarios)
• Referencia PDF archivo de anterior n8n carga de nodos o archivos
PDF4me procesos binarios PDF archivos con detección automática de formato
• Obligatorio cuando el tipo de datos de entrada es "Datos binarios".
{{ $binary.data }}
Contenido PDF en Base64StringBase64 Codificado PDF Aporte (Obligatorio si Base64 Cadena)
• Proporcionar PDF contenido como cadena codificada en base64
PDF4me decodifica y procesa automáticamente el PDF contenido
• Obligatorio cuando el tipo de datos de entrada es "Base64 Cadena"
JVBERi0x...
URL del PDFStringPúblico PDF URL Aporte (Obligatorio si URL)
• Proporcionar un permiso público/abierto URL hacia PDF archivo
PDF4me descarga y procesa el archivo desde URL
• Obligatorio cuando el tipo de datos de entrada es "URL"
https://abc.com/xyz.pdf
Nombre del documento***StringNombre del archivo de entrada
• Especifique el nombre de la entrada PDF archivo
• Se utiliza para la detección de formato y la optimización del procesamiento.
• Debe incluir la extensión .pdf
document.pdf
Extraer textoBooleanAlternar extracción de texto
• Habilitar o deshabilitar la extracción de contenido de texto
• Cuando está habilitada, extrae todo el contenido de texto legible.
• Conserva la información de formato
true
Extraer imágenesBooleanAlternar extracción de imágenes
• Habilitar o deshabilitar la extracción de imágenes
• Cuando está habilitada, extrae todas las imágenes y gráficos incrustados.
• Elementos visuales guardados como archivos separados
true

Opciones avanzadas

Los siguientes parámetros están disponibles en la sección Opciones avanzadas y son opcionales:

ParámetroTipoDescripciónEjemplo
PáginasStringEspecificación del rango de páginas
• Definir qué páginas procesar para la extracción de recursos
• Utilice "todos" para referirse a todo el documento, números específicos o rangos.
• Ejemplos: "1,3,5" (páginas específicas), "1-5,10-15" (rangos)
all
Perfiles personalizadosStringPerfiles de configuración personalizados
• Configure opciones adicionales mediante perfiles personalizados.
JSONformato similar que contiene parámetros predefinidos
• Permite configurar ajustes avanzados de procesamiento de extracción.
• Opcional para requisitos especializados
{ "outputDataFormat": "json" }

Producción

Parámetros de salida

ParámetroTipoDescripciónEjemplo
Nombre del archivoStringPDF4me nombre de archivo generado - El nombre de archivo completo del documento procesado correctamente, con la extensión y la marca de tiempo adecuadas. PDF4me Garantiza una nomenclatura única y valida el cumplimiento del formato de archivo para una integración perfecta con los procesos posteriores.extracted_resources_1756999816629.json
tipo mimeStringPDF4me MIME identificador de tipo - El estandarizado MIME tipo para el archivo de contenido extraído, normalmente application/json para datos estructurados o application/zip para múltiples archivos. Esto garantiza un manejo y reconocimiento adecuados de los archivos en todos los sistemas y aplicaciones.application/json
Tamaño del archivoNúmeroPDF4me Tamaño del archivo en bytes - El tamaño exacto del archivo de contenido extraído en bytes, proporcionado para la planificación del almacenamiento, la optimización del ancho de banda y la supervisión de la transferencia de archivos. Imprescindible para la gestión documental empresarial y la automatización del flujo de trabajo.1945
éxitoBooleanPDF4me indicador de estado de extracción - Indicador booleano que señala el éxito o el fracaso del proceso de extracción de recursos. Devuelve true para extracciones exitosas y false para cualquier error, lo que permite un manejo de errores robusto en flujos de trabajo automatizadostrue
mensajeStringPDF4me mensaje de estado de extracción - Mensaje descriptivo que indica el resultado del proceso de extracción de recursos. Proporciona mensajes de estado claros para extracciones exitosas e información detallada sobre errores para la resolución de problemas.Resource extraction completed successfully
Nombre del documentoStringPDF4me Referencia del nombre del documento original - El nombre de archivo original de la entrada PDF Archivo procesado. Esta referencia se mantiene para fines de auditoría, depuración y seguimiento del origen del contenido extraído en los flujos de trabajo empresariales.document.pdf

N8N Respuesta a la acción

El PDF4me Extraer recursos API Devuelve una respuesta que se puede visualizar en varios formatos. Elija la vista que mejor se adapte a sus necesidades:

JSON Formato de respuesta

El crudo JSON respuesta de la API:

{
"fileName": "extracted_resources_1756999816629.json",
"mimeType": "application/json",
"fileSize": 1945,
"success": true,
"message": "Resource extraction completed successfully",
"docName": "document.pdf"
}

Casos de uso

Sistemas de gestión de contenido: Extraer texto e imágenes de PDF documentos para repositorios de contenido centralizados, que permiten crear bases de datos de contenido de documentos con capacidad de búsqueda.

Pipelines de procesamiento de datos: Extraer automáticamente datos estructurados de PDF Informes, facturas y formularios para su integración con herramientas de inteligencia empresarial y plataformas de análisis.

Análisis de documentos: Procesar grandes volúmenes de PDF documentos para extraer información específica para el control del cumplimiento, la investigación y la elaboración de informes automatizados.

Digitalización de archivos: Convertir el legado PDF transforma los archivos en datos estructurados y con capacidad de búsqueda para los sistemas modernos de gestión de contenidos y descubrimiento de conocimiento.

Obtén ayuda