Saltar al contenido principal

Extraer texto por expresión usando n8n acción

PDF4me Extraer texto por expresión extrae contenido de texto específico de PDF documentos mediante coincidencia de patrones y filtrado basado en expresiones a través de n8n Flujos de trabajo de automatización. Proceso PDFs lejos n8n disparadores, datos binarios, cadenas base64 o público URLPermite localizar y extraer texto mediante patrones de caracteres comodín (%), expresiones regulares, campos de datos específicos, segmentación por página y reglas de extracción flexibles con salida estructurada. Esta solución es ideal para la extracción de números de factura, la captura de campos de datos, la recuperación de texto basada en patrones, la extracción automatizada de datos, el análisis de documentos y los flujos de trabajo de análisis de contenido que requieren una segmentación precisa del texto con coincidencia flexible e integración perfecta.

Entradas de blog relacionadas
Aún no hay ninguna entrada de blog sobre esta función; estará disponible próximamente.
Mientras tanto, echa un vistazo al blog de PDF4me para encontrar tutoriales y flujos de trabajo para todas las plataformas.
Visita el blog

Configuración

Añade el PDF4me Nodo "Extraer texto por expresión" a su n8n flujo de trabajo y configure los parámetros necesarios. Para obtener instrucciones de configuración inicial, consulte nuestra n8n Guía de integración.

Requisitos previos:

  • PDF4me API credenciales
  • n8n acceso al flujo de trabajo

Configuración:

  1. Agregar PDF4me nodo a flujo de trabajo
  2. Seleccione la acción "Extraer texto por expresión".
  3. Configure los parámetros de entrada (véase más abajo).
Configuración de extracción de texto mediante expresión

Parámetros

Lista completa de parámetros para la acción Extraer texto por expresión. Configure estos parámetros para controlar la extracción de texto.

Importante: Los parámetros marcados con un asterisco (***) son obligatorios y deben proporcionarse para que la acción funcione correctamente.

ParámetroTipoDescripciónEjemplo
Tipo de datos de entrada***StringPDF Selección del formato de entrada
• Elija el formato de su PDF entrada de datos
PDF4me admite varios tipos de entrada
• Opciones: Datos binarios, Base64 Cuerda o URL
Binary Data
Campo binario de entradaBinarioBinario PDF Entrada de archivo (Obligatorio si se trata de datos binarios)
• Referencia PDF archivo de anterior n8n carga de nodos o archivos
PDF4me procesos binarios PDF archivos con detección automática de formato
• Obligatorio cuando el tipo de datos de entrada es "Datos binarios".
{{ $binary.data }}
Contenido PDF en Base64StringBase64 Codificado PDF Aporte (Obligatorio si Base64 Cadena)
• Proporcionar PDF contenido como cadena codificada en base64
PDF4me decodifica y procesa automáticamente el PDF contenido
• Obligatorio cuando el tipo de datos de entrada es "Base64 Cadena"
JVBER...
URL del PDFStringPúblico PDF URL Aporte (Obligatorio si URL)
• Proporcionar un permiso público/abierto URL hacia PDF archivo
PDF4me descarga y procesa el archivo desde URL
• Obligatorio cuando el tipo de datos de entrada es "URL"
https://abc.com/document.pdf
Nombre del documento***StringNombre del archivo de entrada
• Especifique el nombre de la entrada PDF archivo
• Se utiliza para la detección de formato y la optimización del procesamiento.
• Debe incluir la extensión .pdf
document.pdf
Expresión***StringPatrón de extracción de texto
• Defina el patrón o la expresión que coincida con el contenido del texto.
• Admite patrones de expresiones regulares, comodines y expresiones personalizadas.
• Usar % para coincidencias con comodines o patrones de expresiones regulares específicos
%
Secuencia de páginas***StringEspecificación del rango de páginas
• Definir qué páginas procesar para la extracción de texto.
• Utilice "todo" para referirse a todo el documento o a números/rangos de páginas específicos.
• Ejemplos: "1,3,5" (específico), "1-5" (rango), "1-" (desde la página 1 hasta el final)
1-

Opciones avanzadas

Los siguientes parámetros están disponibles en la sección Opciones avanzadas y son opcionales:

ParámetroTipoDescripciónEjemplo
Perfiles personalizadosStringPerfiles de configuración personalizados
• Configure opciones adicionales mediante perfiles personalizados.
JSONformato similar que contiene parámetros predefinidos
• Permite configurar ajustes avanzados de procesamiento de extracción.
• Opcional para requisitos especializados
{ "outputDataFormat": "json" }

Producción

Parámetros de salida

ParámetroTipoDescripciónEjemplo
Nombre del archivoStringPDF4me nombre de archivo generado - El nombre de archivo completo del documento procesado correctamente, con la extensión y la marca de tiempo adecuadas. PDF4me Garantiza una nomenclatura única y valida el cumplimiento del formato de archivo para una integración perfecta con los procesos posteriores.text_extraction_results_1756999697398.json
tipo mimeStringPDF4me MIME identificador de tipo - El estandarizado MIME tipo para el archivo de contenido extraído, normalmente application/json para datos estructurados o application/zip para múltiples archivos. Esto garantiza un manejo y reconocimiento adecuados de los archivos en todos los sistemas y aplicaciones.application/json
Tamaño del archivoNúmeroPDF4me Tamaño del archivo en bytes - El tamaño exacto del archivo de contenido extraído en bytes, proporcionado para la planificación del almacenamiento, la optimización del ancho de banda y la supervisión de la transferencia de archivos. Esencial para la gestión de documentos empresariales y la automatización del flujo de trabajo.106
éxitoBooleanPDF4me indicador de estado de extracción - Indicador booleano que señala el éxito o el fracaso del proceso de extracción de texto. Devuelve true para extracciones exitosas y false para cualquier error, lo que permite un manejo de errores robusto en flujos de trabajo automatizadostrue
mensajeStringPDF4me mensaje de estado de extracción - Mensaje descriptivo que indica el resultado del proceso de extracción de texto. Proporciona mensajes de estado claros para extracciones exitosas e información detallada sobre errores para la resolución de problemas.Text extraction by expression completed successfully
Nombre del documentoStringPDF4me Referencia del nombre del documento original - El nombre de archivo original de la entrada PDF Archivo procesado. Esta referencia se mantiene para fines de auditoría, depuración y seguimiento del origen del contenido extraído en los flujos de trabajo empresariales.document.pdf
expresiónStringPDF4me expresión de extracción utilizada - El patrón o expresión que se utilizó para la extracción de texto. Este campo muestra la expresión real que se aplicó durante el proceso de extracción con fines de verificación y depuración.%
secuencia de páginasStringPDF4me Rango de páginas procesadas - El rango de páginas que se procesó durante la extracción de texto. Este campo muestra las páginas reales que se analizaron para la expresión especificada, lo que resulta útil para la verificación y la resolución de problemas.1-2

N8N Respuesta a la acción

El PDF4me Extraer texto por expresión API Devuelve una respuesta que se puede visualizar en varios formatos. Elija la vista que mejor se adapte a sus necesidades:

JSON Formato de respuesta

El crudo JSON respuesta de la API:

{
"fileName": "text_extraction_results_1756999697398.json",
"mimeType": "application/json",
"fileSize": 106,
"success": true,
"message": "Text extraction by expression completed successfully",
"docName": "document.pdf",
"expression": "%",
"pageSequence": "1-2"
}

Casos de uso

Minería de datos y extracción de información

  • Extraer patrones de datos específicos, información de contacto y datos estructurados de PDF documentos que utilizan expresiones personalizadas para minería de datos e inteligencia empresarial
  • Procese documentos legales, contratos y registros oficiales extrayendo cláusulas, términos e información legal específicos mediante expresiones dirigidas.
  • Transforme informes financieros, facturas y documentos contables extrayendo datos financieros específicos, importes e información de transacciones mediante expresiones personalizadas.

Análisis de contenido e investigación

  • Extraer datos de investigación, citas e información académica de PDF documentos que utilizan expresiones personalizadas para la investigación académica y el análisis de contenido
  • Procesar artículos científicos, documentos de investigación y publicaciones técnicas extrayendo datos específicos, mediciones y resultados de investigación mediante expresiones dirigidas.
  • Transforme los informes comerciales, la investigación de mercado y el análisis de la industria extrayendo métricas, estadísticas y datos comerciales específicos mediante expresiones personalizadas.

Cumplimiento y procesamiento regulatorio

  • Extraer datos de cumplimiento, información regulatoria y detalles de auditoría de PDF documentos que utilizan expresiones personalizadas para el cumplimiento normativo y el procesamiento de auditorías
  • Procese documentos de control de calidad, informes de inspección y materiales de certificación extrayendo datos de cumplimiento específicos, estándares e información regulatoria.
  • Transforme documentos oficiales, permisos y presentaciones regulatorias extrayendo datos regulatorios específicos, métricas de cumplimiento e información oficial mediante expresiones personalizadas.

Obtén ayuda