Saltar al contenido principal

Analizar documento en n8n

Lo que hace este nodo

PDF4me Analizar documento ejecuta su plantilla de análisis guardada contra una PDF dentro de un n8n flujo de trabajo y devuelve los campos extraídos como datos estructurados. Aliméntelo con datos binarios de un nodo anterior, un Base64 cadena, o un público URL, haga referencia a la plantilla por ID de análisisy canalizar el resultado JSON, XML, o CSV directamente en Set, IF, HTTP Request o cualquier flujo descendente n8n nodo. La plantilla contiene la lógica de extracción, por lo que el mismo nodo extrae facturas, contratos, recibos y cualquier diseño personalizado que hayas configurado.

Entradas de blog relacionadas(1)

Antes de ejecutar este nodo: crear una plantilla de análisis en el PDF4me panel. Defina sus claves de captura y seleccione Expresión regular para patrones estables o JavaScript Expresión para lógica condicional. El n8n referencias de nodos que la plantilla por ID de análisis. Ver Preparar la información de análisis para el documento Para la configuración completa, ejemplos de expresiones regulares (INV-\d{6,10}, \d{2}/\d{2}/\d{4}), y dos en funcionamiento JavaScript Ejemplos de clasificadores de expresión.

Autenticando su API Pedido

El PDF4me nodo en n8n requiere PDF4me API credenciales. Cree la credencial una vez en n8n con tu API clave del panel de control, luego hacer referencia a ella desde cada PDF4me nodo en tu flujo de trabajo.

Datos importantes que no debes perderte

Se requiere el ID de análisis (es su TemplateId).
El ID de análisis es el GUID asignado por el panel de control al guardar cambios en una plantilla. Cópielo del panel de detalles de la plantilla y péguelo en el n8n nodo. Sin él, el nodo no tiene un mapa de qué campos extraer.
Expresiones regulares para patrones estables, JavaScript para lógica condicional
Capturar claves directamente en la plantilla. Utilizar expresiones regulares para números de factura, fechas, importes e identificadores fiscales (alrededor del 80% de las claves de producción). Utilizar JavaScript Expresión con el texto Variable para la clasificación y reglas de reserva.
La salida son datos estructurados, no binarios. PDF
A diferencia de los nodos Compress, Protect o Convert que devuelven datos sin procesar PDF bytes, Analizar documento devuelve JSON (por defecto), XML, o CSV en el campo binario que especifique. Conéctelo a los nodos Set o IF para enrutar los valores hacia abajo.
Analizar la configuración del nodo Documento en n8n

Parámetros

ParámetroRequeridoLo que haceEjemplo
Input Data TypeYesHow the PDF reaches the node. Binary Data (from a prior node), Base64 String (inline encoded), or URL (public file URL).Binary Data
Input Binary FieldConditionalName of the binary field on the input item containing the PDF. Required when Input Data Type is Binary Data.data
Base64 PDF ContentConditionalBase64 encoded PDF content. Required when Input Data Type is Base64 String. No data: prefix.JVBERi0xLjQK...
PDF URLConditionalPublicly reachable URL of the PDF. Required when Input Data Type is URL. The PDF4me service downloads and processes it.https://example.com/invoice.pdf
Document NameYesSource filename including .pdf extension. Used for format detection and error tracing.invoice.pdf
Parse IDYesTemplateId GUID from the PDF4me dashboard. Identifies the parse template (capture keys + extraction rules) to apply.12345678-1234-1234-1234-123456789abc
Output FormatYesShape of the returned data. JSON (default, structured object), XML (hierarchical), or CSV (flat tabular). JSON is the right choice for almost every n8n workflow.JSON
Output Binary Field NameYesName of the binary field the node attaches the parsed output to on the output item. Reference it from downstream nodes.data
Custom ProfilesNoAdvanced JSON-style overrides for parsing behaviour (output sub-format, include metadata flag, etc). Leave empty for default behaviour.{ "outputDataFormat": "json", "includeMetadata": true }

Tipos de expresiones en su plantilla de análisis

Las reglas de captura se encuentran en la plantilla, no en la n8n nodo. Ambos tipos de expresiones se envían con cada PDF4me cuenta.

Expresión regularPatrones estables
Números de factura (INV-\d{6,10}), fechas (\d{2}/\d{2}/\d{4}), cantidades ($?\d{1,3}(?:,\d{3})*(?:.\d{2})?). Alrededor del 80% de las claves de producción.
Expresión JavaScriptLógica condicional y clasificadores
El texto del área de captura se pasa como texto; devuelve una cadena. Clasificación de múltiples marcadores, reglas de reserva, normalización de fechas. Ver Preparar la información de análisis para el documento para dos muestras de trabajo.

Producción

CampoTipoLo que contiene
fileNameStringGenerated output filename with timestamp and extension matching Output Format (.json / .xml / .csv).
mimeTypeStringMIME type of the output (application/json, application/xml, text/csv).
fileSizeNumberSize of the parsed output in bytes.
successBooleantrue on a successful parse, false otherwise. Wire into an IF node for branching.
messageStringStatus message. Document parsed successfully on the happy path, or a descriptive error.
docNameStringOriginal input filename, preserved for audit trails.

Los datos de clave/valor analizados residen en el campo binario que nombró en Nombre del campo binario de salida.

Ejemplos de flujo de trabajo

Patrones de flujo de trabajo comunes de n8nTypical ways to chain Parse Document into an n8n workflow.
Adjunto de correo electrónico a Postgres
  1. El activador de Gmail se dispara con las nuevas facturas etiquetadas como "vendor-invoice".
  2. El filtro solo permite archivos adjuntos con extensión .pdf.
  3. El análisis del documento ejecuta la plantilla de factura contra el archivo adjunto binario.
  4. Se analizaron los mapas de nodos establecidos. invoiceNumber, totalAmount, invoiceDate.
  5. La instrucción INSERT de Postgres escribe la fila en la tabla accounts_payable.
Clasificar y extraer en un solo flujo de trabajo
  1. El webhook recibe un PDF desde un portal de carga de socios.
  2. Parse Document ejecuta una plantilla con un JavaScript Clave de expresión que devuelve el tipo de documento.
  3. Cambiar las rutas de los nodos según el tipo devuelto (factura / pedido / recibo) a las ramas descendentes específicas de cada tipo.
  4. Cada rama envía los campos analizados al sistema de destino correcto.
Procesamiento por lotes de S3 a Airtable
  1. El programa se activa cada 15 minutos.
  2. S3 List + Obtener objeto carga cada nuevo PDF en el depósito de entrada.
  3. El análisis del documento ejecuta la plantilla en cada elemento binario.
  4. La función Crear registro de Airtable escribe los campos analizados en la base de datos de seguimiento.

Preguntas frecuentes

What is a Parse ID and where do I get it?+
Parse ID is the TemplateId GUID generated by the PDF4me dashboard when you click Save Changes on a parse template. Find it in the template detail panel. Pin it in your n8n node so the same template runs every execution.
Do I need a template, or can the node parse any PDF without one?+
A template is required for field-level extraction in n8n. Without a Parse ID the node has no map of which regions to capture. Build a template once in the dashboard, then reuse the same Parse ID across runs and across platforms (Make, Zapier, Power Automate).
How does the n8n node know what fields to extract?+
The capture keys live in the template, not in n8n. Each capture area gets a key name (camelCase) and an extraction rule: Regex Expression for stable patterns or JavaScript Expression for conditional logic. The output has one field per key.
Which Input Data Type should I pick?+
Binary Data for files arriving from upstream nodes (Read Binary Files, HTTP Request with response format File, Gmail attachment, Dropbox Download). Base64 String when the PDF is encoded inline. URL when the file lives at a public web address.
Can I extract data using JavaScript Expression in addition to regex?+
Yes. The capture area text is passed as the variable text inside your JavaScript Expression and you return a string. Use it for multi-marker classification, fallback rules, or date normalization. See the Prepare Parse Info for Document guide for two working classifier samples.
JSON, XML, or CSV. Which Output Format should I use?+
JSON for almost every n8n workflow. It maps cleanly into Set, IF, and HTTP Request nodes. XML when your downstream system requires it natively. CSV for spreadsheet uploads and bulk imports.
Is the output a file I can save, or just a JSON object?+
Both. The parsed data is attached to the binary field you set under Output Binary Field Name, so you can Write Binary File to disk, send it as an email attachment, or upload it to storage. The structured data is also available on the regular json output for downstream node mapping.

Acciones relacionadas

La misma tarea en otras plataformas.

Obtén ayuda