Saltar al contenido principal

Extraer datos del formulario de PDF en n8n

Extraer datos del formulario de PDF es un PDF4me acción del nodo en n8n que lee los valores rellenados de un campo rellenable. PDF y los devuelve como una estructurada formData JSON objeto. Úselo para entregar formularios de solicitud devueltos, hojas de admisión firmadas o encuestas PDFs en filas de la base de datos sin que nadie tenga que volver a escribir las respuestas.

Lo que hace este nodo

PDF4me: Extraer datos del formulario PDF toma un formulario rellenable completo PDF a partir de datos binarios, un Base64 String, o un URL, lee su capa de formulario interactivo y devuelve cada campo como un par nombre y valor dentro de un único Datos del formulario objeto. Las entradas de texto, las casillas de verificación, los botones de radio y las selecciones desplegables se vuelven a juntar, listos para asignarse a una fila de una hoja de cálculo. CRM registro o una rama condicional en el flujo de trabajo.

Entradas de blog relacionadas(1)

Autenticando su API Pedido

Cada PDF4me nodo en n8n requiere un válido Credencial para conectarse con. Crea o selecciona uno que contenga tu PDF4me API clave para que el flujo de trabajo pueda autenticar las solicitudes de extracción de forma segura.

Datos importantes que no debes perderte

El PDF Debe tener campos de formulario reales.
Este nodo lee la capa interactiva de AcroForm. Una página escaneada o un documento aplanado. PDF no tiene objetos de campo restantes para leer, así que rediríjalos a un OCR o AI Analizando el nodo en su lugar.
Los campos en blanco siguen apareciendo en la salida.
Un campo sin rellenar devuelve una cadena vacía en lugar de omitirse, por lo que conviene comprobar si hay valores vacíos más adelante en lugar de asumir que falta la clave.
Los nombres de los campos provienen del autor del formulario.
Las llaves coinciden con lo que sea que PDF El diseñador nombró cada campo, y las casillas de verificación devuelven su valor de exportación en lugar de un valor verdadero o falso garantizado. Ejecute primero un archivo de ejemplo e inspeccione el resultado real.
El nodo PDF4me en n8n está configurado con la acción Extraer datos de formulario de PDF, Tipo de datos de entrada Datos binarios, Campo de entrada Datos binarios, Nombre del documento document.pdf y Perfiles personalizados en Opciones avanzadas.

PDF4me Extraer datos del formulario de PDF panel de parámetros en n8n

Extracción de datos de formularios frente a extracción de texto plano

Ambos enfoques extraen contenido de un PDF, pero solo uno te proporciona campos con nombre. La distinción determina qué nodo pertenece a tu flujo de trabajo.

AcercarseLo que recibes a cambioMejor ajuste
Extract Form Data From PDFNamed field and value pairs from the interactive form layerGenuine fillable PDFs where every answer already sits in a named field
Plain text extractionThe visible page content as one flat string, with no field namesStatic PDFs with no form layer, where you will parse the text yourself
AI document parsingModel-inferred fields from any layout, including scansScanned, flattened, or wildly inconsistent documents with no usable form structure

¿Qué parámetros extrae los datos del formulario? PDF ¿Necesidad?

Requerido: Acción, Tipo de datos de entrada, el campo que coincide con ese tipo de entrada y Nombre del documento. La opción Perfiles personalizados en Opciones avanzadas es opcional.

ParámetroRequeridoLo que haceEjemplo
ActionRequiredSelects the PDF4me node action to run. Choose Extract Form Data From PDF.Extract Form Data From PDF
Input Data TypeRequiredFormat of the source PDF input. Choose Binary Data (from a previous node), Base64 String, or URL.Binary Data
Input Binary FieldConditionalName of the binary property on the incoming n8n item that holds the filled PDF. Required when Input Data Type is Binary Data. Defaults to data.data
Base64 Document ContentConditionalBase64-encoded content of the filled PDF. Required when Input Data Type is Base64 String.JVBERi0xLjQK...
File URLConditionalPublicly reachable HTTPS URL to the filled PDF. Required when Input Data Type is URL.https://example.com/application_form.pdf
Document NameRequiredFilename of the source PDF, used for reference and tracking in the extraction request. Include the .pdf extension.application_form.pdf
Custom ProfilesOptionalAdvanced Options field for extra processing settings, supplied in a JSON-like format. Leave blank unless you have a specific profile to apply.{ 'outputDataFormat': 'json' }

Campos de salida

Una carrera exitosa devuelve uno n8n elemento que contiene los valores de formulario extraídos como JSON.

CampoTipoLo que contiene
formDataObjectEvery form field read from the PDF, as a set of field name and field value pairs.
formData.<fieldName>StringThe name of an individual field exactly as the PDF author defined it, for example name, email, or country.
formData.<fieldValue>String, Number, or BooleanThe value entered or selected for that field. Blank fields return an empty string, and checkboxes return their export value.

Un cuerpo de respuesta típico tiene este aspecto:

{
"formData": {
"name": "PDF4me",
"email": "",
"country": "USA"
}
}

¿Cómo configuro la extracción de datos de formularios? PDF en n8n¿

  1. Agregar PDF4me a tu n8n flujo de trabajo y elegir el Extraer datos del formulario de PDF acción.
  2. En Credencial para conectarse con, seleccione su PDF4me credenciales o haga clic Crear nueva credencial y pega tu API llave.
  3. Colocar Tipo de datos de entrada a Datos binarios (por defecto), Base64 String, o URL y suministrar el relleno correspondiente PDF campo.
  4. Colocar Nombre del documento al nombre del archivo de origen, por ejemplo application_form.pdf.
  5. Dejar Perfiles personalizados bajo Opciones avanzadas Déjelo en blanco a menos que necesite un perfil de procesamiento específico.
  6. Ejecuta el nodo y luego asigna valores desde el resultado. formData objeto en el siguiente paso de su flujo de trabajo.

Configuraciones típicas

Ejemplos de flujo de trabajoCommon n8n workflow patterns using Extract Form Data From PDF.
Formularios de solicitud enviados por correo electrónico a una hoja de cálculo.
  1. Se activa un correo electrónico cuando se completa una solicitud. PDF llega.
  2. Extraer datos del formulario de PDF lee el archivo adjunto en un objeto formData.
  3. Una hoja de cálculo de Google o Excel El nodo agrega una fila, asignando cada nombre de campo a una columna.
CRM Generación de clientes potenciales a partir de formularios de admisión
  1. Un disparador de almacenamiento en la nube se activa con una nueva entrada cargada PDF.
  2. Extraer datos del formulario de PDF Extrae los datos de contacto de la capa del formulario.
  3. A CRM El nodo crea o actualiza el registro utilizando el nombre, el correo electrónico y los valores de la empresa extraídos.
Enrutamiento de aprobación condicional
  1. Un webhook recibe un formulario de solicitud firmado desde un portal externo.
  2. Extraer datos del formulario de PDF Devuelve la cantidad solicitada y los campos del departamento.
  3. Un nodo IF se ramifica hacia el aprobador correcto en función de esos valores.
Digitalización por lotes de un archivo
  1. Un nodo Loop Over Items itera sobre una lista de formularios archivados. URLs.
  2. Extraer datos del formulario de PDF se ejecuta con el tipo de datos de entrada establecido en URL para cada archivo.
  3. Cada objeto formData se escribe en una tabla de la base de datos cuya clave es el nombre del documento de origen.

Consejos prácticos

Run one sample file before you map anything
Field names and checkbox export values are set by whoever designed the form, so inspect the real formData output first instead of guessing the key names.
Test for empty strings, not missing keys
Unfilled fields are still present in the output with an empty value, so a simple key existence check will not tell you whether the user answered.
Check the PDF is not flattened
A form that looks fillable in a viewer may have been flattened on save, which strips the field layer. If formData comes back empty, that is usually why.
Send scans to an AI parser instead
Scanned paper forms have no interactive fields at all. Route those to Parse Document rather than expecting this node to read them.
Keep Document Name meaningful
It is used for reference and tracking on the request, so passing the real source filename makes execution logs far easier to audit later.
Validate before writing to a system of record
Add a check on required fields after extraction so an incomplete submission is flagged rather than silently creating a half-empty CRM record.

Hoja de trucos

CampoValor
ActionExtract Form Data From PDF
Input Data TypeBinary Data
Input Binary Fielddata
Document Namedocument.pdf
Custom Profiles{ 'outputDataFormat': 'json' }
CredentialsPDF4me API credential
ReturnsformData object of field name and value pairs

Preguntas frecuentes

Does Extract Form Data From PDF work on a scanned or flattened PDF?+
No. This node reads values from real interactive form fields, the AcroForm layer described in the ISO 32000 PDF specification. A scanned page is just an image, and a flattened PDF has had its fields painted into static content, so in both cases there are no field objects left to read. For those files use an OCR or AI parsing node instead, such as Parse Document.
What do empty form fields return?+
A field the user left blank still appears in the formData object, with an empty string as its value. The key set reflects the fields defined in the PDF, not only the ones that were filled in, so downstream nodes should test for empty values rather than assume a missing key.
How are checkboxes and radio buttons returned?+
Checkbox and radio button fields return their underlying export value as defined in the PDF, not always a literal true or false. Common values include Yes, Off, or a named choice set by whoever built the form. Run the node once on a sample filled PDF and inspect the actual output before writing comparison logic against it.
Can I send extracted PDF form data straight to Excel or a database?+
Yes. The formData object is standard JSON, so any node that accepts item fields can consume it. Map formData keys onto columns in a spreadsheet, database, or CRM node placed after the PDF4me node, using the standard n8n data mapping approach.
What is the difference between extracting form data and extracting text from a PDF?+
Extracting form data reads named field values from the interactive form layer, so you get reliable key and value pairs such as email mapped to its entered address. Extracting text returns the visible page content as a flat string with no field names attached, leaving you to parse it. Prefer form data extraction whenever the PDF is a genuine fillable form.

Acciones relacionadas

La misma tarea en otras plataformas

Obtén ayuda