Saltar al contenido principal

Extraer texto de Word en n8n

Extraer texto de Word es un n8n nodo por PDF4me Esta herramienta extrae texto limpio de un archivo .docx, con opciones para eliminar comentarios, encabezados y pies de página, y finalizar los cambios registrados antes de la extracción. Úsela para la migración de contenido, la minería de texto o para alimentar el texto de documentos a análisis posteriores sin necesidad de copiar y pegar manualmente.

Lo que hace este nodo

PDF4meExtraer texto de Word Lee un archivo .docx y devuelve su contenido de texto, opcionalmente limitado a un rango de páginas y limpio de comentarios, encabezados/pies de página o cambios rastreados no resueltos. Acepta entrada a través de datos binarios, Base64 Cuerda o URLIdeal para la migración de contenido, la limpieza editorial, la indexación de búsqueda y la alimentación de texto de documentos a procesos de minería de texto o análisis.

Entradas de blog relacionadas
Aún no hay ninguna entrada de blog sobre esta función; estará disponible próximamente.
Mientras tanto, echa un vistazo al blog de PDF4me para encontrar tutoriales y flujos de trabajo para todas las plataformas.
Visita el blog

Autenticando su API Pedido

Cada PDF4me nodo en n8n requiere un válido Credencial para conectarse con. Crea o selecciona uno que contenga tu PDF4me API clave para que el flujo de trabajo pueda autenticar las solicitudes de extracción de forma segura.

Datos importantes que no debes perderte

Solo dos campos son realmente obligatorios.
La entrada del documento de Word (a través del tipo de datos de entrada) y el nombre del documento. El rango de páginas y los tres interruptores de limpieza tienen valores predeterminados que funcionan, coincidiendo con el mismo patrón que el ya verificado. Make versión de esta acción.
La función Aceptar cambios se ejecuta antes de la extracción, no después.
La opción «Aceptar cambios» finaliza primero todos los cambios registrados en el documento, de modo que el texto extraído refleje la versión editada. Desactive esta opción si necesita un texto que se corresponda lógicamente con el original.
La salida es un archivo binario, no una cadena de texto simple.
El texto extraído se devuelve como un archivo binario en el campo Nombre del campo binario de salida, típicamente JSON. Pásalo a un nodo posterior para leer, analizar o almacenar el contenido de texto real.
Nodo n8n para extraer texto de Word configurado con la acción "Extraer texto de Word", tipo de datos de entrada "Datos binarios", campo de entrada "Datos binarios", nombre del documento "document.docx", número de página inicial "1", número de página final "3" y opciones de extracción con las opciones "Eliminar comentarios", "Eliminar encabezado/pie de página" y "Aceptar cambios" habilitadas.

PDF4me Panel de parámetros del nodo Extraer texto del nodo Palabra en n8n

¿Qué parámetros necesita la función "Extraer texto de Word"?

Requerido: Tipo de datos de entrada y nombre del documento, además del campo que coincida con el tipo de entrada elegido (Campo binario de entrada, Base64 El contenido de Word o la URL de Word son opcionales. El número de página de inicio, el número de página final, el nombre del campo binario de salida y los tres interruptores de Opciones de extracción son todos opcionales.

ParámetroRequeridoLo que haceEjemplo
Input Data TypeRequiredFormat of the source Word document. Choose Binary Data (from a previous node), Base64 String, or URL.Binary Data
Input Binary FieldConditionalName of the binary property on the incoming n8n item that holds the Word file. Required when Input Data Type is Binary Data.data
Base64 Word ContentConditionalBase64-encoded Word content. Required when Input Data Type is Base64 String.UEsDBBQAAAAIAA...
Word URLConditionalPublicly reachable HTTPS URL to the source Word file. Required when Input Data Type is URL.https://example.com/document.docx
Document NameRequiredFilename of the input Word file, including the .docx extension, used for format detection.document.docx
Start Page NumberOptionalFirst page to include in extraction. Leave unset to start from page 1.1
End Page NumberOptionalLast page to include in extraction. Leave unset to extract through the last page.3
Remove CommentsOptionalStrips reviewer comments from the extracted text when enabled.true
Remove Header/FooterOptionalExcludes running headers and footers when enabled, leaving only body content.true
Accept ChangesOptionalFinalizes all tracked changes before extraction when enabled, so text reflects the edited version.true
Output Binary Field NameOptionalName of the binary property the output item exposes. Default is data.data

Opciones avanzadas

Perfiles personalizados (opcional)
A JSONBloque tipo -de parámetros predefinidos para configuraciones de extracción especializadas, como { "outputDataFormat": "json" }, superpuestos sobre los campos individuales anteriores.

Campos de salida

CampoTipoLo que contiene
successBooleanTrue when extraction succeeded. Use to route error-handling branches.
fileNameStringGenerated filename for the extracted content file, typically ending in .json.
mimeTypeStringMIME type of the output, typically application/json or text/plain.
fileSizeNumberSize of the extracted content file in bytes.
docNameStringOriginal filename of the input Word document, kept for audit and tracking.
messageStringHuman-readable status message for the extraction result.
Binary (data)BinaryThe extracted text content under Output Binary Field Name (default data). Pass into a downstream node to read or store the text.

¿Cómo configuro la extracción de texto de Word? n8n¿

  1. Agregar PDF4me a tu n8n flujo de trabajo y elegir el Extraer texto de Word acción.
  2. En Credencial para conectarse con, seleccione su PDF4me credenciales o haga clic Crear nueva credencial y pega tu API llave.
  3. Colocar Tipo de datos de entrada a Datos binarios (por defecto), Base64 Cadena, o URL y proporcione el campo de origen correspondiente.
  4. Colocar Nombre del documento con el .docx extensión.
  5. Opcionalmente se puede configurar Número de página inicial y Número de página final para limitar la extracción a un rango de páginas.
  6. Colocar Eliminar comentarios, Eliminar encabezado/pie de página, y Aceptar cambios según sea necesario para una extracción de versión limpia o editada.
  7. Ejecuta el nodo y dirige el texto extraído a tu canalización de contenido, índice de búsqueda o flujo de trabajo de análisis.

Configuraciones típicas

Ejemplos de flujo de trabajoCommon n8n workflow patterns using Extract Text From Word.
Migración de contenido a un CMS
  1. Un disparador de Google Drive se activa cuando se agrega un documento de Word antiguo a una carpeta de migración.
  2. PDF4me La función Extraer texto de Word se ejecuta con las opciones Eliminar encabezado/pie de página y Eliminar comentarios habilitadas para una extracción limpia que solo contenga el cuerpo del documento.
  3. El texto extraído se publica en un CMS sin interfaz gráfica como una nueva entrada de contenido.
Revisión editorial posterior
  1. El manuscrito revisado, con los cambios y comentarios registrados, se carga mediante un formulario.
  2. PDF4me La función Extraer texto de Word se ejecuta con las opciones Aceptar cambios y Eliminar comentarios habilitadas para obtener una versión final limpia.
  3. El texto finalizado se envía a un proceso de corrección de estilo o publicación.
Índice de búsqueda creado a partir de una biblioteca de documentos
  1. Un nodo Loop Over Items itera documentos de Word desde un SharePoint biblioteca de documentos.
  2. PDF4me La función Extraer texto de Word se ejecuta en cada archivo con las opciones de extracción predeterminadas.
  3. El texto extraído se indexa en un motor de búsqueda como Elasticsearch o Algolia.
Extracción a nivel de sección para informes extensos
  1. Un flujo de trabajo solo necesita el resumen ejecutivo de un informe extenso.
  2. PDF4me La función Extraer texto de Word se ejecuta con el número de página inicial 1 y el número de página final 2 para limitar la extracción a las páginas de resumen.
  3. El texto resumido extraído se envía a una etapa de resumen o análisis de texto.

Consejos prácticos

Only Input and Document Name are required
Page range and the three cleanup toggles all have working defaults; set them only when your workflow needs the behavior to differ.
Use page range for large documents
Set Start Page Number and End Page Number to extract only the section you need instead of processing an entire long document.
Accept Changes changes the output text
With Accept Changes on, deleted text in tracked changes will not appear in the extraction; with it off, the pre-edit text may still be present.
Output is binary, read it downstream
The extracted text arrives as a binary file, not a plain n8n string field; use a node that reads binary content to access the actual text.
Document Name still matters with Binary Data
The extension drives format detection regardless of input type; keep it accurate even when the file itself comes from a previous node.
Remove Header/Footer helps content analysis
Running headers and footers (page numbers, document titles) can pollute text-mining results; strip them for cleaner analysis.

Hoja de trucos

CampoValor
ActionExtract Text From Word
Input Data TypeBinary Data
Input Binary Fielddata
Document Namedocument.docx
Start Page Number1 (optional)
End Page Number(optional, defaults to last page)
Remove Commentstrue
Remove Header/Footertrue
Accept Changestrue
CredentialsPDF4me API credential

Preguntas frecuentes

Which fields are required for Extract Text From Word?+
Two: the Word document input (via Input Data Type) and Document Name. Start Page Number, End Page Number, Remove Comments, Remove Header/Footer, and Accept Changes are all optional; the node applies sensible defaults.
What do Remove Comments, Remove Header/Footer, and Accept Changes do?+
Remove Comments strips reviewer comments from the extracted text. Remove Header/Footer excludes running headers and footers so only body content comes through. Accept Changes finalizes tracked changes before extraction, so the text reflects the edited version rather than the original with revision marks.
Can I extract text from only part of the document?+
Yes. Set Start Page Number and End Page Number to limit extraction to a specific page range, leave them unset to extract the entire document.
What format is the extracted text returned in?+
A binary file (typically JSON) exposed under Output Binary Field Name, alongside metadata fields like fileName, fileSize, and success. Pass the binary into a downstream node to read or store the text, similar to how the general-purpose Python approach in this Word text-extraction guide returns structured content rather than a raw string.
Does Accept Changes run before or after extraction?+
Before. Setting Accept Changes finalizes every tracked change in the document first, so the extracted text reflects the edited version, the same distinction raised in Microsoft Q&A discussions on extracting text from Word documents about edited versus original content.

Acciones relacionadas

La misma tarea en otras plataformas

Obtén ayuda