Extraer texto de Word en n8n
Extraer texto de Word es un n8n nodo por PDF4me Esta herramienta extrae texto limpio de un archivo .docx, con opciones para eliminar comentarios, encabezados y pies de página, y finalizar los cambios registrados antes de la extracción. Úsela para la migración de contenido, la minería de texto o para alimentar el texto de documentos a análisis posteriores sin necesidad de copiar y pegar manualmente.
Lo que hace este nodo
PDF4meExtraer texto de Word Lee un archivo .docx y devuelve su contenido de texto, opcionalmente limitado a un rango de páginas y limpio de comentarios, encabezados/pies de página o cambios rastreados no resueltos. Acepta entrada a través de datos binarios, Base64 Cuerda o URLIdeal para la migración de contenido, la limpieza editorial, la indexación de búsqueda y la alimentación de texto de documentos a procesos de minería de texto o análisis.
Autenticando su API Pedido
Cada PDF4me nodo en n8n requiere un válido Credencial para conectarse con. Crea o selecciona uno que contenga tu PDF4me API clave para que el flujo de trabajo pueda autenticar las solicitudes de extracción de forma segura.
Datos importantes que no debes perderte

PDF4me Panel de parámetros del nodo Extraer texto del nodo Palabra en n8n
¿Qué parámetros necesita la función "Extraer texto de Word"?
Requerido: Tipo de datos de entrada y nombre del documento, además del campo que coincida con el tipo de entrada elegido (Campo binario de entrada, Base64 El contenido de Word o la URL de Word son opcionales. El número de página de inicio, el número de página final, el nombre del campo binario de salida y los tres interruptores de Opciones de extracción son todos opcionales.
| Parámetro | Requerido | Lo que hace | Ejemplo |
|---|---|---|---|
| Input Data Type | Required | Format of the source Word document. Choose Binary Data (from a previous node), Base64 String, or URL. | Binary Data |
| Input Binary Field | Conditional | Name of the binary property on the incoming n8n item that holds the Word file. Required when Input Data Type is Binary Data. | data |
| Base64 Word Content | Conditional | Base64-encoded Word content. Required when Input Data Type is Base64 String. | UEsDBBQAAAAIAA... |
| Word URL | Conditional | Publicly reachable HTTPS URL to the source Word file. Required when Input Data Type is URL. | https://example.com/document.docx |
| Document Name | Required | Filename of the input Word file, including the .docx extension, used for format detection. | document.docx |
| Start Page Number | Optional | First page to include in extraction. Leave unset to start from page 1. | 1 |
| End Page Number | Optional | Last page to include in extraction. Leave unset to extract through the last page. | 3 |
| Remove Comments | Optional | Strips reviewer comments from the extracted text when enabled. | true |
| Remove Header/Footer | Optional | Excludes running headers and footers when enabled, leaving only body content. | true |
| Accept Changes | Optional | Finalizes all tracked changes before extraction when enabled, so text reflects the edited version. | true |
| Output Binary Field Name | Optional | Name of the binary property the output item exposes. Default is data. | data |
Opciones avanzadas
{ "outputDataFormat": "json" }, superpuestos sobre los campos individuales anteriores.Campos de salida
| Campo | Tipo | Lo que contiene |
|---|---|---|
success | Boolean | True when extraction succeeded. Use to route error-handling branches. |
fileName | String | Generated filename for the extracted content file, typically ending in .json. |
mimeType | String | MIME type of the output, typically application/json or text/plain. |
fileSize | Number | Size of the extracted content file in bytes. |
docName | String | Original filename of the input Word document, kept for audit and tracking. |
message | String | Human-readable status message for the extraction result. |
Binary (data) | Binary | The extracted text content under Output Binary Field Name (default data). Pass into a downstream node to read or store the text. |
¿Cómo configuro la extracción de texto de Word? n8n¿
- Agregar PDF4me a tu n8n flujo de trabajo y elegir el Extraer texto de Word acción.
- En Credencial para conectarse con, seleccione su PDF4me credenciales o haga clic Crear nueva credencial y pega tu API llave.
- Colocar Tipo de datos de entrada a Datos binarios (por defecto), Base64 Cadena, o URL y proporcione el campo de origen correspondiente.
- Colocar Nombre del documento con el
.docxextensión. - Opcionalmente se puede configurar Número de página inicial y Número de página final para limitar la extracción a un rango de páginas.
- Colocar Eliminar comentarios, Eliminar encabezado/pie de página, y Aceptar cambios según sea necesario para una extracción de versión limpia o editada.
- Ejecuta el nodo y dirige el texto extraído a tu canalización de contenido, índice de búsqueda o flujo de trabajo de análisis.
Configuraciones típicas
Ejemplos de flujo de trabajoCommon n8n workflow patterns using Extract Text From Word.
- Un disparador de Google Drive se activa cuando se agrega un documento de Word antiguo a una carpeta de migración.
- PDF4me La función Extraer texto de Word se ejecuta con las opciones Eliminar encabezado/pie de página y Eliminar comentarios habilitadas para una extracción limpia que solo contenga el cuerpo del documento.
- El texto extraído se publica en un CMS sin interfaz gráfica como una nueva entrada de contenido.
- El manuscrito revisado, con los cambios y comentarios registrados, se carga mediante un formulario.
- PDF4me La función Extraer texto de Word se ejecuta con las opciones Aceptar cambios y Eliminar comentarios habilitadas para obtener una versión final limpia.
- El texto finalizado se envía a un proceso de corrección de estilo o publicación.
- Un nodo Loop Over Items itera documentos de Word desde un SharePoint biblioteca de documentos.
- PDF4me La función Extraer texto de Word se ejecuta en cada archivo con las opciones de extracción predeterminadas.
- El texto extraído se indexa en un motor de búsqueda como Elasticsearch o Algolia.
- Un flujo de trabajo solo necesita el resumen ejecutivo de un informe extenso.
- PDF4me La función Extraer texto de Word se ejecuta con el número de página inicial 1 y el número de página final 2 para limitar la extracción a las páginas de resumen.
- El texto resumido extraído se envía a una etapa de resumen o análisis de texto.
Consejos prácticos
Hoja de trucos
| Campo | Valor |
|---|---|
| Action | Extract Text From Word |
| Input Data Type | Binary Data |
| Input Binary Field | data |
| Document Name | document.docx |
| Start Page Number | 1 (optional) |
| End Page Number | (optional, defaults to last page) |
| Remove Comments | true |
| Remove Header/Footer | true |
| Accept Changes | true |
| Credentials | PDF4me API credential |