Extraer texto de Word
Extracto → Extraer texto de Word
El Extraer texto de Word API Extrae texto de un documento de Word (.doc, .docx). Usted envía el documento como Base64 (docContent), docName, StartPageNumber, EndPageNumber, RemoveComments, RemoveHeaderFooter, AcceptChangesy opcionalmente async. El API devoluciones JSON o un archivo de texto con el texto extraído. Utilice la herramienta de prueba que aparece a continuación para comprobarlo; encontrará más detalles en las secciones siguientes.
Prueba la función Extraer texto de Word. API
:::nota Referencia rápida
Punto final: POST /api/v2/ExtractTextFromWord · Requerido: api-key, docContent, docName, StartPageNumber, EndPageNumber, RemoveComments, RemoveHeaderFooter, AcceptChanges
:::
Utiliza el formulario a continuación para enviar tu solicitud API clave, documento de Word (Base64), rango de páginas y opciones (eliminar comentarios, encabezado/pie de página, aceptar cambios registrados). La respuesta es JSON o texto con contenido extraído. No se requiere código, complete los campos y haga clic. Enviar solicitud.
Descripción general, parámetros y casos de uso
- Overview
- Parameters
- Use cases
¿Qué es Extraer texto de Word?
Este punto final extrae texto de un documento de Word (.doc, .docx). Usted especifica un rango de páginas (StartPageNumber, EndPageNumber) y opciones: RemoveComments (comentarios de la tira), RemoveHeaderFooter (eliminar encabezados/pies de página), AcceptChanges (aplicar cambios controlados). El API devoluciones JSON o un archivo de texto con el texto extraído. Úselo cuando necesite texto sin formato de Word para búsquedas, análisis o migración.
Características principales
- Rango de páginas: StartPageNumber y EndPageNumber Limitar la extracción a páginas específicas.
- Filtrado de contenido: RemoveComments, RemoveHeaderFooter, AcceptChanges controlar lo que se incluye.
- Formatos: Admite archivos .doc y .docx (Base64).
- Asíncrono: Usar async para documentos grandes.
Utilizar cuando necesite texto sin formato de Word (por ejemplo, para búsquedas, migraciones o análisis). Para PDF uso de extracción Extraer recursos o Extraer texto por expresión.
API parámetros
| Parámetro | Tipo | Requerido | Descripción |
|---|---|---|---|
| api-key | cadena | Sí | Su PDF4me API llave, Base64 codificado. Consíguelo desde el panel. |
| docContent | base64 | Sí | Contenido del documento de Word (Base64). .doc, .docx. |
| docName | cadena | Sí | Nombre del archivo de Word (por ejemplo, salida). |
| StartPageNumber | entero | Sí | Número de página inicial. |
| EndPageNumber | entero | Sí | Número de página final. |
| RemoveComments | booleano | Sí | Eliminar los comentarios del texto extraído. |
| RemoveHeaderFooter | booleano | Sí | Eliminar el encabezado/pie de página del texto extraído. |
| AcceptChanges | booleano | Sí | Aceptar los cambios registrados en el documento. |
| async | booleano | No | Habilitar el procesamiento asíncrono. |
Cuándo usar la función Extraer texto de Word
- Migración de contenido: Extraer texto de Word para importarlo a CMS, búsquedas o bases de datos.
- Análisis: Obtenga texto sin formato para PNL, indexación de búsqueda o generación de informes.
- Específico de la página: Extraer solo un rango de páginas (por ejemplo, apéndice, secciones específicas).
Para ver esquemas de solicitud/respuesta y ejemplos de código, consulte Extraer texto de Word en el PDF4me API documentos.
Requisitos previos
Antes de utilizar este punto final, asegúrese de tener:
- Un válido PDF4me API llave (Consigue tu API Llave)
- Un documento de Word (.docx o .doc) en Base64 formato
Formato de respuesta
El API devuelve un JSON Respuesta o archivo de texto con el contenido extraído del rango de páginas especificado.