Saltar al contenido principal

Extraer texto de Word - Analizador de contenido API

PDF4me Extraer texto de Word Te permite extraer contenido de texto de documentos de Word con opciones para filtrar por rango de páginas y contenido. API El servicio procesa archivos de Word y extrae el contenido de texto de documentos de Word con opciones personalizables. API recibe el contenido del documento de Word a través de REST API llamadas, utilizando Base64 Codificación para una transmisión segura. Con soporte para selección de rangos de páginas, eliminación de comentarios, filtrado de encabezados y pies de página, y aceptación de cambios, esta solución es ideal para flujos de trabajo de procesamiento de documentos y análisis de contenido.

Entradas de blog relacionadas
Aún no hay ninguna entrada de blog sobre esta función; estará disponible próximamente.
Mientras tanto, echa un vistazo al blog de PDF4me para encontrar tutoriales y flujos de trabajo para todas las plataformas.
Visita el blog

Autenticando su API Pedido

Para acceder al PDF4me REST APICada solicitud debe incluir las credenciales de autenticación adecuadas. La autenticación garantiza una comunicación segura y valida su identidad como usuario autorizado del sistema. REST API.

Características principales

  • Compatibilidad con documentos de Word: Extraer texto de documentos de Microsoft Word (.doc, .docx)
  • Selección de rango de páginas: Procesar rangos de páginas específicos o documentos completos con números de página de inicio y fin personalizados.
  • Filtrado de contenido: Eliminar comentarios, encabezados, pies de página y control de cambios para una extracción de texto limpia.
  • Base64 Codificación: Transmisión segura del contenido de los archivos mediante Base64 codificación
  • Simple API Integración: RESTful API Diseñado para flujos de trabajo automatizados de procesamiento de documentos de Word.

REST API Punto final

El PDF4me REST API utiliza estándar HTTP métodos para interactuar con los recursos. Todas las operaciones de extracción de texto de Word se realizan a través de un único punto final:

  • Método: POST
  • Punto final: /api/v2/ExtractTextFromWord

REST API Parámetros

Lista completa de parámetros para la función Extraer texto de Word REST APILos parámetros están organizados por categoría para una mejor comprensión e implementación.

Importante: Los parámetros marcados con un asterisco (*) son obligatorios y deben proporcionarse para la API para que funcione correctamente.

Parámetros requeridos

ParámetroTipoDescripciónEjemplo
docName*StringNombre del archivo de documento de Word de origen (sin extensión o con extensión .docx/.doc)output
docContent*Base64 (String)El contenido del documento de Word de entrada en Base64 formatoJVBERi...
StartPageNumber*IntegerNúmero de página inicial para la extracción de texto1
EndPageNumber*IntegerNúmero de página final para la extracción de texto3
RemoveComments*BooleanElija si desea eliminar los comentarios del texto extraído: verdadero: Eliminar comentarios, FALSOIncluir comentariostrue
RemoveHeaderFooter*BooleanElige si deseas eliminar los encabezados y pies de página: verdadero: Eliminar encabezados/pies de página, FALSO: Incluir encabezados/pies de páginatrue
AcceptChanges*BooleanElige si deseas aceptar los cambios registrados: verdadero: Aceptar cambios, FALSO: Rechazar cambiostrue

Parámetros opcionales

ParámetroTipoDescripciónEjemplo
asyncBooleanHabilitar el procesamiento asíncrono. Cuando true, el API devoluciones 202 Accepted con un Location encabezado para sondear el resultadofalse

Producción

El PDF4me Extraer texto de Word REST API devuelve diferentes respuestas según el modo de procesamiento. API devuelve el texto extraído como un JSON respuesta o archivo de texto.

Procesamiento síncrono (predeterminado)

Cuando async es false o no proporcionado, el API Devuelve el texto extraído inmediatamente.

Código de estado: 200 OK

Formato de respuesta:

{
"extractedText": "Extracted text content from Word document pages 1 to 3...",
"fileName": "output.txt"
}

O como archivo de texto:

Extracted text content from Word document pages 1 to 3...

La respuesta contiene el contenido de texto extraído del rango de páginas especificado.

Ejemplo de solicitud

Encabezamiento

Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY

Nota:

  • Consigue tu API clave del PDF4me Panel
  • El API La clave debe ser Base64 codificado y prefijado con "Basic" en el Authorization encabezado
  • Ejemplo: Si su API La clave es abc123, codificarlo a Base64 y usar Authorization: Basic YWJjMTIz

Carga útil

Solicitud básica:

{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output",
"StartPageNumber": 1,
"EndPageNumber": 3,
"RemoveComments": true,
"RemoveHeaderFooter": true,
"AcceptChanges": true
}

Con procesamiento asíncrono:

{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output",
"StartPageNumber": 1,
"EndPageNumber": 3,
"RemoveComments": true,
"RemoveHeaderFooter": true,
"AcceptChanges": true,
"async": true
}

Ejemplos de código

El PDF4me Extraer texto de Word REST API Proporciona ejemplos de código en varios lenguajes de programación. Elija el lenguaje que mejor se adapte a su entorno de desarrollo:

C# (CSharp) Muestra

Completo C# Implementación para extraer texto de documentos de Word:

Características de extracción de texto de Word

Procesamiento de documentos

  • Compatibilidad con formato WordCompatibilidad total con los formatos de documento de Microsoft Word .doc y .docx.
  • Preservación del formatoMantiene el formato y la estructura del texto durante la extracción.
  • Documentos complejos: Maneja documentos de Word complejos con tablas, imágenes y contenido incrustado.
  • Procesamiento profesionalExtracción de texto de alta calidad con preservación precisa del contenido.
  • Entrada flexible: Compatibilidad con diversas versiones y formatos de documentos de Word.

Procesamiento de páginas

  • Selección de rango de páginasExtraer texto de rangos de páginas específicos con números de página de inicio y fin.
  • Segmentación flexible: Procesar páginas individuales, rangos de páginas o documentos completos
  • Procesamiento personalizado: Compatibilidad con cualquier combinación de páginas con control preciso
  • Procesamiento por lotes: Maneje varias páginas de manera eficiente en una sola API llamadas
  • Diseño profesionalExtracción de texto consistente en todas las páginas de destino.

Filtrado de contenido

  • Eliminación de comentariosOpción para excluir comentarios y anotaciones del texto extraído.
  • Filtrado de encabezado/pie de página: Eliminar encabezados y pies de página para una extracción de contenido limpia
  • Seguimiento de cambios: Aceptar o rechazar los cambios registrados durante la extracción de texto.
  • Limpieza de contenidoOpciones de filtrado avanzadas para necesidades específicas de extracción de texto.
  • Resultados profesionales: Salida de texto limpia y formateada con preservación precisa del contenido

Casos de uso y aplicaciones en la industria

Casos de uso para empresas y negocios

  • Análisis de documentos: Extraer contenido de texto de documentos de Word para su análisis y procesamiento.
  • Gestión de contenidosExtraer texto de documentos de Word para sistemas de gestión de contenido.
  • Procesamiento de informes: Extraer texto de informes de Word para su procesamiento y análisis automatizados.
  • Inteligencia empresarial: Extraer texto de documentos comerciales de Word para análisis de datos

Obtén ayuda