Extraer texto de Word - Analizador de contenido API
PDF4me Extraer texto de Word Te permite extraer contenido de texto de documentos de Word con opciones para filtrar por rango de páginas y contenido. API El servicio procesa archivos de Word y extrae el contenido de texto de documentos de Word con opciones personalizables. API recibe el contenido del documento de Word a través de REST API llamadas, utilizando Base64 Codificación para una transmisión segura. Con soporte para selección de rangos de páginas, eliminación de comentarios, filtrado de encabezados y pies de página, y aceptación de cambios, esta solución es ideal para flujos de trabajo de procesamiento de documentos y análisis de contenido.
Autenticando su API Pedido
Para acceder al PDF4me REST APICada solicitud debe incluir las credenciales de autenticación adecuadas. La autenticación garantiza una comunicación segura y valida su identidad como usuario autorizado del sistema. REST API.
Características principales
- Compatibilidad con documentos de Word: Extraer texto de documentos de Microsoft Word (.doc, .docx)
- Selección de rango de páginas: Procesar rangos de páginas específicos o documentos completos con números de página de inicio y fin personalizados.
- Filtrado de contenido: Eliminar comentarios, encabezados, pies de página y control de cambios para una extracción de texto limpia.
- Base64 Codificación: Transmisión segura del contenido de los archivos mediante Base64 codificación
- Simple API Integración: RESTful API Diseñado para flujos de trabajo automatizados de procesamiento de documentos de Word.
REST API Punto final
El PDF4me REST API utiliza estándar HTTP métodos para interactuar con los recursos. Todas las operaciones de extracción de texto de Word se realizan a través de un único punto final:
- Método: POST
- Punto final:
/api/v2/ExtractTextFromWord
REST API Parámetros
Lista completa de parámetros para la función Extraer texto de Word REST APILos parámetros están organizados por categoría para una mejor comprensión e implementación.
Importante: Los parámetros marcados con un asterisco (*) son obligatorios y deben proporcionarse para la API para que funcione correctamente.
Parámetros requeridos
| Parámetro | Tipo | Descripción | Ejemplo |
|---|---|---|---|
| docName* | String | Nombre del archivo de documento de Word de origen (sin extensión o con extensión .docx/.doc) | output |
| docContent* | Base64 (String) | El contenido del documento de Word de entrada en Base64 formato | JVBERi... |
| StartPageNumber* | Integer | Número de página inicial para la extracción de texto | 1 |
| EndPageNumber* | Integer | Número de página final para la extracción de texto | 3 |
| RemoveComments* | Boolean | Elija si desea eliminar los comentarios del texto extraído: verdadero: Eliminar comentarios, FALSOIncluir comentarios | true |
| RemoveHeaderFooter* | Boolean | Elige si deseas eliminar los encabezados y pies de página: verdadero: Eliminar encabezados/pies de página, FALSO: Incluir encabezados/pies de página | true |
| AcceptChanges* | Boolean | Elige si deseas aceptar los cambios registrados: verdadero: Aceptar cambios, FALSO: Rechazar cambios | true |
Parámetros opcionales
| Parámetro | Tipo | Descripción | Ejemplo |
|---|---|---|---|
| async | Boolean | Habilitar el procesamiento asíncrono. Cuando true, el API devoluciones 202 Accepted con un Location encabezado para sondear el resultado | false |
Producción
El PDF4me Extraer texto de Word REST API devuelve diferentes respuestas según el modo de procesamiento. API devuelve el texto extraído como un JSON respuesta o archivo de texto.
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
Procesamiento síncrono (predeterminado)
Cuando async es false o no proporcionado, el API Devuelve el texto extraído inmediatamente.
Código de estado: 200 OK
Formato de respuesta:
{
"extractedText": "Extracted text content from Word document pages 1 to 3...",
"fileName": "output.txt"
}
O como archivo de texto:
Extracted text content from Word document pages 1 to 3...
La respuesta contiene el contenido de texto extraído del rango de páginas especificado.
Procesamiento asíncrono
Cuando async es true, el API procesa el documento de forma asíncrona.
Respuesta inicial:
Código de estado: 202 Accepted
Encabezados de respuesta:
Location: https://api.pdf4me.com/api/v2/ExtractTextFromWordStatus/{operationId}
Cuerpo de la respuesta:
{
"traceId": "operation-trace-id"
}
Encuesta para obtener resultados:
Utilice el Location encabezado URL para consultar la finalización:
const response = await fetch(locationUrl, {
headers: { 'Authorization': 'Basic ' + apiKey }
});
// Continue polling until status code is 200
if (response.status === 200) {
const result = await response.json();
// Process extracted text
}
Respuestas de error
| Código de estado | Descripción | Ejemplo de respuesta |
|---|---|---|
| 400 Bad Request | Parámetros de solicitud no válidos o campos obligatorios faltantes. | {"error": "Missing required parameter: docContent"} |
| 401 Unauthorized | Inválido o faltante API llave | {"error": "Unauthorized"} |
| 408 Tiempo de espera de solicitud agotado | Tiempo de espera agotado para el procesamiento de la solicitud. | {"error": "Request timeout"} |
| 500 Internal Server Error | Error del servidor durante el procesamiento | {"error": "Internal server error"} |
Comprender la respuesta
La respuesta de extracción de texto puede presentarse en dos formatos:
- JSON Formato: Contiene
extractedText(cadena) yfileName(cadena) - Formato de texto: Archivo de texto plano con el contenido extraído
Detalles del parámetro:
- StartPageNumber y EndPageNumber: Defina el rango de páginas (indexación basada en 1)
- RemoveComments: Cuando
trueElimina todos los comentarios del documento de Word antes de la extracción. - RemoveHeaderFooter: Cuando
trueElimina los encabezados y pies de página de cada página antes de la extracción. - AcceptChanges: Cuando
trueacepta todos los cambios registrados en el documento de Word antes de la extracción.
Formatos de Word compatibles:
.docx(Word 2007 y versiones posteriores).doc(Word 97-2003)
Ejemplo de solicitud
Encabezamiento
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
Nota:
- Consigue tu API clave del PDF4me Panel
- El API La clave debe ser Base64 codificado y prefijado con "Basic" en el Authorization encabezado
- Ejemplo: Si su API La clave es
abc123, codificarlo a Base64 y usarAuthorization: Basic YWJjMTIz
Carga útil
Solicitud básica:
{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output",
"StartPageNumber": 1,
"EndPageNumber": 3,
"RemoveComments": true,
"RemoveHeaderFooter": true,
"AcceptChanges": true
}
Con procesamiento asíncrono:
{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output",
"StartPageNumber": 1,
"EndPageNumber": 3,
"RemoveComments": true,
"RemoveHeaderFooter": true,
"AcceptChanges": true,
"async": true
}
Ejemplos de código
El PDF4me Extraer texto de Word REST API Proporciona ejemplos de código en varios lenguajes de programación. Elija el lenguaje que mejor se adapte a su entorno de desarrollo:
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
C# (CSharp) Muestra
Completo C# Implementación para extraer texto de documentos de Word:
Java Muestra
Java Implementación con manejo completo de errores y procesamiento de respuestas:
JavaScript Muestra
Node.js y compatible con navegadores JavaScript implementación:
Google Apps Script Muestra
Google Apps Script implementación para Google Workspace integración:
Características de extracción de texto de Word
Procesamiento de documentos
- Compatibilidad con formato WordCompatibilidad total con los formatos de documento de Microsoft Word .doc y .docx.
- Preservación del formatoMantiene el formato y la estructura del texto durante la extracción.
- Documentos complejos: Maneja documentos de Word complejos con tablas, imágenes y contenido incrustado.
- Procesamiento profesionalExtracción de texto de alta calidad con preservación precisa del contenido.
- Entrada flexible: Compatibilidad con diversas versiones y formatos de documentos de Word.
Procesamiento de páginas
- Selección de rango de páginasExtraer texto de rangos de páginas específicos con números de página de inicio y fin.
- Segmentación flexible: Procesar páginas individuales, rangos de páginas o documentos completos
- Procesamiento personalizado: Compatibilidad con cualquier combinación de páginas con control preciso
- Procesamiento por lotes: Maneje varias páginas de manera eficiente en una sola API llamadas
- Diseño profesionalExtracción de texto consistente en todas las páginas de destino.
Filtrado de contenido
- Eliminación de comentariosOpción para excluir comentarios y anotaciones del texto extraído.
- Filtrado de encabezado/pie de página: Eliminar encabezados y pies de página para una extracción de contenido limpia
- Seguimiento de cambios: Aceptar o rechazar los cambios registrados durante la extracción de texto.
- Limpieza de contenidoOpciones de filtrado avanzadas para necesidades específicas de extracción de texto.
- Resultados profesionales: Salida de texto limpia y formateada con preservación precisa del contenido
Casos de uso y aplicaciones en la industria
- Business & Enterprise
- Legal & Professional Services
- Education & Research
- Government & Compliance
- Technology & Development
Casos de uso para empresas y negocios
- Análisis de documentos: Extraer contenido de texto de documentos de Word para su análisis y procesamiento.
- Gestión de contenidosExtraer texto de documentos de Word para sistemas de gestión de contenido.
- Procesamiento de informes: Extraer texto de informes de Word para su procesamiento y análisis automatizados.
- Inteligencia empresarial: Extraer texto de documentos comerciales de Word para análisis de datos
Casos de uso de servicios legales y profesionales
- Tramitación de documentos legales: Extraer texto de documentos legales de Word para la gestión de casos
- Análisis de contratos: Extraer texto de contratos y documentos legales
- Gestión de casos: Extraer texto de documentos legales para sistemas de gestión de casos
- Investigación jurídica: Extraer texto de documentos legales para investigación y análisis.
Casos de uso en educación e investigación
- Investigación académica: Extraer texto de documentos académicos de Word para investigación y análisis.
- Documentos de investigación: Extraer texto de artículos de investigación y documentos académicos
- Contenido educativoExtraer texto de documentos educativos de Word
- Análisis académico: Extraer texto de documentos académicos para su análisis.
Casos de uso en materia de gobierno y cumplimiento normativo
- Monitoreo del cumplimiento: Extraer texto de documentos de cumplimiento de Word para su seguimiento y auditoría.
- Documentación reglamentariaExtraer texto de documentos normativos de Word
- Informes gubernamentalesExtraer texto de documentos gubernamentales de Word
- Registros públicosExtraer texto de documentos de Word de registros públicos
Casos de uso de tecnología y desarrollo
- Migración de datosConvertir el contenido de documentos de Word a otros formatos para la migración de datos.
- Procesamiento de contenido: Extraer texto de documentos de Word para la integración del sistema
- API Integración: Extraer texto de documentos de Word para API procesamiento
- Extracción de datos: Extraer texto de documentos de Word para su procesamiento de datos.