Extracción de metadatos de documentos de Word - Análisis de documentos API
PDF4me Extraer metadatos de Word Le permite extraer metadatos y propiedades completas de documentos de Word con capacidades de análisis detallado de documentos. API El servicio procesa archivos de Word y recupera propiedades de documento integradas, propiedades personalizadas, estadísticas de documento, información del autor, fechas de creación y seguimiento de revisiones. API recibe el contenido del documento de Word a través de REST API llamadas, utilizando Base64 Codificación para una transmisión segura. Con soporte para formato y localización específicos de cada cultura, esta solución es ideal para la gestión de documentos, el seguimiento del cumplimiento normativo, el análisis de contenido y los flujos de trabajo de documentos empresariales.
Autenticando su API Pedido
Para acceder al PDF4me REST APICada solicitud debe incluir las credenciales de autenticación adecuadas. La autenticación garantiza una comunicación segura y valida su identidad como usuario autorizado del sistema. REST API.
Características principales
- Extracción integral de metadatos: Recuperar todas las propiedades del documento, tanto integradas como personalizadas.
- Estadísticas de documentosObtén el recuento de páginas, palabras, caracteres y párrafos en tiempo real.
- Información del autorExtraer información sobre el autor, el gerente, la empresa y los datos de contacto.
- Propiedades de fecha/hora: Recuperar las marcas de tiempo de creación, modificación e impresión.
- Propiedades personalizadas: Acceda a todas las propiedades personalizadas del documento con prefijo automático
- Apoyo culturalFormatear fechas y horas según la configuración regional especificada.
- Operación de solo lecturaExtraer metadatos sin modificar el documento original.
- Salida estructurada: Devolver metadatos organizados en JSON formato para un procesamiento sencillo
REST API Punto final
El PDF4me REST API utiliza estándar HTTP métodos para interactuar con los recursos. Todas las operaciones de extracción de metadatos se realizan a través de un único punto final:
- Método: POST
- Punto final:
office/ApiV2Word/ExtractMetadata
REST API Parámetros
Lista completa de parámetros para la extracción de metadatos de Word. REST APILos parámetros están organizados por categoría para una mejor comprensión e implementación.
Importante: Los parámetros marcados con un asterisco (*) son obligatorios y deben proporcionarse para la API para que funcione correctamente.
Parámetros requeridos
| Parámetro | Tipo | Descripción | Ejemplo |
|---|---|---|---|
| documento* | Object | Referencia del documento. Debe contener Nombre (cadena): Nombre del archivo de Word con extensión .docx | { "Name": "document.docx" } |
| docContent* | Base64 | Contenido del documento de Word codificado en Base64 | UEsDBBQABgAIAAAA... |
Parámetros opcionales
| Parámetro | Tipo | Descripción | Ejemplo |
|---|---|---|---|
| Nombre de la cultura | String | Código cultural para el formato de fecha y hora (p. ej., "en-US", "de-DE", "fr-FR"). Predeterminado: InvariantCulture (formato consistente). Afecta al formato de visualización de fecha y hora en los metadatos. Las culturas no válidas recurren a InvariantCulture. | en-US |
Producción
El PDF4me Extraer metadatos de Word REST API devuelve diferentes respuestas según el modo de procesamiento. API devuelve los metadatos como un JSON objeto, no como datos binarios.
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
Procesamiento síncrono (predeterminado)
El API procesa la solicitud y devuelve:
Código de estado: 200 OK
Tipo de contenido: application/json
Cuerpo de la respuesta:
{
"document": null,
"fileName": null,
"success": true,
"errorMessage": null,
"metadata": {
"Author": "John Doe",
"Title": "Project Proposal",
"Subject": "Q1 2024 Planning",
"Keywords": "planning, budget, strategy",
"Comments": "Draft version for review",
"Category": "Business",
"Company": "Acme Corporation",
"Manager": "Jane Smith",
"Created": "1/15/2024 10:30:00 AM",
"LastModified": "1/20/2024 2:45:00 PM",
"LastPrinted": "1/18/2024 9:15:00 AM",
"RevisionNumber": 3,
"TotalEditingTime": 120,
"Pages": 8,
"Words": 2150,
"Characters": 12800,
"Paragraphs": 45,
"Custom_Department": "Marketing",
"Custom_ProjectCode": "PRJ-2024-001",
"Custom_Confidential": "Internal"
}
}
Campos de respuesta:
- documento (Base64 o nulo): No se utiliza para la extracción de metadatos; puede ser nulo.
- Nombre del archivo (cadena o nulo): No se utiliza para la extracción de metadatos; puede ser nulo.
- éxito (booleano): Indica si la solicitud se realizó correctamente.
- mensaje de error (cadena o nulo): Detalles del error cuando el éxito es falso.
- metadatos (objeto): Diccionario de metadatos completo que contiene todas las propiedades del documento.
Cómo usarlo:
- Extraer el
metadatacampo del JSON respuesta - Acceder a las propiedades individuales según sea necesario
- Utilice metadatos para la clasificación de documentos, el seguimiento del cumplimiento o el análisis.
Ejemplo (JavaScript):
const response = await fetch(url, options);
const data = await response.json();
const author = data.metadata.Author;
const pageCount = data.metadata.Pages;
// Access any metadata property
Procesamiento asíncrono
Comportamiento asíncrono (202 Accepted con sondeo) se controla mediante la configuración del servidor, no mediante un parámetro del cuerpo de la solicitud. Cuando está habilitado, el API puede devolver un estado 202 con una encuesta URL en el Location encabezado. Sondear el URL con GET solicitudes hasta que reciba 200 OK con la misma forma de respuesta (incluyendo metadata, success, errorMessage).
Respuestas de error
El API devuelve estándar HTTP Códigos de error con detalles del error:
- Parámetros de solicitud no válidos
- Faltan campos obligatorios (
documentoconNombre,docContent) - Inválido Base64 codificación en
docContent - Documento de Word no válido o dañado
- Inválido o faltante API llave
- API La llave no funciona correctamente. Base64 codificado en Authorization encabezado
- Desaparecido
Autorización: Básicaencabezado
- Error de procesamiento del servidor
- Error en el procesamiento del documento de Word
- Error en la extracción de metadatos
Formato de respuesta de error:
{
"error": "Error message describing what went wrong"
}
Detalles del formato de respuesta
Importante: El API siempre regresa JSON con objeto de metadatos.
Estructura de respuesta:
{
"document": "Base64 or null",
"fileName": "string or null",
"success": true,
"errorMessage": "string or null",
"metadata": {
// Built-in properties
"Author": "string",
"Title": "string",
"Subject": "string",
"Keywords": "string",
"Comments": "string",
"Category": "string",
"Company": "string",
"Manager": "string",
"Created": "string (formatted date/time)",
"LastModified": "string (formatted date/time)",
"LastPrinted": "string (formatted date/time)",
"RevisionNumber": "integer",
"TotalEditingTime": "integer (minutes)",
// Document statistics
"Pages": "integer",
"Words": "integer",
"Characters": "integer",
"Paragraphs": "integer",
// Custom properties (prefixed with Custom_)
"Custom_PropertyName": "value"
}
}
Encabezado de tipo de contenido:
- Éxito:
application/json - Los metadatos se devuelven como una estructura JSON objeto
Acceso a los metadatos:
JavaScript/Node.js:
const metadata = response.metadata;
console.log(`Author: ${metadata.Author}`);
console.log(`Pages: ${metadata.Pages}`);
console.log(`Words: ${metadata.Words}`);
Python:
metadata = response['metadata']
print(f"Author: {metadata['Author']}")
print(f"Pages: {metadata['Pages']}")
print(f"Words: {metadata['Words']}")
C#:
var metadata = response.Metadata;
Console.WriteLine($"Author: {metadata["Author"]}");
Console.WriteLine($"Pages: {metadata["Pages"]}");
Console.WriteLine($"Words: {metadata["Words"]}");
Propiedades de metadatos
Propiedades de documento integradas
| Nombre de la propiedad | Tipo | Descripción | Ejemplo |
|---|---|---|---|
| Autor | String | Nombre del autor del documento | "John Doe" |
| Título | String | Título del documento | "Project Proposal" |
| Sujeto | String | Asunto del documento | "Q1 2024 Planning" |
| Palabras clave | String | Palabras clave del documento (separadas por comas) | "planning, budget, strategy" |
| Comentarios | String | Comentarios del documento | "Draft version for review" |
| Categoría | String | Categoría del documento | "Business" |
| Compañía | String | Nombre de empresa | "Acme Corporation" |
| Gerente | String | Nombre del gerente | "Jane Smith" |
| Creado | String | Fecha y hora de creación del documento (formato) | "1/15/2024 10:30:00 AM" |
| Última modificación | String | Fecha y hora del último guardado (formato) | "1/20/2024 2:45:00 PM" |
| Última impresión | String | Última fecha/hora impresa (formato) | "1/18/2024 9:15:00 AM" |
| Número de revisión | Integer | Número de revisión del documento | 3 |
| Tiempo total de edición | Integer | Tiempo total de edición en minutos | 120 |
Estadísticas de documentos
| Nombre de la propiedad | Tipo | Descripción | Ejemplo |
|---|---|---|---|
| Páginas | Integer | Número total de páginas | 8 |
| Palabras | Integer | Recuento total de palabras | 2150 |
| Personajes | Integer | Número total de caracteres | 12800 |
| Párrafos | Integer | Número total de párrafos | 45 |
Propiedades personalizadas
Las propiedades personalizadas tienen el prefijo Custom_ en la respuesta:
Custom_Department- Propiedad del departamento de aduanasCustom_ProjectCode- Propiedad de código de proyecto personalizadoCustom_Confidential- Nivel de confidencialidad personalizado- Cualquier otra propiedad personalizada definida en el documento de Word.
Ejemplos de cultura respaldada
| Código cultural | Descripción | Ejemplo de formato de fecha |
|---|---|---|
en-US | Inglés (Estados Unidos) | "15/01/2024 10:30:00 AM" |
en-GB | Inglés (Reino Unido) | "15/01/2024 10:30:00" |
de-DE | Alemán (Alemania) | "15.01.2024 10:30:00" |
fr-FR | Francés (Francia) | "15/01/2024 10:30:00" |
es-ES | Español (España) | "15/01/2024 10:30:00" |
ja-JP | Japonés (Japón) | "2024/01/15 10:30:00" |
Ejemplo de solicitud
Encabezamiento
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
Nota:
- Consigue tu API clave del PDF4me Panel
- El API La clave debe ser Base64 codificado y prefijado con "Basic" en el Authorization encabezado
- Ejemplo: Si su API La clave es
abc123, codificarlo a Base64 y usarAuthorization: Basic YWJjMTIz
Carga útil
Ejemplo básico (solo campos obligatorios):
{
"document": { "Name": "document.docx" },
"docContent": "UEsDBBQABgAIAAAAIQDfpNJsWgEAACAFAAATAAgCW0NvbnRlbnRfVHlwZXNdLnhtbCCiBAIooAAC..."
}
Ejemplo avanzado (con campos opcionales):
{
"document": { "Name": "document.docx" },
"docContent": "UEsDBBQABgAIAAAAIQDfpNJsWgEAACAFAAATAAgCW0NvbnRlbnRfVHlwZXNdLnhtbCCiBAIooAAC...",
"cultureName": "en-US"
}
Ejemplos de código
El PDF4me Extraer metadatos de Word REST API Proporciona ejemplos de código en varios lenguajes de programación. Elija el lenguaje que mejor se adapte a su entorno de desarrollo:
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
Java Muestra
Java Implementación con manejo completo de errores y procesamiento de respuestas:
JavaScript Muestra
Node.js y compatible con navegadores JavaScript implementación:
Google Script Muestra
Google Apps Script implementación para Google Workspace integración:
Casos de uso y aplicaciones en la industria
- Legal & Professional Services
- Business & Enterprise
- Education & Research
- Finance & Banking
Casos de uso de servicios legales y profesionales
- Clasificación de documentosClasificar documentos legales por tipo de caso, cliente o área de práctica.
- Seguimiento del cumplimiento: Supervisar las fechas de creación de documentos y el historial de revisiones para el cumplimiento normativo.
- Gestión de documentos del cliente: Seguimiento de las propiedades de los documentos para la organización de archivos del cliente
- Mantenimiento del registro de auditoría: Registrar los metadatos del documento para cumplir con los requisitos de auditoría legal.
Casos de uso para empresas y negocios
- Gestión de propuestas: Extraer metadatos de las propuestas para el seguimiento y análisis de clientes.
- Organización de materiales de marketingClasificar los documentos de marketing por campaña y público objetivo.
- Análisis del rendimiento del contenidoAnalizar las estadísticas de los documentos para la optimización del contenido.
- Seguimiento de entregables para el cliente: Supervisar las propiedades de los documentos para la gestión de proyectos de clientes.
Casos de uso en educación e investigación
- Clasificación de documentos médicosClasificar los documentos médicos por paciente, procedimiento o departamento.
- Documentación de investigaciónExtraer metadatos de documentos de investigación para el seguimiento de estudios.
- Registros académicos y de pacientesOrganizar documentos académicos y de pacientes por propiedades de metadatos.
- Cumplimiento y ética: Supervisar los metadatos de los documentos para el cumplimiento normativo en el ámbito de la atención médica y la investigación.
Casos de uso en finanzas y banca
- Análisis del informe financieroExtraer metadatos de informes financieros para el seguimiento del cumplimiento normativo.
- Gestión de documentos presupuestariosClasificar los documentos presupuestarios por departamento y año fiscal.
- Documentación de auditoría: Seguimiento de las propiedades de los documentos para el mantenimiento del registro de auditoría
- Presentación de documentos regulatorios: Supervisar los metadatos de los documentos para los requisitos de presentación reglamentaria