Extraction de métadonnées à partir de documents Word - Analyse de documents API
PDF4me Extraire les métadonnées de Word permet d'extraire des métadonnées et des propriétés complètes des documents Word grâce à des capacités d'analyse documentaire détaillées. API Ce service traite les fichiers Word et récupère les propriétés intégrées du document, les propriétés personnalisées, les statistiques du document, les informations sur l'auteur, les dates de création et le suivi des révisions. API reçoit le contenu des documents Word via REST API appels, utilisant Base64 Encodage pour une transmission sécurisée. Grâce à la prise en charge de la mise en forme et de la localisation spécifiques à chaque culture, cette solution est idéale pour la gestion documentaire, le suivi de la conformité, l'analyse de contenu et les flux de travail documentaires en entreprise.
Authentification de votre API Demande
Pour accéder au PDF4me REST APIChaque requête doit inclure des informations d'authentification valides. L'authentification garantit la sécurité des communications et confirme votre identité en tant qu'utilisateur autorisé. REST API.
Caractéristiques principales
- Extraction complète des métadonnéesRécupérer toutes les propriétés intégrées et personnalisées des documents
- Statistiques des documentsObtenez en temps réel le nombre de pages, de mots, de caractères et de paragraphes.
- Informations sur l'auteur: Extraire les coordonnées de l'auteur, du responsable, de l'entreprise et des informations de contact
- Propriétés de date/heureRécupérer les horodatages de création, de modification et d'impression
- Propriétés personnaliséesAccédez à toutes les propriétés personnalisées des documents avec préfixage automatique.
- Soutien culturelFormatez les dates et les heures selon les paramètres régionaux spécifiés.
- Fonctionnement en lecture seuleExtraire les métadonnées sans modifier le document original
- Sortie structurée: Retourner les métadonnées organisées dans JSON format pour un traitement facile
REST API Point de terminaison
Le PDF4me REST API utilise la norme HTTP méthodes d'interaction avec les ressources. Toutes les opérations d'extraction de métadonnées sont effectuées via un point de terminaison unique :
- Méthode: POST
- Point final :
office/ApiV2Word/ExtractMetadata
REST API Paramètres
Liste complète des paramètres pour l'extraction des métadonnées de Word REST APILes paramètres sont organisés par catégorie pour une meilleure compréhension et une mise en œuvre plus aisée.
Important: Les paramètres marqués d'un astérisque (*) sont obligatoires et doivent être fournis pour le API pour fonctionner correctement.
Paramètres requis
| Paramètre | Taper | Description | Exemple |
|---|---|---|---|
| document* | Object | Référence du document. Doit contenir Nom (chaîne de caractères) : Nom du fichier Word avec l'extension .docx | { "Name": "document.docx" } |
| docContent* | Base64 | Contenu du document Word encodé en Base64 | UEsDBBQABgAIAAAA... |
Paramètres optionnels
| Paramètre | Taper | Description | Exemple |
|---|---|---|---|
| nom de la culture | String | Code de culture pour le formatage de la date et de l'heure (par exemple, « en-US », « de-DE », « fr-FR »). Par défaut : InvariantCulture (formatage uniforme). Affecte le format d'affichage de la date et de l'heure dans les métadonnées. En cas de culture invalide, InvariantCulture est utilisé par défaut. | en-US |
Sortir
Le PDF4me Extraire les métadonnées de Word REST API renvoie des réponses différentes selon le mode de traitement. API renvoie les métadonnées sous forme de JSON objet, et non sous forme de données binaires.
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
Traitement synchrone (par défaut)
Le API traite la requête et renvoie :
Code d'état : 200 OK
Type de contenu : application/json
Corps de la réponse :
{
"document": null,
"fileName": null,
"success": true,
"errorMessage": null,
"metadata": {
"Author": "John Doe",
"Title": "Project Proposal",
"Subject": "Q1 2024 Planning",
"Keywords": "planning, budget, strategy",
"Comments": "Draft version for review",
"Category": "Business",
"Company": "Acme Corporation",
"Manager": "Jane Smith",
"Created": "1/15/2024 10:30:00 AM",
"LastModified": "1/20/2024 2:45:00 PM",
"LastPrinted": "1/18/2024 9:15:00 AM",
"RevisionNumber": 3,
"TotalEditingTime": 120,
"Pages": 8,
"Words": 2150,
"Characters": 12800,
"Paragraphs": 45,
"Custom_Department": "Marketing",
"Custom_ProjectCode": "PRJ-2024-001",
"Custom_Confidential": "Internal"
}
}
Champs de réponse :
- document (Base64 ou null) : Non utilisé pour l’extraction de métadonnées ; peut être nul
- nom de fichier (chaîne de caractères ou valeur nulle) : non utilisé pour l’extraction de métadonnées ; peut être nul
- succès (booléen) : Indique si la requête a abouti.
- message d'erreur (chaîne de caractères ou null) : Détails de l’erreur en cas d’échec
- métadonnées (objet) : Dictionnaire de métadonnées complet contenant toutes les propriétés du document
Mode d'emploi :
- Extraire le
metadatachamp du JSON réponse - Accéder aux propriétés individuelles selon les besoins
- Utilisez les métadonnées pour la classification des documents, le suivi de la conformité ou l'analyse.
Exemple (JavaScript) :
const response = await fetch(url, options);
const data = await response.json();
const author = data.metadata.Author;
const pageCount = data.metadata.Pages;
// Access any metadata property
Traitement asynchrone
Comportement asynchrone (202) Accepted (avec interrogation) est contrôlé par la configuration du serveur, et non par un paramètre du corps de la requête. Lorsqu'il est activé, le API peut renvoyer un statut 202 avec un sondage URL dans le Location En-tête. Interroger l'en-tête. URL avec GET demandes jusqu'à ce que vous en receviez 200 OK avec la même forme de réponse (y compris metadata, success, errorMessage).
Réponses d'erreur
Le API retours standard HTTP codes d'erreur avec détails de l'erreur :
- Paramètres de requête invalides
- Champs obligatoires manquants (
documentavecNom,docContent) - Invalide Base64 encodage dans
docContent - Document Word invalide ou corrompu
- Invalide ou manquant API clé
- API clé non correctement Base64 encodé dans Authorization en-tête
- Manquant
Autorisation : de baseen-tête
- Erreur de traitement côté serveur
- Échec du traitement du document Word
- Échec de l'extraction des métadonnées
Format de réponse en cas d'erreur :
{
"error": "Error message describing what went wrong"
}
Détails du format de réponse
Important: Le API toujours retourne JSON avec un objet de métadonnées.
Structure de la réponse :
{
"document": "Base64 or null",
"fileName": "string or null",
"success": true,
"errorMessage": "string or null",
"metadata": {
// Built-in properties
"Author": "string",
"Title": "string",
"Subject": "string",
"Keywords": "string",
"Comments": "string",
"Category": "string",
"Company": "string",
"Manager": "string",
"Created": "string (formatted date/time)",
"LastModified": "string (formatted date/time)",
"LastPrinted": "string (formatted date/time)",
"RevisionNumber": "integer",
"TotalEditingTime": "integer (minutes)",
// Document statistics
"Pages": "integer",
"Words": "integer",
"Characters": "integer",
"Paragraphs": "integer",
// Custom properties (prefixed with Custom_)
"Custom_PropertyName": "value"
}
}
En-tête Content-Type :
- Succès:
application/json - Les métadonnées sont renvoyées sous forme structurée JSON objet
Accès aux métadonnées :
JavaScript/Node.js:
const metadata = response.metadata;
console.log(`Author: ${metadata.Author}`);
console.log(`Pages: ${metadata.Pages}`);
console.log(`Words: ${metadata.Words}`);
Python:
metadata = response['metadata']
print(f"Author: {metadata['Author']}")
print(f"Pages: {metadata['Pages']}")
print(f"Words: {metadata['Words']}")
C#:
var metadata = response.Metadata;
Console.WriteLine($"Author: {metadata["Author"]}");
Console.WriteLine($"Pages: {metadata["Pages"]}");
Console.WriteLine($"Words: {metadata["Words"]}");
Propriétés des métadonnées
Propriétés intégrées du document
| Nom de la propriété | Taper | Description | Exemple |
|---|---|---|---|
| Auteur | String | Nom de l'auteur du document | "John Doe" |
| Titre | String | Titre du document | "Project Proposal" |
| Sujet | String | Sujet du document | "Q1 2024 Planning" |
| Mots clés | String | Mots clés du document (séparés par des virgules) | "planning, budget, strategy" |
| Commentaires | String | Commentaires sur le document | "Draft version for review" |
| Catégorie | String | Catégorie de documents | "Business" |
| Entreprise | String | Nom de l'entreprise | "Acme Corporation" |
| Directeur | String | Nom du responsable | "Jane Smith" |
| Créé | String | Date et heure de création du document (formatées) | "1/15/2024 10:30:00 AM" |
| Dernière modification | String | Dernière date/heure d'enregistrement (formatée) | "1/20/2024 2:45:00 PM" |
| Dernière impression | String | Dernière date/heure d'impression (formatée) | "1/18/2024 9:15:00 AM" |
| Numéro de révision | Integer | Numéro de révision du document | 3 |
| Temps total de montage | Integer | Temps total de montage en minutes | 120 |
Statistiques des documents
| Nom de la propriété | Taper | Description | Exemple |
|---|---|---|---|
| Pages | Integer | Nombre total de pages | 8 |
| Mots | Integer | Nombre total de mots | 2150 |
| Personnages | Integer | Nombre total de caractères | 12800 |
| Paragraphes | Integer | Nombre total de paragraphes | 45 |
Propriétés personnalisées
Les propriétés personnalisées sont préfixées par Custom_ dans la réponse :
Custom_Department- Propriété du département des douanesCustom_ProjectCode- Propriété du code de projet personnaliséCustom_Confidential- Niveau de confidentialité personnalisé- Toutes autres propriétés personnalisées définies dans le document Word
Exemples de culture soutenue
| Code culturel | Description | Exemple de format de date |
|---|---|---|
en-US | Anglais (États-Unis) | "15/01/2024 10:30:00" |
en-GB | Anglais (Royaume-Uni) | "15/01/2024 10:30:00" |
de-DE | Allemand (Allemagne) | "15.01.2024 10:30:00" |
fr-FR | Français (France) | "15/01/2024 10:30:00" |
es-ES | Espagnol (Espagne) | "15/01/2024 10:30:00" |
ja-JP | Japonais (Japon) | "2024/01/15 10:30:00" |
Exemple de requête
En-tête
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
Note:
- Obtenez votre API clé de la PDF4me Tableau de bord
- Le API La clé doit être Base64 encodé et préfixé par « Basic » dans le Authorization en-tête
- Exemple : Si votre API La clé est
abc123, encodez-le en Base64 et utiliserAuthorization: Basic YWJjMTIz
Charge utile
Exemple simple (champs obligatoires uniquement) :
{
"document": { "Name": "document.docx" },
"docContent": "UEsDBBQABgAIAAAAIQDfpNJsWgEAACAFAAATAAgCW0NvbnRlbnRfVHlwZXNdLnhtbCCiBAIooAAC..."
}
Exemple avancé (avec champs facultatifs) :
{
"document": { "Name": "document.docx" },
"docContent": "UEsDBBQABgAIAAAAIQDfpNJsWgEAACAFAAATAAgCW0NvbnRlbnRfVHlwZXNdLnhtbCCiBAIooAAC...",
"cultureName": "en-US"
}
Exemples de code
Le PDF4me Extraire les métadonnées de Word REST API propose des exemples de code dans plusieurs langages de programmation. Choisissez le langage qui convient le mieux à votre environnement de développement :
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
C# Exemple (CSharp)
Complet C# implémentation pour l'extraction de métadonnées à partir de Word :
Java Échantillon
Java implémentation avec gestion complète des erreurs et traitement des réponses :
JavaScript Échantillon
Node.js et compatible avec les navigateurs JavaScript mise en œuvre:
Python Échantillon
Python implémentation avec la bibliothèque requests et JSON manutention:
Google Script Échantillon
Google Apps Script mise en œuvre pour Google Workspace intégration :
Cas d'utilisation et applications industrielles
- Legal & Professional Services
- Business & Enterprise
- Education & Research
- Finance & Banking
Cas d'utilisation des services juridiques et professionnels
- Classification des documentsClasser les documents juridiques par type d'affaire, client ou domaine de pratique.
- Suivi de la conformitéSurveiller les dates de création des documents et l'historique des révisions pour assurer la conformité réglementaire.
- Gestion des documents clients: Suivi des propriétés des documents pour l'organisation des dossiers clients
- Maintenance des pistes d'audit: Consigner les métadonnées des documents pour les exigences d'audit légal
Cas d'utilisation en entreprise
- Gestion des propositionsExtraire les métadonnées des propositions à des fins de suivi et d'analyse des clients
- Organisation du matériel marketingClasser les documents marketing par campagne et public cible
- Analyse des performances du contenuAnalyser les statistiques des documents pour optimiser le contenu
- Suivi des livrables clients: Surveiller les propriétés des documents pour la gestion de projet client
Cas d'utilisation dans le domaine de l'éducation et de la recherche
- Classification des documents médicauxClasser les documents médicaux par patient, intervention ou service.
- Documentation de rechercheExtraire les métadonnées des documents de recherche pour le suivi des études
- Dossiers académiques et médicauxOrganiser les documents académiques et patients selon leurs propriétés de métadonnées
- Conformité et éthiqueSurveiller les métadonnées des documents pour assurer la conformité réglementaire dans le secteur de la santé et de la recherche
Cas d'utilisation dans le secteur financier et bancaire
- Analyse des rapports financiersExtraire les métadonnées des rapports financiers à des fins de suivi de la conformité
- Gestion des documents budgétairesClasser les documents budgétaires par département et par exercice financier.
- Documentation d'audit: Suivre les propriétés des documents pour la maintenance de la piste d'audit
- Dépôt réglementaireSurveiller les métadonnées des documents pour répondre aux exigences de soumission réglementaire