Aller au contenu principal

Extraction de métadonnées à partir de documents Word - Analyse de documents API

PDF4me Extraire les métadonnées de Word permet d'extraire des métadonnées et des propriétés complètes des documents Word grâce à des capacités d'analyse documentaire détaillées. API Ce service traite les fichiers Word et récupère les propriétés intégrées du document, les propriétés personnalisées, les statistiques du document, les informations sur l'auteur, les dates de création et le suivi des révisions. API reçoit le contenu des documents Word via REST API appels, utilisant Base64 Encodage pour une transmission sécurisée. Grâce à la prise en charge de la mise en forme et de la localisation spécifiques à chaque culture, cette solution est idéale pour la gestion documentaire, le suivi de la conformité, l'analyse de contenu et les flux de travail documentaires en entreprise.

Articles de blog connexes
Il n'y a pas encore d'article de blog consacré à cette fonctionnalité — à venir prochainement.
En attendant, n'hésitez pas à consulter le blog de PDF4me pour découvrir des tutoriels et des procédures de travail adaptés à toutes les plateformes.
Consultez le blog

Authentification de votre API Demande

Pour accéder au PDF4me REST APIChaque requête doit inclure des informations d'authentification valides. L'authentification garantit la sécurité des communications et confirme votre identité en tant qu'utilisateur autorisé. REST API.

Caractéristiques principales

  • Extraction complète des métadonnéesRécupérer toutes les propriétés intégrées et personnalisées des documents
  • Statistiques des documentsObtenez en temps réel le nombre de pages, de mots, de caractères et de paragraphes.
  • Informations sur l'auteur: Extraire les coordonnées de l'auteur, du responsable, de l'entreprise et des informations de contact
  • Propriétés de date/heureRécupérer les horodatages de création, de modification et d'impression
  • Propriétés personnaliséesAccédez à toutes les propriétés personnalisées des documents avec préfixage automatique.
  • Soutien culturelFormatez les dates et les heures selon les paramètres régionaux spécifiés.
  • Fonctionnement en lecture seuleExtraire les métadonnées sans modifier le document original
  • Sortie structurée: Retourner les métadonnées organisées dans JSON format pour un traitement facile

REST API Point de terminaison

Le PDF4me REST API utilise la norme HTTP méthodes d'interaction avec les ressources. Toutes les opérations d'extraction de métadonnées sont effectuées via un point de terminaison unique :

  • Méthode: POST
  • Point final : office/ApiV2Word/ExtractMetadata

REST API Paramètres

Liste complète des paramètres pour l'extraction des métadonnées de Word REST APILes paramètres sont organisés par catégorie pour une meilleure compréhension et une mise en œuvre plus aisée.

Important: Les paramètres marqués d'un astérisque (*) sont obligatoires et doivent être fournis pour le API pour fonctionner correctement.

Paramètres requis

ParamètreTaperDescriptionExemple
document*ObjectRéférence du document. Doit contenir Nom (chaîne de caractères) : Nom du fichier Word avec l'extension .docx{ "Name": "document.docx" }
docContent*Base64Contenu du document Word encodé en Base64UEsDBBQABgAIAAAA...

Paramètres optionnels

ParamètreTaperDescriptionExemple
nom de la cultureStringCode de culture pour le formatage de la date et de l'heure (par exemple, « en-US », « de-DE », « fr-FR »). Par défaut : InvariantCulture (formatage uniforme). Affecte le format d'affichage de la date et de l'heure dans les métadonnées. En cas de culture invalide, InvariantCulture est utilisé par défaut.en-US

Sortir

Le PDF4me Extraire les métadonnées de Word REST API renvoie des réponses différentes selon le mode de traitement. API renvoie les métadonnées sous forme de JSON objet, et non sous forme de données binaires.

Traitement synchrone (par défaut)

Le API traite la requête et renvoie :

Code d'état : 200 OK

Type de contenu : application/json

Corps de la réponse :

{
"document": null,
"fileName": null,
"success": true,
"errorMessage": null,
"metadata": {
"Author": "John Doe",
"Title": "Project Proposal",
"Subject": "Q1 2024 Planning",
"Keywords": "planning, budget, strategy",
"Comments": "Draft version for review",
"Category": "Business",
"Company": "Acme Corporation",
"Manager": "Jane Smith",
"Created": "1/15/2024 10:30:00 AM",
"LastModified": "1/20/2024 2:45:00 PM",
"LastPrinted": "1/18/2024 9:15:00 AM",
"RevisionNumber": 3,
"TotalEditingTime": 120,
"Pages": 8,
"Words": 2150,
"Characters": 12800,
"Paragraphs": 45,
"Custom_Department": "Marketing",
"Custom_ProjectCode": "PRJ-2024-001",
"Custom_Confidential": "Internal"
}
}

Champs de réponse :

  • document (Base64 ou null) : Non utilisé pour l’extraction de métadonnées ; peut être nul
  • nom de fichier (chaîne de caractères ou valeur nulle) : non utilisé pour l’extraction de métadonnées ; peut être nul
  • succès (booléen) : Indique si la requête a abouti.
  • message d'erreur (chaîne de caractères ou null) : Détails de l’erreur en cas d’échec
  • métadonnées (objet) : Dictionnaire de métadonnées complet contenant toutes les propriétés du document

Mode d'emploi :

  1. Extraire le metadata champ du JSON réponse
  2. Accéder aux propriétés individuelles selon les besoins
  3. Utilisez les métadonnées pour la classification des documents, le suivi de la conformité ou l'analyse.

Exemple (JavaScript) :

const response = await fetch(url, options);
const data = await response.json();
const author = data.metadata.Author;
const pageCount = data.metadata.Pages;
// Access any metadata property

Propriétés des métadonnées

Propriétés intégrées du document

Nom de la propriétéTaperDescriptionExemple
AuteurStringNom de l'auteur du document"John Doe"
TitreStringTitre du document"Project Proposal"
SujetStringSujet du document"Q1 2024 Planning"
Mots clésStringMots clés du document (séparés par des virgules)"planning, budget, strategy"
CommentairesStringCommentaires sur le document"Draft version for review"
CatégorieStringCatégorie de documents"Business"
EntrepriseStringNom de l'entreprise"Acme Corporation"
DirecteurStringNom du responsable"Jane Smith"
CrééStringDate et heure de création du document (formatées)"1/15/2024 10:30:00 AM"
Dernière modificationStringDernière date/heure d'enregistrement (formatée)"1/20/2024 2:45:00 PM"
Dernière impressionStringDernière date/heure d'impression (formatée)"1/18/2024 9:15:00 AM"
Numéro de révisionIntegerNuméro de révision du document3
Temps total de montageIntegerTemps total de montage en minutes120

Statistiques des documents

Nom de la propriétéTaperDescriptionExemple
PagesIntegerNombre total de pages8
MotsIntegerNombre total de mots2150
PersonnagesIntegerNombre total de caractères12800
ParagraphesIntegerNombre total de paragraphes45

Propriétés personnalisées

Les propriétés personnalisées sont préfixées par Custom_ dans la réponse :

  • Custom_Department - Propriété du département des douanes
  • Custom_ProjectCode - Propriété du code de projet personnalisé
  • Custom_Confidential - Niveau de confidentialité personnalisé
  • Toutes autres propriétés personnalisées définies dans le document Word

Exemples de culture soutenue

Code culturelDescriptionExemple de format de date
en-USAnglais (États-Unis)"15/01/2024 10:30:00"
en-GBAnglais (Royaume-Uni)"15/01/2024 10:30:00"
de-DEAllemand (Allemagne)"15.01.2024 10:30:00"
fr-FRFrançais (France)"15/01/2024 10:30:00"
es-ESEspagnol (Espagne)"15/01/2024 10:30:00"
ja-JPJaponais (Japon)"2024/01/15 10:30:00"

Exemple de requête

En-tête

Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY

Note:

  • Obtenez votre API clé de la PDF4me Tableau de bord
  • Le API La clé doit être Base64 encodé et préfixé par « Basic » dans le Authorization en-tête
  • Exemple : Si votre API La clé est abc123, encodez-le en Base64 et utiliser Authorization: Basic YWJjMTIz

Charge utile

Exemple simple (champs obligatoires uniquement) :

{
"document": { "Name": "document.docx" },
"docContent": "UEsDBBQABgAIAAAAIQDfpNJsWgEAACAFAAATAAgCW0NvbnRlbnRfVHlwZXNdLnhtbCCiBAIooAAC..."
}

Exemple avancé (avec champs facultatifs) :

{
"document": { "Name": "document.docx" },
"docContent": "UEsDBBQABgAIAAAAIQDfpNJsWgEAACAFAAATAAgCW0NvbnRlbnRfVHlwZXNdLnhtbCCiBAIooAAC...",
"cultureName": "en-US"
}

Exemples de code

Le PDF4me Extraire les métadonnées de Word REST API propose des exemples de code dans plusieurs langages de programmation. Choisissez le langage qui convient le mieux à votre environnement de développement :

C# Exemple (CSharp)

Complet C# implémentation pour l'extraction de métadonnées à partir de Word :

Cas d'utilisation et applications industrielles

Cas d'utilisation des services juridiques et professionnels

  • Classification des documentsClasser les documents juridiques par type d'affaire, client ou domaine de pratique.
  • Suivi de la conformitéSurveiller les dates de création des documents et l'historique des révisions pour assurer la conformité réglementaire.
  • Gestion des documents clients: Suivi des propriétés des documents pour l'organisation des dossiers clients
  • Maintenance des pistes d'audit: Consigner les métadonnées des documents pour les exigences d'audit légal

Obtenez de l'aide