Metadaten aus Word extrahieren – Dokumentenanalyse API
PDF4me Metadaten aus Word extrahieren ermöglicht es Ihnen, umfassende Metadaten und Eigenschaften aus Word-Dokumenten zu extrahieren und bietet detaillierte Dokumentanalysefunktionen. API Der Dienst verarbeitet Word-Dateien und ruft integrierte Dokumenteigenschaften, benutzerdefinierte Eigenschaften, Dokumentstatistiken, Autoreninformationen, Erstellungsdaten und Revisionsverfolgung ab. API empfängt Word-Dokumentinhalte über REST API Anrufe, die genutzt werden Base64 Sichere Datenübertragung durch Kodierung. Dank Unterstützung für kulturspezifische Formatierung und Lokalisierung eignet sich diese Lösung ideal für Dokumentenmanagement, Compliance-Überwachung, Inhaltsanalyse und unternehmensweite Dokumentenworkflows.
Authentifizierung Ihres API Anfrage
Um auf die PDF4me REST APIJede Anfrage muss die entsprechenden Authentifizierungsdaten enthalten. Die Authentifizierung gewährleistet eine sichere Kommunikation und bestätigt Ihre Identität als autorisierter Benutzer des Systems. REST APIDie
Hauptmerkmale
- Umfassende Metadatenextraktion: Alle integrierten und benutzerdefinierten Dokumenteigenschaften abrufen
- Dokumentenstatistik: Erhalten Sie in Echtzeit die Seitenzahl, Wortzahl, Zeichenzahl und Absatzzahl
- Informationen zum Autor: Autor, Manager, Firma und Kontaktdaten extrahieren
- Datums-/Zeiteigenschaften: Erstellungs-, Änderungs- und Druckzeitstempel abrufen
- Benutzerdefinierte Eigenschaften: Zugriff auf alle benutzerdefinierten Dokumenteigenschaften mit automatischer Präfixierung
- Kulturförderung: Datum und Uhrzeit gemäß dem angegebenen Gebietsschema formatieren
- Nur-Lese-Betrieb: Metadaten extrahieren, ohne das Originaldokument zu verändern
- Strukturierte Ausgabe: Organisierte Metadaten zurückgeben in JSON Format für einfache Verarbeitung
REST API Endpunkt
Der PDF4me REST API verwendet Standard HTTP Methoden zur Interaktion mit Ressourcen. Alle Metadatenextraktionsoperationen werden über einen einzigen Endpunkt durchgeführt:
- Verfahren: POST
- Endpunkt:
office/ApiV2Word/ExtractMetadata
REST API Parameter
Vollständige Liste der Parameter für „Metadaten aus Word extrahieren“ REST APIDie Parameter sind zur besseren Verständlichkeit und Implementierung nach Kategorien geordnet.
Wichtig: Mit einem Sternchen (*) gekennzeichnete Parameter sind erforderlich und müssen angegeben werden. API um ordnungsgemäß zu funktionieren.
Erforderliche Parameter
| Parameter | Typ | Beschreibung | Beispiel |
|---|---|---|---|
| dokumentieren* | Object | Dokumentenreferenz. Muss enthalten Name (Zeichenkette): Name der Word-Datei mit der Dateiendung .docx | { "Name": "document.docx" } |
| docContent* | Base64 | Word-Dokumentinhalt kodiert in Base64 | UEsDBBQABgAIAAAA... |
Optionale Parameter
| Parameter | Typ | Beschreibung | Beispiel |
|---|---|---|---|
| Kulturname | String | Kulturcode für die Datums-/Zeitformatierung (z. B. „en-US“, „de-DE“, „fr-FR“). Standard: InvariantCulture (einheitliche Formatierung). Beeinflusst das Datums-/Zeitformat in den Metadaten. Ungültige Kulturen verwenden InvariantCulture. | en-US |
Ausgabe
Der PDF4me Metadaten aus Word extrahieren REST API Die Antwort hängt vom Verarbeitungsmodus ab. API gibt die Metadaten als ein JSON Objekt, nicht als Binärdaten.
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
Synchrone Verarbeitung (Standard)
Der API verarbeitet die Anfrage und gibt Folgendes zurück:
Statuscode: 200 OK
Inhaltstyp: application/json
Antworttext:
{
"document": null,
"fileName": null,
"success": true,
"errorMessage": null,
"metadata": {
"Author": "John Doe",
"Title": "Project Proposal",
"Subject": "Q1 2024 Planning",
"Keywords": "planning, budget, strategy",
"Comments": "Draft version for review",
"Category": "Business",
"Company": "Acme Corporation",
"Manager": "Jane Smith",
"Created": "1/15/2024 10:30:00 AM",
"LastModified": "1/20/2024 2:45:00 PM",
"LastPrinted": "1/18/2024 9:15:00 AM",
"RevisionNumber": 3,
"TotalEditingTime": 120,
"Pages": 8,
"Words": 2150,
"Characters": 12800,
"Paragraphs": 45,
"Custom_Department": "Marketing",
"Custom_ProjectCode": "PRJ-2024-001",
"Custom_Confidential": "Internal"
}
}
Antwortfelder:
- dokumentieren (Base64 oder null): Wird nicht für die Metadatenextraktion verwendet; kann null sein
- Dateiname (Zeichenkette oder null): Wird nicht für die Metadatenextraktion verwendet; kann null sein.
- Erfolg (Boolescher Wert): Gibt an, ob die Anfrage erfolgreich war.
- Fehlermeldung (Zeichenkette oder null): Fehlerdetails, wenn Erfolg nicht gegeben ist
- Metadaten (Objekt): Umfassendes Metadatenwörterbuch, das alle Dokumenteigenschaften enthält
Anwendungshinweise:
- Extrahieren Sie die
metadataFeld vom JSON Antwort - Bei Bedarf auf einzelne Objekte zugreifen.
- Metadaten für die Dokumentenklassifizierung, die Nachverfolgung von Compliance-Vorgaben oder die Analyse verwenden
Beispiel (JavaScript):
const response = await fetch(url, options);
const data = await response.json();
const author = data.metadata.Author;
const pageCount = data.metadata.Pages;
// Access any metadata property
Asynchrone Verarbeitung
Asynchrones Verhalten (202 Accepted (mit Polling) wird durch die Serverkonfiguration gesteuert, nicht durch einen Parameter im Anfragetext. Wenn aktiviert, API kann bei einer Abfrage den Statuscode 202 zurückgeben. URL im Location Überschrift. Fragen Sie die URL mit GET Stellen Sie so lange Anfragen, bis Sie 200 erhalten. OK mit der gleichen Antwortform (einschließlich metadata, success, errorMessage).
Fehlermeldungen
Der API Standard-Rückgabe HTTP Fehlercodes mit Fehlerdetails:
- Ungültige Anfrageparameter
- Fehlende Pflichtfelder (
dokumentierenmitName,docContent) - Ungültig Base64 Kodierung in
docContent - Ungültiges oder beschädigtes Word-Dokument
- Ungültig oder fehlend API Schlüssel
- API Schlüssel nicht richtig Base64 kodiert in Authorization Überschrift
- Fehlen
Autorisierung: BasisÜberschrift
- Serverseitiger Verarbeitungsfehler
- Fehler bei der Verarbeitung des Word-Dokuments
- Fehler beim Extrahieren der Metadaten
Fehlerantwortformat:
{
"error": "Error message describing what went wrong"
}
Details zum Antwortformat
Wichtig: Der API kehrt immer zurück JSON mit Metadatenobjekt.
Antwortstruktur:
{
"document": "Base64 or null",
"fileName": "string or null",
"success": true,
"errorMessage": "string or null",
"metadata": {
// Built-in properties
"Author": "string",
"Title": "string",
"Subject": "string",
"Keywords": "string",
"Comments": "string",
"Category": "string",
"Company": "string",
"Manager": "string",
"Created": "string (formatted date/time)",
"LastModified": "string (formatted date/time)",
"LastPrinted": "string (formatted date/time)",
"RevisionNumber": "integer",
"TotalEditingTime": "integer (minutes)",
// Document statistics
"Pages": "integer",
"Words": "integer",
"Characters": "integer",
"Paragraphs": "integer",
// Custom properties (prefixed with Custom_)
"Custom_PropertyName": "value"
}
}
Content-Type-Header:
- Erfolg:
application/json - Die Metadaten werden als strukturierte Datei zurückgegeben. JSON Objekt
Zugriff auf Metadaten:
JavaScript/Node.js:
const metadata = response.metadata;
console.log(`Author: ${metadata.Author}`);
console.log(`Pages: ${metadata.Pages}`);
console.log(`Words: ${metadata.Words}`);
Python:
metadata = response['metadata']
print(f"Author: {metadata['Author']}")
print(f"Pages: {metadata['Pages']}")
print(f"Words: {metadata['Words']}")
C#:
var metadata = response.Metadata;
Console.WriteLine($"Author: {metadata["Author"]}");
Console.WriteLine($"Pages: {metadata["Pages"]}");
Console.WriteLine($"Words: {metadata["Words"]}");
Metadateneigenschaften
Integrierte Dokumenteigenschaften
| Name der Immobilie | Typ | Beschreibung | Beispiel |
|---|---|---|---|
| Autor | String | Name des Dokumentautors | "John Doe" |
| Titel | String | Dokumenttitel | "Project Proposal" |
| Thema | String | Dokumentgegenstand | "Q1 2024 Planning" |
| Schlüsselwörter | String | Dokument-Schlüsselwörter (durch Komma getrennt) | "planning, budget, strategy" |
| Kommentare | String | Dokumentkommentare | "Draft version for review" |
| Kategorie | String | Dokumentkategorie | "Business" |
| Unternehmen | String | Name der Firma | "Acme Corporation" |
| Manager | String | Name des Managers | "Jane Smith" |
| Erstellt | String | Erstellungsdatum/-zeit des Dokuments (formatiert) | "1/15/2024 10:30:00 AM" |
| Letzte Änderung | String | Datum/Uhrzeit der letzten Speicherung (formatiert) | "1/20/2024 2:45:00 PM" |
| Letzte Ausgabe | String | Datum/Uhrzeit des letzten Ausdrucks (formatiert) | "1/18/2024 9:15:00 AM" |
| Revisionsnummer | Integer | Dokumentrevisionsnummer | 3 |
| Gesamtbearbeitungszeit | Integer | Gesamtbearbeitungszeit in Minuten | 120 |
Dokumentenstatistik
| Name der Immobilie | Typ | Beschreibung | Beispiel |
|---|---|---|---|
| Seiten | Integer | Gesamtzahl der Seiten | 8 |
| Wörter | Integer | Gesamtzahl der Wörter | 2150 |
| Charaktere | Integer | Gesamtzahl der Zeichen | 12800 |
| Absätze | Integer | Gesamtzahl der Absätze | 45 |
Benutzerdefinierte Eigenschaften
Benutzerdefinierte Eigenschaften werden mit einem Präfix versehen Custom_ in der Antwort:
Custom_Department- Eigentum der ZollabteilungCustom_ProjectCode- Benutzerdefinierte Projektcode-EigenschaftCustom_Confidential- Benutzerdefinierte Vertraulichkeitsstufe- Alle anderen im Word-Dokument definierten benutzerdefinierten Eigenschaften
Beispiele für unterstützte Kultur
| Kulturkodex | Beschreibung | Beispiel für ein Datumsformat |
|---|---|---|
en-US | Englisch (Vereinigte Staaten) | "15.01.2024 10:30:00 Uhr" |
en-GB | Englisch (Vereinigtes Königreich) | "15.01.2024 10:30:00" |
de-DE | Deutsch (Deutschland) | "15.01.2024 10:30:00" |
fr-FR | Französisch (Frankreich) | "15.01.2024 10:30:00" |
es-ES | Spanisch (Spanien) | "15.01.2024 10:30:00" |
ja-JP | Japanisch (Japan) | "2024/01/15 10:30:00" |
Beispielanfrage
Kopfzeile
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
Notiz:
- Hol dir deins API Schlüssel vom PDF4me Armaturenbrett
- Der API Der Schlüssel muss sein Base64 kodiert und mit "Basic" präfixiert in der Authorization Überschrift
- Beispiel: Wenn Ihr API Schlüssel ist
abc123, kodieren Sie es zu Base64 und verwendenAuthorization: Basic YWJjMTIz
Nutzlast
Einfaches Beispiel (nur Pflichtfelder):
{
"document": { "Name": "document.docx" },
"docContent": "UEsDBBQABgAIAAAAIQDfpNJsWgEAACAFAAATAAgCW0NvbnRlbnRfVHlwZXNdLnhtbCCiBAIooAAC..."
}
Erweitertes Beispiel (mit optionalen Feldern):
{
"document": { "Name": "document.docx" },
"docContent": "UEsDBBQABgAIAAAAIQDfpNJsWgEAACAFAAATAAgCW0NvbnRlbnRfVHlwZXNdLnhtbCCiBAIooAAC...",
"cultureName": "en-US"
}
Codebeispiele
Der PDF4me Metadaten aus Word extrahieren REST API Es werden Codebeispiele in verschiedenen Programmiersprachen bereitgestellt. Wählen Sie die Sprache, die am besten zu Ihrer Entwicklungsumgebung passt:
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
C# (CSharp) Beispiel
Vollständig C# Implementierung zum Extrahieren von Metadaten aus Word:
Java Probe
Java Implementierung mit vollständiger Fehlerbehandlung und Antwortverarbeitung:
Python Probe
Python Implementierung mit der Requests-Bibliothek und JSON Handhabung:
Google Script Probe
Google Apps Script Implementierung für Google Workspace Integration:
Branchenspezifische Anwendungsfälle und Anwendungen
- Legal & Professional Services
- Business & Enterprise
- Education & Research
- Finance & Banking
Anwendungsfälle für Rechts- und Beratungsdienstleistungen
- Dokumentenklassifizierung: Klassifizierung von Rechtsdokumenten nach Fallart, Mandant oder Rechtsgebiet
- Compliance-Überwachung: Überwachung der Erstellungsdaten und des Revisionsverlaufs von Dokumenten im Hinblick auf die Einhaltung gesetzlicher Vorschriften
- Kundendokumentenverwaltung: Dokumenteigenschaften für die Clientdateiorganisation verfolgen
- Audit-Trail-Pflege: Protokolldokument-Metadaten für rechtliche Prüfungsanforderungen
Anwendungsfälle für Unternehmen und Organisationen
- Angebotsmanagement: Metadaten aus Angeboten für die Kundenverfolgung und -analyse extrahieren
- Organisation von Marketingmaterialien: Marketingdokumente nach Kampagne und Zielgruppe klassifizieren
- Inhaltsleistungsanalyse: Dokumentstatistiken zur Inhaltsoptimierung analysieren
- Nachverfolgung der Kundenergebnisse: Überwachung der Dokumenteigenschaften für das Kundenprojektmanagement
Anwendungsfälle in Bildung und Forschung
- Klassifizierung medizinischer DokumenteMedizinische Dokumente nach Patient, Eingriff oder Abteilung klassifizieren.
- Forschungsdokumentation: Metadaten aus Forschungsdokumenten zur Studienverfolgung extrahieren
- Akademische und Patientenakten: Organisation von akademischen und Patientendokumenten anhand von Metadateneigenschaften
- Compliance und Ethik: Überwachung von Dokumentenmetadaten zur Einhaltung regulatorischer Vorgaben im Gesundheitswesen und in der Forschung
Anwendungsfälle im Finanz- und Bankwesen
- Analyse von Finanzberichten: Metadaten aus Finanzberichten zur Nachverfolgung der Einhaltung von Vorschriften extrahieren
- Budgetdokumentenverwaltung: Budgetdokumente nach Abteilung und Geschäftsjahr klassifizieren
- Prüfdokumentation: Dokumenteigenschaften zur Aufrechterhaltung des Prüfprotokolls verfolgen
- Meldung an die Aufsichtsbehörden: Überwachung der Dokumentenmetadaten hinsichtlich der Anforderungen an die behördliche Einreichung