Zum Hauptinhalt springen

Metadaten aus Word extrahieren Make

Metadaten extrahieren ist ein Make Modul von PDF4me Das Programm liest die integrierten und benutzerdefinierten Eigenschaften eines Word-Dokuments – Titel, Autor, Betreff, Schlüsselwörter, Erstellungsdatum, Änderungsdatum – und gibt sie strukturiert zurück. JSONNutzen Sie es für die Dokumentenkatalogisierung, die Erstellung von Compliance-Audit-Trails oder zum Befüllen eines Content-Management-Systems, ohne jede Datei manuell öffnen zu müssen.

Was dieses Modul bewirkt

PDF4me Metadaten aus Word extrahieren Liest integrierte Eigenschaften (Titel, Autor, Betreff, Stichwörter, Firma, Erstellungsdatum, Änderungsdatum, Seitenzahl, Wortzahl) und alle benutzerdefinierten Dokumenteigenschaften aus einer Word-Datei und gibt sie als strukturierte Datei zurück. JSON Objekt innerhalb Ihres Make Szenario.

Verwandte Blog-Beiträge
Zu dieser Funktion gibt es noch keinen Blogbeitrag – folgt in Kürze.
Schauen Sie sich in der Zwischenzeit im PDF4me-Blog Tutorials und Arbeitsabläufe für alle Plattformen an.
Besuchen Sie den Blog

Wie authentifiziere ich mein Konto? Make Szenario?

Jeder PDF4me Modul in Make erfordert eine gültige VerbindungErstellen oder wählen Sie einen Eintrag aus, der Ihre Daten enthält. PDF4me API Der Schlüssel dient dazu, dass das Szenario Metadatenextraktionsanfragen sicher authentifizieren kann.

Wichtige Fakten, die Sie nicht verpassen sollten

Sowohl integrierte als auch benutzerdefinierte Eigenschaften enthalten
Standardfelder wie Titel, Autor und Betreff werden zusammen mit allen benutzerdefinierten Dokumenteigenschaften, die Ihre Organisation hinzugefügt hat, zurückgegeben – alles in einem JSON Antwort.
Funktioniert mit .doc- und .docx-Dateien.
Der Dateiname muss die korrekte Dateiendung haben, damit das Modul die Eigenschaften entweder aus dem älteren .doc-Format oder aus dem modernen .docx-Format korrekt lesen kann.
Leere Eigenschaften werden als leer zurückgegeben, nicht als Fehler.
Eine Dokumenteigenschaft, die nie ausgefüllt wurde (wie beispielsweise ein ungenutztes Firmenfeld), wird als leere Zeichenkette zurückgegeben, anstatt dass das Modul fehlschlägt.
Erstellen Sie das PDF4me-Modul „Metadaten aus Word-Dokumenten extrahieren“

Ordnen Sie Dateinamen und Dokument zu und führen Sie dann das Szenario aus, um integrierte und benutzerdefinierte Word-Dokumenteigenschaften zu erhalten. JSONDie

Parameter

Erforderlich: Verbindung, Dateiname und Dokument müssen angegeben werden.

ParameterErforderlichWas es tutBeispiel
ConnectionRequiredPDF4me API connection. Click Add and paste your API key if connecting for the first time.My PDF4me connection
File NameRequiredFilename of the Word document with proper extension (.doc or .docx), used for processing identification.document.docx
DocumentRequiredWord file buffer mapped from a preceding module such as Dropbox, Google Drive, or SharePoint.[Buffer from Get File]

Ausgabefelder

FeldTypWas es enthält
MetadataObjectContainer object with all extracted document properties, both built-in and custom.
TitleStringThe document title property.
AuthorStringThe document author property.
SubjectStringThe document subject property.
KeywordsStringThe document keywords/tags property.
CreatedDateStringThe document creation timestamp.
ModifiedDateStringThe document last-modified timestamp.
PageCountNumberTotal number of pages in the document.
WordCountNumberTotal word count in the document.
SuccessBooleanTrue if metadata extraction completed successfully; false if it failed.

Wie richte ich das Extrahieren von Metadaten ein? Make?

  1. Hinzufügen PDF4meMetadaten extrahieren zu Ihrem Make Szenario.
  2. Wählen Verbindung (oder klicken Sie hier) Hinzufügen um einen mit Ihrem PDF4me API Schlüssel).
  3. Karte Dateiname zum Dateinamen mit der Erweiterung (.doc oder .docx).
  4. Karte Dokumentieren zum Binärinhalt aus dem Quellmodul: Dropbox, Google Drive oder SharePointDie
  5. Führe das Szenario aus. Metadata Das Objekt erscheint in der Ausgabe und kann nun einem Katalog, einem Compliance-Protokoll oder einem CMS zugeordnet werden.

Typische Konfigurationen

Workflow-BeispieleCommon Make scenario patterns using Extract Metadata.
Katalogisierung von Dokumentenbibliotheken
  1. Ein Dropbox-Überwachungsordner-Trigger wird ausgelöst, wenn ein neues Word-Dokument in die Bibliothek hochgeladen wird.
  2. Die Funktion „Metadaten extrahieren“ liest Titel, Autor, Schlüsselwörter und Datum aus der Datei.
  3. Ein Airtable-Schritt zum Erstellen eines Datensatzes indiziert das Dokument mit den extrahierten Eigenschaften zum Suchen und Filtern.
  4. Tags werden automatisch aus der Eigenschaft „Schlüsselwörter“ des Dokumentenkatalogs generiert.
Compliance-Prüfprotokoll
  1. Ein geplanter Auslöser listet alle kontrollierten Dokumente in einem Compliance-Ordner auf.
  2. Ein Iterator durchläuft jede Datei, Datei abrufen → Metadaten extrahieren.
  3. Ein Filter kennzeichnet Dokumente, deren ModifiedDate fällt außerhalb des erwarteten Überprüfungszeitraums.
  4. Markierte Dokumente und ihre Metadaten werden in einem Compliance-Prüfbericht protokolliert.
CMS Bevölkerung aus hochgeladenen Dokumenten
  1. Ein Dokument landet in einem Staging-Ordner, der mit folgendem verbunden ist MakeDie
  2. Die Funktion „Metadaten extrahieren“ liest Titel, Autor, Betreff und Schlüsselwörter.
  3. Ein HTTP Modul POSTs die extrahierten Eigenschaften zu CMS API einen neuen Inhaltsdatensatz erstellen.
  4. Das Originaldokument wird in einen Archivordner verschoben, sobald die CMS Der Datensatz wurde erfolgreich erstellt.

Praktische Tipps

File Name extension must match the real format
A .docx file mapped with a .doc extension (or vice versa) can cause the module to misread properties. Map the source filename directly rather than hardcoding an extension.
Empty properties are normal, not errors
Documents created without filling in Title, Subject, or Company return those fields as empty strings. Handle empty values in downstream Filters rather than assuming every field is populated.
CreatedDate reflects the file, not the content
CreatedDate and ModifiedDate come from the document's file-level properties, they can differ from dates mentioned inside the document body itself.
Custom properties depend on the template
Only documents built from templates with custom document properties will return them. A plain Word file created without a template typically has none.
This module reads properties, it does not edit them
Extract Metadata is read-only. To change a document's title or author property, use a Word editing module instead.
Pair with an Iterator for folder-wide audits
To audit an entire folder of documents, loop the module inside a Make Iterator rather than calling it once per manually selected file.

Spickzettel

FeldWert
ModuleExtract Metadata (Word)
ConnectionPDF4me API key
Supported extensions.doc, .docx
Key output fieldsMetadata.Title, Author, Subject, Keywords, CreatedDate, ModifiedDate
Empty property behaviorReturns empty string, not an error
Custom propertiesIncluded when present in the source template

Häufig gestellte Fragen

What document properties does Extract Metadata return?+
It returns built-in properties such as title, author, subject, keywords, company, creation date, modification date, page count, and word count, plus any custom document properties defined in the file template.
Does it work with both .doc and .docx files?+
Yes. Map the correct extension in File Name and the module reads properties from either the legacy .doc binary format or the modern .docx XML-based format.
Can I use this for compliance audit trails?+
Yes. Creation date, modification date, and author fields are commonly logged to a compliance database to evidence when a controlled document was created and last changed. See <a href="https://learn.microsoft.com/en-us/office/vba/api/word.document.builtindocumentproperties" target="_blank" rel="noopener noreferrer">Microsoft's Word document properties reference</a> for the full built-in property set this module reads from.
What happens if a property was never set in the document?+
Properties that were never filled in, such as an empty Subject or Company field, return as empty strings rather than causing an error, so downstream logic should handle blank values gracefully.

Branchenspezifische Anwendungsfälle und Anwendungen

  • Dokumenten-Audit-Trails: Änderungsdaten und Autoren für Nachweise aus Compliance-Audits extrahieren
  • Versionskontrollverfolgung: Dokumentversionen anhand von Erstellungs- und Änderungszeitstempeln überwachen
  • Autorenverifizierung: Überprüfen Sie, ob die Dokumentautoren mit den Listen des autorisierten Personals übereinstimmen.
  • Durchsetzung der Aufbewahrungsrichtlinie: Überprüfen Sie die Erstellungsdaten anhand der Aufbewahrungsfristen für Archivierungsentscheidungen.
  • Kontrolliertes Dokumentenmanagement: Dokumenteigenschaften für die Einhaltung von ISO-Normen/Qualitätsmanagement verfolgen

Verwandte Aktionen

Dieselbe Aufgabe auf anderen Plattformen

Hilfe erhalten