跳到主要内容

使用以下方法从 Word 文档中提取元数据 n8n 行动

PDF4me 从 Word 文档中提取元数据 能够从 Word 文档中提取全面的元数据和属性 n8n 具备详细文档分析功能的自动化工作流程。这项强大的元数据提取功能支持内置文档属性、自定义属性、文档统计信息、作者信息、创建日期和版本跟踪,并支持特定文化的格式设置和本地化,非常适合文档管理、合规性跟踪和内容分析工作流程。

相关博客文章
目前尚无关于此功能的博客文章——敬请期待。
在此期间,您可以浏览 PDF4me 博客,查看适用于各平台的教程和工作流程。
访问博客

设置

添加 PDF4me 将“从 Word 文档中提取元数据”节点添加到您的 n8n 工作流程并配置所需参数。有关初始设置说明,请参阅我们的 n8n 集成指南

先决条件:

  • PDF4me API 证书
  • n8n 工作流访问

配置:

  1. 添加 PDF4me 节点到工作流
  2. 选择“从 Word 文档中提取元数据”操作
  3. 配置输入参数(见下文)
从 Word 文档中提取元数据

参数

以下是“从 Word 文档中提取元数据”操作的完整参数列表。配置这些参数可控制元数据提取行为。

重要的: 标有星号 (***) 的参数为必填项。高级参数可对元数据格式进行更精细的控制。

范围类型描述例子
输入数据类型***StringWord文档输入格式选择
• 选择 Word 文档数据输入格式
PDF4me 支持多种输入类型
• 选项:二进制数据, Base64 字符串,或 URL
Binary Data
输入二进制字段***二进制二进制字文件输入 (二进制数据必填)
• 参考先前文档中的 Word 文件(.docx、.doc)。 n8n 节点或文件上传
PDF4me 处理具有自动格式检测功能的二进制 Word 文件
• 当输入数据类型为“二进制数据”时为必填项
{{ $binary.data }}
Base64 文字内容***StringBase64 编码词输入 (如果是 Base64 字符串则为必填项)
• 提供以 base64 编码字符串形式保存的 Word 文档内容(.docx、.doc),以确保安全传输。
PDF4me 自动解码和处理 Word 内容
• 当输入数据类型为“Base64 字符串”时为必填项
UEsDBBQABgAI...
Word文档URL***String公开文档 URL 输入 (如果是 URL,则为必填项)
• 提供公开/开放权限 URL 到待处理的 Word 文件(.docx、.doc)
PDF4me 从提供的源下载并处理 Word 文件。 URL
• 当输入数据类型为“URL”时为必填项
https://abc.com/document.docx
Word 文档名称***StringWord文档输入文件名
• 请指定输入 Word 文件的名称,并带有正确的扩展名(.docx、.doc)。
PDF4me 此功能用于格式检测和处理优化
document.docx
文化名称String文件文化/本地化
• 日期/时间格式的区域代码(例如,“en-US”、“de-DE”、“fr-FR”)
• 默认值:InvariantCulture(统一格式)
• 影响元数据中的日期/时间显示格式
en-US

输出

输出参数

范围类型描述例子
文件名String原始 Word 文档文件名 - 输入的 Word 文档文件名myWordFile.docx
成功BooleanPDF4me 运行状态 - Boolean 指示元数据提取操作成功或失败的标志。 PDF4me 返回 true 为了成功运营和 false 任何错误true
文化名称String文化/地方规范 - 用于日期/时间格式的区域代码(例如,“en-US”、“de-DE”、“fr-FR”)en-US
元数据Object嵌套元数据对象 - 包含文档元数据结构,其中嵌套的元数据对象包含所有文档属性,包括作者、标题、主题、关键词、评论、类别、公司、管理员、创建日期、最后修改日期、最后打印日期、修订号、总编辑时间、页数、字数、字符数、段落数。{"metadata": {"Author": "Ynoox Testtwo", "Company": "HP Inc.", "Words": 921}}
信息String操作消息 - 指示元数据提取操作结果的描述性消息Word metadata extracted successfully

N8N 行动反应

PDF4me 从 Word 文档中提取元数据 API 返回的结果可以以多种格式查看。请选择最符合您需求的视图:

JSON 回复格式

原始 JSON 来自 API

[
{
"fileName": "myWordFile.docx",
"success": true,
"cultureName": "en-US",
"metadata": {
"document": null,
"fileName": null,
"success": true,
"errorMessage": null,
"metadata": {
"Author": "Ynoox Testtwo",
"Title": "",
"Subject": "",
"Keywords": "",
"Comments": "",
"Category": "",
"Company": "HP Inc.",
"Manager": "",
"Created": "5/16/2019 6:04:00 AM",
"LastModified": "8/7/2024 7:04:00 AM",
"LastPrinted": "5/16/2019 6:04:00 AM",
"RevisionNumber": 5,
"TotalEditingTime": 2,
"Pages": 3,
"Words": 921,
"Characters": 5256,
"Paragraphs": 12
}
},
"message": "Word metadata extracted successfully"
}
]

用例

企业文档自动化

  • 文档管理提取元数据以进行文档组织和编目
  • 合规性跟踪:跟踪文档属性以确保符合监管要求
  • 内容分析分析文档统计信息和属性
  • 文档搜索使用元数据进行文档搜索和检索

人工智能驱动的文档处理

  • 多格式支持处理 .docx 和 .doc 格式的 Word 文档
  • 多语言处理支持不同语言和地区
  • 智能元数据提取自动提取所有文档属性

商业智能与分析

  • 文档分析分析文档属性和统计数据
  • 合规性监控确保文档符合元数据要求
  • 绩效指标跟踪处理准确性和效率

获取帮助