使用以下方法从 Word 文档中提取元数据 n8n 行动
PDF4me 从 Word 文档中提取元数据 能够从 Word 文档中提取全面的元数据和属性 n8n 具备详细文档分析功能的自动化工作流程。这项强大的元数据提取功能支持内置文档属性、自定义属性、文档统计信息、作者信息、创建日期和版本跟踪,并支持特定文化的格式设置和本地化,非常适合文档管理、合规性跟踪和内容分析工作流程。
相关博客文章
目前尚无关于此功能的博客文章——敬请期待。
在此期间,您可以浏览 PDF4me 博客,查看适用于各平台的教程和工作流程。
访问博客 →
设置
添加 PDF4me 将“从 Word 文档中提取元数据”节点添加到您的 n8n 工作流程并配置所需参数。有关初始设置说明,请参阅我们的 n8n 集成指南。
先决条件:
- PDF4me API 证书
- n8n 工作流访问
配置:
- 添加 PDF4me 节点到工作流
- 选择“从 Word 文档中提取元数据”操作
- 配置输入参数(见下文)

参数
以下是“从 Word 文档中提取元数据”操作的完整参数列表。配置这些参数可控制元数据提取行为。
重要的: 标有星号 (***) 的参数为必填项。高级参数可对元数据格式进行更精细的控制。
| 范围 | 类型 | 描述 | 例子 |
|---|---|---|---|
| 输入数据类型*** | String | Word文档输入格式选择 • 选择 Word 文档数据输入格式 • PDF4me 支持多种输入类型 • 选项:二进制数据, Base64 字符串,或 URL | Binary Data |
| 输入二进制字段*** | 二进制 | 二进制字文件输入 (二进制数据必填) • 参考先前文档中的 Word 文件(.docx、.doc)。 n8n 节点或文件上传 • PDF4me 处理具有自动格式检测功能的二进制 Word 文件 • 当输入数据类型为“二进制数据”时为必填项 | {{ $binary.data }} |
| Base64 文字内容*** | String | Base64 编码词输入 (如果是 Base64 字符串则为必填项) • 提供以 base64 编码字符串形式保存的 Word 文档内容(.docx、.doc),以确保安全传输。 • PDF4me 自动解码和处理 Word 内容 • 当输入数据类型为“Base64 字符串”时为必填项 | UEsDBBQABgAI... |
| Word文档URL*** | String | 公开文档 URL 输入 (如果是 URL,则为必填项) • 提供公开/开放权限 URL 到待处理的 Word 文件(.docx、.doc) • PDF4me 从提供的源下载并处理 Word 文件。 URL • 当输入数据类型为“URL”时为必填项 | https://abc.com/document.docx |
| Word 文档名称*** | String | Word文档输入文件名 • 请指定输入 Word 文件的名称,并带有正确的扩展名(.docx、.doc)。 • PDF4me 此功能用于格式检测和处理优化 | document.docx |
| 文化名称 | String | 文件文化/本地化 • 日期/时间格式的区域代码(例如,“en-US”、“de-DE”、“fr-FR”) • 默认值:InvariantCulture(统一格式) • 影响元数据中的日期/时间显示格式 | en-US |
输出
输出参数
| 范围 | 类型 | 描述 | 例子 |
|---|---|---|---|
| 文件名 | String | 原始 Word 文档文件名 - 输入的 Word 文档文件名 | myWordFile.docx |
| 成功 | Boolean | PDF4me 运行状态 - Boolean 指示元数据提取操作成功或失败的标志。 PDF4me 返回 true 为了成功运营和 false 任何错误 | true |
| 文化名称 | String | 文化/地方规范 - 用于日期/时间格式的区域代码(例如,“en-US”、“de-DE”、“fr-FR”) | en-US |
| 元数据 | Object | 嵌套元数据对象 - 包含文档元数据结构,其中嵌套的元数据对象包含所有文档属性,包括作者、标题、主题、关键词、评论、类别、公司、管理员、创建日期、最后修改日期、最后打印日期、修订号、总编辑时间、页数、字数、字符数、段落数。 | {"metadata": {"Author": "Ynoox Testtwo", "Company": "HP Inc.", "Words": 921}} |
| 信息 | String | 操作消息 - 指示元数据提取操作结果的描述性消息 | Word metadata extracted successfully |
N8N 行动反应
这 PDF4me 从 Word 文档中提取元数据 API 返回的结果可以以多种格式查看。请选择最符合您需求的视图:
- JSON
- Table
- Schema
JSON 回复格式
原始 JSON 来自 API:
[
{
"fileName": "myWordFile.docx",
"success": true,
"cultureName": "en-US",
"metadata": {
"document": null,
"fileName": null,
"success": true,
"errorMessage": null,
"metadata": {
"Author": "Ynoox Testtwo",
"Title": "",
"Subject": "",
"Keywords": "",
"Comments": "",
"Category": "",
"Company": "HP Inc.",
"Manager": "",
"Created": "5/16/2019 6:04:00 AM",
"LastModified": "8/7/2024 7:04:00 AM",
"LastPrinted": "5/16/2019 6:04:00 AM",
"RevisionNumber": 5,
"TotalEditingTime": 2,
"Pages": 3,
"Words": 921,
"Characters": 5256,
"Paragraphs": 12
}
},
"message": "Word metadata extracted successfully"
}
]
表格视图
以结构化表格格式呈现的响应数据:
| 范围 | 价值 |
|---|---|
| fileName | myWordFile.docx |
| success | true |
| cultureName | en-US |
| metadata | 包含文档元数据的嵌套对象 |
| message | Word metadata extracted successfully |
元数据对象结构:
| 范围 | 价值 |
|---|---|
| 文档 | null |
| fileName | null |
| success | true |
| errorMessage | null |
| metadata | 包含文档属性的对象 |
文档属性(metadata.metadata):
| 财产 | 价值 |
|---|---|
| Author | Ynoox Testtwo |
| Title | "" |
| Subject | "" |
| Keywords | "" |
| Comments | "" |
| Category | "" |
| Company | HP Inc. |
| Manager | "" |
| Created | 5/16/2019 6:04:00 AM |
| LastModified | 8/7/2024 7:04:00 AM |
| LastPrinted | 5/16/2019 6:04:00 AM |
| RevisionNumber | 5 |
| TotalEditingTime | 2 |
| Pages | 3 |
| Words | 921 |
| Characters | 5256 |
| Paragraphs | 12 |
架构视图
响应的数据结构和类型:
1 item
fileName: T myWordFile.docx
success: ☑ true
cultureName: T en-US
metadata: {} Object
document: null
fileName: null
success: ☑ true
errorMessage: null
metadata: {} Object
Author: T Ynoox Testtwo
Title: T ""
Subject: T ""
Keywords: T ""
Comments: T ""
Category: T ""
Company: T HP Inc.
Manager: T ""
Created: T 5/16/2019 6:04:00 AM
LastModified: T 8/7/2024 7:04:00 AM
LastPrinted: T 5/16/2019 6:04:00 AM
RevisionNumber: # 5
TotalEditingTime: # 2
Pages: # 3
Words: # 921
Characters: # 5256
Paragraphs: # 12
message: T Word metadata extracted successfully
类型指示器:
T= String (文本)#= 数字☑= Boolean[]= Array{}= Objectnull= 空值
用例
企业文档自动化
- 文档管理提取元数据以进行文档组织和编目
- 合规性跟踪:跟踪文档属性以确保符合监管要求
- 内容分析分析文档统计信息和属性
- 文档搜索使用元数据进行文档搜索和检索
人工智能驱动的文档处理
- 多格式支持处理 .docx 和 .doc 格式的 Word 文档
- 多语言处理支持不同语言和地区
- 智能元数据提取自动提取所有文档属性
商业智能与分析
- 文档分析分析文档属性和统计数据
- 合规性监控确保文档符合元数据要求
- 绩效指标跟踪处理准确性和效率