提取元数据 Power Automate
PDF4me 提取元数据 该操作允许从 Word 文档中提取全面的元数据和属性。 Power Automate 具备详尽的文档分析功能。这项强大的元数据提取功能支持内置文档属性、自定义属性、文档统计信息、作者信息、创建日期和版本跟踪,并支持特定文化的格式和本地化,非常适合跨平台的文档管理、合规性跟踪和内容分析工作流程。 Microsoft 365。
验证您的身份 API 要求
要访问 PDF4me 网站 API 通过 Power Automate每个请求都必须包含正确的身份验证凭据。身份验证可确保通信安全,并验证您作为授权用户的身份,从而实现与您的系统之间的无缝集成。 Power Automate 流程和 PDF4me 强大的 Word 元数据提取服务。

主要特点
- 综合元数据提取检索所有内置和自定义文档属性
- 文档统计获取实时页数、字数、字符数和段落数
- 作者信息提取作者、经理、公司和联系方式
- 日期/时间属性获取创建、修改和打印时间戳
- 自定义属性:访问所有带有自动前缀的自定义文档属性
- 文化支持:根据指定的区域设置格式化日期和时间
- 只读操作提取元数据而不修改原始文档
- 结构化输出返回已整理的元数据 JSON 便于处理的格式
参数
以下是“提取元数据”操作的完整参数列表。配置这些参数可以控制元数据提取行为。
重要的: 标有星号 (***) 的参数为必填项。高级参数可对元数据格式进行更精细的控制。
| 范围 | 类型 | 描述 | 例子 |
|---|---|---|---|
| 文件内容*** | Base64 | 源 Word 文件内容 • 从上一个操作的输出映射 Word 文件 • 支持来自 Word 的文件 SharePointDropbox, OneDrive电子邮件附件 • 可以从流变量中动态检索 • 文件内容中也可以直接提供 base64 编码。 • 必须是有效的 Word 文档(.docx、.doc 格式) • 元数据提取期间文档为只读 | [File Content from Get File] |
| 文件名*** | String | Word文档名称 • 指定带有扩展名的 Word 文件名(.docx、.doc) • 用于参考和处理 • 必须包含正确的文件扩展名 • 支持从流程变量进行动态命名 • 用于文件识别和记录 | document.docx |
| 文化名称 | String | 文件文化/本地化 • 日期/时间格式的区域代码(例如,“en-US”、“de-DE”、“fr-FR”) • 默认值:InvariantCulture(统一格式) • 影响元数据中的日期/时间显示格式 • 国际文件应使用有效的文化代码 • 无效文化回退到不变文化 | en-US |
输出
这 PDF4me 提取元数据 操作返回全面的输出数据,以实现无缝连接。 Power Automate 流量整合:
- Table
- JSON
- Flow Integration
表格视图
以结构化表格格式呈现的响应数据:
| 范围 | 类型 | 描述 |
|---|---|---|
| 元数据 | Object | 包含所有文档属性的综合元数据字典 |
| 成功 | Boolean | 操作成功则为真,操作失败则为假。 |
| 错误信息 | String | 错误描述(成功则为空) |
| 错误 | Array | 详细错误信息列表(成功则为空数组) |
JSON 回复格式
原始 JSON 行动的回应:
{
"metadata": {
"Author": "John Doe",
"Title": "Project Proposal",
"Subject": "Q1 2024 Planning",
"Keywords": "planning, budget, strategy",
"Comments": "Draft version for review",
"Category": "Business",
"Company": "Acme Corporation",
"Manager": "Jane Smith",
"Created": "1/15/2024 10:30:00 AM",
"LastModified": "1/20/2024 2:45:00 PM",
"LastPrinted": "1/18/2024 9:15:00 AM",
"RevisionNumber": 3,
"TotalEditingTime": 120,
"Pages": 8,
"Words": 2150,
"Characters": 12800,
"Paragraphs": 45,
"Custom_Department": "Marketing",
"Custom_ProjectCode": "PRJ-2024-001",
"Custom_Confidential": "Internal"
},
"Success": true,
"ErrorMessage": null,
"Errors": []
}
错误响应示例:
{
"metadata": null,
"Success": false,
"ErrorMessage": "Document is empty",
"Errors": [
{
"Code": "DOCUMENT_ERROR",
"Message": "The document content is null or empty"
}
]
}
Power Automate 流量使用情况
在后续操作中使用提取的元数据:
- 文件分类根据作者、类别或自定义属性路由文档
- 合规性跟踪监控文档创建日期和修订号
- 内容分析分析文档统计数据,用于报告和优化
- 工作流路由使用元数据确定文档处理路径
- 审计日志记录文档属性,以进行合规性和跟踪
- 数据库存储将元数据存储在数据库中以进行文档管理
元数据属性
内置文档属性
| 物业名称 | 类型 | 描述 | 例子 |
|---|---|---|---|
| 作者 | String | 文档作者姓名 | "John Doe" |
| 标题 | String | 文档标题 | "Project Proposal" |
| 主题 | String | 文件主题 | "Q1 2024 Planning" |
| 关键词 | String | 文档关键词(逗号分隔) | "planning, budget, strategy" |
| 评论 | String | 文档注释 | "Draft version for review" |
| 类别 | String | 文档类别 | "Business" |
| 公司 | String | 公司名称 | "Acme Corporation" |
| 经理 | String | 经理姓名 | "Jane Smith" |
| 创建 | String | 文档创建日期/时间(已格式化) | "1/15/2024 10:30:00 AM" |
| 最后修改日期 | String | 上次保存的日期/时间(已格式化) | "1/20/2024 2:45:00 PM" |
| 最后打印日期 | String | 最后打印日期/时间(已格式化) | "1/18/2024 9:15:00 AM" |
| 修订号 | Integer | 文件修订号 | 3 |
| 总编辑时间 | Integer | 总编辑时间(分钟) | 120 |
文档统计
| 物业名称 | 类型 | 描述 | 例子 |
|---|---|---|---|
| 页 | Integer | 总页数 | 8 |
| 字 | Integer | 总字数 | 2150 |
| 人物 | Integer | 总字符数 | 12800 |
| 段落 | Integer | 段落总数 | 45 |
支持的文化示例
| 文化密码 | 描述 | 日期格式示例 |
|---|---|---|
en-US | 英语(美国) | “2024年1月15日 上午10:30:00” |
en-GB | 英语(英国) | “2024年1月15日 10:30:00” |
de-DE | 德国(德国) | “2024年1月15日 10:30:00” |
fr-FR | 法语(法国) | “2024年1月15日 10:30:00” |
es-ES | 西班牙语(西班牙) | “2024年1月15日 10:30:00” |
ja-JP | 日语(日本) | “2024/01/15 10:30:00” |
常见错误信息
了解并排除错误有助于确保元数据提取工作流程顺畅:
| 错误信息 | 原因 | 解决方案 |
|---|---|---|
| 请求为空 | 请求对象为空 | 提供有效的请求对象 |
| “文档为空” | 文档对象为空 | 请提供有效的Word文档 |
| “提取元数据时出错” | 元数据提取期间的一般异常 | 检查文档格式和参数。查看 Errors 数组中的异常详细信息。 |
| “从字节加载文档时出错” | 无效或损坏的 Word 文档 | 请确认输入的文档是否为有效的 Word 文件(.docx)。 |
工作流程示例
这 PDF4me 提取元数据 行动 Power Automate 提供专为实际业务场景设计的全面工作流程模板:
- Document Classification
- Compliance Tracking
- Content Analysis
- Audit Logging
自动化文档分类工作流程
利用基于元数据的自动化分类,简化您的文档管理:
完整工作流程步骤:
- 扳机文档已上传至 SharePoint 文档库
- 获取文档从上传位置检索 Word 文档
- 提取元数据提取所有文档属性和统计信息
- 设定文化: 文化名称 = "en-US" 以保持一致的日期格式
- 按作者分类:根据作者属性路由文档
- 按类别分类:根据类别属性路由文档
- 更新 SharePoint根据分类将文档移动到相应的文件夹
- 日志分类:文档管理系统中的记录分类结果
商业优势:
- 每月自动分类 500 多份文档
- 根据元数据将文档路由到相应的部门
- 减少90%的人工文档分拣时间
- 确保文档组织结构的一致性
自动化合规跟踪工作流程
利用自动化元数据跟踪增强您的合规性管理:
完整工作流程步骤:
- 扳机:文档创建或修改于 SharePoint 合规文件夹
- 获取文档从合规库中检索 Word 文档
- 提取元数据提取创建日期、修订号和作者信息
- 设定文化:文化名称 = "en-US" 用于标准化日期格式
- 检查合规性验证文档的发布时间和修订状态
- 更新数据库:将元数据存储在合规性跟踪数据库中
- 发送提醒通知合规团队需要审核的文件
- 生成报告:根据元数据创建合规状态报告
商业优势:
- 自动跟踪 200 多份合规文件
- 监控文档的年龄和修订状态
- 确保及时进行合规性审查
- 减少75%的合规审计准备时间
自动化内容分析工作流程
利用自动化文档分析优化内容管理:
完整工作流程步骤:
- 扳机:发布于 SharePoint 内容库
- 获取文档从内容库中检索 Word 文档
- 提取元数据提取文档统计信息和属性
- 设定文化: 文化名称 = "en-US" 以保持一致格式
- 分析统计数据计算字数、页数和字符数
- 更新分析:将内容指标存储在分析数据库中
- 生成洞察创建内容绩效报告
- 电子邮件报告向内容团队发送内容分析报告
商业优势:
- 每月自动分析 300 多份文档
- 跟踪内容指标和表现
- 为内容优化提供见解
- 减少85%的人工内容分析时间
自动化审计日志工作流程
通过自动元数据日志记录增强您的审计跟踪:
完整工作流程步骤:
- 扳机:文档已访问或修改 SharePoint
- 获取文档从以下位置检索 Word 文档 SharePoint
- 提取元数据提取所有文档属性和时间戳
- 设定文化: 文化名称 = "en-US" 用于标准化格式
- 日志元数据:将元数据存储在审计日志系统中
- 跟踪更改监控版本号和修改日期
- 生成审计跟踪:创建综合审计报告
- 存档日志:将审计日志存储在安全归档系统中
商业优势:
- 每月自动记录 1000 多个文档访问事件
- 保留完整的审计跟踪记录
- 确保符合监管要求
- 减少95%的人工审计日志记录时间
行业应用案例及应用
- Legal & Professional Services
- Finance & Accounting
- Sales & Marketing
- Human Resources
- Healthcare & Medical
- Education & Research
法律及专业服务用例
- 文件分类按案件类型、客户或业务领域对法律文件进行分类
- 合规性跟踪监控文档创建日期和修订历史记录,以确保符合监管要求
- 客户文档管理跟踪客户端文件组织的文档属性
- 审计跟踪维护:记录文档元数据以满足法律审计要求
财务与会计应用案例
- 财务报告分析:从财务报告中提取元数据以进行合规性跟踪
- 预算文件管理按部门和财政年度对预算文件进行分类
- 审计文档:跟踪文档属性以维护审计跟踪
- 监管备案监控文档元数据,以满足监管申报要求
销售与市场营销用例
- 提案管理提取提案中的元数据,用于客户跟踪和分析
- 营销材料组织按营销活动和目标受众对营销文档进行分类
- 内容表现分析分析文档统计数据以优化内容
- 客户交付物跟踪监控客户项目管理的文档属性
人力资源应用案例
- 政策文件管理从人力资源政策中提取元数据以进行版本控制
- 员工文件组织按类型和部门对员工文件进行分类
- 合规性监控跟踪文件创建和修改日期,以确保人力资源合规性
- 培训材料分析分析培训文件统计数据,以评估其有效性。
医疗保健应用案例
- 医疗文件分类按患者、手术或科室对医疗文件进行分类
- 合规性跟踪监控文档元数据,以确保符合医疗保健监管法规
- 研究文档:从研究文档中提取元数据以进行研究跟踪
- 患者记录管理按元数据属性整理患者文档
教育与研究应用案例
- 学术文件组织按课程、院系或研究领域对学术文件进行分类
- 研究数据管理:从研究文档中提取元数据,用于研究组织
- 课程跟踪:监控课程文档属性以进行版本控制
- 学生文件管理按元数据属性整理学生文档