跳到主要内容

提取元数据 Power Automate

PDF4me 提取元数据 该操作允许从 Word 文档中提取全面的元数据和属性。 Power Automate 具备详尽的文档分析功能。这项强大的元数据提取功能支持内置文档属性、自定义属性、文档统计信息、作者信息、创建日期和版本跟踪,并支持特定文化的格式和本地化,非常适合跨平台的文档管理、合规性跟踪和内容分析工作流程。 Microsoft 365

相关博客文章
目前尚无关于此功能的博客文章——敬请期待。
在此期间,您可以浏览 PDF4me 博客,查看适用于各平台的教程和工作流程。
访问博客

验证您的身份 API 要求

要访问 PDF4me 网站 API 通过 Power Automate每个请求都必须包含正确的身份验证凭据。身份验证可确保通信安全,并验证您作为授权用户的身份,从而实现与您的系统之间的无缝集成。 Power Automate 流程和 PDF4me 强大的 Word 元数据提取服务。

提取元数据 Power Automate

主要特点

  • 综合元数据提取检索所有内置和自定义文档属性
  • 文档统计获取实时页数、字数、字符数和段落数
  • 作者信息提取作者、经理、公司和联系方式
  • 日期/时间属性获取创建、修改和打印时间戳
  • 自定义属性:访问所有带有自动前缀的自定义文档属性
  • 文化支持:根据指定的区域设置格式化日期和时间
  • 只读操作提取元数据而不修改原始文档
  • 结构化输出返回已整理的元数据 JSON 便于处理的格式

参数

以下是“提取元数据”操作的完整参数列表。配置这些参数可以控制元数据提取行为。

重要的: 标有星号 (***) 的参数为必填项。高级参数可对元数据格式进行更精细的控制。

范围类型描述例子
文件内容***Base64源 Word 文件内容
• 从上一个操作的输出映射 Word 文件
• 支持来自 Word 的文件 SharePointDropbox, OneDrive电子邮件附件
• 可以从流变量中动态检索
• 文件内容中也可以直接提供 base64 编码。
• 必须是有效的 Word 文档(.docx、.doc 格式)
• 元数据提取期间文档为只读
[File Content from Get File]
文件名***StringWord文档名称
• 指定带有扩展名的 Word 文件名(.docx、.doc)
• 用于参考和处理
• 必须包含正确的文件扩展名
• 支持从流程变量进行动态命名
• 用于文件识别和记录
document.docx
文化名称String文件文化/本地化
• 日期/时间格式的区域代码(例如,“en-US”、“de-DE”、“fr-FR”)
• 默认值:InvariantCulture(统一格式)
• 影响元数据中的日期/时间显示格式
• 国际文件应使用有效的文化代码
• 无效文化回退到不变文化
en-US

输出

PDF4me 提取元数据 操作返回全面的输出数据,以实现无缝连接。 Power Automate 流量整合:

表格视图

以结构化表格格式呈现的响应数据:

范围类型描述
元数据Object包含所有文档属性的综合元数据字典
成功Boolean操作成功则为真,操作失败则为假。
错误信息String错误描述(成功则为空)
错误Array详细错误信息列表(成功则为空数组)

元数据属性

内置文档属性

物业名称类型描述例子
作者String文档作者姓名"John Doe"
标题String文档标题"Project Proposal"
主题String文件主题"Q1 2024 Planning"
关键词String文档关键词(逗号分隔)"planning, budget, strategy"
评论String文档注释"Draft version for review"
类别String文档类别"Business"
公司String公司名称"Acme Corporation"
经理String经理姓名"Jane Smith"
创建String文档创建日期/时间(已格式化)"1/15/2024 10:30:00 AM"
最后修改日期String上次保存的日期/时间(已格式化)"1/20/2024 2:45:00 PM"
最后打印日期String最后打印日期/时间(已格式化)"1/18/2024 9:15:00 AM"
修订号Integer文件修订号3
总编辑时间Integer总编辑时间(分钟)120

文档统计

物业名称类型描述例子
Integer总页数8
Integer总字数2150
人物Integer总字符数12800
段落Integer段落总数45

支持的文化示例

文化密码描述日期格式示例
en-US英语(美国)“2024年1月15日 上午10:30:00”
en-GB英语(英国)“2024年1月15日 10:30:00”
de-DE德国(德国)“2024年1月15日 10:30:00”
fr-FR法语(法国)“2024年1月15日 10:30:00”
es-ES西班牙语(西班牙)“2024年1月15日 10:30:00”
ja-JP日语(日本)“2024/01/15 10:30:00”

常见错误信息

了解并排除错误有助于确保元数据提取工作流程顺畅:

错误信息原因解决方案
请求为空请求对象为空提供有效的请求对象
“文档为空”文档对象为空请提供有效的Word文档
“提取元数据时出错”元数据提取期间的一般异常检查文档格式和参数。查看 Errors 数组中的异常详细信息。
“从字节加载文档时出错”无效或损坏的 Word 文档请确认输入的文档是否为有效的 Word 文件(.docx)。

工作流程示例

PDF4me 提取元数据 行动 Power Automate 提供专为实际业务场景设计的全面工作流程模板:

自动化文档分类工作流程

利用基于元数据的自动化分类,简化您的文档管理:

完整工作流程步骤:

  1. 扳机文档已上传至 SharePoint 文档库
  2. 获取文档从上传位置检索 Word 文档
  3. 提取元数据提取所有文档属性和统计信息
  4. 设定文化: 文化名称 = "en-US" 以保持一致的日期格式
  5. 按作者分类:根据作者属性路由文档
  6. 按类别分类:根据类别属性路由文档
  7. 更新 SharePoint根据分类将文档移动到相应的文件夹
  8. 日志分类:文档管理系统中的记录分类结果

商业优势:

  • 每月自动分类 500 多份文档
  • 根据元数据将文档路由到相应的部门
  • 减少90%的人工文档分拣时间
  • 确保文档组织结构的一致性

行业应用案例及应用

法律及专业服务用例

  • 文件分类按案件类型、客户或业务领域对法律文件进行分类
  • 合规性跟踪监控文档创建日期和修订历史记录,以确保符合监管要求
  • 客户文档管理跟踪客户端文件组织的文档属性
  • 审计跟踪维护:记录文档元数据以满足法律审计要求

获取帮助