跳到主要内容

提取文本和图像 Power Automate

PDF4me 提取文本和图像 该操作会从文本中检索所有文本内容和嵌入的图像。 PDF 文件 Power Automate 用于全面提取内容。这项多功能功能可独立控制文本和图像提取,将全文以字符串形式返回,将图像以对象数组形式返回,从而支持内容重用、数据分析、图像处理以及跨平台多格式内容分发。 Microsoft 365 工作流程。

相关博客文章(1)

验证您的身份 API 要求

要访问 PDF4me 网站 API 通过 Power Automate每个请求都必须包含正确的身份验证凭据。身份验证可确保通信安全,并验证您作为授权用户的身份,从而实现与您的系统之间的无缝集成。 Power Automate 流量和 PDF4me强大的内容提取服务。

Power Automate 提取文本和图像

主要特点

  • 文本提取从中检索所有文本内容 PDF 文件
  • 图像提取将所有嵌入的图像提取为单独的文件
  • 独立控制您可以选择仅提取文本、仅提取图像或两者都提取。
  • Array 输出接收图像数组以进行迭代和处理
  • 批量处理:从多个来源提取内容 PDF工作流程中的 s

参数

以下是“提取文本和图像”操作的完整参数列表。配置这些参数可控制内容提取。

重要的: 标有星号 (***) 的参数是必需的,必须提供这些参数才能使操作正常运行。

范围类型描述例子
文件内容***二进制来源 PDF 文件内容
• 地图 PDF 来自先前操作输出的文件
• 支持 PDF来自 SharePointOneDrive, 电子邮件
• 可以从流变量中动态检索
• 必须有效 PDF 文档
[File Content from Get File]
姓名***StringPDF 文档名称
• 来源 PDF 文件名带有 .pdf 扩展名
• 用于处理身份识别
• 必须包含正确的文件扩展名
• 支持从流程中动态命名
Document.pdf
提取图像***Boolean图像提取控制
真的 - 提取所有嵌入图像
错误的 - 跳过图像提取
• 如果不需要图片,请设置为 false
• 仅需文本时减少处理量
true
提取文本***Boolean文本提取控制
真的 提取所有文本内容
错误的 - 跳过文本提取
• 如果不需要文本,请设置为 false
• 当仅需图像时,可减少处理量
true

输出

PDF4me 提取文本和图像 操作返回全面的输出数据,以实现无缝连接。 Power Automate 流量整合:

表格视图

以结构化表格格式呈现的响应数据:

范围类型描述
文本String从以下文本中提取的完整内容 PDF
图片Array返回提取出的图像列表,以对象数组的形式返回。

工作流程示例

PDF4me 提取文本和图像 行动 Power Automate 提供专为实际业务场景设计的全面工作流程模板:

自动化内容分离与归档

利用自动化提取和存储,革新您的内容管理方式:

完整工作流程步骤:

  1. 扳机文档已上传至处理文件夹
  2. 获取文档: 取回 PDFSharePoint
  3. 提取内容提取文本和图像
  4. 保存文本:将提取的文本存储在归档文件的文本文件中。
  5. 应用于每张图片遍历提取的图像
  6. 保存图片:将每张图片单独存储在图片文件夹中
  7. 创建索引生成包含文本和图像引用的元数据
  8. 更新数据库日志提取详情和位置

商业优势:

  • 将内容从 200 多个中分离出来 PDF每月
  • 支持独立的文本和图像管理
  • 减少 60% 的存储冗余
  • 促进内容重用和再利用

行业应用案例及应用

出版与媒体应用案例

  • 内容提取提取文本和图像以供内容重用
  • 数字资产管理:分离并编目文档资产
  • 内容迁移提取平台迁移所需的内容
  • 档案管理将内容分开整理,以便更好地访问

获取帮助