跳到主要内容

在 Power Automate 中从 PDF 文件中提取文本:包括扫描文档和图像文档

· 阅读需 14 分钟
SEO and Content Writer

您的Dropbox、SharePoint或电子邮件中存储着PDF文件,其中一些是纯文本文件,另一些是扫描件或图像文件,您需要将所有文本整合到一个可靠的流程中。问题在于: 基于图像的 PDF 文件没有可选择的文本。它们首先需要OCR技术。一旦它们可以搜索, PDF4me 提取文本和图像 将所有东西都拉进来 一次通话无需二次读取,不浪费 API 积分。

本指南将引导您完成一个可以同时处理以下两件事的流程: 扳机获取文件内容 (Dropbox)→ 使用 OCR 将 PDF 转换为可编辑 PDF。 (针对扫描文档)→ 提取文本和图像 (PDF4me)。您可以获得完整的输出结构和链接,以便自行排查问题并尝试使用 API。

为什么一次通话至关重要。

构建用于拆分文档、重命名文件或路由内容的流程时,通常需要从每个 PDF 文件中提取文本和图像。循环中重新读取每个文档会消耗大量的 API 调用次数,从而降低流程速度。 提取文本和图像 单个响应中同时返回文本内容和嵌入的图像。您将获得所需的一切:文本、图像文件名和 Base64 图像数据,因此下游操作无需额外读取即可重命名、路由或归档。

提示: 需要按条形码拆分 PDF 文件,并按条形码重命名每个文件吗?使用 按条形码分割 PDF它返回 条形码文本 每个拆分操作都会在同一响应中完成,因此您无需再次调用即可重命名。请参阅我们的 在 Power Automate 中按条形码拆分 PDF 指导。

你需要什么?

流程概览(4 个步骤)。

  1. 手动触发流程按需启动流程(或使用) 创建文件时 (在 Dropbox 中用于自动化)。
  2. 使用路径获取文件内容 (Dropbox):从类似这样的路径获取 PDF 文件 /pdf4metest/extracttext/image to pdf.pdf
  3. PDF:使用 OCR 将 PDF 转换为可编辑 PDF (PDF4me):将扫描/图像格式的 PDF 文件转换为可搜索文本。如果您的 PDF 文件本身已支持文本搜索,请跳过此步骤。
  4. PDF:提取文本和图像 (PDF4me):在一个响应中返回全文和所有嵌入的图像。
Power Automate 流程:手动触发 → 获取文件内容 → 使用 OCR 将 PDF 转换为可编辑 PDF → 提取 PDF 中的文本和图像

输入: 一个 PDF 文件(图像型或文本型)。 输出: 文本内容 texts 数组和图像 images 数组 fileNamestreamFile (Base64)

PDF示例:带有编号行的PDF文档示例(基于图像的输入)

输入示例:OCR识别后可提取文本的图像PDF。


步骤 1:触发 + 获取文件内容。

目前为止的流程: 触发器 → 获取文件内容。

  1. 添加 手动触发流程 (或者 创建文件时 (在 Dropbox 中用于自动化)。
  2. 添加 Dropbox使用路径获取文件内容
  3. 参数:
  • 文件路径 *请输入您的 PDF 文件路径,例如: /pdf4metest/extracttext/image to pdf.pdf如果需要浏览,请使用文件夹图标。
  • 高级参数推断内容类型设置为 是的
  1. 联系: 确保 已连接到 Dropbox

输出结果是文件内容(二进制)。将其映射到 文件内容 在 OCR 操作中(以及稍后在提取文本和图像中)。

小心: 务必绘制实际地图 文件内容 输出结果,而非文件路径或元数据。Power Automate 有时会在下拉菜单中提供多个选项;请选择包含二进制文件的选项。

获取文件内容:文件路径 /pdf4metest/extracttext/image 到 pdf.pdf,推断内容类型:是

步骤 2:使用 OCR 将 PDF 转换为可编辑 PDF(适用于基于图像的 PDF)。

目前为止的流程: 触发器 → 获取文件内容 → 使用 OCR 将 PDF 转换为可编辑 PDF。

如果您的 PDF 文件是扫描件或图像文件,请添加此步骤,以便在提取文本之前使其可搜索。如果您的 PDF 文件已经包含可选择的文本,请尝试在阅读器中复制一个单词,然后您可以跳到步骤 3,直接将文件内容传递给“提取文本和图像”工具。

  1. 添加 PDF4mePDF:使用 OCR 将 PDF 转换为可编辑 PDF
  2. 参数:
  • 文件内容*, 地图 使用路径获取文件内容 输出(PDF二进制文件)。
  • 文件名 *请输入一个名称,例如: Test.pdf 或者源文件名。
  • 质量类型草稿 对于普通 PDF 文件(每个文件 1 次 API 调用)或 高的 对于扫描/基于图像的 PDF(每页 2 次 API 调用)。
  • 仅在需要时进行OCR识别错误的 始终运行 OCR,或 是的 如果 PDF 文件已经可以搜索,则跳过此步骤(节省 API 调用)。
  • 语言设置为源文档语言(例如, en如果需要提高 OCR 准确率。
  • 是否异步 用于同步(推荐用于流程)。
  1. 联系已连接至 PDF4me PDF
使用 OCR 将 PDF 转换为可编辑 PDF:文件内容来自“获取文件”,文件名为 Test.pdf,质量类型为“草稿”,是否仅在需要时启用 OCR 为 false,语言为“语言”,是否异步为“否”。

步骤 3:提取文本和图像。

目前为止的流程: … → 使用 OCR 将 PDF 转换为可编辑 PDF → 提取文本和图像。

  1. 添加 PDF4mePDF:提取文本和图像
  2. 参数:
  • 文件内容*映射输出 使用 OCR 将 PDF 转换为可编辑 PDF (或直接来自) 获取文件内容 如果您跳过了 OCR)。
  • 文件名 *请输入一个名称,例如: New.pdf 或者源文件名。
  • 提取文本是的 提取文本。
  • 提取图像是的 提取嵌入图像(或) 如果您只需要文本的话)。
  1. 联系已连接至 PDF4me PDF
提取文本和图像:OCR 步骤的文件内容,文件名 New.pdf,提取文本:是,提取图像:是

输出: 动作返回 身体 和:

  • 文本包含所有提取文本的字符串数组(换行符为 \n)。
  • 图片对象数组: fileName (例如。 page001_image001.jpg) 和 streamFile (Base64)。在后续操作中使用这些编码来保存或处理图像。
原始 JSON 输出:状态码 200,正文包含文本数组和图像数组(文件名,流文件)

参数和输出参考。

以下是我们使用的配置简明指南。您可以根据自己的实际情况进行调整。

范围价值笔记
获取文件文件路径/pdf4metest/extracttext/...您的 Dropbox 路径
获取文件推断内容类型是的帮助 Power Automate 处理文件
OCR质量类型草稿使用 高的 处理棘手的扫描文档
OCR仅在需要时进行OCR识别错误的设置为 是的 如果文本已经可搜索,则可节省 API 调用。
提炼提取文本/图像是/是关闭不必要的功能以加快速度
输出正文字符串数组所有提取的文本
输出身体图像文件名,流文件每张图像的 Base64 图像数据

有关完整的参数详细信息,请参阅 提取文本和图像:Power Automate使用 OCR 将 PDF 转换为可编辑 PDF。


故障排除。

事情有时会出错。以下方法通常可以解决问题:

“文件为空”或“文件无法打开”

通常意味着映射了错误的字段。请使用包含实际值的字段。 文件内容不是路径或引用。Power Automate 的下拉菜单在这里可能会比较棘手。参见 Zapier 和 Power Automate 使用技巧 用于 Base64 编码和文件处理。

发送 JPG 或 PNG 格式的文件而不是 PDF 格式的文件。

提取文本和图像需要 PDF 文件。如果源文件是图像,请先使用以下命令将其转换为 PDF 文件: 转换为 PDF然后传递结果。

401、402 或其他错误

查看 PDF4me故障排除 针对 401(API 密钥)、402(积分)和平台特定问题进行修复。


以交互方式试用 API。

使用我们的工具,无需 Power Automate 即可测试提取文本和图像 API。 API 测试上传PDF文件,查看回复:


后续步骤。

你快完成了。
  • 将测试 PDF 文件拖放到文件夹中,运行流程,检查结果。 身体 输出 文本图片
  • 喂养 文本 放入 Compose、Parse JSON 或 Conditions 中;使用 图片 使用创建文件或任何存储操作。
  • 交换 手动触发 为了 创建文件时 (Dropbox)并将触发器的文件路径连接到 获取文件内容 实现无需人工干预的自动化。