在 Power Automate 中从 PDF 文件中提取文本:包括扫描文档和图像文档

您的Dropbox、SharePoint或电子邮件中存储着PDF文件,其中一些是纯文本文件,另一些是扫描件或图像文件,您需要将所有文本整合到一个可靠的流程中。问题在于: 基于图像的 PDF 文件没有可选择的文本。它们首先需要OCR技术。一旦它们可以搜索, PDF4me 提取文本和图像 将所有东西都拉进来 一次通话无需二次读取,不浪费 API 积分。
本指南将引导您完成一个可以同时处理以下两件事的流程: 扳机 → 获取文件内容 (Dropbox)→ 使用 OCR 将 PDF 转换为可编辑 PDF。 (针对扫描文档)→ 提取文本和图像 (PDF4me)。您可以获得完整的输出结构和链接,以便自行排查问题并尝试使用 API。
为什么一次通话至关重要。
构建用于拆分文档、重命名文件或路由内容的流程时,通常需要从每个 PDF 文件中提取文本和图像。循环中重新读取每个文档会消耗大量的 API 调用次数,从而降低流程速度。 提取文本和图像 单个响应中同时返回文本内容和嵌入的图像。您将获得所需的一切:文本、图像文件名和 Base64 图像数据,因此下游操作无需额外读取即可重命名、路由或归档。
提示: 需要按条形码拆分 PDF 文件,并按条形码重命名每个文件吗?使用 按条形码分割 PDF它返回 条形码文本 每个拆分操作都会在同一响应中完成,因此您无需再次调用即可重命名。请参阅我们的 在 Power Automate 中按条形码拆分 PDF 指导。
你需要什么?
- 动力自动化, 打开 Power Automate登录并创建一个新的云流(即时或自动化)。
- PDF4me API密钥, 获取您的 API 密钥添加 PDF4me 操作时,您将创建连接。首次使用?请参阅 将 PDF4me 连接到 Power Automate。
- Dropbox我们用它来 获取文件内容SharePoint、OneDrive 或任何可以提供文件内容的连接器也都可以。
流程概览(4 个步骤)。
- 手动触发流程按需启动流程(或使用) 创建文件时 (在 Dropbox 中用于自动化)。
- 使用路径获取文件内容 (Dropbox):从类似这样的路径获取 PDF 文件
/pdf4metest/extracttext/image to pdf.pdf。 - PDF:使用 OCR 将 PDF 转换为可编辑 PDF (PDF4me):将扫描/图像格式的 PDF 文件转换为可搜索文本。如果您的 PDF 文件本身已支持文本搜索,请跳过此步骤。
- PDF:提取文本和图像 (PDF4me):在一个响应中返回全文和所有嵌入的图像。

输入: 一个 PDF 文件(图像型或文本型)。 输出: 文本内容 texts 数组和图像 images 数组 fileName 和 streamFile (Base64)

输入示例:OCR识别后可提取文本的图像PDF。
步骤 1:触发 + 获取文件内容。
目前为止的流程: 触发器 → 获取文件内容。
- 添加 手动触发流程 (或者 创建文件时 (在 Dropbox 中用于自动化)。
- 添加 Dropbox → 使用路径获取文件内容。
- 参数:
- 文件路径 *请输入您的 PDF 文件路径,例如:
/pdf4metest/extracttext/image to pdf.pdf如果需要浏览,请使用文件夹图标。 - 高级参数 → 推断内容类型设置为 是的。
- 联系: 确保 已连接到 Dropbox。
输出结果是文件内容(二进制)。将其映射到 文件内容 在 OCR 操作中(以及稍后在提取文本和图像中)。
小心: 务必绘制实际地图 文件内容 输出结果,而非文件路径或元数据。Power Automate 有时会在下拉菜单中提供多个选项;请选择包含二进制文件的选项。

步骤 2:使用 OCR 将 PDF 转换为可编辑 PDF(适用于基于图像的 PDF)。
目前为止的流程: 触发器 → 获取文件内容 → 使用 OCR 将 PDF 转换为可编辑 PDF。
如果您的 PDF 文件是扫描件或图像文件,请添加此步骤,以便在提取文本之前使其可搜索。如果您的 PDF 文件已经包含可选择的文本,请尝试在阅读器中复制一个单词,然后您可以跳到步骤 3,直接将文件内容传递给“提取文本和图像”工具。
- 添加 PDF4me → PDF:使用 OCR 将 PDF 转换为可编辑 PDF。
- 参数:
- 文件内容*, 地图 使用路径获取文件内容 输出(PDF二进制文件)。
- 文件名 *请输入一个名称,例如:
Test.pdf或者源文件名。 - 质量类型: 草稿 对于普通 PDF 文件(每个文件 1 次 API 调用)或 高的 对于扫描/基于图像的 PDF(每页 2 次 API 调用)。
- 仅在需要时进行OCR识别: 错误的 始终运行 OCR,或 是的 如果 PDF 文件已经可以搜索,则跳过此步骤(节省 API 调用)。
- 语言设置为源文档语言(例如,
en如果需要提高 OCR 准确率。 - 是否异步: 不 用于同步(推荐用于流程)。
- 联系: 已连接至 PDF4me PDF。

步骤 3:提取文本和图像。
目前为止的流程: … → 使用 OCR 将 PDF 转换为可编辑 PDF → 提取文本和图像。
- 添加 PDF4me → PDF:提取文本和图像。
- 参数:
- 文件内容*映射输出 使用 OCR 将 PDF 转换为可编辑 PDF (或直接来自) 获取文件内容 如果您跳过了 OCR)。
- 文件名 *请输入一个名称,例如:
New.pdf或者源文件名。 - 提取文本: 是的 提取文本。
- 提取图像: 是的 提取嵌入图像(或) 不 如果您只需要文本的话)。
- 联系: 已连接至 PDF4me PDF。

输出: 动作返回 身体 和:
- 文本包含所有提取文本的字符串数组(换行符为
\n)。 - 图片对象数组:
fileName(例如。page001_image001.jpg) 和streamFile(Base64)。在后续操作中使用这些编码来保存或处理图像。

参数和输出参考。
以下是我们使用的配置简明指南。您可以根据自己的实际情况进行调整。
| 步 | 范围 | 价值 | 笔记 |
|---|---|---|---|
| 获取文件 | 文件路径 | /pdf4metest/extracttext/... | 您的 Dropbox 路径 |
| 获取文件 | 推断内容类型 | 是的 | 帮助 Power Automate 处理文件 |
| OCR | 质量类型 | 草稿 | 使用 高的 处理棘手的扫描文档 |
| OCR | 仅在需要时进行OCR识别 | 错误的 | 设置为 是的 如果文本已经可搜索,则可节省 API 调用。 |
| 提炼 | 提取文本/图像 | 是/是 | 关闭不必要的功能以加快速度 |
| 输出 | 正文 | 字符串数组 | 所有提取的文本 |
| 输出 | 身体图像 | 文件名,流文件 | 每张图像的 Base64 图像数据 |
有关完整的参数详细信息,请参阅 提取文本和图像:Power Automate 和 使用 OCR 将 PDF 转换为可编辑 PDF。。
故障排除。
事情有时会出错。以下方法通常可以解决问题:
通常意味着映射了错误的字段。请使用包含实际值的字段。 文件内容不是路径或引用。Power Automate 的下拉菜单在这里可能会比较棘手。参见 Zapier 和 Power Automate 使用技巧 用于 Base64 编码和文件处理。
提取文本和图像需要 PDF 文件。如果源文件是图像,请先使用以下命令将其转换为 PDF 文件: 转换为 PDF然后传递结果。
查看 PDF4me故障排除 针对 401(API 密钥)、402(积分)和平台特定问题进行修复。
以交互方式试用 API。
使用我们的工具,无需 Power Automate 即可测试提取文本和图像 API。 API 测试上传PDF文件,查看回复:
后续步骤。
- 将测试 PDF 文件拖放到文件夹中,运行流程,检查结果。 身体 输出
文本和图片。 - 喂养
文本放入 Compose、Parse JSON 或 Conditions 中;使用图片使用创建文件或任何存储操作。 - 交换 手动触发 为了 创建文件时 (Dropbox)并将触发器的文件路径连接到 获取文件内容 实现无需人工干预的自动化。