跳到主要内容

如何在 Zapier 中从扫描的 PDF 文件中提取文本:观看 → OCR → 提取(3 个步骤)

· 阅读需 11 分钟
SEO and Content Writer

扫描的发票、传真表格或保存为 PDF 格式的屏幕截图,看起来像文档,但其中的文字只是像素。您无法选中、复制或将其导入到 Zap 中。解决方法:运行 OCR优先 要使 PDF 文件可搜索,然后提取文本。这里有一个三步 Zap 教程,使用 Dropbox 和 PDF4me 即可轻松完成此操作。

简而言之: 将 PDF 文件拖放到 Dropbox → Zap 触发 → OCR 使其可搜索 → 提取文本将内容提取出来 全文将该字段映射到 Sheets、Airtable、电子邮件或其他任何位置。

你最终会得到什么

当 PDF 文件进入您的 Dropbox 文件夹时,Zap 会运行 OCR(如果需要),并将所有文本提取到一个字段中。 全文您可以将其映射到 Google 表格、Airtable、电子邮件或任何后续步骤。输出结果包括 追踪 ID 用于调试和 页面文本信息 查看每页详情。

从 PDF 输出中提取文本:包含示例 PDF 文档和第 1 至 10 行的完整文本、跟踪 ID 和页面文本信息

Zap 的输出:提取的文本、跟踪 ID 和页面文本信息。


为什么基于图像的 PDF 需要先进行 OCR 识别?

基于图像的 PDF 文件将文本存储为像素。提取工具需要的是文本层,因此它们无法返回任何有用的信息。 使PDF可搜索/OCR 然后加上那一层 从PDF中提取文本 可以读取所有内容。仅当您的 PDF 文件中已有可选择的文本时才可跳过 OCR 步骤(尝试在阅读器中复制一个单词进行验证)。


你需要什么?


三步搞定

  1. 文件夹中的新文件 (Dropbox):手表 /pdf4metest/ExtractText 每隔2分钟。
  2. 使PDF可搜索/OCR (PDF4me):将基于图像的 PDF 转换为可搜索的文档。
  3. 从PDF中提取文本 (PDF4me):将文本提取到 全文追踪 ID, 和 页面文本信息
Zapier 工作流程:Dropbox 在文件夹中新建文件(2 分钟)→ PDF4me 使 PDF 可搜索/OCR → PDF4me 从 PDF 中提取文本

输入: 基于图像的 PDF(例如, Image To PDF.pdf)包含“PDF 文档示例”等内容和编号行。 输出: 所有文本 全文准备好进行下一步了。

PDF 文档示例:基于图像的输入,包含 10 行编号内容

输入示例:需要先进行 OCR 识别才能提取图像的 PDF 文件。


步骤 1:文件夹中的新文件(触发器)。

目前为止的 Zap: 仅触发。

  1. 添加 Dropbox文件夹中的新文件 作为触发因素。
  2. 空间默认 (或者选择你的空间)。
  3. 文件夹 */pdf4metest/ExtractText (或您的目标文件夹)。
  4. 是否包含子文件夹中的文件?错误的 (或对于嵌套文件夹为 True)。
  5. 是否包含文件内容?是的必须选择“是”,以便将文件内容传递给下一步。
  6. 包含分享链接吗?是的 (选修的)。
  7. 点击 继续 并测试扳机。
新建文件在文件夹中:默认空间,文件夹 /pdf4metest/ExtractText,包含文件内容:是,包含共享链接:是

重要的:是否包含文件内容?是的如果选择“否”,Zapier 将传递一个引用而不是文件,OCR 和提取步骤将失败。


步骤 2:使 PDF 可搜索/OCR(操作)。

目前为止的 Zap: 触发器 → 使 PDF 可搜索/OCR。

  1. 添加 PDF4me使PDF可搜索/OCR
  2. 文件 *: 地图 1. 文件 来自 Dropbox 触发器。请使用包含实际文件内容的字段,而不是“文件:(存在但未显示)”。
  3. 文件名: 地图 1. 文件名1. 文件扩展名 (例如。 Image To PDF + .pdf)。
  4. 质量类型*标准 适用于大多数PDF文件。
  5. 将进程设置为异步错误的 所以 Zap 会等待 OCR 完成。
  6. 点击 继续 并进行测试。
使 PDF 可搜索/OCR:文件来自步骤 1,文件名:Image To PDF.pdf,质量类型:标准,处理方式:异步(否)

OCR步骤会返回一个可搜索的PDF文件。提取步骤会使用该文件。


步骤 3:从 PDF 中提取文本(操作)。

目前为止的 Zap: 触发器 → OCR → 提取文本。

  1. 添加 PDF4me从PDF中提取文本
  2. 文件 *: 地图 2. 文件 URL 来自 OCR 步骤(已处理的 PDF)。
  3. 文件名: 地图 2. 完整文件名 (例如。 Image To PDF.pdf)。
  4. 提取模式*完整文档 对于一个字段中的所有文本,或者 按页码 按页输出。
  5. 点击 继续 并进行测试。
从 PDF 中提取文本:通过 OCR 步骤获取文件 URL 和完整文件名,提取模式为完整文档

输出: 动作返回 全文 (所有提取的文本) 追踪 ID (例如。 5e4ba591-94c4-4b6c-ac3f-ca062d483981), 和 页面文本信息对于像上面这样的示例 PDF,您会看到“示例 PDF 文档”以及第 1 行到第 10 行的内容。 全文


快速参考表

关键设置笔记
扳机文件夹:/pdf4metest/ExtractText文件内容如下: 是的
OCR质量类型:标准对于扫描效果不佳的情况,请使用专家模式(需要更多 API 调用)。
OCR将进程设置为异步:否保持 Zap 同步
提炼提取模式:完整文档一个字段中的所有文本
输出全文将此步骤映射到后续步骤

有关完整的参数详细信息,请参阅 从 PDF 中提取文本:ZapierPDF OCR,Zapier


故障排除。

文件:(存在但未显示)

此选项通常传递的是一个引用而不是文件本身。请选择包含实际文件内容的字段。参见 Zapier 和 Power Automate 使用技巧 用于文件处理。

文件为空或未提取任何文本

确保 是否包含文件内容?是的 在触发器中,并且您映射了 OCR 步骤的 文件 URL (或文件输出)到 Extract 步骤,而不是路径或元数据。

401、402 或其他 API 错误

PDF4me故障排除 涵盖 401(API 密钥)、402(积分)等。


亲自体验一下API。

无需构建 Zap 即可测试提取文本 API:


后续步骤。

一切就绪。
  • 将测试 PDF 文件拖放到文件夹中,然后运行 Zap。检查提取步骤的输出。 全文
  • 在“提取”之后添加一个步骤,例如“向 Google 表格添加行”、“发送电子邮件”或“更新 Airtable”,并进行映射。 全文 投入其中。
  • 启用 Zap,使其在文件夹中出现新 PDF 文件时运行。