跳到主要内容

PDF OCR

对扫描件进行光学字符识别。 PDF 或者输入一张图片,这样图片中的文字就变成了真实的、可选择的文本。该操作会读取页面图像中的字符,并在其后添加一个文本图层,从而允许您搜索文档、从中复制文本,并让索引工具读取其内容。输入内容为单个扫描件。 PDF 或图像文件。输出为单个文件。 PDF 看起来一样,但现在包含可搜索的文本。

当需要按关键词搜索扫描的合同或发票文件夹、需要从拍摄的收据或表格中复制数字,或者需要通过全文搜索或文档管理系统读取存档的纸质记录时,就可以使用它。


配置​

配置 PDF OCR 工作流程构建器中的步骤:

PDF4me 工作流程中的 PDF OCR 配置


行动概述​

输入单次扫描 PDF 文档或图像文件
输出一个可搜索的单一平台 PDF 带有可选文本图层

特性​

质量​

  • 类型: 选择
  • 默认: 草稿

设定识别质量 OCR 默认设置为“草稿”,速度最快。下拉菜单提供更高质量的设置,可以提高对模糊、倾斜或低分辨率扫描件的准确性,但会增加处理时间。对于清晰、高分辨率的页面,请保持设置为“草稿”;如果源扫描件难以辨认,请提高设置。

做 OCR 需要时​

  • 类型: 布尔值
  • 默认: 离开

控制操作是否在运行识别之前检查每个文档。启用后,它会跳过已包含文本层的文件并直接运行识别。 OCR 仅对需要搜索的文档执行此操作,避免对已可搜索的文件进行不必要的处理。关闭时,它不会运行。 OCR 对经过此步骤的每个文档都执行此操作。当输入文件混合了扫描文件时,启用此功能。 PDFs 已经可以搜索到的。


如何运行 PDF OCR 使用工作流​

当您需要处理数百份扫描文档时,自动化是唯一可行的方法。 PDF4me 工作流可以运行 OCR 对每个到达的文件进行处理。以下是一个识别扫描文件中文本的示例工作流程。 PDFs 以及图像,并生成可搜索的内容 PDF。

创建工作流程​

打开 工作流程仪表盘 并选择 创建工作流 开始构建您的自动化流程。

创建新的工作流程

添加触发器​

添加并配置一个触发器来启动工作流。一旦配置的文件夹中有新文件到达,自动化流程就会运行。此示例使用 Google Drive 扳机。 PDF4me 工作流也支持 Dropbox 触发器有很多种,您可以选择适合您工作流程的触发器。

用于 PDF OCR 工作流程的 Google 云端硬盘触发器

添加 PDF OCR 行动​

添加和配置 PDF OCR 操作。启用 做 OCR 必要时 以便 OCR 仅对需要运行的文档运行,避免不必要的处理调用。

工作流程中的 PDF OCR 操作

添加“保存到存储”操作​

文件处理完毕后,将其保存到您的存储空间。对于此用例,请添加并配置一个 保存到 Google Drive 执行操作并设置要保存处理后文件的文件夹。

保存到 Google 云端硬盘操作,用于保存输出文件

发布工作流程​

配置完成后,选择 节省 发布工作流程。最终的工作流程如下例所示。

PDF OCR 示例自动化工作流程


试试看 PDF4me 工作流程​

打开工作流仪表板,创建一个工作流,并添加 PDF OCR 接下来,请在您自己的文档上运行此命令。