PDF OCR
对扫描件进行光学字符识别。 PDF 或者输入一张图片,这样图片中的文字就变成了真实的、可选择的文本。该操作会读取页面图像中的字符,并在其后添加一个文本图层,从而允许您搜索文档、从中复制文本,并让索引工具读取其内容。输入内容为单个扫描件。 PDF 或图像文件。输出为单个文件。 PDF 看起来一样,但现在包含可搜索的文本。
当需要按关键词搜索扫描的合同或发票文件夹、需要从拍摄的收据或表格中复制数字,或者需要通过全文搜索或文档管理系统读取存档的纸质记录时,就可以使用它。
配置
配置 PDF OCR 工作流程构建器中的步骤:

行动概述
| 输入 | 单次扫描 PDF 文档或图像文件 |
| 输出 | 一个可搜索的单一平台 PDF 带有可选文本图层 |
特性
质量
- 类型: 选择
- 默认: 草稿
设定识别质量 OCR 默认设置为“草稿”,速度最快。下拉菜单提供更高质量的设置,可以提高对模糊、倾斜或低分辨率扫描件的准确性,但会增加处理时间。对于清晰、高分辨率的页面,请保持设置为“草稿”;如果源扫描件难以辨认,请提高设置。
做 OCR 需要时
- 类型: 布尔值
- 默认: 离开
控制操作是否在运行识别之前检查每个文档。启用后,它会跳过已包含文本层的文件并直接运行识别。 OCR 仅对需要搜索的文档执行此操作,避免对已可搜索的文件进行不必要的处理。关闭时,它不会运行。 OCR 对经过此步骤的每个文档都执行此操作。当输入文件混合了扫描文件时,启用此功能。 PDFs 已经可以搜索到的。
如何运行 PDF OCR 使用工作流
当您需要处理数百份扫描文档时,自动化是唯一可行的方法。 PDF4me 工作流可以运行 OCR 对每个到达的文件进行处理。以下是一个识别扫描文件中文本的示例工作流程。 PDFs 以及图像,并生成可搜索的内容 PDF。
创建工作流程
打开 工作流程仪表盘 并选择 创建工作流 开始构建您的自动化流程。
添加触发器
添加并配置一个触发器来启动工作流。一旦配置的文件夹中有新文件到达,自动化流程就会运行。此示例使用 Google Drive 扳机。 PDF4me 工作流也支持 Dropbox 触发器有很多种,您可以选择适合您工作流程的触发器。
添加 PDF OCR 行动
添加和配置 PDF OCR 操作。启用 做 OCR 必要时 以便 OCR 仅对需要运行的文档运行,避免不必要的处理调用。
添加“保存到存储”操作
文件处理完毕后,将其保存到您的存储空间。对于此用例,请添加并配置一个 保存到 Google Drive 执行操作并设置要保存处理后文件的文件夹。

发布工作流程
配置完成后,选择 节省 发布工作流程。最终的工作流程如下例所示。

试试看 PDF4me 工作流程
打开工作流仪表板,创建一个工作流,并添加 PDF OCR 接下来,请在您自己的文档上运行此命令。