转变 PDF 可编辑 PDF 使用 OCR 使用 n8n 行动
PDF4me 转变 PDF 可编辑 PDF 使用 OCR 扫描变换 PDF将基于图像的文档转换为可搜索、可编辑的文档 PDFs 通过 n8n 自动化工作流程。流程 PDF离开 n8n 触发器、二进制数据、base64 字符串或公共 URL申请 OCR 支持多语言、质量等级选择(草稿/高)、条件 OCR 该解决方案支持文档处理、文本层创建、布局保留和可搜索内容生成,是文档数字化、扫描文档处理和发票处理的理想选择。 OCR存档转换,可搜索 PDF 创建和自动化 OCR 需要精确识别文本、保持格式并实现无缝集成的工作流程。
相关博客文章
目前尚无关于此功能的博客文章——敬请期待。
在此期间,您可以浏览 PDF4me 博客,查看适用于各平台的教程和工作流程。
访问博客 →
设置
添加 PDF4me “转变 PDF 可编辑 PDF 使用 OCR节点到您的 n8n 工作流程并配置所需参数。有关初始设置说明,请参阅我们的 n8n 集成指南。
先决条件:
- PDF4me API 证书
- n8n 工作流访问
配置:
- 添加 PDF4me 节点到工作流
- 选择“转换” PDF 可编辑 PDF 使用 OCR“ 行动
- 配置输入参数(见下文)

参数
Convert 函数的完整参数列表 PDF 可编辑 PDF 使用 OCR 操作。配置这些参数以控制 OCR 转换。
重要的: 标有星号 (***) 的参数是必需的,必须提供这些参数才能使操作正常运行。
| 范围 | 类型 | 描述 | 例子 |
|---|---|---|---|
| 输入数据类型*** | String | PDF 输入格式选择 • 选择您的格式 PDF 文档输入 • PDF4me 支持多种输入类型 OCR 转换 • 选项:二进制数据, Base64 字符串,或 URL | Binary Data |
| 输入二进制字段 | 二进制 | 二进制 PDF 文件输入 (二进制数据必填) • 参考 PDF 来自前一个文件 n8n 节点或文件上传 • 适用于扫描件 PDFs,基于图像的 PDF以及混合内容 • 当输入数据类型为“二进制数据”时为必填项 | {{ $binary.data }} |
| Base64 PDF 内容 | String | Base64 编码 PDF 输入 (如果适用,则为必填项) Base64 细绳) • 提供 PDF 内容以 base64 编码字符串的形式呈现 • 支持多种 PDF 格式包括扫描文档 • 当输入数据类型为“Base64 细绳” | JVBE... |
| PDF URL | String | 民众 PDF URL 输入 (如果适用,则为必填项) URL) • 提供公开/开放权限 URL 到 PDF 文件 • 下载并处理文档 OCR 转换 • 当输入数据类型为“URL“ | https://abc.com/scanned.pdf |
| 文件名称*** | String | 输入文件名 • 指定输入名称 PDF 文件 • 重要性 OCR 质量和文本识别准确率 • 必须包含 .pdf 扩展名 | scanned_document.pdf |
| 质量类型*** | String | OCR 品质甄选 • 选择 OCR 加工质量水平 • 草稿:适合正常 PDFs(1 API 按文件调用) • 高:适用于图像/扫描文档(2 API 每页调用次数) | Draft |
| 仅在需要时进行OCR识别*** | Boolean | 条件 OCR 加工 • 真:应用 OCR 仅当 PDF 是基于图像的还是不可搜索的 • 错误:应用 OCR 无论现有文本层如何,所有内容均适用 • 优化处理和 API 消耗 | True |
| 语言*** | String | OCR 语言设置 • 在文中明确指出文本的主要语言。 PDF • 优化 OCR 提高文本识别准确率 • 默认语言为英语,也提供其他语言。 | English |
| 输出格式*** | Boolean | 输出格式控制 • 正确:启用可编辑对象的高级格式设置选项 PDF • 确保更好地保留布局和结构 • 推荐用于维护文档格式 | true |
| 合并所有工作表*** | Boolean | 表格合并控制 • 正确:将所有工作表/页面合并成一个连续的文档 • 错误:保持页面结构和格式不变 • 根据所需的输出结构进行选择 | True |
| 输出文件名*** | String | 输出文件名 • 指定生成的可编辑文件的名称 PDF 文件 • 必须包含 .pdf 扩展名 • PDF4me 确保唯一命名和格式验证 | editable_pdf_output.pdf |
| 输出二进制字段名称*** | String | 二进制数据映射 • 定义用于访问生成的可编辑文件的变量名 PDF 数据 • 用于后续工作流程操作 • 对工作流程数据流至关重要 | data |
高级选项
以下参数可在“高级选项”部分中找到,且为可选参数:
| 范围 | 类型 | 描述 | 例子 |
|---|---|---|---|
| 自定义配置文件 | String | 自定义配置配置文件 • 使用自定义配置文件设置其他选项 • JSON包含预定义格式的类似格式 OCR 参数 • 包括语言检测、文本识别准确率、格式保留 • 特殊需求可选 | { "language": "auto", "accuracy": "high", "preserveFormatting": true } |
输出
输出参数
| 范围 | 类型 | 描述 | 例子 |
|---|---|---|---|
| 成功 | Boolean | PDF4me OCR 转换状态指示器 - 布尔标志,指示成功或失败 OCR 转换过程。退货 true 为了成功转化和 false 针对任何错误,在自动化工作流程中实现强大的错误处理能力。 | true |
| 信息 | String | PDF4me OCR 转换状态消息 - 描述结果的说明信息 OCR 转换过程。为转换成功提供清晰的状态消息,并为故障排除提供详细的错误信息。 | PDF converted to editable PDF using OCR successfully |
| 文件名 | String | PDF4me 生成的文件名 - 成功处理的可编辑文件的完整文件名 PDF 带有正确扩展名的文件。 PDF4me 确保唯一命名并验证文件格式合规性,以便与下游流程无缝集成。 | editable_pdf_output.pdf |
| mimeType | String | PDF4me MIME 类型标识符 - 标准化 MIME 生成的可编辑文本的类型 PDF 文件,始终设置为 application/pdf 经过 PDF4me的 OCR 处理引擎。这确保了所有系统和应用程序都能正确处理和识别文件。 | application/pdf |
| 文件大小 | 数字 | PDF4me 文件大小(字节) - 生成的可编辑对象的确切大小 PDF 文件大小以字节为单位,用于存储规划、带宽优化和文件传输监控。对企业文档管理和工作流自动化至关重要。 | 121875 |
| 质量类型 | String | PDF4me OCR 使用的质量设置 - 在以下过程中应用的质量设置 OCR 转换过程。显示用于文本识别和文档处理的实际质量级别。常用值包括“草稿”、“高”和“存档”。 | Draft |
| 需要时使用 OCR | String | PDF4me OCR 条件处理设置 - 表示是否 OCR 可根据需要有条件地应用(仅在需要时应用)或应用于所有内容。显示处理过程中使用的实际设置,用于验证和调试目的。 | true |
| 语言 | String | PDF4me OCR 使用的语言设置 - 在以下过程中应用的语言设置 OCR 转换过程。显示用于文本识别的实际语言,以优化准确率和处理速度。 | English |
| 合并所有工作表 | Boolean | PDF4me 使用的表格合并设置 - 指示在处理过程中是否将所有工作表或页面合并到单个文档中。显示应用于文档结构处理的实际设置。 | false |
N8N 行动反应
这 PDF4me 转变 PDF 可编辑 PDF 使用 OCR API 返回的结果可以以多种格式查看。请选择最符合您需求的视图:
- JSON
- Table
- Schema
- Binary
JSON 回复格式
原始 JSON 来自……的回应 API:
{
"success": true,
"message": "PDF converted to editable PDF using OCR successfully",
"fileName": "editable_pdf_output.pdf",
"mimeType": "application/pdf",
"fileSize": 121875,
"qualityType": "Draft",
"ocrWhenNeeded": "true",
"language": "English",
"mergeAllSheets": false
}
表格视图
以结构化表格格式呈现的响应数据:
| 范围 | 价值 |
|---|---|
| success | true |
| message | PDF 已转换为可编辑格式 PDF 使用 OCR 成功地 |
| fileName | editable_pdf_output.pdf |
| mimeType | application/pdf |
| fileSize | 121875 |
| qualityType | Draft |
| ocrWhenNeeded | true |
| language | English |
| mergeAllSheets | false |
架构视图
响应的数据结构和类型:
success: ✓ true
message: AB PDF converted to editable PDF using OCR successfully
fileName: AB editable_pdf_output.pdf
mimeType: AB application/pdf
fileSize: # 121875
qualityType: AB Draft
ocrWhenNeeded: AB true
language: AB English
mergeAllSheets: ✓ false
类型指示器:
AB= String#= 数字✓= Boolean
二进制数据视图
实际可编辑部分 PDF 文件数据和元数据:
data
─────────────────────────────────────────
File Name: editable_pdf_output.pdf
File Extension: pdf
Mime Type: application/pdf
File Size: 119.0 KB
用例
文件数字化和归档
- 将纸质文档和扫描文件转换为可搜索、可编辑的数字格式
- 将历史档案和遗留文件数字化,以便于现代访问和保存。
- 将纸质表格和文件转换为可编辑的数字版本
内容管理和可搜索性
- 使扫描文档可搜索,以便用于内容管理系统
- 启用先前无法搜索的文档的全文搜索功能
- 转换基于图像的 PDF将内容转换为易于访问、可编辑的内容,以获得更好的用户体验
工作流自动化和处理
- 在文档处理工作流程中自动转换扫描文档
- 处理收到的纸质文件,实现数据自动提取和分析
- 启用对先前静态文档内容的下游处理