分裂 PDF 通过文本 n8n 行动
PDF4me 分裂 PDF 通过文本 分割 PDF 通过检测文本模式和内容生成文档 n8n 自动化工作流程。流程 PDFs 通过 n8n 触发器、二进制数据、base64 字符串或公共 URLs 该解决方案能够自动查找特定文本字符串,按文本位置拆分文档,并利用检测到的内容进行智能文件命名,从而更好地组织文件。它非常适合需要精确文本检测、智能文档拆分和无缝集成的场景,例如发票拆分、合同拆分、批量文档处理、基于内容的组织、自动归档以及基于文本的文档排序等工作流程。
相关博客文章
目前尚无关于此功能的博客文章——敬请期待。
在此期间,您可以浏览 PDF4me 博客,查看适用于各平台的教程和工作流程。
访问博客 →
设置
添加 PDF4me “分裂 PDF 通过“文本”节点连接到您的 n8n 工作流程并配置所需参数。有关初始设置说明,请参阅我们的 n8n 集成指南。
先决条件:
- PDF4me API 证书
- n8n 工作流访问
配置:
- 添加 PDF4me 节点到工作流
- 选择“拆分” PDF 通过文本”操作
- 配置输入参数(见下文)

参数
Split 的完整参数列表 PDF 通过文本操作。配置这些参数以控制基于文本的操作。 PDF 分裂。
重要的: 标有星号 (***) 的参数是必需的,必须提供这些参数才能使操作正常运行。
| 范围 | 类型 | 描述 | 例子 |
|---|---|---|---|
| 输入数据类型*** | String | PDF 输入格式选择 • 选择您的格式 PDF 数据输入 • PDF4me 支持多种输入类型 • 选项:二进制数据、Base64 字符串或 URL | Binary Data |
| 二进制属性名称 | String | 二进制 PDF 文件输入 (二进制数据必填) • 参考 PDF 来自前一个文件 n8n 节点或文件上传 • PDF4me 二进制进程 PDF 文件自动格式检测 • 当输入数据类型为“二进制数据”时为必填项 | data |
| Base64 文档内容 | String | Base64 编码 PDF 输入 (如果是 Base64 字符串则为必填项) • 提供 PDF 数据以 base64 编码字符串的形式呈现 • PDF4me 自动解码和处理 PDF 内容 • 当输入数据类型为“Base64 细绳” | UEsDBBQABgAI... |
| 文件 URL | String | 民众 PDF URL 输入 (如果是 URL,则为必填项) • 提供公开/开放权限 URL 到 PDF 文件 • PDF4me 从……下载并处理文件 URL • 当输入数据类型为“URL“ | https://abc.com/sample.pdf |
| 搜索文本*** | String | 文本搜索规范 • 指定要在范围内搜索的确切文本字符串 PDF • PDF4me 使用此文本作为分割文档的分割点 • 区分大小写匹配,实现精确文本检测 | page 1, line 10. |
| 分页文字*** | String | 分裂位置选择 • 选择分割点 PDF 相对于检测到的文本 • 选项:页面后分割(在页面后分割),页面前分割(在页面前分割) • PDF4me 提供灵活的分割定位 | After |
| 文件命名*** | String | 输出文件命名约定 • 选择生成的拆分方式 PDF 文件应命名 • 选项:按顺序命名,按页码命名(带页码) • 帮助整理输出文件 | Name As Per Order |
| 文件名*** | String | 输出文件名规范 • 指定生成的拆分名称 PDF 文件 • 必须包含 .pdf 扩展名 • PDF4me 确保唯一命名和格式验证 | output.pdf |
| 输出二进制字段名称*** | String | 二进制数据映射 • 定义用于访问生成的拆分数据的变量名 PDF 数据 • 用于后续工作流程操作 • 对工作流程数据流至关重要 | data |
高级选项
以下参数可在“高级选项”部分中找到,且为可选参数:
| 范围 | 类型 | 描述 | 例子 |
|---|---|---|---|
| 自定义配置文件 | String | 自定义配置配置文件 • 使用自定义配置文件设置其他选项 • JSON包含预定义参数的类似格式 • 支持 outputDataFormat、preserveMetadata 等。 • 特殊需求可选 | { "outputDataFormat": "base64", "preserveMetadata": true, "optimizeForPrinting": false, "compressionLevel": "medium" } |
输出
输出参数
| 范围 | 类型 | 描述 | 例子 |
|---|---|---|---|
| 成功 | Boolean | PDF4me 文本分割操作状态指示器 - Boolean 指示成功或失败的标志 PDF 文本分割过程。 PDF4me 返回 true 为了成功运营和 false 针对任何错误,在自动化工作流程中实现强大的错误处理能力。 | true |
| 信息 | String | PDF4me 文本分割操作状态消息 - 提供文本拆分处理结果详细信息的易于理解的状态消息。包括成功确认或错误详情,以便进行故障排除。 | PDF split by text successfully |
| 文件名 | String | PDF4me 生成的拆分 PDF 文件名 - 成功生成的分割文件的完整文件名 PDF 文档必须具有正确的 .pdf 扩展名。 PDF4me 确保唯一命名并验证文件格式合规性,以便与下游流程无缝集成。 | text_split_output.pdf |
| mimeType | String | PDF4me 输出 MIME 类型 - MIME 生成的类型 PDF 文件,始终为“application/pdf” PDF 文档。对 Web 应用程序中的内容类型验证和正确的文件处理非常有用。 | application/pdf |
| 文件大小 | 数字 | PDF4me 分裂 PDF 文件大小(字节) - 生成的分割的确切大小 PDF 文件大小以字节为单位,由 PDF4me 用于存储规划、带宽优化和文件传输监控。对企业文档管理和工作流自动化至关重要。 | 125430 |
| 文档名称 | String | PDF4me 文档名称引用 - 用于参考和跟踪的已处理拆分文档的名称。这与 fileName 为了保持文档管理工作流程的一致性 | text_split_output.pdf |
| 文本分割完成 | Boolean | PDF4me 文本分割完成确认 - Boolean 旗帜确认 PDF 文本分割操作已成功完成。可用于验证基于文本的分割是否已正确应用。 | true |
| 找到的文本匹配项 | 数字 | PDF4me 检测到的文本匹配计数 - 成功找到并用作分割点的文本匹配数量 PDF 文档。可用于跟踪文本检测效果和分割准确率。 | 3 |
| 文件已生成 | 数字 | PDF4me 拆分文件生成的计数 - 个人数量 PDF 成功从文本分割操作生成的文件。可用于跟踪分割完整性和文档分割结果。 | 4 |
N8N 行动反应
这 PDF4me 分裂 PDF 通过文本 API 返回的结果可以以多种格式查看。请选择最符合您需求的视图:
- JSON
- Table
- Schema
- Binary
JSON 回复格式
原始 JSON 来自 API:
[
{
"success": true,
"message": "PDF split by text successfully",
"fileName": "text_split_output.pdf",
"mimeType": "application/pdf",
"fileSize": 125430,
"docName": "text_split_output.pdf",
"textSplitCompleted": true,
"textMatchesFound": 3,
"filesGenerated": 4
}
]
表格视图
以结构化表格格式呈现的响应数据:
| 范围 | 价值 |
|---|---|
| success | true |
| message | PDF split by text successfully |
| fileName | text_split_output.pdf |
| mimeType | application/pdf |
| fileSize | 125430 |
| docName | text_split_output.pdf |
| textSplitCompleted | true |
| textMatchesFound | 3 |
| filesGenerated | 4 |
架构视图
响应的数据结构和类型:
1 item
success: ☑ true
message: AB PDF split by text successfully
fileName: AB text_split_output.pdf
mimeType: AB application/pdf
fileSize: # 125430
docName: AB text_split_output.pdf
textSplitCompleted: ☑ true
textMatchesFound: # 3
filesGenerated: # 4
类型指示器:
AB= String#= 数字☑= Boolean
二进制数据视图
实际的拆分 PDF 文件数据和元数据:
data
─────────────────────────────
File Name: text_split_output.pdf
File Extension: pdf
Mime Type: application/pdf
File Size: 122.5 KB
二进制数据访问:
- n8n 二进制对象:
$binary.data.data - Base64 内容可直接使用
- 文件操作可供下载、通过电子邮件发送或存储
用例
文档处理和内容管理
- 在特定文本标记或章节标题处拆分大型文档,以便为不同部门或流程创建组织有序、易于管理的文件。
- 处理法律文件时,根据特定的条款标记或章节分隔符进行拆分,为每个法律章节创建单独的文件。
- 根据章节标题或小节标题自动拆分报告和手册,以便更好地组织内容。
业务流程自动化
- 通过搜索特定文本模式(例如“发票编号”或“到期付款”)来拆分发票批次,从而为每笔交易创建单独的发票文件。
- 处理合同和协议时,根据“章节”或“条款”等特定文本标记进行拆分,为每个章节创建单独的文件。
- 通过按文本模式(例如“季度报告”或“年度汇总”)拆分财务文档,实现不同报告期的财务文档自动整理。
内容分发和工作流程管理
- 根据访问要求,在特定文本标记处分割机密文档,为不同的利益相关者创建单独的文件。
- 将培训材料按“模块”或“课程”等文本模式拆分,为不同的受众创建单独的学习模块。
- 通过按文本标记(例如“API 参考”或“用户指南”)拆分技术文档,实现技术文档的自动化组织,以适应不同的用户类型。