使用表达式提取文本 n8n 行动
PDF4me 通过表达式提取文本 从文本中提取特定内容 PDF 通过模式匹配和基于表达式的过滤来处理文档 n8n 自动化工作流程。流程 PDF离开 n8n 触发器、二进制数据、base64 字符串或公共 URL该解决方案利用通配符模式(%)、正则表达式、特定数据字段、页面定位以及灵活的提取规则,定位并提取文本,并生成结构化输出。它非常适合需要精确文本定位、灵活匹配和无缝集成的场景,例如发票号码提取、数据字段捕获、基于模式的文本检索、自动化数据提取、文档解析和内容分析等工作流程。
相关博客文章
目前尚无关于此功能的博客文章——敬请期待。
在此期间,您可以浏览 PDF4me 博客,查看适用于各平台的教程和工作流程。
访问博客 →
设置
添加 PDF4me 将“按表达式提取文本”节点添加到您的 n8n 工作流程并配置所需参数。有关初始设置说明,请参阅我们的 n8n 集成指南。
先决条件:
- PDF4me API 证书
- n8n 工作流访问
配置:
- 添加 PDF4me 节点到工作流
- 选择“按表达式提取文本”操作
- 配置输入参数(见下文)

参数
以下是“按表达式提取文本”操作的完整参数列表。配置这些参数可以控制文本提取。
重要的: 标有星号 (***) 的参数是必需的,必须提供这些参数才能使操作正常运行。
| 范围 | 类型 | 描述 | 例子 |
|---|---|---|---|
| 输入数据类型*** | String | PDF 输入格式选择 • 选择您的格式 PDF 数据输入 • PDF4me 支持多种输入类型 • 选项:二进制数据, Base64 字符串,或 URL | Binary Data |
| 输入二进制字段 | 二进制 | 二进制 PDF 文件输入 (二进制数据必填) • 参考 PDF 来自前一个文件 n8n 节点或文件上传 • PDF4me 二进制进程 PDF 文件自动格式检测 • 当输入数据类型为“二进制数据”时为必填项 | {{ $binary.data }} |
| Base64 PDF 内容 | String | Base64 编码 PDF 输入 (如果适用,则为必填项) Base64 细绳) • 提供 PDF 内容以 base64 编码字符串的形式呈现 • PDF4me 自动解码和处理 PDF 内容 • 当输入数据类型为“Base64 细绳” | JVBER... |
| PDF URL | String | 民众 PDF URL 输入 (如果适用,则为必填项) URL) • 提供公开/开放权限 URL 到 PDF 文件 • PDF4me 从……下载并处理文件 URL • 当输入数据类型为“URL“ | https://abc.com/document.pdf |
| 文件名称*** | String | 输入文件名 • 指定输入名称 PDF 文件 • 用于格式检测和处理优化 • 必须包含 .pdf 扩展名 | document.pdf |
| 表达*** | String | 文本提取模式 • 定义用于匹配文本内容的模式或表达式 • 支持正则表达式模式、通配符和自定义表达式 • 使用 % 用于通配符匹配或特定正则表达式模式 | % |
| 页面顺序*** | String | 页面范围规范 • 定义要处理哪些页面以提取文本 • 使用“全部”可指定整个文档,也可指定特定的页码/页码范围。 • 例如:“1,3,5”(具体),“1-5”(范围),“1-”(从第 1 页到最后一页) | 1- |
高级选项
以下参数可在“高级选项”部分中找到,且为可选参数:
| 范围 | 类型 | 描述 | 例子 |
|---|---|---|---|
| 自定义配置文件 | String | 自定义配置配置文件 • 使用自定义配置文件设置其他选项 • JSON包含预定义参数的类似格式 • 启用高级提取处理设置 • 特殊需求可选 | { "outputDataFormat": "json" } |
输出
输出参数
| 范围 | 类型 | 描述 | 例子 |
|---|---|---|---|
| 文件名 | String | PDF4me 生成的文件名 - 已成功处理的文档的完整文件名,包括正确的扩展名和时间戳。 PDF4me 确保唯一命名并验证文件格式合规性,以便与下游流程无缝集成。 | text_extraction_results_1756999697398.json |
| mimeType | String | PDF4me MIME 类型标识符 - 标准化 MIME 提取的内容文件的类型,通常 application/json 对于结构化数据或 application/zip 支持多个文件。这确保了所有系统和应用程序都能正确处理和识别文件。 | application/json |
| 文件大小 | 数字 | PDF4me 文件大小(字节) - 提供提取内容文件的确切大小(以字节为单位),用于存储规划、带宽优化和文件传输监控。这对企业文档管理和工作流自动化至关重要。 | 106 |
| 成功 | Boolean | PDF4me 提取状态指示器 - 指示文本提取过程成功或失败的布尔标志。返回 true 为了成功提取和 false 针对任何错误,在自动化工作流程中实现强大的错误处理能力。 | true |
| 信息 | String | PDF4me 提取状态消息 - 描述文本提取结果的消息。为成功提取提供清晰的状态消息,并为故障排除提供详细的错误信息。 | Text extraction by expression completed successfully |
| 文档名称 | String | PDF4me 原始文档名称参考 - 输入文件的原始文件名 PDF 已处理的文件。此引用用于审计跟踪、调试以及跟踪企业工作流程中提取内容的来源。 | document.pdf |
| 表达 | String | PDF4me 使用的提取表达式 - 用于文本提取的模式或表达式。此字段显示提取过程中实际应用的表达式,以便进行验证和调试。 | % |
| 页面序列 | String | PDF4me 已处理页面范围 - 文本提取过程中处理的页面范围。此字段显示针对指定表达式实际扫描的页面,有助于验证和故障排除。 | 1-2 |
N8N 行动反应
这 PDF4me 通过表达式提取文本 API 返回的结果可以以多种格式查看。请选择最符合您需求的视图:
- JSON
- Table
- Schema
- Binary
JSON 回复格式
原始 JSON 来自 API:
{
"fileName": "text_extraction_results_1756999697398.json",
"mimeType": "application/json",
"fileSize": 106,
"success": true,
"message": "Text extraction by expression completed successfully",
"docName": "document.pdf",
"expression": "%",
"pageSequence": "1-2"
}
表格视图
以结构化表格格式呈现的响应数据:
| 范围 | 价值 |
|---|---|
| fileName | text_extraction_results_1756999697398.json |
| mimeType | application/json |
| fileSize | 106 |
| success | true |
| docName | document.pdf |
| message | Text extraction by expression completed successfully |
| expression | % |
| pageSequence | 1-2 |
架构视图
响应的数据结构和类型:
fileName: AB text_extraction_results_1756999697398.json
mimeType: AB application/json
fileSize: # 106
success: ✓ true
docName: AB document.pdf
message: AB Text extraction by expression completed successfully
expression: AB %
pageSequence: AB 1-2
类型指示器:
AB= String#= 数字✓= Boolean
二进制数据视图
实际提取的文本内容数据和元数据:
data
─────────────────────────────────────────
File Name: text_extraction_results_1756999697398.json
File Extension: json
Mime Type: application/json
File Size: 106 bytes
用例
数据挖掘与信息提取
- 从中提取特定数据模式、联系信息和结构化数据 PDF 使用自定义表达式进行数据挖掘和商业智能的文档
- 利用目标表达式提取特定条款、条件和法律信息,从而处理法律文件、合同和官方记录。
- 使用自定义表达式提取特定的财务数据、金额和交易信息,从而转换财务报告、发票和会计凭证。
内容分析与研究
- 从中提取研究数据、引文和学术信息 PDF 使用自定义表达式的文档,用于学术研究和内容分析
- 利用目标表达式提取特定数据、测量结果和研究成果,从而处理科学论文、研究文档和技术出版物。
- 利用自定义表达式提取特定指标、统计数据和业务数据,从而转换业务报告、市场调研和行业分析。
合规与监管流程
- 从以下来源提取合规数据、监管信息和审计详情 PDF 使用自定义表达式的文档,用于监管合规性和审计处理
- 通过提取特定的合规数据、标准和法规信息,处理质量控制文件、检验报告和认证材料。
- 使用自定义表达式提取特定的监管数据、合规指标和官方信息,从而转换官方文件、许可证和监管备案文件。