跳到主要内容

使用表达式提取文本 n8n 行动

PDF4me 通过表达式提取文本 从文本中提取特定内容 PDF 通过模式匹配和基于表达式的过滤来处理文档 n8n 自动化工作流程。流程 PDF离开 n8n 触发器、二进制数据、base64 字符串或公共 URL该解决方案利用通配符模式(%)、正则表达式、特定数据字段、页面定位以及灵活的提取规则,定位并提取文本,并生成结构化输出。它非常适合需要精确文本定位、灵活匹配和无缝集成的场景,例如发票号码提取、数据字段捕获、基于模式的文本检索、自动化数据提取、文档解析和内容分析等工作流程。

相关博客文章
目前尚无关于此功能的博客文章——敬请期待。
在此期间,您可以浏览 PDF4me 博客,查看适用于各平台的教程和工作流程。
访问博客

设置

添加 PDF4me 将“按表达式提取文本”节点添加到您的 n8n 工作流程并配置所需参数。有关初始设置说明,请参阅我们的 n8n 集成指南

先决条件:

  • PDF4me API 证书
  • n8n 工作流访问

配置:

  1. 添加 PDF4me 节点到工作流
  2. 选择“按表达式提取文本”操作
  3. 配置输入参数(见下文)
按表达式配置提取文本

参数

以下是“按表达式提取文本”操作的完整参数列表。配置这些参数可以控制文本提取。

重要的: 标有星号 (***) 的参数是必需的,必须提供这些参数才能使操作正常运行。

范围类型描述例子
输入数据类型***StringPDF 输入格式选择
• 选择您的格式 PDF 数据输入
PDF4me 支持多种输入类型
• 选项:二进制数据, Base64 字符串,或 URL
Binary Data
输入二进制字段二进制二进制 PDF 文件输入 (二进制数据必填)
• 参考 PDF 来自前一个文件 n8n 节点或文件上传
PDF4me 二进制进程 PDF 文件自动格式检测
• 当输入数据类型为“二进制数据”时为必填项
{{ $binary.data }}
Base64 PDF 内容StringBase64 编码 PDF 输入 (如果适用,则为必填项) Base64 细绳)
• 提供 PDF 内容以 base64 编码字符串的形式呈现
PDF4me 自动解码和处理 PDF 内容
• 当输入数据类型为“Base64 细绳”
JVBER...
PDF URLString民众 PDF URL 输入 (如果适用,则为必填项) URL
• 提供公开/开放权限 URLPDF 文件
PDF4me 从……下载并处理文件 URL
• 当输入数据类型为“URL
https://abc.com/document.pdf
文件名称***String输入文件名
• 指定输入名称 PDF 文件
• 用于格式检测和处理优化
• 必须包含 .pdf 扩展名
document.pdf
表达***String文本提取模式
• 定义用于匹配文本内容的模式或表达式
• 支持正则表达式模式、通配符和自定义表达式
• 使用 % 用于通配符匹配或特定正则表达式模式
%
页面顺序***String页面范围规范
• 定义要处理哪些页面以提取文本
• 使用“全部”可指定整个文档,也可指定特定的页码/页码范围。
• 例如:“1,3,5”(具体),“1-5”(范围),“1-”(从第 1 页到最后一页)
1-

高级选项

以下参数可在“高级选项”部分中找到,且为可选参数:

范围类型描述例子
自定义配置文件String自定义配置配置文件
• 使用自定义配置文件设置其他选项
JSON包含预定义参数的类似格式
• 启用高级提取处理设置
• 特殊需求可选
{ "outputDataFormat": "json" }

输出

输出参数

范围类型描述例子
文件名StringPDF4me 生成的文件名 - 已成功处理的文档的完整文件名,包括正确的扩展名和时间戳。 PDF4me 确保唯一命名并验证文件格式合规性,以便与下游流程无缝集成。text_extraction_results_1756999697398.json
mimeTypeStringPDF4me MIME 类型标识符 - 标准化 MIME 提取的内容文件的类型,通常 application/json 对于结构化数据或 application/zip 支持多个文件。这确保了所有系统和应用程序都能正确处理和识别文件。application/json
文件大小数字PDF4me 文件大小(字节) - 提供提取内容文件的确切大小(以字节为单位),用于存储规划、带宽优化和文件传输监控。这对企业文档管理和工作流自动化至关重要。106
成功BooleanPDF4me 提取状态指示器 - 指示文本提取过程成功或失败的布尔标志。返回 true 为了成功提取和 false 针对任何错误,在自动化工作流程中实现强大的错误处理能力。true
信息StringPDF4me 提取状态消息 - 描述文本提取结果的消息。为成功提取提供清晰的状态消息,并为故障排除提供详细的错误信息。Text extraction by expression completed successfully
文档名称StringPDF4me 原始文档名称参考 - 输入文件的原始文件名 PDF 已处理的文件。此引用用于审计跟踪、调试以及跟踪企业工作流程中提取内容的来源。document.pdf
表达StringPDF4me 使用的提取表达式 - 用于文本提取的模式或表达式。此字段显示提取过程中实际应用的表达式,以便进行验证和调试。%
页面序列StringPDF4me 已处理页面范围 - 文本提取过程中处理的页面范围。此字段显示针对指定表达式实际扫描的页面,有助于验证和故障排除。1-2

N8N 行动反应

PDF4me 通过表达式提取文本 API 返回的结果可以以多种格式查看。请选择最符合您需求的视图:

JSON 回复格式

原始 JSON 来自 API

{
"fileName": "text_extraction_results_1756999697398.json",
"mimeType": "application/json",
"fileSize": 106,
"success": true,
"message": "Text extraction by expression completed successfully",
"docName": "document.pdf",
"expression": "%",
"pageSequence": "1-2"
}

用例

数据挖掘与信息提取

  • 从中提取特定数据模式、联系信息和结构化数据 PDF 使用自定义表达式进行数据挖掘和商业智能的文档
  • 利用目标表达式提取特定条款、条件和法律信息,从而处理法律文件、合同和官方记录。
  • 使用自定义表达式提取特定的财务数据、金额和交易信息,从而转换财务报告、发票和会计凭证。

内容分析与研究

  • 从中提取研究数据、引文和学术信息 PDF 使用自定义表达式的文档,用于学术研究和内容分析
  • 利用目标表达式提取特定数据、测量结果和研究成果,从而处理科学论文、研究文档和技术出版物。
  • 利用自定义表达式提取特定指标、统计数据和业务数据,从而转换业务报告、市场调研和行业分析。

合规与监管流程

  • 从以下来源提取合规数据、监管信息和审计详情 PDF 使用自定义表达式的文档,用于监管合规性和审计处理
  • 通过提取特定的合规数据、标准和法规信息,处理质量控制文件、检验报告和认证材料。
  • 使用自定义表达式提取特定的监管数据、合规指标和官方信息,从而转换官方文件、许可证和监管备案文件。

获取帮助