跳到主要内容

从中提取资源 PDF 使用 n8n 行动

PDF4me 提取资源 从文本中提取文本内容和嵌入的图像 PDF 通过文件 n8n 自动化工作流程。流程 PDF离开 n8n 触发器、二进制数据、base64 字符串或公共 URL该解决方案能够自动提取文本、图像、图形和视觉元素,并支持页面特定目标定位、选择性提取选项(仅文本、仅图像或两者兼有)以及结构化输出格式。它非常适合需要精确提取内容、灵活定位和无缝集成的内容重用、图像提取、文本分析、文档数字化、内容迁移和资源恢复工作流程。

相关博客文章
目前尚无关于此功能的博客文章——敬请期待。
在此期间,您可以浏览 PDF4me 博客,查看适用于各平台的教程和工作流程。
访问博客

设置

添加 PDF4me 将“提取资源”节点添加到您的 n8n 工作流程并配置所需参数。有关初始设置说明,请参阅我们的 n8n 集成指南

先决条件:

  • PDF4me API 证书
  • n8n 工作流访问

配置:

  1. 添加 PDF4me 节点到工作流
  2. 选择“提取资源”操作
  3. 配置输入参数(见下文)
提取资源配置

参数

以下是“提取资源”操作的完整参数列表。配置这些参数以控制资源提取。

重要的: 标有星号 (***) 的参数是必需的,必须提供这些参数才能使操作正常运行。

范围类型描述例子
输入数据类型***StringPDF 输入格式选择
• 选择您的格式 PDF 数据输入
PDF4me 支持多种输入类型
• 选项:二进制数据, Base64 字符串,或 URL
Binary Data
输入二进制字段二进制二进制 PDF 文件输入 (二进制数据必填)
• 参考 PDF 来自前一个文件 n8n 节点或文件上传
PDF4me 二进制进程 PDF 文件自动格式检测
• 当输入数据类型为“二进制数据”时为必填项
{{ $binary.data }}
Base64 PDF 内容StringBase64 编码 PDF 输入 (如果适用,则为必填项) Base64 细绳)
• 提供 PDF 内容以 base64 编码字符串的形式呈现
PDF4me 自动解码和处理 PDF 内容
• 当输入数据类型为“Base64 细绳”
JVBERi0x...
PDF URLString民众 PDF URL 输入 (如果适用,则为必填项) URL
• 提供公开/开放权限 URLPDF 文件
PDF4me 从……下载并处理文件 URL
• 当输入数据类型为“URL
https://abc.com/xyz.pdf
文件名称***String输入文件名
• 指定输入名称 PDF 文件
• 用于格式检测和处理优化
• 必须包含 .pdf 扩展名
document.pdf
提取文本Boolean文本提取切换
• 启用或禁用文本内容提取
• 启用后,提取所有可读文本内容
• 保留格式信息
true
提取图像Boolean图像提取切换
• 启用或禁用图像提取
• 启用后,提取所有嵌入的图像和图形
• 视觉元素保存为单独的文件
true

高级选项

以下参数可在“高级选项”部分中找到,且为可选参数:

范围类型描述例子
String页面范围规范
• 定义要处理哪些页面以提取资源
• 使用“全部”可指定整个文档、特定数字或范围。
• 例如:“1,3,5”(具体页码),“1-5,10-15”(页码范围)
all
自定义配置文件String自定义配置配置文件
• 使用自定义配置文件设置其他选项
JSON包含预定义参数的类似格式
• 启用高级提取处理设置
• 特殊需求可选
{ "outputDataFormat": "json" }

输出

输出参数

范围类型描述例子
文件名StringPDF4me 生成的文件名 - 已成功处理的文档的完整文件名,包括正确的文件扩展名和时间戳。 PDF4me 确保唯一命名并验证文件格式合规性,以便与下游流程无缝集成。extracted_resources_1756999816629.json
mimeTypeStringPDF4me MIME 类型标识符 - 标准化 MIME 提取的内容文件的类型,通常 application/json 对于结构化数据或 application/zip 支持多个文件。这确保了所有系统和应用程序都能正确处理和识别文件。application/json
文件大小数字PDF4me 文件大小(字节) - 提供提取内容文件的确切大小(以字节为单位),用于存储规划、带宽优化和文件传输监控。这对企业文档管理和工作流自动化至关重要。1945
成功BooleanPDF4me 提取状态指示器 - 指示资源提取过程成功或失败的布尔标志。返回 true 为了成功提取和 false 针对任何错误,在自动化工作流程中实现强大的错误处理能力。true
信息StringPDF4me 提取状态消息 - 描述资源提取过程结果的消息。为成功提取提供清晰的状态消息,并为故障排除提供详细的错误信息。Resource extraction completed successfully
文档名称StringPDF4me 原始文档名称参考 - 输入文件的原始文件名 PDF 已处理的文件。此引用用于审计跟踪、调试以及跟踪企业工作流程中提取内容的来源。document.pdf

N8N 行动反应

PDF4me 提取资源 API 返回的结果可以以多种格式查看。请选择最符合您需求的视图:

JSON 回复格式

原始 JSON 来自 API

{
"fileName": "extracted_resources_1756999816629.json",
"mimeType": "application/json",
"fileSize": 1945,
"success": true,
"message": "Resource extraction completed successfully",
"docName": "document.pdf"
}

用例

内容管理系统从……中提取文本和图像 PDF 用于集中式内容存储库的文档,实现文档内容的可搜索数据库。

数据处理流程自动从中提取结构化数据 PDF 用于与商业智能工具和分析平台集成的报告、发票和表格。

文档分析处理大量 PDF 文档用于提取特定信息,以进行合规性监控、研究和自动报告。

档案数字化转换旧版本 PDF 将档案转换为可搜索的结构化数据,用于现代内容管理和知识发现系统。

获取帮助