从中提取资源 PDF 使用 n8n 行动
PDF4me 提取资源 从文本中提取文本内容和嵌入的图像 PDF 通过文件 n8n 自动化工作流程。流程 PDF离开 n8n 触发器、二进制数据、base64 字符串或公共 URL该解决方案能够自动提取文本、图像、图形和视觉元素,并支持页面特定目标定位、选择性提取选项(仅文本、仅图像或两者兼有)以及结构化输出格式。它非常适合需要精确提取内容、灵活定位和无缝集成的内容重用、图像提取、文本分析、文档数字化、内容迁移和资源恢复工作流程。
相关博客文章
目前尚无关于此功能的博客文章——敬请期待。
在此期间,您可以浏览 PDF4me 博客,查看适用于各平台的教程和工作流程。
访问博客 →
设置
添加 PDF4me 将“提取资源”节点添加到您的 n8n 工作流程并配置所需参数。有关初始设置说明,请参阅我们的 n8n 集成指南。
先决条件:
- PDF4me API 证书
- n8n 工作流访问
配置:
- 添加 PDF4me 节点到工作流
- 选择“提取资源”操作
- 配置输入参数(见下文)

参数
以下是“提取资源”操作的完整参数列表。配置这些参数以控制资源提取。
重要的: 标有星号 (***) 的参数是必需的,必须提供这些参数才能使操作正常运行。
| 范围 | 类型 | 描述 | 例子 |
|---|---|---|---|
| 输入数据类型*** | String | PDF 输入格式选择 • 选择您的格式 PDF 数据输入 • PDF4me 支持多种输入类型 • 选项:二进制数据, Base64 字符串,或 URL | Binary Data |
| 输入二进制字段 | 二进制 | 二进制 PDF 文件输入 (二进制数据必填) • 参考 PDF 来自前一个文件 n8n 节点或文件上传 • PDF4me 二进制进程 PDF 文件自动格式检测 • 当输入数据类型为“二进制数据”时为必填项 | {{ $binary.data }} |
| Base64 PDF 内容 | String | Base64 编码 PDF 输入 (如果适用,则为必填项) Base64 细绳) • 提供 PDF 内容以 base64 编码字符串的形式呈现 • PDF4me 自动解码和处理 PDF 内容 • 当输入数据类型为“Base64 细绳” | JVBERi0x... |
| PDF URL | String | 民众 PDF URL 输入 (如果适用,则为必填项) URL) • 提供公开/开放权限 URL 到 PDF 文件 • PDF4me 从……下载并处理文件 URL • 当输入数据类型为“URL“ | https://abc.com/xyz.pdf |
| 文件名称*** | String | 输入文件名 • 指定输入名称 PDF 文件 • 用于格式检测和处理优化 • 必须包含 .pdf 扩展名 | document.pdf |
| 提取文本 | Boolean | 文本提取切换 • 启用或禁用文本内容提取 • 启用后,提取所有可读文本内容 • 保留格式信息 | true |
| 提取图像 | Boolean | 图像提取切换 • 启用或禁用图像提取 • 启用后,提取所有嵌入的图像和图形 • 视觉元素保存为单独的文件 | true |
高级选项
以下参数可在“高级选项”部分中找到,且为可选参数:
| 范围 | 类型 | 描述 | 例子 |
|---|---|---|---|
| 页 | String | 页面范围规范 • 定义要处理哪些页面以提取资源 • 使用“全部”可指定整个文档、特定数字或范围。 • 例如:“1,3,5”(具体页码),“1-5,10-15”(页码范围) | all |
| 自定义配置文件 | String | 自定义配置配置文件 • 使用自定义配置文件设置其他选项 • JSON包含预定义参数的类似格式 • 启用高级提取处理设置 • 特殊需求可选 | { "outputDataFormat": "json" } |
输出
输出参数
| 范围 | 类型 | 描述 | 例子 |
|---|---|---|---|
| 文件名 | String | PDF4me 生成的文件名 - 已成功处理的文档的完整文件名,包括正确的文件扩展名和时间戳。 PDF4me 确保唯一命名并验证文件格式合规性,以便与下游流程无缝集成。 | extracted_resources_1756999816629.json |
| mimeType | String | PDF4me MIME 类型标识符 - 标准化 MIME 提取的内容文件的类型,通常 application/json 对于结构化数据或 application/zip 支持多个文件。这确保了所有系统和应用程序都能正确处理和识别文件。 | application/json |
| 文件大小 | 数字 | PDF4me 文件大小(字节) - 提供提取内容文件的确切大小(以字节为单位),用于存储规划、带宽优化和文件传输监控。这对企业文档管理和工作流自动化至关重要。 | 1945 |
| 成功 | Boolean | PDF4me 提取状态指示器 - 指示资源提取过程成功或失败的布尔标志。返回 true 为了成功提取和 false 针对任何错误,在自动化工作流程中实现强大的错误处理能力。 | true |
| 信息 | String | PDF4me 提取状态消息 - 描述资源提取过程结果的消息。为成功提取提供清晰的状态消息,并为故障排除提供详细的错误信息。 | Resource extraction completed successfully |
| 文档名称 | String | PDF4me 原始文档名称参考 - 输入文件的原始文件名 PDF 已处理的文件。此引用用于审计跟踪、调试以及跟踪企业工作流程中提取内容的来源。 | document.pdf |
N8N 行动反应
这 PDF4me 提取资源 API 返回的结果可以以多种格式查看。请选择最符合您需求的视图:
- JSON
- Table
- Schema
- Binary
JSON 回复格式
原始 JSON 来自 API:
{
"fileName": "extracted_resources_1756999816629.json",
"mimeType": "application/json",
"fileSize": 1945,
"success": true,
"message": "Resource extraction completed successfully",
"docName": "document.pdf"
}
表格视图
以结构化表格格式呈现的响应数据:
| 范围 | 价值 |
|---|---|
| fileName | extracted_resources_1756999816629.json |
| mimeType | application/json |
| fileSize | 1945 |
| success | true |
| docName | document.pdf |
| message | Resource extraction completed successfully |
架构视图
响应的数据结构和类型:
fileName: AB extracted_resources_1756999816629.json
mimeType: AB application/json
fileSize: # 1945
success: ✓ true
docName: AB document.pdf
message: AB Resource extraction completed successfully
类型指示器:
AB= String#= 数字✓= Boolean
二进制数据视图
实际提取的内容数据和元数据:
data
─────────────────────────────────────────
File Name: extracted_resources_1756999816629.json
File Extension: json
Mime Type: application/json
File Size: 1.9 KB
用例
内容管理系统从……中提取文本和图像 PDF 用于集中式内容存储库的文档,实现文档内容的可搜索数据库。
数据处理流程自动从中提取结构化数据 PDF 用于与商业智能工具和分析平台集成的报告、发票和表格。
文档分析处理大量 PDF 文档用于提取特定信息,以进行合规性监控、研究和自动报告。
档案数字化转换旧版本 PDF 将档案转换为可搜索的结构化数据,用于现代内容管理和知识发现系统。