从附件中提取 PDF 使用 n8n 行动
PDF4me 从附件中提取 PDF 从中提取嵌入文件 PDF 通过文件 n8n 自动化工作流程。流程 PDF离开 n8n 触发器、二进制数据、base64 字符串或公共 URL能够自动检测和提取附件中的文档、图像、电子表格、数据文件和其他嵌入式内容,同时保持文件完整性、保留元数据并支持多种格式(PDF(DOC、XLS、图像等)。该解决方案非常适合文档分析、文件恢复、证据提取、附件管理、数据提取工作流程以及需要可靠嵌入式文件提取和无缝集成的综合文档处理。
相关博客文章
目前尚无关于此功能的博客文章——敬请期待。
在此期间,您可以浏览 PDF4me 博客,查看适用于各平台的教程和工作流程。
访问博客 →
设置
添加 PDF4me 从 PDF节点到您的 n8n 工作流程并配置所需参数。有关初始设置说明,请参阅我们的 n8n 集成指南。
先决条件:
- PDF4me API 证书
- n8n 工作流访问
配置:
- 添加 PDF4me 节点到工作流
- 选择“从……提取附件 PDF“ 行动
- 配置输入参数(见下文)

参数
从附件提取的完整参数列表 PDF 操作。配置这些参数以控制附件提取。
重要的: 标有星号 (***) 的参数是必需的,必须提供这些参数才能使操作正常运行。
| 范围 | 类型 | 描述 | 例子 |
|---|---|---|---|
| 输入数据类型*** | String | PDF 输入格式选择 • 选择您的格式 PDF 数据输入 • PDF4me 支持多种输入类型 • 选项:二进制数据, Base64 字符串,或 URL | Binary Data |
| 输入二进制字段 | 二进制 | 二进制 PDF 文件输入 (二进制数据必填) • 参考 PDF 来自前一个文件 n8n 节点或文件上传 • PDF4me 二进制进程 PDF 文件自动格式检测 • 当输入数据类型为“二进制数据”时为必填项 | {{ $binary.data }} |
| Base64 文档内容 | String | Base64 编码 PDF 输入 (如果适用,则为必填项) Base64 细绳) • 提供 PDF 数据以 base64 编码字符串的形式呈现 • PDF4me 自动解码和处理 PDF 内容 • 当输入数据类型为“Base64 细绳” | UEsDBBQABgAI... |
| 文件 URL | String | 民众 PDF URL 输入 (如果适用,则为必填项) URL) • 提供公开/开放权限 URL 到 PDF 文件 • PDF4me 从……下载并处理文件 URL • 当输入数据类型为“URL“ | https://abc.com/sample.pdf |
| 文件名称*** | String | 来源 PDF 参考 • 指定源的名称 PDF 文件 • 用于提取过程中的参考和跟踪目的 • 有助于处理跟踪 | document.pdf |
高级选项
以下参数可在“高级选项”部分中找到,且为可选参数:
| 范围 | 类型 | 描述 | 例子 |
|---|---|---|---|
| 自定义配置文件 | Object | 提取配置 • 用于自定义提取行为的高级配置对象 • 支持的输出格式和处理选项 • JSON 灵活参数规范格式 • 特殊需求可选 | {"outputDataFormat": "json", "extractMetadata": true} |
支持的附件类型
| 类别 | 文件类型 | 描述 |
|---|---|---|
| 文件 | PDF,DOC, DOCXTXT、RTF、ODT | 文本文件和办公文件 |
| 图片 | JPG, JPEG, PNGGIF、BMP TIFFSVG | 图像文件和图形 |
| 电子表格 | XLS、XLSX、 CSV,ODS | 数据文件和电子表格 |
| 数据 | JSON, XML, HTML, CSS | 网络和数据文件 |
输出
输出参数
| 范围 | 类型 | 描述 | 例子 |
|---|---|---|---|
| 文件 | Array | PDF4me 输入文档参考 - 指向用于提取的原始输入文档的引用。对于此操作类型,此值为空。 | null |
| 输出文档 | Array | PDF4me 提取的附件集合 - 从源文件中成功提取的附件对象数组,包含文件数据、元数据和属性 PDF 文档 | [{"fileName": "sample.txt", "barcodeText": null, "docText": null, "image": null}] |
| traceId | String | PDF4me 处理跟踪标识符 - 用于跟踪提取请求的唯一跟踪 ID PDF4me用于调试和审计的处理管道 | null |
| 工作编号 | String | PDF4me 工作标识符 - 提取操作的唯一作业 ID。同步操作为空,异步处理为有值。 | null |
| 状态网址 | String | PDF4me 状态跟踪 URL - URL 用于检查异步提取操作的状态。同步操作则为 null。 | null |
| 订阅使用情况 | Object | PDF4me 订阅使用数据 - 关于……的信息 API 提取作业的使用情况和订阅消耗 | null |
| 元数据 | Object | PDF4me 操作元数据 - 包含处理信息、时间戳和操作详情的综合元数据对象 | {"success": true, "message": "Attachments extracted successfully"} |
| _metadata.success | Boolean | PDF4me 提取状态指示器 - Boolean 指示附件提取过程成功或失败的标志。 PDF4me 返回 true 为了成功提取和 false 任何错误 | true |
| _metadata.message | String | PDF4me 提取状态消息 - 提供易于理解的状态消息,详细说明提取过程的结果。包括成功确认或错误详情,以便进行故障排除。 | Attachments extracted successfully |
| _metadata.processingTimestamp | String | PDF4me 处理时间戳 - ISO 8601 时间戳,指示萃取操作完成的时间 PDF4me的提取引擎 | 2025-09-23T20:04:09.290Z |
| _metadata.sourceFileName | String | PDF4me 源文档文件名 - 原始文件名 PDF 已处理用于附件提取的文档 | document.pdf |
| _metadata.操作 | String | PDF4me 操作类型 - 执行的操作类型 PDF4me的 API对于此操作,始终使用“从 PDF 中提取附件” | extractAttachmentFromPdf |
提取的附件对象结构
| 场地 | 类型 | 描述 | 例子 |
|---|---|---|---|
| 文件名 | String | PDF4me 提取的文件名 - 源文件中提取的附件的原始文件名 PDF 文档 | sample.txt |
| 条形码文本 | String | PDF4me 条形码内容 - 从附件中找到的条形码中提取文本内容。如果没有条形码,则为空。 | null |
| 文档文本 | String | PDF4me 文档文本内容 - 从附件文件中提取的文本内容。如果附件不是文本文件,则为空。 | null |
| 图像 | String | PDF4me 图像数据 - Base64 如果附件是图像文件,则返回编码后的图像数据;如果附件不是图像文件,则返回 null。 | null |
N8N 行动反应
这 PDF4me 从附件中提取 PDF API 返回的结果可以以多种格式查看。请选择最符合您需求的视图:
- JSON
- Table
- Schema
- Binary
JSON 回复格式
原始 JSON 来自……的回应 API:
[
{
"documents": null,
"outputDocuments": [
{
"fileName": "sample.txt",
"barcodeText": null,
"docText": null,
"image": null
}
],
"traceId": null,
"jobId": null,
"statusUrl": null,
"subscriptionUsage": null,
"_metadata": {
"success": true,
"message": "Attachments extracted successfully",
"processingTimestamp": "2025-09-23T20:04:09.290Z",
"sourceFileName": "document.pdf",
"operation": "extractAttachmentFromPdf"
}
}
]
表格视图
以结构化表格格式呈现的响应数据:
| 范围 | 价值 |
|---|---|
| documents | null |
| outputDocuments[0].fileName | sample.txt |
| outputDocuments[0].barcodeText | null |
| outputDocuments[0].docText | null |
| outputDocuments[0].image | null |
| traceId | null |
| jobId | null |
| statusUrl | null |
| subscriptionUsage | null |
| _metadata.success | true |
| _metadata.message | Attachments extracted successfully |
| _metadata.processingTimestamp | 2025-09-23T20:04:09.290Z |
| _metadata.sourceFileName | document.pdf |
| _metadata.operation | extractAttachmentFromPdf |
架构视图
响应的数据结构和类型:
1 item
documents: null
outputDocuments: [
{
fileName: AB sample.txt
barcodeText: null
docText: null
image: null
}
]
traceId: null
jobId: null
statusUrl: null
subscriptionUsage: null
_metadata: {
success: ☑ true
message: AB Attachments extracted successfully
processingTimestamp: AB 2025-09-23T20:04:09.290Z
sourceFileName: AB document.pdf
operation: AB extractAttachmentFromPdf
}
类型指示器:
AB= String#= 数字☑= Boolean{}= Object[]= Array
二进制数据视图
实际附件数据和元数据:
outputDocuments
─────────────────────────────
File Count: {{ $json.outputDocuments.length }}
Success Status: {{ $json._metadata.success }}
Processing Time: {{ $json._metadata.processingTimestamp }}
用例
文档内容恢复
- 嵌入式文件恢复使用
outputDocuments用于恢复嵌入在数组中的文件的数组 PDF 文件,恢复对原始资料的访问 - 文件名称恢复从文件中提取原始文件名
fileName用于维护正确的文件标识和组织 - 丢失文件恢复恢复先前嵌入的文档 PDF但它们不再以原始格式提供。
内容处理与分析
- 依恋分析处理来自以下位置的单个文件:
outputDocuments收集信息以分析内容、提取数据或对每种文件类型执行特定操作 - 条形码处理利用
barcodeText用于从附件中提取和处理条形码信息的字段,以用于库存、跟踪或识别目的 - 文本内容提取利用
docText用于从文档附件中提取文本内容以进行搜索、分析或数据处理工作流程的字段
工作流自动化和集成
- 文件分发根据文件类型和内容分析,自动将提取的附件分发到相应的系统、文件夹或用户。
- 内容归档使用
_metadata.traceId并将提取结果保存到结构化的归档系统中,以维护审计跟踪。 - 多系统集成将提取的文件与外部文档管理系统、云存储平台或业务应用程序集成