从附件中提取 PDF 文件恢复 API
PDF4me 从附件中提取 PDF 使您能够提取嵌入在文件中的所有附件。 PDF 文件。这 API 服务流程 PDF 从文件中提取嵌入的文件、文档和资源 PDF 文件。 API 接收 PDF 通过内容 REST API 利用电话 Base64 用于安全传输的编码。支持从中提取多种文件类型。 PDF 对于文档而言,此解决方案是文档管理系统和文件提取工作流程的理想选择。
验证您的身份 API 要求
要访问 PDF4me REST API每个请求都必须包含正确的身份验证凭据。身份验证可确保通信安全,并验证您作为授权用户的身份。 REST API。
主要特点
- 文件提取从文件中提取所有嵌入的文件、文档和资源 PDF 文件
- 多种文件类型支持多种附件格式,包括文本、图像、文档和压缩文件。
- 批量萃取从单个文件中提取多个附件 PDF 一次操作即可完成文档处理
- Base64 编码:使用安全文件内容传输 Base64 编码
- 简单的 API 一体化RESTful API 专为自动化文档提取工作流程而设计
REST API 端点
这 PDF4me REST API 使用标准 HTTP 与资源交互的方法。所有附件提取操作均通过单个端点执行:
- 方法: POST
- 终点:
/api/v2/ExtractAttachmentFromPdf
REST API 参数
从附件提取的完整参数列表 PDF REST API参数按类别组织,以便更好地理解和实施。
重要的: 标有星号 (*) 的参数为必填项,必须提供。 API 正常运作。
必需参数
| 范围 | 类型 | 描述 | 例子 |
|---|---|---|---|
| docContent* | Base64 (String) | 输入的内容 PDF 文件编码为 Base64 附件提取和文件恢复处理的格式 | JVBERi... |
| docName* | String | 来源 PDF 文件名应带有正确的 .pdf 扩展名,以便进行文档识别和附件提取处理。 | output.pdf |
可选参数
| 范围 | 类型 | 描述 | 例子 |
|---|---|---|---|
| async | Boolean | 启用异步处理。 true, 这 API 返回 202 Accepted 与一个 Location 用于轮询结果的标头 | true |
输出
这 PDF4me 从附件中提取 PDF REST API 根据处理模式的不同,会返回不同的响应。 API 返回提取的附件数据。 JSON 回复 或者作为 ZIP 文件 包含所有提取的附件。
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
同步处理(默认)
什么时候 async 是 false 或者未提供, API 立即返回提取的附件结果。
状态码: 200 OK
回复格式:
{
"outputDocuments": [
{
"fileName": "attachment1.txt",
"streamFile": "base64-encoded-file-content..."
},
{
"fileName": "attachment2.pdf",
"streamFile": "base64-encoded-file-content..."
}
]
}
响应包含一个提取的附件数组,每个附件都有一个 fileName 和 streamFile (Base64编码内容)。
异步处理
什么时候 async 是 true, 这 API 异步处理文档。
初步回应:
状态码: 202 Accepted
响应头:
Location: https://api.pdf4me.com/api/v2/ExtractAttachmentFromPdfStatus/{operationId}
回复正文:
{
"traceId": "operation-trace-id"
}
民意调查结果:
使用 Location 标题 URL 投票确认完成情况:
const response = await fetch(locationUrl, {
headers: { 'Authorization': 'Basic ' + apiKey }
});
// Continue polling until status code is 200
if (response.status === 200) {
const result = await response.json();
// Process extracted attachments
}
错误响应
| 状态码 | 描述 | 示例回答 |
|---|---|---|
| 400 Bad Request | 请求参数无效或缺少必填字段 | {"error": "Missing required parameter: docContent"} |
| 401 Unauthorized | 无效或缺失 API 钥匙 | {"error": "Unauthorized"} |
| 408 请求超时 | 请求处理超时 | {"error": "Request timeout"} |
| 500 Internal Server Error | 处理过程中出现服务器错误 | {"error": "Internal server error"} |
了解 JSON 回复
萃取响应是 JSON 包含已提取附件数组的对象:
- 输出文档: Array 提取的附件对象
- 文件名提取文件的名称
- 流文件: Base64提取文件的编码内容
选择: ZIP 文件响应
在某些情况下, API 可能会返回 ZIP 包含所有已提取附件的文件,而不是 JSON。 这 ZIP 文件可以下载并解压以访问各个文件。
解码 Base64 内容:
解码 Base64来自 -编码文件的内容 streamFile:
// JavaScript
const decoded = atob(base64String);
const blob = new Blob([decoded], { type: 'application/octet-stream' });
# Python
import base64
decoded = base64.b64decode(base64_string)
with open('extracted_file.txt', 'wb') as f:
f.write(decoded)
请求示例
标题
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
笔记:
- 获得你的 API 钥匙 PDF4me 仪表板
- 这 API 关键必须是 Base64 编码后以“Basic”为前缀 Authorization 标题
- 例如:如果你的 API 关键是
abc123将其编码为 Base64 并使用Authorization: Basic YWJjMTIz
有效载荷
基本请求:
{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output.pdf"
}
使用异步处理:
{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output.pdf",
"async": true
}
代码示例
这 PDF4me 从附件中提取 PDF REST API 提供多种编程语言的代码示例。请选择最适合您开发环境的语言:
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
附件提取功能
文件恢复功能
- 完全提取从文件中提取所有嵌入的文件和资源 PDF 文件
- 文件类型检测自动识别嵌入式文件类型和格式
- 元数据保存保留原始文件名、创建日期和属性
- 质量保证确保文件完整性并正确提取,避免文件损坏
文档处理
- PDF 分析深入分析 PDF 用于定位嵌入式附件的结构
- 资源识别智能检测各种嵌入式文件类型
- 批量萃取处理来自单个文件的多个附件 PDF 一次操作
- 安全处理安全提取并验证文件完整性
高级功能
- 多格式支持提取文档、图像、压缩文件和多媒体文件
- 文件整理提取过程中请保持正确的文件命名和组织结构
- 内容验证验证提取文件的完整性和准确性
- 专业成果适用于企业应用的高质量萃取
行业应用案例及应用
- Document Management & Recovery
- Legal & Compliance
- Business & Finance
- Technical & Engineering
- Healthcare & Medical
文档管理与恢复用例
- 存档恢复从已存档的 PDF 文档中提取文件以进行数据恢复
- 内容管理从文档管理系统中检索嵌入式资源
- 文件整理从复杂的 PDF 包中提取和整理文件
- 数据迁移在文档迁移过程中提取附件
法律与合规应用案例
- 证据回收从法律PDF文件中提取佐证文件和证据
- 合规文件:检索监管文件和证书
- 审计支持提取审计跟踪和支持材料
- 法律取证:恢复嵌入文件以用于法律取证程序
商业与金融应用案例
- 发票处理从发票PDF文件中提取支持文件
- 合同管理获取合同附件和修订
- 财务报告提取相关电子表格和报告
- 文档分析分析嵌入式内容以获取商业智能
技术与工程应用案例
- 技术文档提取代码示例、规范和图表
- 项目文件获取项目资源和支持材料
- 设计资产提取图像、CAD 文件和设计资源
- 研究数据从PDF文件中恢复数据集和研究资料
医疗保健应用案例
- 医疗记录提取患者档案和医疗文件
- 研究数据检索临床试验数据和研究资料
- 合规文件提取监管文件和认证
- 患者护理恢复相关医学影像和报告