提取资源 - 文本和图像提取器 API
PDF4me 提取资源 使您能够从中提取文本内容和嵌入的图像 PDF 文件。这 API 服务流程 PDF 从文件中提取文本和图像资源 PDF 文件。 API 接收 PDF 通过内容 REST API 利用电话 Base64 采用编码技术实现安全传输。该解决方案支持选择性提取文本和图像,是内容处理工作流程和数据提取平台的理想之选。
验证您的身份 API 要求
要访问 PDF4me REST API每个请求都必须包含正确的身份验证凭据。身份验证可确保通信安全,并验证您作为授权用户的身份。 REST API。
主要特点
- 文本提取提取所有文本内容 PDF 文件
- 图像提取从中检索所有图像和视觉元素 PDF 文件
- 选择性萃取根据您的需求,您可以选择仅提取文本、仅提取图像或两者都提取。
- Base64 编码:使用安全文件内容传输 Base64 编码
- 简单的 API 一体化RESTful API 专为自动化内容提取工作流程而设计
REST API 端点
这 PDF4me REST API 使用标准 HTTP 与资源交互的方法。所有资源提取操作均通过单个端点执行:
- 方法: POST
- 终点:
/api/v2/ExtractResources
REST API 参数
提取资源的完整参数列表 REST API参数按类别组织,以便更好地理解和实施。
重要的: 标有星号 (*) 的参数为必填项,必须提供。 API 正常运作。
必需参数
| 范围 | 类型 | 描述 | 例子 |
|---|---|---|---|
| docContent* | Base64 (String) | 输入的内容 PDF 文件编码为 Base64 资源提取和内容分析处理的格式 | JVBERi... |
| docName* | String | 来源 PDF 文件名应带有正确的 .pdf 扩展名,以便进行文档识别和资源提取处理。 | sample.pdf |
| extractText* | Boolean | 选择是否从中提取文本内容 PDF: 真的提取所有带格式的文本内容, 错误的:跳过文本提取,仅进行图像处理 | true |
| extractImages* | Boolean | 选择是否从中提取图像 PDF: 真的提取图像和视觉元素 错误的跳过图像提取,加快纯文本处理速度。 | true |
可选参数
| 范围 | 类型 | 描述 | 例子 |
|---|---|---|---|
| async | Boolean | 启用异步处理。 true, 这 API 返回 202 Accepted 与一个 Location 用于轮询结果的标头 | true |
输出
这 PDF4me 提取资源 REST API 根据处理模式的不同,会返回不同的响应。 API 返回提取的文本和图像。 JSON 回复。
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
同步处理(默认)
什么时候 async 是 false 或者未提供, API 立即返回提取的资源。
状态码: 200 OK
回复格式:
{
"textList": ["extracted text content...", "more text..."],
"imageList": [
{
"fileName": "image1.png",
"imageContent": "base64-encoded-image-content..."
},
{
"fileName": "image2.jpg",
"imageContent": "base64-encoded-image-content..."
}
]
}
响应包含提取的文本(字符串数组)和提取的图像(包含文件名的对象数组)。 Base64编码内容。
异步处理
什么时候 async 是 true, 这 API 异步处理文档。
初步回应:
状态码: 202 Accepted
响应头:
Location: https://api.pdf4me.com/api/v2/ExtractResourcesStatus/{operationId}
回复正文:
{
"traceId": "operation-trace-id"
}
民意调查结果:
使用 Location 标题 URL 投票确认完成情况:
const response = await fetch(locationUrl, {
headers: { 'Authorization': 'Basic ' + apiKey }
});
// Continue polling until status code is 200
if (response.status === 200) {
const result = await response.json();
// Process extracted resources
}
错误响应
| 状态码 | 描述 | 示例回答 |
|---|---|---|
| 400 Bad Request | 请求参数无效或缺少必填字段 | {"error": "Missing required parameter: docContent"} |
| 401 Unauthorized | 无效或缺失 API 钥匙 | {"error": "Unauthorized"} |
| 408 请求超时 | 请求处理超时 | {"error": "Request timeout"} |
| 500 Internal Server Error | 处理过程中出现服务器错误 | {"error": "Internal server error"} |
了解 JSON 回复
资源开采响应是 JSON 包含以下内容的对象:
- 文本列表: Array 包含提取文本内容的字符串(如果
extractText是true) - 图片列表: Array 图像对象(如果
extractImages是true) - 文件名提取的图像文件的名称
- 图片内容: Base64图像的编码内容
解码 Base64 图片内容:
解码并保存 Base64编码图像:
// JavaScript
const decoded = atob(base64String);
const blob = new Blob([decoded], { type: 'image/png' });
const url = URL.createObjectURL(blob);
# Python
import base64
image_data = base64.b64decode(base64_string)
with open('extracted_image.png', 'wb') as f:
f.write(image_data)
请求示例
标题
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
笔记:
- 获得你的 API 钥匙来自 PDF4me 仪表板
- 这 API 关键必须是 Base64 编码后以“Basic”为前缀 Authorization 标题
- 例如:如果你的 API 关键是
abc123将其编码为 Base64 并使用Authorization: Basic YWJjMTIz
有效载荷
基本请求:
{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "sample.pdf",
"extractText": true,
"extractImages": true
}
使用异步处理:
{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "sample.pdf",
"extractText": true,
"extractImages": true,
"async": true
}
代码示例
这 PDF4me 提取资源 REST API 提供多种编程语言的代码示例。请选择最适合您开发环境的语言:
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
图像提取特征
- 高质量图像提取原始分辨率和质量的图像
- 多种格式支持多种图像格式(JPG, PNG, GIF, ETC。)
- 矢量图形提取可缩放矢量图形和图表
- 元数据保存维护图像属性和元数据
高级处理
- 选择性萃取选择仅提取文本、仅提取图像或文本和图像混合提取。
- 批量处理处理多个 PDFs 并高效地提取资源
- 内容分析分析并分类提取的内容类型
- 专业成果适用于企业应用的高质量萃取
行业应用案例及应用
- Document Management & Processing
- Business & Finance
- Legal & Compliance
- Healthcare & Medical
- Education & Research
- Marketing & Content
文档管理与处理用例
- 内容数字化从扫描文档中提取文本和图像,用于数字存档
- 文档分析: 分析 PDF 用于信息提取和处理的内容
- 数据迁移:在文档迁移和系统更新期间提取内容
- 内容索引创建可搜索索引 PDF 文本和图像内容
商业与金融应用案例
- 发票处理从发票中提取文本和图像以进行自动化处理
- 报告分析从财务报告和报表中提取数据和图表
- 合同管理从合同和协议中提取文本和视觉元素
- 合规文件处理监管文件并提取所需信息
法律与合规应用案例
- 法律文件处理从法律文件中提取文本和证据
- 个案管理从案件档案和法律摘要中提取内容
- 监管合规处理合规文件并提取所需数据
- 证据收集提取文本和图像,用于法律证据和文件记录
医疗保健应用案例
- 医疗记录从患者记录和医疗报告中提取文本和图像
- 研究数据处理研究文件并提取数据和图表
- 临床试验从临床研究文件中提取信息
- 医学影像从医学图像中提取诊断内容 PDFs
教育与研究应用案例
- 学术论文从研究论文和出版物中提取文本和图表
- 教育内容:处理教科书和教育材料
- 研究数据从研究文档中提取数据和图表
- 图书馆数字化将图书馆藏书数字化并提取可搜索内容
营销与内容应用案例
- 内容创作提取文本和图像用于内容营销和社交媒体
- 品牌资产从……中提取徽标和品牌元素 PDF 文件
- 设计资源提取创意项目的设计元素和图形
- 内容再利用提取内容以便在不同格式和平台上重复使用