跳到主要内容

提取资源 - 文本和图像提取器 API

PDF4me 提取资源 使您能够从中提取文本内容和嵌入的图像 PDF 文件。这 API 服务流程 PDF 从文件中提取文本和图像资源 PDF 文件。 API 接收 PDF 通过内容 REST API 利用电话 Base64 采用编码技术实现安全传输。该解决方案支持选择性提取文本和图像,是内容处理工作流程和数据提取平台的理想之选。

相关博客文章
目前尚无关于此功能的博客文章——敬请期待。
在此期间,您可以浏览 PDF4me 博客,查看适用于各平台的教程和工作流程。
访问博客

验证您的身份 API 要求

要访问 PDF4me REST API每个请求都必须包含正确的身份验证凭据。身份验证可确保通信安全,并验证您作为授权用户的身份。 REST API

主要特点

  • 文本提取提取所有文本内容 PDF 文件
  • 图像提取从中检索所有图像和视觉元素 PDF 文件
  • 选择性萃取根据您的需求,您可以选择仅提取文本、仅提取图像或两者都提取。
  • Base64 编码:使用安全文件内容传输 Base64 编码
  • 简单的 API 一体化RESTful API 专为自动化内容提取工作流程而设计

REST API 端点

PDF4me REST API 使用标准 HTTP 与资源交互的方法。所有资源提取操作均通过单个端点执行:

  • 方法: POST
  • 终点: /api/v2/ExtractResources

REST API 参数

提取资源的完整参数列表 REST API参数按类别组织,以便更好地理解和实施。

重要的: 标有星号 (*) 的参数为必填项,必须提供。 API 正常运作。

必需参数

范围类型描述例子
docContent*Base64String输入的内容 PDF 文件编码为 Base64 资源提取和内容分析处理的格式JVBERi...
docName*String来源 PDF 文件名应带有正确的 .pdf 扩展名,以便进行文档识别和资源提取处理。sample.pdf
extractText*Boolean选择是否从中提取文本内容 PDF真的提取所有带格式的文本内容, 错误的:跳过文本提取,仅进行图像处理true
extractImages*Boolean选择是否从中提取图像 PDF真的提取图像和视觉元素 错误的跳过图像提取,加快纯文本处理速度。true

可选参数

范围类型描述例子
asyncBoolean启用异步处理。 true, 这 API 返回 202 Accepted 与一个 Location 用于轮询结果的标头true

输出

PDF4me 提取资源 REST API 根据处理模式的不同,会返回不同的响应。 API 返回提取的文本和图像。 JSON 回复

同步处理(默认)

什么时候 asyncfalse 或者未提供, API 立即返回提取的资源。

状态码: 200 OK

回复格式:

{
"textList": ["extracted text content...", "more text..."],
"imageList": [
{
"fileName": "image1.png",
"imageContent": "base64-encoded-image-content..."
},
{
"fileName": "image2.jpg",
"imageContent": "base64-encoded-image-content..."
}
]
}

响应包含提取的文本(字符串数组)和提取的图像(包含文件名的对象数组)。 Base64编码内容。

请求示例

标题

Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY

笔记:

  • 获得你的 API 钥匙来自 PDF4me 仪表板
  • API 关键必须是 Base64 编码后以“Basic”为前缀 Authorization 标题
  • 例如:如果你的 API 关键是 abc123将其编码为 Base64 并使用 Authorization: Basic YWJjMTIz

有效载荷

基本请求:

{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "sample.pdf",
"extractText": true,
"extractImages": true
}

使用异步处理:

{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "sample.pdf",
"extractText": true,
"extractImages": true,
"async": true
}

代码示例

PDF4me 提取资源 REST API 提供多种编程语言的代码示例。请选择最适合您开发环境的语言:

C# (CSharp) 示例

完全的 C# 从资源中提取资源的实现 PDF

图像提取特征

  • 高质量图像提取原始分辨率和质量的图像
  • 多种格式支持多种图像格式(JPGPNGGIF, ETC。)
  • 矢量图形提取可缩放矢量图形和图表
  • 元数据保存维护图像属性和元数据

高级处理

  • 选择性萃取选择仅提取文本、仅提取图像或文本和图像混合提取。
  • 批量处理处理多个 PDFs 并高效地提取资源
  • 内容分析分析并分类提取的内容类型
  • 专业成果适用于企业应用的高质量萃取

行业应用案例及应用

文档管理与处理用例

  • 内容数字化从扫描文档中提取文本和图像,用于数字存档
  • 文档分析: 分析 PDF 用于信息提取和处理的内容
  • 数据迁移:在文档迁移和系统更新期间提取内容
  • 内容索引创建可搜索索引 PDF 文本和图像内容

获取帮助