跳到主要内容

从表格中提取信息 PDF 数据解析器 API

PDF4me 从表格中提取 PDF 使您能够从中提取表结构和数据 PDF 文件。这 API 服务流程 PDF 从文件中提取表格内容、结构和数据 PDF 文件。 API 接收 PDF 通过内容 REST API 利用电话 Base64 采用编码技术实现安全传输。该解决方案支持结构化数据输出和表格分析,是数据处理工作流程和商业智能平台的理想之选。

相关博客文章
目前尚无关于此功能的博客文章——敬请期待。
在此期间,您可以浏览 PDF4me 博客,查看适用于各平台的教程和工作流程。
访问博客

验证您的身份 API 要求

要访问 PDF4me REST API每个请求都必须包含正确的身份验证凭据。身份验证可确保通信安全,并验证您作为授权用户的身份。 REST API

主要特点

  • 表格提取从表格中提取表结构和数据 PDF 文件
  • 结构化数据输出以有序、结构化的格式检索表格数据,以便于集成
  • 表格结构保持维护表格布局、表头、行和列的关系
  • Base64 编码:使用安全文件内容传输 Base64 编码
  • 简单的 API 一体化RESTful API 专为自动化表格提取工作流程而设计

REST API 端点

PDF4me REST API 使用标准 HTTP 与资源交互的方法。所有表提取操作均通过单个端点执行:

  • 方法: POST
  • 终点: /api/v2/ExtractTableFromPdf

REST API 参数

从表中提取数据的完整参数列表 PDF REST API参数按类别组织,以便更好地理解和实施。

重要的: 标有星号 (*) 的参数为必填项,必须提供。 API 正常运作。

必需参数

范围类型描述例子
docName*String来源 PDF 文件名应带有正确的 .pdf 扩展名,以便进行文档识别和表格提取处理。output.pdf
docContent*Base64String输入的内容 PDF 文件编码为 Base64 表格分析和数据提取处理的格式JVBERi...

可选参数

范围类型描述例子
asyncBoolean启用异步处理。 true, 这 API 返回 202 Accepted 与一个 Location 用于轮询结果的标头true

输出

PDF4me 从表格中提取 PDF REST API 根据处理模式的不同,会返回不同的响应。 API 返回提取的表格数据。 JSON 回复

同步处理(默认)

什么时候 asyncfalse 或者未提供, API 立即返回提取的表格数据。

状态码: 200 OK

回复格式:

{
"tables": [
{
"rows": [
["Header 1", "Header 2", "Header 3"],
["Data 1", "Data 2", "Data 3"],
["Data 4", "Data 5", "Data 6"]
],
"columns": 3,
"rows": 3
}
]
}

响应包含一个表格数组,每个表格都有行、列和单元格数据。

请求示例

标题

Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY

笔记:

  • 获得你的 API 钥匙来自 PDF4me 仪表板
  • API 关键必须是 Base64 编码后以“Basic”为前缀 Authorization 标题
  • 例如:如果你的 API 关键是 abc123将其编码为 Base64 并使用 Authorization: Basic YWJjMTIz

有效载荷

基本请求:

{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output.pdf"
}

使用异步处理:

{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output.pdf",
"async": true
}

代码示例

PDF4me 从表格中提取 PDF REST API 提供多种编程语言的代码示例。请选择最适合您开发环境的语言:

C# (CSharp) 示例

完全的 C# 从中提取表格的实现 PDF

表格提取功能

数据提取能力

  • 完全恢复:从表中提取所有数据 PDF 具有精确结构保存的文件
  • 头部识别识别并保留表头、列名和行标签
  • 细胞内容物提取提取单个单元格的内容,并注意数据类型和格式。
  • 表格结构分析维护表格布局、关系和层级结构

高级处理

  • 多表支持:在单个操作中处理多个表 PDF 文档
  • 复杂表格处理提取包含合并单元格、跨行和复杂布局的表格
  • 格式保留保持表格原有的格式、样式和视觉效果
  • 数据验证确保提取过程中数据的完整性和准确性

专业功能

  • 结构化输出生成组织有序、结构化的数据,以便于集成
  • 批量处理处理多个 PDFs 并高效地提取表格
  • 质量保证确保业务应用程序提取数据的准确性和可靠性
  • 企业集成与现有数据管理系统无缝集成

行业应用案例及应用

商业智能与分析应用案例

  • 财务报告从报告中提取财务表格,用于数据分析和报告。
  • 绩效指标:处理 KPI 表和绩效仪表板,以实现业务智能
  • 数据仓库从文档中提取结构化数据以填充数据仓库
  • 商业分析: 转变 PDF 将表格转换为可分析的数据格式,以便获得洞见

获取帮助