从表格中提取信息 PDF 数据解析器 API
PDF4me 从表格中提取 PDF 使您能够从中提取表结构和数据 PDF 文件。这 API 服务流程 PDF 从文件中提取表格内容、结构和数据 PDF 文件。 API 接收 PDF 通过内容 REST API 利用电话 Base64 采用编码技术实现安全传输。该解决方案支持结构化数据输出和表格分析,是数据处理工作流程和商业智能平台的理想之选。
验证您的身份 API 要求
要访问 PDF4me REST API每个请求都必须包含正确的身份验证凭据。身份验证可确保通信安全,并验证您作为授权用户的身份。 REST API。
主要特点
- 表格提取从表格中提取表结构和数据 PDF 文件
- 结构化数据输出以有序、结构化的格式检索表格数据,以便于集成
- 表格结构保持维护表格布局、表头、行和列的关系
- Base64 编码:使用安全文件内容传输 Base64 编码
- 简单的 API 一体化RESTful API 专为自动化表格提取工作流程而设计
REST API 端点
这 PDF4me REST API 使用标准 HTTP 与资源交互的方法。所有表提取操作均通过单个端点执行:
- 方法: POST
- 终点:
/api/v2/ExtractTableFromPdf
REST API 参数
从表中提取数据的完整参数列表 PDF REST API参数按类别组织,以便更好地理解和实施。
重要的: 标有星号 (*) 的参数为必填项,必须提供。 API 正常运作。
必需参数
| 范围 | 类型 | 描述 | 例子 |
|---|---|---|---|
| docName* | String | 来源 PDF 文件名应带有正确的 .pdf 扩展名,以便进行文档识别和表格提取处理。 | output.pdf |
| docContent* | Base64 (String) | 输入的内容 PDF 文件编码为 Base64 表格分析和数据提取处理的格式 | JVBERi... |
可选参数
| 范围 | 类型 | 描述 | 例子 |
|---|---|---|---|
| async | Boolean | 启用异步处理。 true, 这 API 返回 202 Accepted 与一个 Location 用于轮询结果的标头 | true |
输出
这 PDF4me 从表格中提取 PDF REST API 根据处理模式的不同,会返回不同的响应。 API 返回提取的表格数据。 JSON 回复。
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
同步处理(默认)
什么时候 async 是 false 或者未提供, API 立即返回提取的表格数据。
状态码: 200 OK
回复格式:
{
"tables": [
{
"rows": [
["Header 1", "Header 2", "Header 3"],
["Data 1", "Data 2", "Data 3"],
["Data 4", "Data 5", "Data 6"]
],
"columns": 3,
"rows": 3
}
]
}
响应包含一个表格数组,每个表格都有行、列和单元格数据。
异步处理
什么时候 async 是 true, 这 API 异步处理文档。
初步回应:
状态码: 202 Accepted
响应头:
Location: https://api.pdf4me.com/api/v2/ExtractTableFromPdfStatus/{operationId}
回复正文:
{
"traceId": "operation-trace-id"
}
民意调查结果:
使用 Location 标题 URL 投票确认完成情况:
const response = await fetch(locationUrl, {
headers: { 'Authorization': 'Basic ' + apiKey }
});
// Continue polling until status code is 200
if (response.status === 200) {
const result = await response.json();
// Process extracted table data
}
错误响应
| 状态码 | 描述 | 示例回答 |
|---|---|---|
| 400 Bad Request | 请求参数无效或缺少必填字段 | {"error": "Missing required parameter: docContent"} |
| 401 Unauthorized | 无效或缺失 API 钥匙 | {"error": "Unauthorized"} |
| 408 请求超时 | 请求处理超时 | {"error": "Request timeout"} |
| 500 Internal Server Error | 处理过程中出现服务器错误 | {"error": "Internal server error"} |
了解 JSON 回复
表格提取响应是 JSON 包含以下内容的对象:
- 表格: Array 表对象
- 行: Array 表示表格行的数组(每一行都是一个单元格值的数组)
- 列表中的列数
- 行表中的行数
表格结构:
每个表格都表示为一个二维数组,其中:
- 外层数组表示行
- 内部数组表示每一行中的单元格
- 第一行通常包含列标题
请求示例
标题
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
笔记:
- 获得你的 API 钥匙来自 PDF4me 仪表板
- 这 API 关键必须是 Base64 编码后以“Basic”为前缀 Authorization 标题
- 例如:如果你的 API 关键是
abc123将其编码为 Base64 并使用Authorization: Basic YWJjMTIz
有效载荷
基本请求:
{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output.pdf"
}
使用异步处理:
{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output.pdf",
"async": true
}
代码示例
这 PDF4me 从表格中提取 PDF REST API 提供多种编程语言的代码示例。请选择最适合您开发环境的语言:
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
表格提取功能
数据提取能力
- 完全恢复:从表中提取所有数据 PDF 具有精确结构保存的文件
- 头部识别识别并保留表头、列名和行标签
- 细胞内容物提取提取单个单元格的内容,并注意数据类型和格式。
- 表格结构分析维护表格布局、关系和层级结构
高级处理
- 多表支持:在单个操作中处理多个表 PDF 文档
- 复杂表格处理提取包含合并单元格、跨行和复杂布局的表格
- 格式保留保持表格原有的格式、样式和视觉效果
- 数据验证确保提取过程中数据的完整性和准确性
专业功能
- 结构化输出生成组织有序、结构化的数据,以便于集成
- 批量处理处理多个 PDFs 并高效地提取表格
- 质量保证确保业务应用程序提取数据的准确性和可靠性
- 企业集成与现有数据管理系统无缝集成
行业应用案例及应用
- Business Intelligence & Analytics
- Document Management & Processing
- Data Migration & Integration
- Research & Analysis
- Compliance & Regulatory
- Healthcare & Medical
商业智能与分析应用案例
- 财务报告从报告中提取财务表格,用于数据分析和报告。
- 绩效指标:处理 KPI 表和绩效仪表板,以实现业务智能
- 数据仓库从文档中提取结构化数据以填充数据仓库
- 商业分析: 转变 PDF 将表格转换为可分析的数据格式,以便获得洞见
文档管理与处理用例
- 发票处理从发票中提取明细项目和价格表,以便进行自动化处理。
- 合同分析从法律文件中提取条款和条件表格
- 报告数字化将纸质报告转换为可搜索的数字化数据
- 内容管理从文档中提取结构化数据以用于内容管理系统
数据迁移与集成用例
- 系统迁移:在系统迁移和数据传输期间提取表数据
- 遗留数据转换将历史文档转换为现代数据格式
- API 一体化提取数据以便与第三方系统集成 APIs
- 数据库人口:使用来自结构化数据填充数据库 PDF 文件
研究与分析用例
- 学术研究从研究论文和学术出版物中提取数据表
- 市场调研:流程调查结果和市场分析表
- 科学数据从科学文献中提取实验数据和研究成果
- 统计分析: 转变 PDF 将表格导入统计分析工具
合规与监管应用案例
- 监管报告从监管文件和报告中提取合规数据
- 审计支持处理财务表格和审计跟踪,以进行合规性验证
- 法律取证从法律文件中提取结构化数据以用于取证程序
- 政策分析提取政策表格和监管要求以进行分析
医疗保健应用案例
- 医疗记录从医疗报告和记录中提取患者数据表
- 临床试验处理研究数据和临床试验结果
- 保险索赔提取计费表和索赔信息
- 医学研究将医学研究数据转换为可分析的格式