跳到主要内容

从表单中提取数据 PDF - 字段解析器 API

PDF4me 从表单中提取数据 PDF 使您能够从表单中提取所有字段数据和值。 PDF 包含可填写表格的文件。 API 服务流程 PDF 从文件中提取表单字段信息、值和属性 PDF 形式。 API 接收 PDF 通过内容 REST API 利用电话 Base64 采用编码技术实现安全传输。该解决方案支持多种表单字段类型和结构化数据输出,是表单处理工作流程和数据提取平台的理想之选。

相关博客文章
目前尚无关于此功能的博客文章——敬请期待。
在此期间,您可以浏览 PDF4me 博客,查看适用于各平台的教程和工作流程。
访问博客

验证您的身份 API 要求

要访问 PDF4me REST API每个请求都必须包含正确的身份验证凭据。身份验证可确保通信安全,并验证您作为授权用户的身份。 REST API

主要特点

  • 表单字段提取提取所有类型的表单字段,包括文本字段、复选框、单选按钮、下拉列表和签名字段。
  • 结构化数据输出以结构化格式检索表单数据 JSON 便于集成的格式
  • 字段属性提取字段名称、值、类型和验证属性
  • Base64 编码:使用安全文件内容传输 Base64 编码
  • 简单的 API 一体化RESTful API 专为自动化表单处理工作流程而设计

REST API 端点

PDF4me REST API 使用标准 HTTP 与资源交互的方法。所有表单数据提取操作均通过单个端点执行:

  • 方法: POST
  • 终点: /api/v2/ExtractPdfFormData

REST API 参数

从表单提取数据的完整参数列表 PDF REST API参数按类别组织,以便更好地理解和实施。

重要的: 标有星号 (*) 的参数为必填项,必须提供。 API 正常运作。

必需参数

范围类型描述例子
docName*String来源 PDF 文件名应带有正确的 .pdf 扩展名,以便进行文档识别和表单数据提取处理。output.pdf
docContent*Base64String输入的内容 PDF 文件编码为 Base64 用于表单字段分析和数据提取处理的格式JVBERi...

可选参数

范围类型描述例子
asyncBoolean启用异步处理。 true, 这 API 返回 202 Accepted 与一个 Location 用于轮询结果的标头true

输出

PDF4me 从表单中提取数据 PDF REST API 根据处理模式的不同,会返回不同的响应。 API 返回提取的表单字段数据。 JSON 回复

同步处理(默认)

什么时候 asyncfalse 或者未提供, API 立即返回提取的表单数据。

状态码: 200 OK

回复格式:

{
"formFields": [
{
"fieldName": "Name",
"fieldValue": "John Doe",
"fieldType": "text"
},
{
"fieldName": "Email",
"fieldValue": "[email protected]",
"fieldType": "text"
},
{
"fieldName": "Date",
"fieldValue": "2024-01-15",
"fieldType": "date"
}
]
}

响应包含一个表单字段数组,其中包含字段名称、值和类型。

请求示例

标题

Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY

笔记:

  • 获得你的 API 钥匙 PDF4me 仪表板
  • API 关键必须是 Base64 编码后以“Basic”为前缀 Authorization 标题
  • 例如:如果你的 API 关键是 abc123将其编码为 Base64 并使用 Authorization: Basic YWJjMTIz

有效载荷

基本请求:

{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output.pdf"
}

使用异步处理:

{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output.pdf",
"async": true
}

代码示例

PDF4me 从表单中提取数据 PDF REST API 提供多种编程语言的代码示例。请选择最适合您开发环境的语言:

C# (CSharp) 示例

完全的 C# 实现从表单中提取数据 PDF

表单数据提取功能

现场分析能力

  • 完整场检测识别所有表单字段,包括隐藏字段和计算字段。
  • 价值提取提取所有字段类型的当前值和默认值
  • 物业分析检索字段属性,包括名称、类型、位置和验证规则
  • 数据验证验证字段数据的完整性和格式合规性

表单处理

  • PDF 形式分析深入分析 PDF 形态结构和场关系
  • 字段类型识别自动识别各种表单字段类型
  • 批量处理处理多个表单并从复杂的表单结构中提取数据
  • 结构化输出生成组织有序、结构化的数据,以便于集成

高级功能

  • 田间测绘将表单字段映射到数据库列或应用程序字段
  • 数据转换:将表单数据转换为各种输出格式(JSONXMLCSV
  • 验证规则提取并应用表单验证规则和约束
  • 专业成果适用于企业应用的高质量萃取

行业应用案例及应用

文档管理与处理用例

  • 表单数据收集从已填写的表格中提取数据 PDF 数据库存储表单
  • 文件数字化通过将纸质表格转换为数字数据 PDF 加工
  • 数据迁移:在文档迁移和系统更新期间提取表单数据
  • 形式分析分析表单填写率和字段使用模式

获取帮助