跳到主要内容

通过表达式提取文本 - 正则表达式搜索 API

PDF4me 通过表达式提取文本 使您能够从中提取特定文本 PDF 使用正则表达式的文档。这 API 服务流程 PDF 从文件中提取与特定模式/表达式匹配的文本 PDF 文件。 API 接收 PDF 通过内容和正则表达式模式 REST API 利用电话 Base64 采用编码技术实现安全传输。该解决方案支持复杂的正则表达式和灵活的页面定位,是文档处理和数据提取工作流程的理想之选。

相关博客文章
目前尚无关于此功能的博客文章——敬请期待。
在此期间,您可以浏览 PDF4me 博客,查看适用于各平台的教程和工作流程。
访问博客

验证您的身份 API 要求

要访问 PDF4me REST API每个请求都必须包含正确的身份验证凭据。身份验证可确保通信安全,并验证您作为授权用户的身份。 REST API

主要特点

  • 正则表达式支持使用正则表达式模式提取文本,实现精确的文本匹配
  • 灵活的页面定位:使用自定义页面序列处理特定页面或整个文档
  • 模式匹配支持复杂的正则表达式和模式识别
  • Base64 编码:使用安全文件内容传输 Base64 编码
  • 简单的 API 一体化RESTful API 专为自动化文本提取工作流程而设计

REST API 端点

PDF4me REST API 使用标准 HTTP 与资源交互的方法。所有通过表达式进行文本提取的操作都通过单个端点执行:

  • 方法: POST
  • 终点: /api/v2/ExtractTextByExpression

REST API 参数

“按表达式提取文本”功能的完整参数列表 REST API参数按类别组织,以便更好地理解和实施。

重要的: 标有星号 (*) 的参数为必填项,必须提供。 API 正常运作。

必需参数

范围类型描述例子
docContent*Base64String输入的内容 PDF 文件在 Base64 格式JVBERi...
docName*String来源 PDF 文件名(需包含正确的文件扩展名)output.pdf
expression*String用于文本提取的正则表达式模式。支持标准正则表达式语法,包括分组、量词和锚点。% 或者 [A-Za-z]+
pageSequence*String指定要处理的页面。使用“1-”表示所有页面,“1-3”表示页面范围,“1,2,3”表示特定页面。1-3

可选参数

范围类型描述例子
asyncBoolean启用异步处理。 true, 这 API 返回 202 Accepted 与一个 Location 用于轮询结果的标头true

输出

PDF4me 通过表达式提取文本 REST API 根据处理模式的不同,会返回不同的响应。 API 返回提取的文本匹配项 JSON 回复

同步处理(默认)

什么时候 asyncfalse 或者未提供, API 立即返回提取出的文本匹配项。

状态码: 200 OK

回复格式:

{
"textList": ["extracted text 1", "extracted text 2", "extracted text 3"]
}

响应包含一个与指定正则表达式模式匹配的文本字符串数组。

请求示例

标题

Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY

笔记:

  • 获得你的 API 钥匙 PDF4me 仪表板
  • API 关键必须是 Base64 编码后以“Basic”为前缀 Authorization 标题
  • 例如:如果你的 API 关键是 abc123将其编码为 Base64 并使用 Authorization: Basic YWJjMTIz

有效载荷

基本请求:

{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output.pdf",
"expression": "%",
"pageSequence": "1-3"
}

使用异步处理:

{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output.pdf",
"expression": "\\d+",
"pageSequence": "1-3",
"async": true
}

代码示例

PDF4me 通过表达式提取文本 REST API 提供多种编程语言的代码示例。请选择最适合您开发环境的语言:

C# (CSharp) 示例

完全的 C# 从表达式中提取文本的实现 PDF

文本提取功能

正则表达式处理

  • 模式匹配完全支持标准正则表达式语法和模式
  • 复杂模式支持高级正则表达式功能,包括分组、量词和锚点
  • 自定义表达式:针对特定文本提取需求创建灵活的模式
  • 模式验证内置正则表达式模式语法和兼容性验证
  • 专业成果:可靠的文本提取和精确的模式匹配

页面处理

  • 页面定位从特定页面或整个文档中提取文本
  • 页面顺序支持自定义页面范围和单个页面选择
  • 柔性加工:精确控制地处理任意页面组合
  • 批量处理高效地在单个页面中处理多个页面 API 呼叫
  • 专业布局在所有目标页面中实现一致的文本提取

高级功能

  • 文本分析:综合文本模式分析与识别
  • 自定义筛选针对特定文本提取需求的高级筛选选项
  • 专业提取高质量文本提取,清晰可见
  • 灵活模式支持任何正则表达式模式和文本匹配要求

行业应用案例及应用

法律及专业服务用例

  • 文档分析从合同、发票和法律文件中提取特定数据模式
  • 合同分析从法律合同中提取关键术语和数据模式
  • 合规性监控从文件中提取监管信息和合规数据
  • 法律数据提取从法律文件中提取特定数据模式

获取帮助