通过表达式提取文本 - 正则表达式搜索 API
PDF4me 通过表达式提取文本 使您能够从中提取特定文本 PDF 使用正则表达式的文档。这 API 服务流程 PDF 从文件中提取与特定模式/表达式匹配的文本 PDF 文件。 API 接收 PDF 通过内容和正则表达式模式 REST API 利用电话 Base64 采用编码技术实现安全传输。该解决方案支持复杂的正则表达式和灵活的页面定位,是文档处理和数据提取工作流程的理想之选。
验证您的身份 API 要求
要访问 PDF4me REST API每个请求都必须包含正确的身份验证凭据。身份验证可确保通信安全,并验证您作为授权用户的身份。 REST API。
主要特点
- 正则表达式支持使用正则表达式模式提取文本,实现精确的文本匹配
- 灵活的页面定位:使用自定义页面序列处理特定页面或整个文档
- 模式匹配支持复杂的正则表达式和模式识别
- Base64 编码:使用安全文件内容传输 Base64 编码
- 简单的 API 一体化RESTful API 专为自动化文本提取工作流程而设计
REST API 端点
这 PDF4me REST API 使用标准 HTTP 与资源交互的方法。所有通过表达式进行文本提取的操作都通过单个端点执行:
- 方法: POST
- 终点:
/api/v2/ExtractTextByExpression
REST API 参数
“按表达式提取文本”功能的完整参数列表 REST API参数按类别组织,以便更好地理解和实施。
重要的: 标有星号 (*) 的参数为必填项,必须提供。 API 正常运作。
必需参数
| 范围 | 类型 | 描述 | 例子 |
|---|---|---|---|
| docContent* | Base64 (String) | 输入的内容 PDF 文件在 Base64 格式 | JVBERi... |
| docName* | String | 来源 PDF 文件名(需包含正确的文件扩展名) | output.pdf |
| expression* | String | 用于文本提取的正则表达式模式。支持标准正则表达式语法,包括分组、量词和锚点。 | % 或者 [A-Za-z]+ |
| pageSequence* | String | 指定要处理的页面。使用“1-”表示所有页面,“1-3”表示页面范围,“1,2,3”表示特定页面。 | 1-3 |
可选参数
| 范围 | 类型 | 描述 | 例子 |
|---|---|---|---|
| async | Boolean | 启用异步处理。 true, 这 API 返回 202 Accepted 与一个 Location 用于轮询结果的标头 | true |
输出
这 PDF4me 通过表达式提取文本 REST API 根据处理模式的不同,会返回不同的响应。 API 返回提取的文本匹配项 JSON 回复。
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
同步处理(默认)
什么时候 async 是 false 或者未提供, API 立即返回提取出的文本匹配项。
状态码: 200 OK
回复格式:
{
"textList": ["extracted text 1", "extracted text 2", "extracted text 3"]
}
响应包含一个与指定正则表达式模式匹配的文本字符串数组。
异步处理
什么时候 async 是 true, 这 API 异步处理文档。
初步回应:
状态码: 202 Accepted
响应头:
Location: https://api.pdf4me.com/api/v2/ExtractTextByExpressionStatus/{operationId}
回复正文:
{
"traceId": "operation-trace-id"
}
民意调查结果:
使用 Location 标题 URL 投票确认完成情况:
const response = await fetch(locationUrl, {
headers: { 'Authorization': 'Basic ' + apiKey }
});
// Continue polling until status code is 200
if (response.status === 200) {
const result = await response.json();
// Process extracted text matches
}
错误响应
| 状态码 | 描述 | 示例回答 |
|---|---|---|
| 400 Bad Request | 请求参数无效、缺少必填字段或正则表达式模式无效 | {"error": "Missing required parameter: expression"} |
| 401 Unauthorized | 无效或缺失 API 钥匙 | {"error": "Unauthorized"} |
| 408 请求超时 | 请求处理超时 | {"error": "Request timeout"} |
| 500 Internal Server Error | 处理过程中出现服务器错误 | {"error": "Internal server error"} |
了解 JSON 回复
文本提取结果为 JSON 包含以下内容的对象:
- 文本列表: Array 包含所有与指定正则表达式模式匹配的文本的字符串
页面顺序格式:
"1-"处理从第 1 页到最后一页的所有页面"1-3"处理第 1、2 和 3 页"1,2,3"处理特定页面 1、2 和 3。
表达式示例:
"%":匹配百分比符号"\\d+"匹配一个或多个数字"[a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\\.[a-zA-Z]{2,}"匹配电子邮件地址"https?://[^\\s]+"匹配网址
请求示例
标题
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
笔记:
- 获得你的 API 钥匙 PDF4me 仪表板
- 这 API 关键必须是 Base64 编码后以“Basic”为前缀 Authorization 标题
- 例如:如果你的 API 关键是
abc123将其编码为 Base64 并使用Authorization: Basic YWJjMTIz
有效载荷
基本请求:
{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output.pdf",
"expression": "%",
"pageSequence": "1-3"
}
使用异步处理:
{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output.pdf",
"expression": "\\d+",
"pageSequence": "1-3",
"async": true
}
代码示例
这 PDF4me 通过表达式提取文本 REST API 提供多种编程语言的代码示例。请选择最适合您开发环境的语言:
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
文本提取功能
正则表达式处理
- 模式匹配完全支持标准正则表达式语法和模式
- 复杂模式支持高级正则表达式功能,包括分组、量词和锚点
- 自定义表达式:针对特定文本提取需求创建灵活的模式
- 模式验证内置正则表达式模式语法和兼容性验证
- 专业成果:可靠的文本提取和精确的模式匹配
页面处理
- 页面定位从特定页面或整个文档中提取文本
- 页面顺序支持自定义页面范围和单个页面选择
- 柔性加工:精确控制地处理任意页面组合
- 批量处理高效地在单个页面中处理多个页面 API 呼叫
- 专业布局在所有目标页面中实现一致的文本提取
高级功能
- 文本分析:综合文本模式分析与识别
- 自定义筛选针对特定文本提取需求的高级筛选选项
- 专业提取高质量文本提取,清晰可见
- 灵活模式支持任何正则表达式模式和文本匹配要求
行业应用案例及应用
- Legal & Professional Services
- Finance & Banking
- Business & Enterprise
- Education & Research
- Government & Compliance
法律及专业服务用例
- 文档分析从合同、发票和法律文件中提取特定数据模式
- 合同分析从法律合同中提取关键术语和数据模式
- 合规性监控从文件中提取监管信息和合规数据
- 法律数据提取从法律文件中提取特定数据模式
金融与银行业应用案例
- 发票处理使用模式匹配提取发票数据和字段值
- 财务报告提取特定指标和数据点 PDF 报告
- 合规性监控从文件中提取监管信息和合规数据
- 金融数据挖掘从财务文档中提取结构化数据
商业及企业应用案例
- 数据挖掘从非结构化数据中识别和提取结构化数据 PDF 文件
- 内容处理提取特定文本模式以进行内容管理和分析
- 表单处理使用模式匹配提取表单数据和字段值
- 商业智能提取关键业务指标和绩效指标 PDF 报告
教育与研究应用案例
- 研究应用从研究论文和学术文档中提取特定数据模式
- 学术数据提取从研究论文中提取结构化数据
- 研究分析从学术文档中提取特定指标
- 教育内容处理从教育文档中提取文本模式
政府及合规应用案例
- 合规性监控从文件中提取监管信息和合规数据
- 监管数据提取从监管文件中提取结构化数据
- 政府报告从政府报告中提取具体指标
- 公共记录从公共记录和文档中提取数据模式