跳到主要内容

通过表达式提取文本

提炼通过表达式提取文本

通过表达式提取文本 API 从文本中提取文本 PDF 它与正则表达式匹配。你发送 PDF 作为 Base64docContent), docNameexpression (正则表达式模式), pageSequence (例如 1-、1-3、1,2,3),以及可选的 async。 这 API 返回 JSON 匹配所有项。请使用下面的测试工具进行尝试;更多详情和表达式示例请参见后续章节。

尝试使用表达式提取文本功能 API

:::备注 快速参考 终点: POST /api/v2/ExtractTextByExpression · 必需的: api-keydocContentdocNameexpressionpageSequence :::

在线体验

使用下方表格提交您的 API 钥匙, PDFBase64),以及正则表达式模式(例如, %\d+(电子邮件模式)。回复是 JSON 匹配所有文本。无需代码,填写字段并点击。 发送请求.

Loading API Tester...

概述、参数和用例

什么是表达式提取文本?

此端点从文本中提取文本 PDF 符合正则表达式。您提供 PDFBase64), expression (正则表达式模式), pageSequence (例如,1 表示所有页面,1-3 表示某个范围,1、2、3 表示特定页面),以及可选的 async。 这 API 返回 JSON 匹配所有文本。可用于提取电子邮件、电话号码、日期等。 URLs或任何来自 PDFs

主要特点

  • 正则表达式模式expression例如 %\d+电子邮件模式、日期模式、货币。
  • 页面定位pageSequence1- (全部), 1-3 (范围), 1,2,3 (具体页面)。
  • JSON 回复:所有与指定模式匹配的项。
  • 异步: 使用 async 大型 PDFs 或者很多场比赛。

:::提示 最适合用于

当您需要从以下来源获取特定数据(电子邮件、数字、日期、金额)时,请使用此方法 PDFs如需查看全文或图片,请使用 提取资源;对于表格,请使用 从PDF中提取表格.

:::

先决条件

使用此端点之前,请确保您已具备以下条件:

  • 有效的 PDF4me API 钥匙 (获得你的 API 钥匙
  • A PDF 文档 Base64 格式或公共 URL 一个 PDF 文件
  • 要搜索的正则表达式模式

表达式示例

常见的基本正则表达式模式:

  • % - 匹配百分比符号(例如,50%,100%)
  • \d+ - 匹配一个或多个数字(例如,123、4567)
  • \d+\.\d+ - 匹配小数(例如,3.14、99.99)
  • [A-Za-z]+ - 匹配一个或多个字母
  • \d{4} - 匹配精确的 4 位数字(例如,年份像 2024)

回复格式

API 返回一个 JSON 返回与指定正则表达式模式匹配的所有文本。

获取帮助