通过表达式提取文本
提炼 → 通过表达式提取文本
这 通过表达式提取文本 API 从文本中提取文本 PDF 它与正则表达式匹配。你发送 PDF 作为 Base64 (docContent), docName, expression (正则表达式模式), pageSequence (例如 1-、1-3、1,2,3),以及可选的 async。 这 API 返回 JSON 匹配所有项。请使用下面的测试工具进行尝试;更多详情和表达式示例请参见后续章节。
尝试使用表达式提取文本功能 API
:::备注 快速参考
终点: POST /api/v2/ExtractTextByExpression · 必需的: api-key, docContent, docName, expression, pageSequence
:::
使用下方表格提交您的 API 钥匙, PDF (Base64),以及正则表达式模式(例如, %, \d+(电子邮件模式)。回复是 JSON 匹配所有文本。无需代码,填写字段并点击。 发送请求.
概述、参数和用例
- Overview
- Parameters
- Use cases
什么是表达式提取文本?
此端点从文本中提取文本 PDF 符合正则表达式。您提供 PDF (Base64), expression (正则表达式模式), pageSequence (例如,1 表示所有页面,1-3 表示某个范围,1、2、3 表示特定页面),以及可选的 async。 这 API 返回 JSON 匹配所有文本。可用于提取电子邮件、电话号码、日期等。 URLs或任何来自 PDFs。
主要特点
- 正则表达式模式: expression例如
%,\d+电子邮件模式、日期模式、货币。 - 页面定位: pageSequence:
1-(全部),1-3(范围),1,2,3(具体页面)。 - JSON 回复:所有与指定模式匹配的项。
- 异步: 使用 async 大型 PDFs 或者很多场比赛。
:::提示 最适合用于
当您需要从以下来源获取特定数据(电子邮件、数字、日期、金额)时,请使用此方法 PDFs如需查看全文或图片,请使用 提取资源;对于表格,请使用 从PDF中提取表格.
:::
先决条件
使用此端点之前,请确保您已具备以下条件:
- 有效的 PDF4me API 钥匙 (获得你的 API 钥匙)
- A PDF 文档 Base64 格式或公共 URL 一个 PDF 文件
- 要搜索的正则表达式模式
表达式示例
- Basic Patterns
- Currency & Percentages
- Contact Information
- Dates
- Text Patterns
- Advanced
- Quick Test Examples
常见的基本正则表达式模式:
%- 匹配百分比符号(例如,50%,100%)\d+- 匹配一个或多个数字(例如,123、4567)\d+\.\d+- 匹配小数(例如,3.14、99.99)[A-Za-z]+- 匹配一个或多个字母\d{4}- 匹配精确的 4 位数字(例如,年份像 2024)
提取财务数据的模式:
\d+%- 将百分比与数字匹配(例如,50%,100%)\$[\d,]+\.?\d*- 核对美元金额(例如,$100、$1,234.56)€[\d,]+\.?\d*- 匹配欧元金额(例如,€50、€1,000.00)£[\d,]+\.?\d*- 匹配英镑金额(例如,£50、£1,000.00)
从文档中提取联系方式:
[a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\.[a-zA-Z]{2,}- 匹配电子邮件地址(例如, [email protected])\+?[\d\s\-\(\)]{10,}- 匹配电话号码(各种格式)https?://[^\s]+- 匹配 URLs (例如。, https://example.com)
以各种格式提取日期:
\d{1,2}/\d{1,2}/\d{2,4}- 匹配日期,例如 2024 年 12 月 25 日或 2024 年 1 月 5 日\d{4}-\d{2}-\d{2}- 匹配 ISO 日期(例如,2024-12-25)[A-Z]{2,3}\s+\d{1,2}\s+\d{4}- 匹配日期,例如“2024年12月25日”
提取特定文本模式:
PDF|pdf- 将单词“匹配起来”PDF(不区分大小写的模式)Chapter\s+\d+- 匹配“章节”后跟数字(例如,第 1 章)[A-Z][a-z]+\s+[A-Z][a-z]+- 匹配大写姓名(例如,John Doe)
针对特定用例的复杂模式:
\b\d{3}-\d{2}-\d{4}\b- 匹配社会安全号码格式(例如,123-45-6789)\b\d{4}\s\d{4}\s\d{4}\s\d{4}\b- 核对信用卡号码(16 位数字,带空格)[A-Z]{2}\d{2}\s?\d{4}\s?\d{4}\s?\d{4}\s?\d{4}\s?\d{4}\s?\d{4}- 匹配 IBAN 格式
推荐的表达式,供您测试 sample (2).pdf 文件:
%- 找出所有百分号(从简单的开始)\d+提取文档中的所有数字[a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\.[a-zA-Z]{2,}提取电子邮件地址https?://[^\s]+- 提取网页链接\d{1,2}/\d{1,2}/\d{2,4}- 提取日期\$[\d,]+\.?\d*提取美元金额
页面顺序示例:
1-- 从第1页到最后一页的所有页面1-3第1、2和3页1,2,3- 具体指第1、2和3页all- 所有页面(如果支持)
回复格式
这 API 返回一个 JSON 返回与指定正则表达式模式匹配的所有文本。