跳到主要内容

通过表达式提取文本 - 正则表达式 Make

PDF4me 通过表达式提取文本 该模块提供基于模式的自动化文本提取功能。 PDF 文档 Make 利用正则表达式和搜索模式,实现多种应用场景。这项智能数据提取服务能够查找并检索发票号码、日期、金额、电子邮件地址、电话号码和自定义文本模式,从而支持跨云存储平台和业务应用程序的结构化数据提取、自动解析、字段识别和智能文档处理工作流程。

相关博客文章
目前尚无关于此功能的博客文章——敬请期待。
在此期间,您可以浏览 PDF4me 博客,查看适用于各平台的教程和工作流程。
访问博客

验证您的身份 API 要求

要访问 PDF4me 网站 API 通过 Make每个请求都必须包含正确的身份验证凭据。身份验证可确保通信安全,并验证您作为授权用户的身份,从而实现与您的系统之间的无缝集成。 Make 场景和 PDF4me强大的文本提取服务。

通过表达式提取文本

主要特点

  • 正则表达式支持使用正则表达式进行强大的模式匹配
  • 多匹配提取检索所有匹配的文本实例
  • 页面特定:指定特定页面或所有页面
  • 结构化输出返回匹配项的文本数组
  • 数据挖掘从非结构化数据中提取特定数据模式 PDFs

参数

以下是“按表达式提取文本”模块的完整参数列表。配置这些参数可以控制文本提取。

重要的: 标有星号 (***) 的参数是必需的,必须提供这些参数,模块才能正常工作。

范围类型描述例子
PDF 文件名***String来源 PDF 文件名
• 指定文件名,并带有 .pdf 扩展名
• 从上一个模块的输出映射
PDF 包含要提取的文本
• 支持动态命名
invoice.pdf
PDF 文件***缓冲PDF 文件内容
• 地图 PDF 来自前一个模块的文件缓冲区
• 数据来源:Dropbox、Google Drive、电子邮件
• 二进制 PDF 包含文本内容
• 包含数据的发票、表格或文件
[PDF Buffer]
表达***String搜索模式/正则表达式
• 正则表达式或搜索模式
• 提取特定文本模式
• 例如:发票号码、日期、电子邮件
• 可以使用简单的文本或复杂的正则表达式
INV-[0-9]{4}
页***String目标页面选择
• 逗号分隔的页码索引(从 0 开始)
• 支持带连字符的范围
• 清空所有页面
String 所需格式
0-

输出

PDF4me 通过表达式提取文本 该模块返回全面的匹配数据,以实现无缝匹配。 Make 场景整合:

表格视图

以结构化表格格式呈现的响应数据:

范围类型描述
文本列表ArrayStrings使用表达式找到的所有文本匹配项

场景示例

PDF4me 通过表达式提取文本 模块 Make 提供全面的文本提取自动化场景模板:

自动发票号码提取方案

利用自动编号提取功能,革新您的发票处理流程:

完整场景步骤:

  1. 扳机请查看电子邮件以获取发票 PDFs
  2. 获取发票 PDF: 提炼 PDF 来自电子邮件附件
  3. 提取发票号码使用模式“INV-[0-9]+”查找数字
  4. 提取量利用规律求出总金额
  5. 提取截止日期查找文档中的日期模式
  6. 创建发票记录将数据插入会计系统
  7. 存档发票: 店铺 PDF 提取元数据
  8. 通知 AP 团队:通知应付账款部门新发票

商业优势:

  • 每月自动处理 300 多张发票
  • 无需手动输入发票号码
  • 实现发票自动跟踪和路由
  • 发票处理时间缩短85%

行业应用案例及应用

  • 发票数据提取发票号码和金额
  • 采购订单处理获取采购订单号
  • 账号提取银行账户信息
  • 交易 ID查找付款参考编号

获取帮助