跳到主要内容

使用分类的 AI 文档解析器

本指南涵盖的内容

AI文档解析器。分类 允许一个分析器在一次调用中处理多个文档变体。您可以定义一个 分析器 ID然后加一个 每个变体的图表 (客户 ABC、客户 XYZ、通用发票、通用采购订单)。每个模式都包含一个 分类名称,一个 分类提示 用自然语言来说, 文档模式 描述要提取的字段。运行时,AI 会将输入的内容与输入的内容进行匹配。 PDF 针对每个模式的分类提示,选择最佳匹配项,并返回匹配的分类名称和提取的字段。同一个分析器 ID 适用于以下情况: REST API 以及所有支持的自动化平台。

相关博客文章(4)
在 Make 中使用 AI 提取和智能重命名任何 PDF:一个包含 4 个模块的 Dropbox 工作流程,借助 PDF4me AI - 文档解析器
四模块构建场景:从 Dropbox 拉取供应商 PDF 文件,运行 AI 文档解析器(默认发票提取),解析 JSON 提取供应商名称,然后以 vendorName.pdf 为文件名重新上传。真实截图,精确字段值,无需手动输入数据。
阅读帖子
在 Zapier 中使用 AI 重命名供应商发票:Dropbox + PDF4me 的 5 步工作流程
五步 Zap:Dropbox 新建文件 → Dropbox 查找文件 → PDF4me AI 文档解析器 → Zapier 代码运行 JavaScript → Dropbox 上传文件。利用 AI 提取客户姓名并将其用作输出文件名。真实截图,精确字段值,除两行 JSON.parse 代码外,无需其他代码。
阅读帖子
在 Zapier 中按供应商名称重命名所有供应商发票:5 步 Dropbox + PDF4me AI 工作流程
五步搞定应付账款团队。Dropbox 监控您的发票接收文件夹,PDF4me AI 文档解析器从每个 PDF 文件中提取供应商名称,Zapier 代码将解析器的输出转换为可映射的标记,Dropbox 将文件上传回 Dropbox,并将供应商名称作为文件名。本教程中使用的示例供应商发票 (sample-vendor-invoice.pdf) 和实际截图、精确字段值均可下载。
阅读帖子

验证您的设置

分类分析器是在以下情况下创建的: PDF4me 开发者控制面板。使用您的帐户登录,然后创建或复制一个 API AI解析器的关键 API 调用引用您在此处构建的分析器的函数。

本指南中将使用的仪表盘网址:

您不容错过的重要事实

一个分析器,多个模式(每个变体一个模式)
Classify 专为实际应用场景而设计,例如客户 ABC 的发票与客户 XYZ 的发票格式可能有所不同。您可以根据发票变体的数量添加任意数量的模式。每个模式都是一个独立的分类名称 + 提示 + 文档模式包。
分类提示是路由核心
请使用简洁明了的英语撰写。在页面顶部标明公司名称、联系邮箱、布局提示以及此版本特有的关键词等具体标识。提示越清晰,流程就越顺畅。
分类操作会同时返回标签和数据。
与纯粹的分类器不同,响应中包含匹配的分类名称。 从该模式的文档模式中提取所有字段。一次调用即可获得路由决策和提取结果。 JSON 一起。

步骤 1:在控制面板中打开 AI 文档解析器

  1. 登录 dev.pdf4me.com
  2. 从仪表盘侧边栏点击 AI文档解析器
  3. 列表页面显示所有现有的分析器,包含三列: 分析器 ID分析器类型 (解析或分类),以及 行动
  4. 点击蓝色 + 添加 按下按钮即可启动新的分析器。
PDF4me AI 文档解析器仪表板列表视图,侧边栏项目“AI 文档解析器”以红色突出显示,主面板顶部有一个蓝色的“添加”按钮,以及一个空白表格,列标题分别为“分析器 ID”、“分析器类型”和“操作”。

AI文档解析器列表视图。点击“+ 添加”以启动新的分析器。

步骤 2:创建分类分析器

新行出现,包含三个控件:

  1. 分析器 ID 输入输入任何你能记住的清晰标识符,例如 client_invoicesVendor Documents, 或者 incoming-orders命名格式没有限制。蛇形命名法、驼峰命名法、烤肉串命名法、带空格的普通单词,都适用。以下示例使用 client_invoices
  2. 分析器类型下拉菜单。 挑选 分类 (本指南)或 解析 (参见) 解析指南)。
  3. 保存/取消 按钮。“保存”按钮用于创建分析器;“取消”按钮用于放弃该行。
PDF4me AI 文档解析器打开“添加行”功能,分析器 ID 字段已填充 client_invoices,分析器类型下拉菜单中“分类”选项高亮显示在“解析”上方,并且该行中已选中“分类”值,右侧有“保存”和“取消”按钮。

添加行:输入分析器 ID(此处) 客户发票), 挑选 分类然后保存。

步骤 3:打开分析器并添加第一个架构

点击新行即可打开详情页面。URL 格式如下:

https://dev.pdf4me.com/ai-document-parser/?id=<your-analyzer-guid>

首次打开控制面板时,它会为每个分析器生成一个 GUID。将此 URL 添加到书签,以便下次直接跳转到同一个分类分析器。

详情页面显示:

  • 分类信息 (左图)显示您在步骤 2 中输入的分析器 ID(此处)。 client_invoices此面板为只读面板。
  • 模式 (右)默认为空。每个架构都是一个文档变体。点击 + 点击右上角的按钮添加第一个架构。
  • 保存更改 (左上角)会保留您对此页面所做的每次编辑。
  • 后退返回到 分析器列表
PDF4me AI 文档解析器分类分析器详情页面。蓝色横幅标题为“AI 文档解析器”,副标题为“利用 AI 自动提取发票数据,快速、准确、结构化输出”。下方是“返回”按钮和蓝色“保存更改”按钮。左侧的“分类信息”面板显示分析器 ID:client_invoices。右侧的“架构”部分为空,最右侧有一个蓝色加号按钮,用于添加新架构。

详情页。 分类信息 左侧显示分析器 ID。点击蓝色“+”按钮添加架构。

步骤 4:填写分类名称、提示和文档模式

每个模式都是分析器必须处理的一种文档变体。每个模式都有三个必需的输入项,底部还有一个常用的快速填充行。

模式字段(必填)

场地目的例子
Classification NameThe label returned by the API when this Schema matches. Use a short, business-friendly name.Client ABC
Classification PromptNatural-language description of how to recognise this variant. Mention company name, email, layout cues, distinguishing phrases. This is what the AI uses to route.The invoice has the company name ABC at the top, followed by the contact email [email protected].
Document SchemaJSON object with a description and a fields array. Each field has fieldName, fieldType, and fieldDescription, plus an optional fieldMethod such as generate for derived values.{ "description": "Extract invoice detail for ABC invoices", "fields": [ ... ] }

示例模式:客户端 ABC

PDF4me AI 文档解析器分类模式编辑器显示了第一个模式,标题为“客户 ABC”。左侧的“分类信息”面板包含分析器 ID client_invoices。模式卡片包含一个红色垃圾桶图标(用于删除)、一个值为“客户 ABC”的“分类名称”字段、一个文本为“顶部发票名称将包含公司名称 ABC,之后顶部将显示客户邮箱地址 abc.com”的分类提示字段,以及一个文档模式 JSON 编辑器,其中显示了“提取 ABC 发票详细信息”的描述,以及一个以“invoiceNumber”(字符串)、“发票编号”、“账单编号”、“收据编号”和“invoiceDate”(生成日期)开头的字段数组。编辑器下方是“发票”和“采购订单”快速填充按钮。

第一个模式。分类名称、分类提示和文档模式共同描述一个文档变体。

Client ABC. Document Schema
{
"description": "Extract invoice detail for ABC invoices",
"fields": [
{
"fieldName": "invoiceNumber",
"fieldType": "string",
"fieldDescription": "Invoice number / bill number / receipt number"
},
{
"fieldName": "invoiceDate",
"fieldType": "date",
"fieldMethod": "generate",
"fieldDescription": "Look for labels: 'Invoice Date', 'Bill Date', 'Date', 'Dated', 'Issue Date', 'Doc Date'. If 4-digit year not found then consider 2-digit year at the end of extracted date."
}
]
}

客户 ABC 的分类提示是引导 AI 找到此模式的自然语言提示:

发票顶部印有公司名称 ABC,下方是联系邮箱。 [email protected]

步骤 5:添加更多架构并保存更改

点击蓝色 + 再次点击按钮,为下一个变体添加架构。每个新架构都有自己的分类名称、分类提示和文档架构。不同架构的字段可以完全不同。例如,客户 ABC 可能没有客户参考列,而客户 XYZ 则有。

示例二:客户端 XYZ

PDF4me AI 文档解析器对第二个名为“客户 XYZ”的架构卡片进行分类。分类名称:客户 XYZ;分类提示:该文档是一张发票,顶部显示公司名称 XYZ,下方是 xyz.com 的电子邮件地址,再下方是地址,以及一个文档架构 JSON 编辑器,其中显示了描述信息:从公司 XYZ 的发票中提取发票数据,字段数组以 invoiceNumber 和 invoiceDate 开头。编辑器下方是“发票”和“采购订单”的快速填充按钮。

同一分析器的第二个模式。两个模式现在都位于 客户发票

Client XYZ. Document Schema
{
"description": "Extract Invoice data from company XYZ's Invoice",
"fields": [
{
"fieldName": "invoiceNumber",
"fieldType": "string",
"fieldDescription": "Invoice number / bill number / receipt number"
},
{
"fieldName": "invoiceDate",
"fieldType": "date",
"fieldMethod": "generate",
"fieldDescription": "Look for labels: 'Invoice Date', 'Bill Date', 'Date', 'Dated', 'Issue Date', 'Doc Date'. If 4-digit year not found then consider 2-digit year at the end of extracted date."
}
]
}

保存后,架构列表将折叠。

两个模式都导入后,列表中会将每个模式显示为一张可折叠卡片,左侧显示分类名称,右侧有展开箭头。点击卡片即可稍后再次编辑。

PDF4me AI 文档解析器分类分析器的详细信息页面,以折叠列表视图显示两个架构。左侧的“分类信息”面板显示分析器 ID:client_invoices。右侧的“架构”部分以折叠的卡片形式列出客户 ABC 和客户 XYZ,卡片带有展开箭头。右上角有一个蓝色加号按钮,用于添加更多架构。

两个方案均已保存。点击任意卡片即可展开编辑;使用“+”号添加更多变体。

点击 保存更改 在左上角启用保存功能,即可保存您添加的每个架构。分析器现已上线,可以接收数据。 PDFs

文档架构中的字段级选项

属性必需的?它的作用
fieldNameRequiredThe name of the field and how it will appear in the response JSON.
fieldTypeRequiredThe type of data to extract. One of string, number, date, or table.
fieldDescriptionRequiredNatural-language description of what needs to be extracted and where to find it. Include alternate labels and example formats so the AI matches correctly.
fieldMethodOptional (default extract)How the AI fills the value. extract takes the value verbatim from the document. generate tells the AI to derive or normalise it (useful for dates, computed totals, or cleaned-up IDs). Omit for default extract behaviour.
fieldsRequired when fieldType is tableNested array describing the columns of the table. Each entry takes the same attributes as a top-level field (fieldName, fieldType, fieldDescription, fieldMethod). Cannot itself be table.

包含表字段的模式(嵌套行)

使用 字段类型:"表格" 当模式需要提取重复行(例如发票明细项)时,每个表字段都有其自身的嵌套结构。 字段 描述列的数组。

{
"description": "Invoice data extractor",
"fields": [
{
"fieldName": "invoiceNumber",
"fieldType": "string",
"fieldDescription": "Invoice number / bill number / receipt number"
},
{
"fieldName": "invoiceDate",
"fieldType": "date",
"fieldDescription": "Look for labels: 'Invoice Date', 'Bill Date', 'Date', 'Dated', 'Issue Date', 'Doc Date'. If 4 digit year not found then consider 2 digit year at the end of extracted date.",
"fieldMethod": "generate"
},
{
"fieldName": "lineItems",
"fieldType": "table",
"fieldDescription": "All product / service rows from the invoice table. Be careful, sometimes a row can be part of the next item like when description goes over one line, but it's of a single item.",
"fields": [
{
"fieldName": "itemNumber",
"fieldType": "string",
"fieldDescription": "Product number, product id number or product code"
},
{
"fieldName": "hsnCode",
"fieldType": "string",
"fieldDescription": "HSN / SAC code (4 to 8 digit)"
}
]
}
]
}

快速填充按钮(用作起点)

模式编辑器提供 发票采购订单 文档架构卡底部预设按钮。 将它们作为起点 仅此而已。单击即可填充该文档系列的典型架构,然后调整字段名称、类型、方法和描述,以匹配您正在配置的特定变体。预设只是框架,并非最终形态。

使用分类分析器 API 或自动化呼叫

保存后,同一个分析器 ID 可通过引用在任何平台上运行。您无需在每个平台上重新创建架构。

场地来源目的
AnalyzerId您在步骤 2 中输入的字符串(client_invoices分类分析器的稳定标识符。
docName来源 PDF 文件名用于跟踪和错误消息。
docContent来源 PDF 编码为 Base64待分类和提取信息的文档。
asyncfalse 对于同步, true 用于民意调查控制响应的传递。

例子 REST 请求正文:

{
"docName": "incoming_invoice.pdf",
"docContent": "BASE64_ENCODED_PDF_CONTENT",
"AnalyzerId": "client_invoices",
"async": false
}

响应包含匹配的分类名称以及该模式文档模式中定义的字段。识别为客户端 ABC 的文档返回客户端 ABC 的字段;识别为客户端 XYZ 的文档返回客户端 XYZ 的字段。一次调用,两种决策。

常用工作流程

典型的分类分析器模式How a Classify Analyzer with multiple Schemas runs in production.
多客户端 AP 收件箱
  1. 来自客户 ABC、客户 XYZ 以及其他几家供应商的发票都集中到一个邮箱里。
  2. MakeZapierPower Automate, 或者 n8n 调用 AI 解析器 分析器 ID:client_invoices
  3. 响应包含分类名称(客户 ABC、客户 XYZ 等)和提取的字段。
  4. 切换步骤会将每个结果路由到匹配项。 ERP 使用分类名称记录客户信息;提取的字段直接填充发票记录。
无需重建即可完成供应商入驻
  1. 新供应商首次发送的发票格式与以往不同。
  2. 操作开启现有 客户发票 在仪表板中点击分析器 +
  3. 添加了一个新的架构,其中包含分类名称(供应商名称)、描述布局的分类提示以及重要字段的文档架构。
  4. 下一个入站 PDF 会自动路由到新的架构。无需重新配置自动化线路。
混合文档分类
  1. 一个分析器可以分析发票、采购订单和贷项通知单。
  2. 每个模式的分类提示都描述了区分标记(“包含”) 记账到 以及应付总额”与“包含采购订单号和收货地址”相比。
  3. 每个模式的文档模式提取与该文档类型相关的字段。
  4. 下游路由根据分类名称进行分支;每个分支都写入匹配的系统。

Classify 的模式最佳实践

  • 每个稳定的文档变体对应一个模式。布局截然不同的两个供应商应该使用两个不同的模式,而不是使用一个模式但规则重叠。
  • 分类提示就是您的路由规则。请用简洁的英语编写,并包含具体的标记(公司名称、电子邮件、特殊短语、布局提示)。
  • 分类名称应简短、易于理解且稳定。下游路由分支将以此为基础。
  • 使用“发票”和“采购订单”快速填充按钮作为起点,然后完善每个变体的字段描述。
  • 添加 fieldMethod: "generate" 对于日期、计算总数或字段,AI 应该规范化值而不是逐字复制。
  • 在正式上线之前,务必使用真实样本对每个架构进行测试:例如,ABC 客户的发票应该始终路由到 ABC 客户的架构,而不是 XYZ 客户的架构。
  • 点击 保存更改 每次编辑后,未保存的模式会在导航过程中丢失。

相关行动

AI文档解析器使用解析器
同一个仪表盘,每个分析器使用一个架构。适用于处理的所有文档都使用同一布局系列的情况。
AI - 文档解析器 Make
使用您保存的分类分析器 ID Make 场景:将其与任何数据源和存储模块结合使用,以在可视化工作流中展开路由和提取操作。
AI - 文档解析器 Power Automate
从以下位置运行相同的分类分析器 Power Automate 流畅自然地连接 SharePointExcelDataverse, 和 Outlook
AI - 文档解析器 n8n
自托管或云 n8n 工作流程。“AI 分析器 ID”下拉菜单会直接从您的帐户加载您保存的分析器。
AI - 文档解析器 Zapier
从 6000 多个 AI 中提取触发器 SaaS 应用程序和 Webhook。在“AI 分析器名称”字段中输入您保存的分类分析器 ID。

常见问题解答

How is Classify different from Parse in AI Document Parser?+
Parse holds a single Document Schema and returns its extracted fields. Classify holds multiple Schemas, one per document variant, each with its own Classification Prompt and Document Schema. At runtime the AI picks the best-matching Schema and returns its fields plus the Classification Name. Use Classify when one Analyzer must handle several layouts.
What is the Classification Prompt?+
A natural-language description of the markers that identify this document variant. Mention the company name printed at the top, the contact email, layout cues, anything distinctive. The AI compares every Schema Classification Prompt against the incoming PDF to pick the best match.
Can each Schema have different fields?+
Yes. Each Schema has its own Document Schema, so Client ABC can extract invoiceNumber and invoiceDate while Client XYZ extracts invoiceNumber, customerRef, and PONumber. The response contains exactly the fields defined in the matched Schema.
What does fieldMethod: generate do?+
Inside a Document Schema, fieldMethod controls how the AI fills the value. generate tells the AI to derive or normalize the value rather than copy a substring verbatim. Useful for dates (normalize multiple formats), totals (compute or normalize), and identifiers that may need cleanup. Omit fieldMethod for straight extraction.
How many Schemas can I add to one Analyzer?+
No hard cap published. In practice, 5 to 20 well-described Schemas per Analyzer perform best. If you need dozens, group similar variants under broader Classification Names and let the Document Schema handle the small differences.
Does the Analyzer Id change after Save Changes?+
No. The Analyzer Id is the string you typed in the Add row in Step 2 (for example client_invoices). It stays stable across edits and is the value every API call and automation module uses.
Do I need to upload a sample PDF when setting up the Analyzer?+
No. The AI Analyzer does not need a sample for setup. You describe each variant in natural language via the Classification Prompt; the AI engine applies the prompts to whatever document you send at runtime.
What happens if the incoming PDF does not match any Schema confidently?+
The AI still returns its best guess. To handle ambiguous cases, add a catch-all Schema with a generic Classification Prompt and a minimal Document Schema, or route low-confidence responses to a manual review queue in your automation.

获取帮助