跳到主要内容

拆分文档 - 文档分割 API

PDF4me 拆分文档 此功能可让您将 Word 文档分割成多个较小的文档,并提供灵活的分割选项和全面的配置控制。 API 该服务可处理 Word 文件,并按页面、节、标题或自定义页面范围拆分文件,用户可完全控制拆分条件、文档命名和输出组织方式。 API 通过以下方式接收 Word 文档内容 REST API 利用电话 Base64 采用编码实现安全传输。该解决方案支持基于页面的拆分、基于章节的划分、基于标题的分隔以及自定义页面范围,是文档管理、内容分发和工作流程自动化的理想之选。

相关博客文章
目前尚无关于此功能的博客文章——敬请期待。
在此期间,您可以浏览 PDF4me 博客,查看适用于各平台的教程和工作流程。
访问博客

验证您的身份 API 要求

要访问 PDF4me REST API每个请求都必须包含正确的身份验证凭据。身份验证可确保通信安全,并验证您作为授权用户的身份。 REST API

主要特点

  • 多种拆分类型按页面、章节、标题或自定义范围拆分
  • 页面范围支持按特定页码或页码范围拆分
  • 基于部分的分割在每个 Word 章节之后拆分文档
  • 标题式部门:按指定样式的每个标题(例如,标题 1、标题 2)拆分文档
  • 灵活配置:使用 splitConfig 参数自定义拆分条件
  • 唯一文档名称每个拆分后的文档都会获得一个唯一的 GUID 文件名。
  • 格式保留保持文档的原始格式和结构
  • 文化支持:特定于区域设置的文档处理

REST API 端点

PDF4me REST API 使用标准 HTTP 与资源交互的方法。所有文档拆分操作均通过单个端点执行:

  • 方法: POST
  • 终点: office/ApiV2Word/SplitDocument

REST API 参数

拆分文档的完整参数列表 REST API参数按类别组织,以便更好地理解和实施。

重要的: 标有星号 (*) 的参数为必填项。 splitConfig 当需要参数时 splitType 是“数组”、“页数”或“标题”。

必需参数

范围类型描述例子
文档*Object文件参考。必须包含 姓名string):Word 文件名,扩展名为 .docx。用于参考和处理。{ "Name": "document.docx" }
文档内容*Base64Word文档内容编码 Base64文档将根据指定条件拆分。必须是有效的 Word 文档(.docx、.doc 格式)。base64EncodedDocumentContent

可选参数

范围类型描述例子
分体式String文档拆分类型。选项: allpages - 拆分成多个页面(默认), array - 按明确的页码范围拆分(例如“1-3,4,5-7”), numberofpages - 每 N 页后分割(配置:正整数,例如“3”或“5”), section - 将文档按章节拆分, headings - 根据给定样式的每个标题(例如“标题 1”)拆分文档。每个拆分后的文档都会获得一个唯一的 ID。 GUID 文件名"allpages"
splitConfigString分片配置。 对于数组: 页面范围如“1-3,4,5-7”(第 1-3 页、第 4 页、第 5-7 页)或单个页面“1,3,5”。 页数:像“3”或“5”这样的正整数:每 N 页后分割。 标题标题样式名称,例如“标题 1”或“标题 2”。当 splitType 为“array”、“numberofpages”或“headings”时为必填项。页码从 1 开始。标题匹配不区分大小写。"1-3,4,5-7" 或者 "3" 或者 "Heading 1"
文化名称String文档处理的区域性代码(例如,“en-US”、“de-DE”、“fr-FR”)。默认值:“en-US”。影响文档语言和格式。用于元数据和本地化处理。en-US

拆分类型选项

API 提供不同的文档拆分类型:

分体式描述需要 splitConfig用例
allpages分页显示(默认)将每一页提取为单独的文档
array按明确的页码范围拆分。每个以逗号分隔的范围都成为一个文档(例如,“1-3,4,5-7” → 3 个文档)。是的从特定页面范围或单个页面创建文档
numberofpages每隔 N 页拆分一次。按顺序拆分:每 N 页形成一个文档;剩余部分构成最后一个文档。是的分成大小相等的部分(例如,每 3 页或 5 页)
section在每个 Word 节之后拆分文档每个部分一份文件
headings在指定样式的每个标题(例如“标题 1”)之后拆分文档是的按标题级别提取章节或部分

拆分配置示例

了解拆分配置有助于优化文档拆分工作流程:

array:明确的页面范围

  • "1-3,4,5-7" → 3 个文件:第 1-3 页、第 4 页、第 5-7 页
  • "1,3,5" → 3 个文档:第 1 页、第 3 页、第 5 页
  • "1-5,6-10" → 2 份文件:第 1-5 页,第 6-10 页

numberofpages每隔 N 页分割一次

行为: 每隔 N 页依次分割。 配置: 必填,格式为单个正整数(例如: "3""5")。

例如:

  • 配置 "3" 一份10页的文件 → 分为4份文件:

    文件1:第1-3页,文件2:第4-6页,文件3:第7-9页,文件4:第10页

  • 配置 "5" 一份12页的文件 → 分为3份文件:

    文件1:第1-5页,文件2:第6-10页,文件3:第11-12页

headings每个标题后拆分

  • "Heading 1"每个区块包含一份文档,区块结束于下一个标题 1(或文档末尾)。
  • "Heading 2"每个区块包含一份文档,区块结束于下一个二级标题(或文档末尾)。
  • 不区分大小写的匹配

section

无需任何配置。文档会在每个 Word 分节符后拆分;每个分节符都会成为一个单独的文档。

输出

PDF4me 拆分文档 REST API 返回拆分结果 JSON。 这 API 返回一个包含标准响应字段的单个文档(第一个拆分文档)。

同步处理(默认)

API 处理请求并返回第一个拆分文档:

状态码: 200 OK

内容类型: application/json

回复正文:

{
"document": "UEsDBBQABgAIAAAAIQDfpNJsWgEAACAFAAATAAgCW0NvbnRlbnRfVHlwZXNdLnhtbCCiBAIooAAC...",
"fileName": "a1b2c3d4-e5f6-7890-abcd-ef1234567890.docx",
"success": true,
"errorMessage": null
}

回复字段:

  • 文档string):第一个拆分文档的内容,编码为 Base64 细绳
  • 文件名string):为拆分文档生成的文件名(GUID-基于)
  • 成功boolean):指示请求是否成功
  • 错误信息string (或 null):成功为假时的错误详情

使用方法:

  1. 提取 document 来自该领域的 JSON 回复 (Base64
  2. 解码 Base64 获取二进制 Word 文档数据的字符串
  3. 使用 fileName 保存拆分后的文档

示例(JavaScript):

const response = await fetch(url, options);
const data = await response.json();
const wordBytes = atob(data.document); // Decode Base64
// Save with data.fileName or custom name

请求示例

标题

Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY

笔记:

  • 获得你的 API 钥匙 PDF4me 仪表板
  • API 关键必须是 Base64 编码后以“Basic”为前缀 Authorization 标题
  • 例如:如果你的 API 关键是 abc123将其编码为 Base64 并使用 Authorization: Basic YWJjMTIz

有效载荷

基本示例(拆分所有页面 - 默认):

{
"document": { "Name": "document.docx" },
"docContent": "base64EncodedDocumentContent",
"splitType": "allpages"
}

页面范围示例(数组):

{
"document": { "Name": "document.docx" },
"docContent": "base64EncodedDocumentContent",
"splitType": "array",
"splitConfig": "1-3,4,5-7"
}

每 N 页后分割示例(页数):

{
"document": { "Name": "document.docx" },
"docContent": "base64EncodedDocumentContent",
"splitType": "numberofpages",
"splitConfig": "3"
}

基于标题的示例(每个标题后拆分):

{
"document": { "Name": "document.docx" },
"docContent": "base64EncodedDocumentContent",
"splitType": "headings",
"splitConfig": "Heading 1",
"cultureName": "en-US"
}

分段示例(每节后拆分):

{
"document": { "Name": "document.docx" },
"docContent": "base64EncodedDocumentContent",
"splitType": "section",
"cultureName": "en-US"
}

代码示例

PDF4me 拆分文档 REST API 提供多种编程语言的代码示例。请选择最适合您开发环境的语言:

C#CSharp) 样本

完全的 C# 实现 Word 文档拆分:

行业应用案例及应用

法律及专业服务用例

  • 合同管理将多方合同拆分为各个部分
  • 案例文件从案件文件中提取特定页面
  • 合规报告将相关章节分发给不同部门
  • 法律研究按主题或章节拆分大型法律文件

获取帮助