跳到主要内容

从 Word 中提取文本 - 内容解析器 API

PDF4me 从 Word 中提取文本 此功能可让您从 Word 文档中提取文本内容,并提供页面范围和内容筛选选项。 API 该服务可处理 Word 文件并从 Word 文档中提取文本内容,并提供自定义选项。 API 通过以下方式接收 Word 文档内容 REST API 利用电话 Base64 采用编码实现安全传输。该解决方案支持页面范围选择、注释删除、页眉/页脚过滤和更改接受,是文档处理和内容分析工作流程的理想之选。

相关博客文章
目前尚无关于此功能的博客文章——敬请期待。
在此期间,您可以浏览 PDF4me 博客,查看适用于各平台的教程和工作流程。
访问博客

验证您的身份 API 要求

要访问 PDF4me REST API每个请求都必须包含正确的身份验证凭据。身份验证可确保通信安全,并验证您作为授权用户的身份。 REST API

主要特点

  • Word 文档支持从 Microsoft Word 文档(.doc、.docx)中提取文本
  • 页面范围选择:处理具有自定义起始页码和结束页码的特定页码范围或整个文档
  • 内容过滤:移除注释、页眉、页脚和修订痕迹,以提取纯净文本
  • Base64 编码:使用安全文件内容传输 Base64 编码
  • 简单的 API 一体化RESTful API 专为自动化 Word 文档处理工作流程而设计

REST API 端点

PDF4me REST API 使用标准 HTTP 与资源交互的方法。所有 Word 文本提取操作均通过单个端点执行:

  • 方法: POST
  • 终点: /api/v2/ExtractTextFromWord

REST API 参数

从 Word 中提取文本的完整参数列表 REST API参数按类别组织,以便更好地理解和实施。

重要的: 标有星号 (*) 的参数为必填项,必须提供。 API 正常运作。

必需参数

范围类型描述例子
docName*String源 Word 文档文件名(不带扩展名或带 .docx/.doc 扩展名)output
docContent*Base64String输入的 Word 文档的内容 Base64 格式JVBERi...
StartPageNumber*Integer文本提取起始页码1
EndPageNumber*Integer文本提取结束页码3
RemoveComments*Boolean选择是否从提取的文本中删除注释: 真的删除评论 错误的:包含评论true
RemoveHeaderFooter*Boolean选择是否移除页眉和页脚: 真的移除页眉/页脚, 错误的包含页眉/页脚true
AcceptChanges*Boolean选择是否接受跟踪更改: 真的接受改变, 错误的拒绝更改true

可选参数

范围类型描述例子
asyncBoolean启用异步处理。 true, 这 API 返回 202 Accepted 与一个 Location 用于轮询结果的标头false

输出

PDF4me 从 Word 中提取文本 REST API 根据处理模式的不同,会返回不同的响应。 API 返回提取的文本作为 JSON 回复 或者 文本文件

同步处理(默认)

什么时候 asyncfalse 或者未提供, API 立即返回提取的文本。

状态码: 200 OK

回复格式:

{
"extractedText": "Extracted text content from Word document pages 1 to 3...",
"fileName": "output.txt"
}

或者以文本文件的形式:

Extracted text content from Word document pages 1 to 3...

响应包含从指定页面范围提取的文本内容。

请求示例

标题

Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY

笔记:

  • 获得你的 API 钥匙 PDF4me 仪表板
  • API 关键必须是 Base64 编码后以“Basic”为前缀 Authorization 标题
  • 例如:如果你的 API 关键是 abc123将其编码为 Base64 并使用 Authorization: Basic YWJjMTIz

有效载荷

基本请求:

{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output",
"StartPageNumber": 1,
"EndPageNumber": 3,
"RemoveComments": true,
"RemoveHeaderFooter": true,
"AcceptChanges": true
}

使用异步处理:

{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output",
"StartPageNumber": 1,
"EndPageNumber": 3,
"RemoveComments": true,
"RemoveHeaderFooter": true,
"AcceptChanges": true,
"async": true
}

代码示例

PDF4me 从 Word 中提取文本 REST API 提供多种编程语言的代码示例。请选择最适合您开发环境的语言:

C# (CSharp) 示例

完全的 C# 从 Word 文档中提取文本的实现:

单词文本提取功能

文档处理

  • Word格式支持完全支持 .doc 和 .docx Microsoft Word 文档格式
  • 格式保留提取过程中保持文本格式和结构
  • 复杂文件能够处理包含表格、图像和嵌入式内容的复杂 Word 文档
  • 专业处理高质量文本提取,内容准确保留
  • 灵活输入支持各种 Word 文档版本和格式

页面处理

  • 页面范围选择从指定页码范围内提取文本,并指定起始页码和结束页码。
  • 灵活瞄准处理单个页面、页面范围或整个文档
  • 定制加工支持任意页面组合,并可进行精确控制
  • 批量处理高效地在单个页面中处理多个页面 API 呼叫
  • 专业布局在所有目标页面中实现一致的文本提取

内容过滤

  • 评论删除:可选择从提取的文本中排除评论和注释
  • 页眉/页脚筛选:移除页眉和页脚,以便干净地提取内容
  • 变更跟踪:接受或拒绝文本提取过程中跟踪的更改
  • 内容清理针对特定文本提取需求的高级筛选选项
  • 专业成果输出格式清晰、内容准确且保存完好的文本。

行业应用案例及应用

商业及企业应用案例

  • 文档分析从 Word 文档中提取文本内容以进行分析和处理
  • 内容管理:从 Word 文档中提取文本以用于内容管理系统
  • 报告处理从 Word 报告中提取文本以进行自动处理和分析
  • 商业智能从 Word 商业文档中提取文本以进行数据分析

获取帮助