从 Word 中提取文本
提炼 → 从 Word 中提取文本
这 从 Word 中提取文本 API 从 Word 文档(.doc、.docx)中提取文本。您将文档作为 Base64 (docContent), docName, StartPageNumber, EndPageNumber, RemoveComments, RemoveHeaderFooter, AcceptChanges,并且(可选) async。 这 API 返回 JSON 或者保存提取文本的文本文件。请使用下面的测试工具进行尝试;更多详情请参见后续章节。
尝试使用 Word 的“提取文本”功能 API
:::备注 快速参考
终点: POST /api/v2/ExtractTextFromWord · 必需的: api-key, docContent, docName, StartPageNumber, EndPageNumber, RemoveComments, RemoveHeaderFooter, AcceptChanges
:::
使用下方表格提交您的 API 关键,Word 文档(Base64)、页面范围和选项(移除评论、页眉/页脚、接受跟踪更改)。响应是 JSON 或包含提取内容的文本。无需代码,填写字段并点击 发送请求.
概述、参数和用例
- Overview
- Parameters
- Use cases
什么是从 Word 文档中提取文本?
此端点从 Word 文档(.doc、.docx)中提取文本。您可以指定页面范围(StartPageNumber, EndPageNumber)和选项: RemoveComments (去除评论) RemoveHeaderFooter (去除页眉/页脚) AcceptChanges (应用跟踪更改)。 API 返回 JSON 或者导出为包含提取文本的文本文件。当您需要从 Word 文档中提取纯文本以进行搜索、分析或迁移时,可以使用此功能。
主要特点
- 页面范围: StartPageNumber 和 EndPageNumber 限制提取范围至特定页面。
- 内容过滤: RemoveComments, RemoveHeaderFooter, AcceptChanges 控制包含的内容。
- 格式支持 .doc 和 .docx 格式(Base64)。
- 异步: 使用 async 用于大型文档。
:::提示 最佳用途
当您需要从 Word 文档导出纯文本时(例如,用于搜索、迁移或分析)。 PDF 提取用途 提取资源 或者 通过表达式提取文本.
:::
API 参数
| 范围 | 类型 | 必需的 | 描述 |
|---|---|---|---|
| api-key | 细绳 | 是的 | 你的 PDF4me API 钥匙, Base64 已编码。从……获取 仪表板。 |
| docContent | base64 | 是的 | Word文档内容(Base64).doc,.docx。 |
| docName | 细绳 | 是的 | Word 文件名(例如 output)。 |
| StartPageNumber | 整数 | 是的 | 起始页码。 |
| EndPageNumber | 整数 | 是的 | 页码结束。 |
| RemoveComments | 布尔值 | 是的 | 从提取的文本中删除注释。 |
| RemoveHeaderFooter | 布尔值 | 是的 | 从提取的文本中删除页眉/页脚。 |
| AcceptChanges | 布尔值 | 是的 | 接受文档中的修订痕迹。 |
| async | 布尔值 | 不 | 启用异步处理。 |
何时使用“从 Word 中提取文本”功能
- 内容迁移从 Word 文档中提取文本,以便导入到内容管理系统、搜索引擎或数据库中。
- 分析获取用于自然语言处理、搜索索引或报告的纯文本。
- 页面特定仅提取页码范围(例如附录、特定章节)。
需要完整信息 API?
有关请求/响应模式和代码示例,请参阅 从 Word 中提取文本 在 PDF4me API 文档。
:::
先决条件
使用此端点之前,请确保您已具备以下条件:
- 有效的 PDF4me API 钥匙 (获得你的 API 钥匙)
- Word 文档(.docx 或 .doc) Base64 格式
回复格式
这 API 返回一个 JSON 返回包含从指定页面范围提取的文本内容的响应或文本文件。