从 Word 中提取文本 - 内容解析器 API
PDF4me 从 Word 中提取文本 此功能可让您从 Word 文档中提取文本内容,并提供页面范围和内容筛选选项。 API 该服务可处理 Word 文件并从 Word 文档中提取文本内容,并提供自定义选项。 API 通过以下方式接收 Word 文档内容 REST API 利用电话 Base64 采用编码实现安全传输。该解决方案支持页面范围选择、注释删除、页眉/页脚过滤和更改接受,是文档处理和内容分析工作流程的理想之选。
验证您的身份 API 要求
要访问 PDF4me REST API每个请求都必须包含正确的身份验证凭据。身份验证可确保通信安全,并验证您作为授权用户的身份。 REST API。
主要特点
- Word 文档支持从 Microsoft Word 文档(.doc、.docx)中提取文本
- 页面范围选择:处理具有自定义起始页码和结束页码的特定页码范围或整个文档
- 内容过滤:移除注释、页眉、页脚和修订痕迹,以提取纯净文本
- Base64 编码:使用安全文件内容传输 Base64 编码
- 简单的 API 一体化RESTful API 专为自动化 Word 文档处理工作流程而设计
REST API 端点
这 PDF4me REST API 使用标准 HTTP 与资源交互的方法。所有 Word 文本提取操作均通过单个端点执行:
- 方法: POST
- 终点:
/api/v2/ExtractTextFromWord
REST API 参数
从 Word 中提取文本的完整参数列表 REST API参数按类别组织,以便更好地理解和实施。
重要的: 标有星号 (*) 的参数为必填项,必须提供。 API 正常运作。
必需参数
| 范围 | 类型 | 描述 | 例子 |
|---|---|---|---|
| docName* | String | 源 Word 文档文件名(不带扩展名或带 .docx/.doc 扩展名) | output |
| docContent* | Base64 (String) | 输入的 Word 文档的内容 Base64 格式 | JVBERi... |
| StartPageNumber* | Integer | 文本提取起始页码 | 1 |
| EndPageNumber* | Integer | 文本提取结束页码 | 3 |
| RemoveComments* | Boolean | 选择是否从提取的文本中删除注释: 真的删除评论 错误的:包含评论 | true |
| RemoveHeaderFooter* | Boolean | 选择是否移除页眉和页脚: 真的移除页眉/页脚, 错误的包含页眉/页脚 | true |
| AcceptChanges* | Boolean | 选择是否接受跟踪更改: 真的接受改变, 错误的拒绝更改 | true |
可选参数
| 范围 | 类型 | 描述 | 例子 |
|---|---|---|---|
| async | Boolean | 启用异步处理。 true, 这 API 返回 202 Accepted 与一个 Location 用于轮询结果的标头 | false |
输出
这 PDF4me 从 Word 中提取文本 REST API 根据处理模式的不同,会返回不同的响应。 API 返回提取的文本作为 JSON 回复 或者 文本文件。
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
同步处理(默认)
什么时候 async 是 false 或者未提供, API 立即返回提取的文本。
状态码: 200 OK
回复格式:
{
"extractedText": "Extracted text content from Word document pages 1 to 3...",
"fileName": "output.txt"
}
或者以文本文件的形式:
Extracted text content from Word document pages 1 to 3...
响应包含从指定页面范围提取的文本内容。
异步处理
什么时候 async 是 true, 这 API 异步处理文档。
初步回应:
状态码: 202 Accepted
响应头:
Location: https://api.pdf4me.com/api/v2/ExtractTextFromWordStatus/{operationId}
回复正文:
{
"traceId": "operation-trace-id"
}
民意调查结果:
使用 Location 标题 URL 投票确认完成情况:
const response = await fetch(locationUrl, {
headers: { 'Authorization': 'Basic ' + apiKey }
});
// Continue polling until status code is 200
if (response.status === 200) {
const result = await response.json();
// Process extracted text
}
错误响应
| 状态码 | 描述 | 示例回答 |
|---|---|---|
| 400 Bad Request | 请求参数无效或缺少必填字段 | {"error": "Missing required parameter: docContent"} |
| 401 Unauthorized | 无效或缺失 API 钥匙 | {"error": "Unauthorized"} |
| 408 请求超时 | 请求处理超时 | {"error": "Request timeout"} |
| 500 Internal Server Error | 处理过程中出现服务器错误 | {"error": "Internal server error"} |
了解反应
文本提取结果可以采用两种格式:
- JSON 格式包含
extractedText(字符串)和fileName(细绳) - 文本格式:包含提取内容的纯文本文件
参数详情:
- StartPageNumber 和 EndPageNumber定义页面范围(从 1 开始索引)
- RemoveComments: 什么时候
true提取前删除 Word 文档中的所有注释 - RemoveHeaderFooter: 什么时候
true提取之前,移除每页的页眉和页脚。 - AcceptChanges: 什么时候
true提取前,会接受 Word 文档中的所有跟踪更改。
支持的 Word 文档格式:
.docx(Word 2007 及更高版本).doc(Word 97-2003)
请求示例
标题
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
笔记:
- 获得你的 API 钥匙 PDF4me 仪表板
- 这 API 关键必须是 Base64 编码后以“Basic”为前缀 Authorization 标题
- 例如:如果你的 API 关键是
abc123将其编码为 Base64 并使用Authorization: Basic YWJjMTIz
有效载荷
基本请求:
{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output",
"StartPageNumber": 1,
"EndPageNumber": 3,
"RemoveComments": true,
"RemoveHeaderFooter": true,
"AcceptChanges": true
}
使用异步处理:
{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output",
"StartPageNumber": 1,
"EndPageNumber": 3,
"RemoveComments": true,
"RemoveHeaderFooter": true,
"AcceptChanges": true,
"async": true
}
代码示例
这 PDF4me 从 Word 中提取文本 REST API 提供多种编程语言的代码示例。请选择最适合您开发环境的语言:
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
单词文本提取功能
文档处理
- Word格式支持完全支持 .doc 和 .docx Microsoft Word 文档格式
- 格式保留提取过程中保持文本格式和结构
- 复杂文件能够处理包含表格、图像和嵌入式内容的复杂 Word 文档
- 专业处理高质量文本提取,内容准确保留
- 灵活输入支持各种 Word 文档版本和格式
页面处理
- 页面范围选择从指定页码范围内提取文本,并指定起始页码和结束页码。
- 灵活瞄准处理单个页面、页面范围或整个文档
- 定制加工支持任意页面组合,并可进行精确控制
- 批量处理高效地在单个页面中处理多个页面 API 呼叫
- 专业布局在所有目标页面中实现一致的文本提取
内容过滤
- 评论删除:可选择从提取的文本中排除评论和注释
- 页眉/页脚筛选:移除页眉和页脚,以便干净地提取内容
- 变更跟踪:接受或拒绝文本提取过程中跟踪的更改
- 内容清理针对特定文本提取需求的高级筛选选项
- 专业成果输出格式清晰、内容准确且保存完好的文本。
行业应用案例及应用
- Business & Enterprise
- Legal & Professional Services
- Education & Research
- Government & Compliance
- Technology & Development
商业及企业应用案例
- 文档分析从 Word 文档中提取文本内容以进行分析和处理
- 内容管理:从 Word 文档中提取文本以用于内容管理系统
- 报告处理从 Word 报告中提取文本以进行自动处理和分析
- 商业智能从 Word 商业文档中提取文本以进行数据分析
法律及专业服务用例
- 法律文件处理从法律 Word 文档中提取文本以进行案件管理
- 合同分析从合同和法律文件中提取文本
- 个案管理:从法律文件中提取文本,用于案件管理系统
- 法律研究从法律文件中提取文本以进行研究和分析
教育与研究应用案例
- 学术研究从学术Word文档中提取文本以进行研究和分析
- 研究文件从研究论文和学术文档中提取文本
- 教育内容从教育类 Word 文档中提取文本
- 学术分析从学术文档中提取文本进行分析
政府及合规应用案例
- 合规性监控从 Word 合规性文档中提取文本,用于监控和审计
- 监管文件从监管 Word 文档中提取文本
- 政府报告从政府 Word 文档中提取文本
- 公共记录从公开记录的 Word 文档中提取文本
技术与开发应用案例
- 数据迁移将 Word 文档内容转换为其他格式以进行数据迁移
- 内容处理:从 Word 文档中提取文本以进行系统集成
- API 一体化从 Word 文档中提取文本 API 加工
- 数据提取从 Word 文档中提取文本以进行数据处理