从 Word 文档中提取元数据 - 文档分析 API
PDF4me 从 Word 中提取元数据 使您能够从 Word 文档中提取全面的元数据和属性,并具备详细的文档分析功能。 API 该服务处理 Word 文件,并检索内置文档属性、自定义属性、文档统计信息、作者信息、创建日期和修订跟踪信息。 API 通过以下方式接收 Word 文档内容 REST API 利用电话 Base64 采用编码技术实现安全传输。该解决方案支持特定文化的格式设置和本地化,是文档管理、合规性跟踪、内容分析和企业文档工作流程的理想之选。
验证您的身份 API 要求
要访问 PDF4me REST API每个请求都必须包含正确的身份验证凭据。身份验证可确保通信安全,并验证您作为授权用户的身份。 REST API。
主要特点
- 综合元数据提取检索所有内置和自定义文档属性
- 文档统计获取实时页数、字数、字符数和段落数
- 作者信息提取作者、经理、公司和联系方式
- 日期/时间属性获取创建、修改和打印时间戳
- 自定义属性:访问所有带有自动前缀的自定义文档属性
- 文化支持:根据指定的区域设置格式化日期和时间
- 只读操作提取元数据而不修改原始文档
- 结构化输出返回已整理的元数据 JSON 便于处理的格式
REST API 端点
这 PDF4me REST API 使用标准 HTTP 与资源交互的方法。所有元数据提取操作均通过单个端点执行:
- 方法: POST
- 终点:
office/ApiV2Word/ExtractMetadata
REST API 参数
从 Word 中提取元数据的完整参数列表 REST API参数按类别组织,以便更好地理解和实施。
重要的: 标有星号 (*) 的参数为必填项,必须提供。 API 正常运作。
必需参数
| 范围 | 类型 | 描述 | 例子 |
|---|---|---|---|
| 文档* | Object | 文件参考。必须包含 姓名 (字符串):扩展名为 .docx 的 Word 文件名 | { "Name": "document.docx" } |
| 文档内容* | Base64 | Word文档内容编码 Base64 | UEsDBBQABgAIAAAA... |
可选参数
| 范围 | 类型 | 描述 | 例子 |
|---|---|---|---|
| 文化名称 | String | 日期/时间格式的区域性代码(例如,“en-US”、“de-DE”、“fr-FR”)。默认值:InvariantCulture(统一格式)。影响元数据中的日期/时间显示格式。无效的区域性代码将回退到 InvariantCulture。 | en-US |
输出
这 PDF4me 从 Word 中提取元数据 REST API 根据处理模式的不同,会返回不同的响应。 API 返回元数据作为 JSON 目的不是二进制数据。
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
同步处理(默认)
这 API 处理请求并返回:
状态码: 200 OK
内容类型: application/json
回复正文:
{
"document": null,
"fileName": null,
"success": true,
"errorMessage": null,
"metadata": {
"Author": "John Doe",
"Title": "Project Proposal",
"Subject": "Q1 2024 Planning",
"Keywords": "planning, budget, strategy",
"Comments": "Draft version for review",
"Category": "Business",
"Company": "Acme Corporation",
"Manager": "Jane Smith",
"Created": "1/15/2024 10:30:00 AM",
"LastModified": "1/20/2024 2:45:00 PM",
"LastPrinted": "1/18/2024 9:15:00 AM",
"RevisionNumber": 3,
"TotalEditingTime": 120,
"Pages": 8,
"Words": 2150,
"Characters": 12800,
"Paragraphs": 45,
"Custom_Department": "Marketing",
"Custom_ProjectCode": "PRJ-2024-001",
"Custom_Confidential": "Internal"
}
}
回复字段:
- 文档 (Base64 (或 null):不用于元数据提取;可以为 null
- 文件名 (字符串或 null):不用于元数据提取;可以为 null
- 成功 (布尔值):指示请求是否成功
- 错误信息 (字符串或 null):成功失败时的错误详情
- 元数据 (对象):包含所有文档属性的综合元数据字典
使用方法:
- 提取
metadata来自该领域的 JSON 回复 - 根据需要访问各个房产
- 使用元数据进行文档分类、合规性跟踪或分析
示例(JavaScript):
const response = await fetch(url, options);
const data = await response.json();
const author = data.metadata.Author;
const pageCount = data.metadata.Pages;
// Access any metadata property
异步处理
异步行为(202) Accepted 轮询机制由服务器配置控制,而不是由请求体参数控制。启用后, API 可能会返回 202 状态码,并进行轮询 URL 在 Location 标题。轮询 URL 和 GET 直到收到 200 个请求为止 OK 具有相同响应形状(包括 metadata, success, errorMessage)。
错误响应
这 API 退货标准 HTTP 错误代码及错误详情:
- 无效的请求参数
- 缺少必填字段
文档和姓名,文档内容) - 无效的 Base64 编码
文档内容 - 无效或损坏的 Word 文档
- 无效或缺失 API 钥匙
- API 钥匙未正确 Base64 编码 Authorization 标题
- 丢失的
授权方式:基本标题
- 服务器端处理错误
- Word文档处理失败
- 元数据提取失败
错误响应格式:
{
"error": "Error message describing what went wrong"
}
回复格式详情
重要的: 这 API 总是返回 JSON 包含元数据对象。
响应结构:
{
"document": "Base64 or null",
"fileName": "string or null",
"success": true,
"errorMessage": "string or null",
"metadata": {
// Built-in properties
"Author": "string",
"Title": "string",
"Subject": "string",
"Keywords": "string",
"Comments": "string",
"Category": "string",
"Company": "string",
"Manager": "string",
"Created": "string (formatted date/time)",
"LastModified": "string (formatted date/time)",
"LastPrinted": "string (formatted date/time)",
"RevisionNumber": "integer",
"TotalEditingTime": "integer (minutes)",
// Document statistics
"Pages": "integer",
"Words": "integer",
"Characters": "integer",
"Paragraphs": "integer",
// Custom properties (prefixed with Custom_)
"Custom_PropertyName": "value"
}
}
内容类型标头:
- 成功:
application/json - 元数据以结构化格式返回。 JSON 目的
访问元数据:
JavaScript/Node.js:
const metadata = response.metadata;
console.log(`Author: ${metadata.Author}`);
console.log(`Pages: ${metadata.Pages}`);
console.log(`Words: ${metadata.Words}`);
Python:
metadata = response['metadata']
print(f"Author: {metadata['Author']}")
print(f"Pages: {metadata['Pages']}")
print(f"Words: {metadata['Words']}")
C#:
var metadata = response.Metadata;
Console.WriteLine($"Author: {metadata["Author"]}");
Console.WriteLine($"Pages: {metadata["Pages"]}");
Console.WriteLine($"Words: {metadata["Words"]}");
元数据属性
内置文档属性
| 物业名称 | 类型 | 描述 | 例子 |
|---|---|---|---|
| 作者 | String | 文档作者姓名 | "John Doe" |
| 标题 | String | 文档标题 | "Project Proposal" |
| 主题 | String | 文件主题 | "Q1 2024 Planning" |
| 关键词 | String | 文档关键词(逗号分隔) | "planning, budget, strategy" |
| 评论 | String | 文档注释 | "Draft version for review" |
| 类别 | String | 文档类别 | "Business" |
| 公司 | String | 公司名称 | "Acme Corporation" |
| 经理 | String | 经理姓名 | "Jane Smith" |
| 创建 | String | 文档创建日期/时间(已格式化) | "1/15/2024 10:30:00 AM" |
| 最后修改日期 | String | 上次保存的日期/时间(已格式化) | "1/20/2024 2:45:00 PM" |
| 最后打印日期 | String | 最后打印日期/时间(已格式化) | "1/18/2024 9:15:00 AM" |
| 修订号 | Integer | 文件修订号 | 3 |
| 总编辑时间 | Integer | 总编辑时间(分钟) | 120 |
文档统计
| 物业名称 | 类型 | 描述 | 例子 |
|---|---|---|---|
| 页 | Integer | 总页数 | 8 |
| 字 | Integer | 总字数 | 2150 |
| 人物 | Integer | 总字符数 | 12800 |
| 段落 | Integer | 段落总数 | 45 |
自定义属性
自定义属性以……为前缀 Custom_ 在回复中:
Custom_Department- 自定义部门属性Custom_ProjectCode- 自定义项目代码属性Custom_Confidential- 自定义保密级别- Word 文档中定义的任何其他自定义属性
支持的文化示例
| 文化密码 | 描述 | 日期格式示例 |
|---|---|---|
en-US | 英语(美国) | “2024年1月15日 上午10:30:00” |
en-GB | 英语(英国) | “2024年1月15日 10:30:00” |
de-DE | 德国(德国) | “2024年1月15日 10:30:00” |
fr-FR | 法语(法国) | “2024年1月15日 10:30:00” |
es-ES | 西班牙语(西班牙) | “2024年1月15日 10:30:00” |
ja-JP | 日语(日本) | “2024/01/15 10:30:00” |
请求示例
标题
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
笔记:
- 获得你的 API 钥匙 PDF4me 仪表板
- 这 API 关键必须是 Base64 编码后以“Basic”为前缀 Authorization 标题
- 例如:如果你的 API 关键是
abc123将其编码为 Base64 并使用Authorization: Basic YWJjMTIz
有效载荷
基本示例(仅必填字段):
{
"document": { "Name": "document.docx" },
"docContent": "UEsDBBQABgAIAAAAIQDfpNJsWgEAACAFAAATAAgCW0NvbnRlbnRfVHlwZXNdLnhtbCCiBAIooAAC..."
}
高级示例(含可选字段):
{
"document": { "Name": "document.docx" },
"docContent": "UEsDBBQABgAIAAAAIQDfpNJsWgEAACAFAAATAAgCW0NvbnRlbnRfVHlwZXNdLnhtbCCiBAIooAAC...",
"cultureName": "en-US"
}
代码示例
这 PDF4me 从 Word 中提取元数据 REST API 提供多种编程语言的代码示例。请选择最适合您开发环境的语言:
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
行业应用案例及应用
- Legal & Professional Services
- Business & Enterprise
- Education & Research
- Finance & Banking
法律及专业服务用例
- 文件分类按案件类型、客户或业务领域对法律文件进行分类
- 合规性跟踪监控文档创建日期和修订历史记录,以确保符合监管要求
- 客户文档管理跟踪客户端文件组织的文档属性
- 审计跟踪维护:记录文档元数据以满足法律审计要求
商业及企业应用案例
- 提案管理提取提案中的元数据,用于客户跟踪和分析
- 营销材料组织按营销活动和目标受众对营销文档进行分类
- 内容表现分析分析文档统计数据以优化内容
- 客户交付物跟踪:监控客户项目管理的文档属性
教育与研究应用案例
- 医疗文件分类按患者、手术或科室对医疗文件进行分类
- 研究文档:从研究文档中提取元数据以进行研究跟踪
- 学术和患者记录按元数据属性组织学术文档和患者文档
- 合规与道德:监控文档元数据,以确保符合医疗保健和研究监管法规
金融与银行业应用案例
- 财务报告分析:从财务报告中提取元数据以进行合规性跟踪
- 预算文件管理按部门和财政年度对预算文件进行分类
- 审计文档:跟踪文档属性以维护审计跟踪
- 监管备案监控文档元数据,以满足监管申报要求