Extrair metadados de documentos do Word - Análise de documentos API
PDF4me Extrair metadados do Word Permite extrair metadados e propriedades abrangentes de documentos do Word com recursos detalhados de análise de documentos. API O serviço processa arquivos do Word e recupera propriedades de documentos integradas, propriedades personalizadas, estatísticas do documento, informações do autor, datas de criação e controle de revisões. API recebe conteúdo de documento Word através de REST API chamadas, utilizando Base64 Codificação para transmissão segura. Com suporte para formatação e localização específicas de cada cultura, esta solução é ideal para gerenciamento de documentos, rastreamento de conformidade, análise de conteúdo e fluxos de trabalho de documentos corporativos.
Autenticando seu API Solicitar
Para acessar o PDF4me REST APIPara que uma solicitação seja aceita, é necessário incluir as credenciais de autenticação adequadas. A autenticação garante a segurança da comunicação e valida sua identidade como usuário autorizado do sistema. REST API.
Principais características
- Extração abrangente de metadadosRecuperar todas as propriedades de documento integradas e personalizadas
- Estatísticas do documentoObtenha a contagem de páginas, palavras, caracteres e parágrafos em tempo real.
- Informações sobre o autorExtrair informações sobre o autor, gerente, empresa e contato.
- Propriedades de data/horaRecuperar registros de data e hora de criação, modificação e impressão.
- Propriedades personalizadasAcesse todas as propriedades personalizadas do documento com prefixo automático.
- Apoio à CulturaFormatar datas e horas de acordo com a localidade especificada.
- Operação somente leituraExtrair metadados sem modificar o documento original.
- Saída EstruturadaRetornar metadados organizados em JSON formato para facilitar o processamento
REST API Ponto final
O PDF4me REST API usa padrão HTTP Métodos para interagir com recursos. Todas as operações de extração de metadados são realizadas por meio de um único ponto de extremidade:
- Método: POST
- Ponto final:
office/ApiV2Word/ExtractMetadata
REST API Parâmetros
Lista completa de parâmetros para a função Extrair Metadados do Word REST APIOs parâmetros estão organizados por categoria para melhor compreensão e implementação.
Importante: Os parâmetros marcados com um asterisco (*) são obrigatórios e devem ser fornecidos para o API para funcionar corretamente.
Parâmetros obrigatórios
| Parâmetro | Tipo | Descrição | Exemplo |
|---|---|---|---|
| documento* | Object | Referência do documento. Deve conter Nome (string): Nome do arquivo Word com extensão .docx | { "Name": "document.docx" } |
| conteúdo do documento* | Base64 | Conteúdo do documento Word codificado em Base64 | UEsDBBQABgAIAAAA... |
Parâmetros opcionais
| Parâmetro | Tipo | Descrição | Exemplo |
|---|---|---|---|
| nome_da_cultura | String | Código de cultura para formatação de data/hora (por exemplo, "en-US", "de-DE", "fr-FR"). Padrão: InvariantCulture (formatação consistente). Afeta o formato de exibição de data/hora nos metadados. Culturas inválidas utilizam o padrão InvariantCulture. | en-US |
Saída
O PDF4me Extrair metadados do Word REST API Retorna respostas diferentes dependendo do modo de processamento. API retorna os metadados como um JSON objeto, não como dados binários.
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
Processamento síncrono (padrão)
O API processa a solicitação e retorna:
Código de status: 200 OK
Tipo de conteúdo: application/json
Corpo da resposta:
{
"document": null,
"fileName": null,
"success": true,
"errorMessage": null,
"metadata": {
"Author": "John Doe",
"Title": "Project Proposal",
"Subject": "Q1 2024 Planning",
"Keywords": "planning, budget, strategy",
"Comments": "Draft version for review",
"Category": "Business",
"Company": "Acme Corporation",
"Manager": "Jane Smith",
"Created": "1/15/2024 10:30:00 AM",
"LastModified": "1/20/2024 2:45:00 PM",
"LastPrinted": "1/18/2024 9:15:00 AM",
"RevisionNumber": 3,
"TotalEditingTime": 120,
"Pages": 8,
"Words": 2150,
"Characters": 12800,
"Paragraphs": 45,
"Custom_Department": "Marketing",
"Custom_ProjectCode": "PRJ-2024-001",
"Custom_Confidential": "Internal"
}
}
Campos de resposta:
- documento (Base64 ou nulo): Não utilizado para extração de metadados; pode ser nulo
- nome_do_arquivo (string ou nulo): Não utilizado para extração de metadados; pode ser nulo
- sucesso (booleano): Indica se a solicitação foi bem-sucedida.
- mensagem de erro (string ou nulo): Detalhes do erro quando o sucesso for falso
- metadados (objeto): Dicionário de metadados abrangente contendo todas as propriedades do documento
Como usar:
- Extraia o
metadatacampo do JSON resposta - Aceda às propriedades individuais conforme necessário.
- Utilize metadados para classificação de documentos, rastreamento de conformidade ou análise.
Exemplo (JavaScript):
const response = await fetch(url, options);
const data = await response.json();
const author = data.metadata.Author;
const pageCount = data.metadata.Pages;
// Access any metadata property
Processamento assíncrono
Comportamento assíncrono (202 Accepted (com polling) é controlado pela configuração do servidor, não por um parâmetro no corpo da requisição. Quando habilitado, o API pode retornar um status 202 com uma pesquisa URL no Location cabeçalho. Consulte o URL com GET Faça solicitações até receber 200. OK com o mesmo formato de resposta (incluindo metadata, success, errorMessage).
Respostas de erro
O API retorna padrão HTTP Códigos de erro com detalhes do erro:
- Parâmetros de solicitação inválidos
- Campos obrigatórios ausentes (
documentocomNome,conteúdo do documento) - Inválido Base64 codificação em
conteúdo do documento - Documento do Word inválido ou corrompido
- Inválido ou ausente API chave
- API chave não está corretamente Base64 codificado em Authorization cabeçalho
- Ausente
Autorização: Básicacabeçalho
- Erro de processamento no servidor
- falha no processamento do documento Word
- Falha na extração de metadados
Formato da resposta de erro:
{
"error": "Error message describing what went wrong"
}
Detalhes do formato da resposta
Importante: O API sempre retorna JSON com objeto de metadados.
Estrutura da resposta:
{
"document": "Base64 or null",
"fileName": "string or null",
"success": true,
"errorMessage": "string or null",
"metadata": {
// Built-in properties
"Author": "string",
"Title": "string",
"Subject": "string",
"Keywords": "string",
"Comments": "string",
"Category": "string",
"Company": "string",
"Manager": "string",
"Created": "string (formatted date/time)",
"LastModified": "string (formatted date/time)",
"LastPrinted": "string (formatted date/time)",
"RevisionNumber": "integer",
"TotalEditingTime": "integer (minutes)",
// Document statistics
"Pages": "integer",
"Words": "integer",
"Characters": "integer",
"Paragraphs": "integer",
// Custom properties (prefixed with Custom_)
"Custom_PropertyName": "value"
}
}
Cabeçalho Content-Type:
- Sucesso:
application/json - Os metadados são retornados como uma estrutura JSON objeto
Acessando metadados:
JavaScript/Node.js:
const metadata = response.metadata;
console.log(`Author: ${metadata.Author}`);
console.log(`Pages: ${metadata.Pages}`);
console.log(`Words: ${metadata.Words}`);
Python:
metadata = response['metadata']
print(f"Author: {metadata['Author']}")
print(f"Pages: {metadata['Pages']}")
print(f"Words: {metadata['Words']}")
C#:
var metadata = response.Metadata;
Console.WriteLine($"Author: {metadata["Author"]}");
Console.WriteLine($"Pages: {metadata["Pages"]}");
Console.WriteLine($"Words: {metadata["Words"]}");
Propriedades dos metadados
Propriedades de documento integradas
| Nome da propriedade | Tipo | Descrição | Exemplo |
|---|---|---|---|
| Autor | String | Nome do autor do documento | "John Doe" |
| Título | String | Título do documento | "Project Proposal" |
| Assunto | String | Assunto do documento | "Q1 2024 Planning" |
| Palavras-chave | String | Palavras-chave do documento (separadas por vírgulas) | "planning, budget, strategy" |
| Comentários | String | Comentários do documento | "Draft version for review" |
| Categoria | String | Categoria do documento | "Business" |
| Empresa | String | Nome da empresa | "Acme Corporation" |
| Gerente | String | Nome do gerente | "Jane Smith" |
| Criado | String | Data/hora de criação do documento (formatada) | "1/15/2024 10:30:00 AM" |
| Última modificação | String | Última data/hora salva (formatada) | "1/20/2024 2:45:00 PM" |
| Última impressão | String | Última data/hora impressa (formatada) | "1/18/2024 9:15:00 AM" |
| Número da revisão | Integer | Número da revisão do documento | 3 |
| Tempo total de edição | Integer | Tempo total de edição em minutos | 120 |
Estatísticas do documento
| Nome da propriedade | Tipo | Descrição | Exemplo |
|---|---|---|---|
| Páginas | Integer | Número total de páginas | 8 |
| Palavras | Integer | Contagem total de palavras | 2150 |
| Personagens | Integer | Contagem total de caracteres | 12800 |
| Parágrafos | Integer | Número total de parágrafos | 45 |
Propriedades personalizadas
As propriedades personalizadas são prefixadas com Custom_ na resposta:
Custom_Department- Propriedade do departamento alfandegárioCustom_ProjectCode- Propriedade de código de projeto personalizadoCustom_Confidential- Nível de confidencialidade personalizado- Quaisquer outras propriedades personalizadas definidas no documento do Word.
Exemplos de cultura apoiada
| Código de Cultura | Descrição | Exemplo de formato de data |
|---|---|---|
en-US | Inglês (Estados Unidos) | "15/01/2024 10:30:00" |
en-GB | Inglês (Reino Unido) | "15/01/2024 10:30:00" |
de-DE | Alemão (Alemanha) | "15.01.2024 10:30:00" |
fr-FR | Francês (França) | "15/01/2024 10:30:00" |
es-ES | Espanhol (Espanha) | "15/01/2024 10:30:00" |
ja-JP | Japonês (Japão) | "2024/01/15 10:30:00" |
Exemplo de solicitação
Cabeçalho
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
Observação:
- Adquira o seu API chave do PDF4me Painel
- O API a chave deve ser Base64 codificado e prefixado com "Básico" no Authorization cabeçalho
- Exemplo: Se o seu API chave é
abc123, codifique-o para Base64 e usarAuthorization: Basic YWJjMTIz
Carga útil
Exemplo básico (somente campos obrigatórios):
{
"document": { "Name": "document.docx" },
"docContent": "UEsDBBQABgAIAAAAIQDfpNJsWgEAACAFAAATAAgCW0NvbnRlbnRfVHlwZXNdLnhtbCCiBAIooAAC..."
}
Exemplo avançado (com campos opcionais):
{
"document": { "Name": "document.docx" },
"docContent": "UEsDBBQABgAIAAAAIQDfpNJsWgEAACAFAAATAAgCW0NvbnRlbnRfVHlwZXNdLnhtbCCiBAIooAAC...",
"cultureName": "en-US"
}
Exemplos de código
O PDF4me Extrair metadados do Word REST API Fornece exemplos de código em várias linguagens de programação. Escolha a linguagem que melhor se adapta ao seu ambiente de desenvolvimento:
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
Java Amostra
Java Implementação com tratamento completo de erros e processamento de respostas:
JavaScript Amostra
Node.js e compatível com navegadores JavaScript Implementação:
Google Script Amostra
Google Apps Script implementação para Google Workspace integração:
Casos de uso e aplicações industriais
- Legal & Professional Services
- Business & Enterprise
- Education & Research
- Finance & Banking
Casos de uso de serviços jurídicos e profissionais
- Classificação de DocumentosClassificar documentos jurídicos por tipo de caso, cliente ou área de atuação.
- Rastreamento de ConformidadeMonitorar as datas de criação e o histórico de revisões dos documentos para fins de conformidade regulatória.
- Gestão de Documentos do ClienteRastrear propriedades de documentos para organização de arquivos do cliente
- Manutenção do Registro de AuditoriaRegistrar metadados de documentos para fins de auditoria legal.
Casos de uso para empresas e negócios
- Gestão de PropostasExtrair metadados de propostas para rastreamento e análise de clientes.
- Organização de Material de MarketingClassificar documentos de marketing por campanha e público-alvo.
- Análise de desempenho de conteúdoAnalisar as estatísticas do documento para otimização de conteúdo.
- Acompanhamento das entregas ao clienteMonitorar as propriedades dos documentos para gerenciamento de projetos do cliente.
Casos de uso em educação e pesquisa
- Classificação de Documentos MédicosClassificar documentos médicos por paciente, procedimento ou departamento.
- Documentação de pesquisaExtrair metadados de documentos de pesquisa para rastreamento de estudos.
- Registros Acadêmicos e de PacientesOrganizar documentos acadêmicos e de pacientes por propriedades de metadados
- Conformidade e ÉticaMonitorar metadados de documentos para conformidade com regulamentações de saúde e pesquisa.
Casos de uso em finanças e bancos
- Análise do Relatório FinanceiroExtrair metadados de relatórios financeiros para fins de acompanhamento da conformidade.
- Gestão de Documentos OrçamentáriosClassificar documentos orçamentários por departamento e ano fiscal.
- Documentação de auditoriaRastrear propriedades de documentos para manutenção do histórico de auditoria
- Arquivamento regulatórioMonitorar metadados de documentos para requisitos de submissão regulatória