Extrair texto por expressão - Pesquisa RegEx API
PDF4me Extrair texto por expressão permite extrair texto específico de PDF documentos usando expressões regulares. Isto API processos de serviço PDF arquiva e extrai texto que corresponde a padrões/expressões específicos de PDF documentos. O API recebe PDF conteúdo e padrões de expressão regular através de REST API chamadas, utilizando Base64 Codificação para transmissão segura. Com suporte para expressões regulares complexas e direcionamento flexível de páginas, esta solução é ideal para fluxos de trabalho de processamento de documentos e extração de dados.
Autenticando seu API Solicitar
Para acessar o PDF4me REST APIPara que uma solicitação seja aceita, é necessário incluir as credenciais de autenticação adequadas. A autenticação garante a segurança da comunicação e valida sua identidade como usuário autorizado do sistema. REST API.
Principais características
- Suporte a expressões regularesExtrair texto usando padrões de expressões regulares para correspondência de texto precisa.
- Segmentação flexível de páginasProcessar páginas específicas ou documentos inteiros com sequências de páginas personalizadas.
- Reconhecimento de padrõesSuporte para expressões regulares complexas e reconhecimento de padrões.
- Base64 CodificaçãoTransmissão segura de conteúdo de arquivos usando Base64 codificação
- Simple API IntegraçãoRESTful API Projetado para fluxos de trabalho automatizados de extração de texto.
REST API Ponto final
O PDF4me REST API usa padrão HTTP Métodos para interagir com recursos. Todas as operações de extração de texto por expressão são realizadas por meio de um único ponto de extremidade:
- Método: POST
- Ponto final:
/api/v2/ExtractTextByExpression
REST API Parâmetros
Lista completa de parâmetros para a função Extrair Texto por Expressão REST APIOs parâmetros estão organizados por categoria para melhor compreensão e implementação.
Importante: Os parâmetros marcados com um asterisco (*) são obrigatórios e devem ser fornecidos para o API para funcionar corretamente.
Parâmetros obrigatórios
| Parâmetro | Tipo | Descrição | Exemplo |
|---|---|---|---|
| docContent* | Base64 (String) | O conteúdo da entrada PDF arquivo em Base64 formato | JVBERi... |
| docName* | String | Fonte PDF nome do arquivo com extensão de arquivo apropriada | output.pdf |
| expression* | String | Padrão de expressão regular para extração de texto. Suporta sintaxe regex padrão, incluindo grupos, quantificadores e âncoras. | % ou [A-Za-z]+ |
| pageSequence* | String | Especifique quais páginas processar. Use "1-" para todas as páginas, "1-3" para um intervalo ou "1,2,3" para páginas específicas. | 1-3 |
Parâmetros opcionais
| Parâmetro | Tipo | Descrição | Exemplo |
|---|---|---|---|
| async | Boolean | Ative o processamento assíncrono. Quando true, o API retornos 202 Accepted com um Location cabeçalho para consultar o resultado | true |
Saída
O PDF4me Extrair texto por expressão REST API Retorna respostas diferentes dependendo do modo de processamento. API Retorna as correspondências de texto extraídas como um JSON resposta.
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
Processamento síncrono (padrão)
Quando async é false ou não fornecido, o API Retorna imediatamente as correspondências do texto extraído.
Código de status: 200 OK
Formato da resposta:
{
"textList": ["extracted text 1", "extracted text 2", "extracted text 3"]
}
A resposta contém uma matriz de cadeias de texto que correspondem ao padrão de expressão regular especificado.
Processamento assíncrono
Quando async é true, o API Processa o documento de forma assíncrona.
Resposta inicial:
Código de status: 202 Accepted
Cabeçalhos de resposta:
Location: https://api.pdf4me.com/api/v2/ExtractTextByExpressionStatus/{operationId}
Corpo da resposta:
{
"traceId": "operation-trace-id"
}
Votação para apuração dos resultados:
Use o Location cabeçalho URL Para verificar a conclusão da pesquisa:
const response = await fetch(locationUrl, {
headers: { 'Authorization': 'Basic ' + apiKey }
});
// Continue polling until status code is 200
if (response.status === 200) {
const result = await response.json();
// Process extracted text matches
}
Respostas de erro
| Código de status | Descrição | Exemplo de resposta |
|---|---|---|
| 400 Bad Request | Parâmetros de solicitação inválidos, campos obrigatórios ausentes ou padrão de expressão regular inválido. | {"error": "Missing required parameter: expression"} |
| 401 Unauthorized | Inválido ou ausente API chave | {"error": "Unauthorized"} |
| 408 Tempo limite da solicitação | Tempo limite de processamento da solicitação | {"error": "Request timeout"} |
| 500 Internal Server Error | Erro do servidor durante o processamento | {"error": "Internal server error"} |
Entendendo o JSON Resposta
A resposta da extração de texto é uma JSON objeto contendo:
- lista de texto: Array de strings contendo todas as correspondências de texto que correspondem ao padrão de expressão regular especificado
Formatos de sequência de páginas:
"1-"Processar todas as páginas da página 1 até a página final."1-3": Processar páginas 1, 2 e 3"1,2,3"Processar páginas específicas 1, 2 e 3.
Exemplos de expressões:
"%": Correspondência dos símbolos de porcentagem"\\d+"Combine um ou mais dígitos"[a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\\.[a-zA-Z]{2,}": Combinar endereços de e-mail"https?://[^\\s]+": URLs correspondentes
Exemplo de solicitação
Cabeçalho
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
Observação:
- Adquira o seu API chave do PDF4me Painel
- O API a chave deve ser Base64 codificado e prefixado com "Básico" no Authorization cabeçalho
- Exemplo: Se o seu API chave é
abc123, codifique-o para Base64 e usarAuthorization: Basic YWJjMTIz
Carga útil
Solicitação básica:
{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output.pdf",
"expression": "%",
"pageSequence": "1-3"
}
Com processamento assíncrono:
{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output.pdf",
"expression": "\\d+",
"pageSequence": "1-3",
"async": true
}
Exemplos de código
O PDF4me Extrair texto por expressão REST API Fornece exemplos de código em várias linguagens de programação. Escolha a linguagem que melhor se adapta ao seu ambiente de desenvolvimento:
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
Java Amostra
Java Implementação com tratamento completo de erros e processamento de respostas:
JavaScript Amostra
Node.js e compatível com navegadores JavaScript Implementação:
Google Apps Script Amostra
Google Apps Script implementação para Google Workspace integração:
Recursos de extração de texto
Processamento de expressões regulares
- Reconhecimento de padrõesSuporte completo para sintaxe e padrões de expressões regulares padrão.
- Padrões complexosSuporte para recursos avançados de expressões regulares, incluindo grupos, quantificadores e âncoras.
- Expressões personalizadasCriação flexível de padrões para requisitos específicos de extração de texto.
- Validação de padrõesValidação integrada para sintaxe e compatibilidade de padrões de expressões regulares.
- Resultados profissionaisExtração de texto confiável com correspondência de padrões precisa.
Processamento de página
- Segmentação de páginaExtrair texto de páginas específicas ou de documentos inteiros.
- Sequências de páginasSuporte para intervalos de páginas personalizados e seleção de páginas individuais.
- Processamento flexívelProcessar qualquer combinação de páginas com controle preciso
- Processamento em loteGerencie várias páginas de forma eficiente em uma única tela. API ligações
- Layout profissionalExtração de texto consistente em todas as páginas de destino.
Recursos avançados
- Análise de textoAnálise e identificação abrangentes de padrões textuais
- Filtragem personalizadaOpções avançadas de filtragem para necessidades específicas de extração de texto.
- Extração profissionalExtração de texto de alta qualidade com visibilidade clara.
- Padrões flexíveisSuporte para qualquer padrão de expressão regular e requisitos de correspondência de texto.
Casos de uso e aplicações industriais
- Legal & Professional Services
- Finance & Banking
- Business & Enterprise
- Education & Research
- Government & Compliance
Casos de uso de serviços jurídicos e profissionais
- Análise de DocumentosExtrair padrões de dados específicos de contratos, faturas e documentos legais.
- Análise de ContratoExtrair termos-chave e padrões de dados de contratos legais.
- Monitoramento de ConformidadeExtrair informações regulatórias e dados de conformidade de documentos.
- Extração de Dados LegaisExtrair padrões de dados específicos de documentos jurídicos.
Casos de uso em finanças e bancos
- Processamento de faturasExtrair dados de faturas e valores de campos usando correspondência de padrões.
- Relatórios financeirosExtrair métricas e pontos de dados específicos de PDF relatórios
- Monitoramento de ConformidadeExtrair informações regulatórias e dados de conformidade de documentos.
- Mineração de Dados FinanceirosExtrair dados estruturados de documentos financeiros.
Casos de uso para empresas e negócios
- Mineração de dadosIdentificar e extrair dados estruturados de dados não estruturados. PDF documentos
- Processamento de conteúdoExtrair padrões de texto específicos para gerenciamento e análise de conteúdo.
- Processamento de formuláriosExtrair dados de formulário e valores de campos usando correspondência de padrões.
- Inteligência de NegóciosExtrair métricas de negócios e indicadores de desempenho de PDF relatórios
Casos de uso em educação e pesquisa
- Aplicações de pesquisaExtrair padrões de dados específicos de artigos de pesquisa e documentos acadêmicos.
- Extração de Dados AcadêmicosExtrair dados estruturados de artigos de pesquisa
- Análise de pesquisaExtrair métricas específicas de documentos acadêmicos.
- Processamento de Conteúdo EducacionalExtrair padrões de texto de documentos educacionais.
Casos de uso para governo e conformidade
- Monitoramento de ConformidadeExtrair informações regulatórias e dados de conformidade de documentos.
- Extração de Dados RegulatóriosExtrair dados estruturados de documentos regulatórios
- Relatórios governamentaisExtrair métricas específicas de relatórios governamentais.
- Registros PúblicosExtrair padrões de dados de registros e documentos públicos.