Pular para o conteúdo principal

Extrair texto por expressão - Pesquisa RegEx API

PDF4me Extrair texto por expressão permite extrair texto específico de PDF documentos usando expressões regulares. Isto API processos de serviço PDF arquiva e extrai texto que corresponde a padrões/expressões específicos de PDF documentos. O API recebe PDF conteúdo e padrões de expressão regular através de REST API chamadas, utilizando Base64 Codificação para transmissão segura. Com suporte para expressões regulares complexas e direcionamento flexível de páginas, esta solução é ideal para fluxos de trabalho de processamento de documentos e extração de dados.

Artigos relacionados no blogue
Ainda não há nenhuma publicação no blogue sobre esta funcionalidade — em breve.
Entretanto, explore o blogue da PDF4me para encontrar tutoriais e fluxos de trabalho para todas as plataformas.
Visite o blogue

Autenticando seu API Solicitar

Para acessar o PDF4me REST APIPara que uma solicitação seja aceita, é necessário incluir as credenciais de autenticação adequadas. A autenticação garante a segurança da comunicação e valida sua identidade como usuário autorizado do sistema. REST API.

Principais características

  • Suporte a expressões regularesExtrair texto usando padrões de expressões regulares para correspondência de texto precisa.
  • Segmentação flexível de páginasProcessar páginas específicas ou documentos inteiros com sequências de páginas personalizadas.
  • Reconhecimento de padrõesSuporte para expressões regulares complexas e reconhecimento de padrões.
  • Base64 CodificaçãoTransmissão segura de conteúdo de arquivos usando Base64 codificação
  • Simple API IntegraçãoRESTful API Projetado para fluxos de trabalho automatizados de extração de texto.

REST API Ponto final

O PDF4me REST API usa padrão HTTP Métodos para interagir com recursos. Todas as operações de extração de texto por expressão são realizadas por meio de um único ponto de extremidade:

  • Método: POST
  • Ponto final: /api/v2/ExtractTextByExpression

REST API Parâmetros

Lista completa de parâmetros para a função Extrair Texto por Expressão REST APIOs parâmetros estão organizados por categoria para melhor compreensão e implementação.

Importante: Os parâmetros marcados com um asterisco (*) são obrigatórios e devem ser fornecidos para o API para funcionar corretamente.

Parâmetros obrigatórios

ParâmetroTipoDescriçãoExemplo
docContent*Base64 (String)O conteúdo da entrada PDF arquivo em Base64 formatoJVBERi...
docName*StringFonte PDF nome do arquivo com extensão de arquivo apropriadaoutput.pdf
expression*StringPadrão de expressão regular para extração de texto. Suporta sintaxe regex padrão, incluindo grupos, quantificadores e âncoras.% ou [A-Za-z]+
pageSequence*StringEspecifique quais páginas processar. Use "1-" para todas as páginas, "1-3" para um intervalo ou "1,2,3" para páginas específicas.1-3

Parâmetros opcionais

ParâmetroTipoDescriçãoExemplo
asyncBooleanAtive o processamento assíncrono. Quando true, o API retornos 202 Accepted com um Location cabeçalho para consultar o resultadotrue

Saída

O PDF4me Extrair texto por expressão REST API Retorna respostas diferentes dependendo do modo de processamento. API Retorna as correspondências de texto extraídas como um JSON resposta.

Processamento síncrono (padrão)

Quando async é false ou não fornecido, o API Retorna imediatamente as correspondências do texto extraído.

Código de status: 200 OK

Formato da resposta:

{
"textList": ["extracted text 1", "extracted text 2", "extracted text 3"]
}

A resposta contém uma matriz de cadeias de texto que correspondem ao padrão de expressão regular especificado.

Exemplo de solicitação

Cabeçalho

Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY

Observação:

  • Adquira o seu API chave do PDF4me Painel
  • O API a chave deve ser Base64 codificado e prefixado com "Básico" no Authorization cabeçalho
  • Exemplo: Se o seu API chave é abc123, codifique-o para Base64 e usar Authorization: Basic YWJjMTIz

Carga útil

Solicitação básica:

{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output.pdf",
"expression": "%",
"pageSequence": "1-3"
}

Com processamento assíncrono:

{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output.pdf",
"expression": "\\d+",
"pageSequence": "1-3",
"async": true
}

Exemplos de código

O PDF4me Extrair texto por expressão REST API Fornece exemplos de código em várias linguagens de programação. Escolha a linguagem que melhor se adapta ao seu ambiente de desenvolvimento:

C# (CSharp) Exemplo

Completo C# Implementação para extrair texto por expressão de PDF:

Recursos de extração de texto

Processamento de expressões regulares

  • Reconhecimento de padrõesSuporte completo para sintaxe e padrões de expressões regulares padrão.
  • Padrões complexosSuporte para recursos avançados de expressões regulares, incluindo grupos, quantificadores e âncoras.
  • Expressões personalizadasCriação flexível de padrões para requisitos específicos de extração de texto.
  • Validação de padrõesValidação integrada para sintaxe e compatibilidade de padrões de expressões regulares.
  • Resultados profissionaisExtração de texto confiável com correspondência de padrões precisa.

Processamento de página

  • Segmentação de páginaExtrair texto de páginas específicas ou de documentos inteiros.
  • Sequências de páginasSuporte para intervalos de páginas personalizados e seleção de páginas individuais.
  • Processamento flexívelProcessar qualquer combinação de páginas com controle preciso
  • Processamento em loteGerencie várias páginas de forma eficiente em uma única tela. API ligações
  • Layout profissionalExtração de texto consistente em todas as páginas de destino.

Recursos avançados

  • Análise de textoAnálise e identificação abrangentes de padrões textuais
  • Filtragem personalizadaOpções avançadas de filtragem para necessidades específicas de extração de texto.
  • Extração profissionalExtração de texto de alta qualidade com visibilidade clara.
  • Padrões flexíveisSuporte para qualquer padrão de expressão regular e requisitos de correspondência de texto.

Casos de uso e aplicações industriais

Casos de uso de serviços jurídicos e profissionais

  • Análise de DocumentosExtrair padrões de dados específicos de contratos, faturas e documentos legais.
  • Análise de ContratoExtrair termos-chave e padrões de dados de contratos legais.
  • Monitoramento de ConformidadeExtrair informações regulatórias e dados de conformidade de documentos.
  • Extração de Dados LegaisExtrair padrões de dados específicos de documentos jurídicos.

Obtenha ajuda