Extrair texto por expressão
Extrair → Extrair texto por expressão
O Extrair texto por expressão API extrai texto de um PDF que corresponde a uma expressão regular. Você envia o PDF como Base64 (docContent), docName, expression (padrão regex), pageSequence (ex.: 1-, 1-3, 1,2,3) e opcionalmente async. O API retornos JSON com todas as correspondências. Use o testador abaixo para experimentar; mais detalhes e exemplos de expressões estão nas seções seguintes.
Experimente a opção Extrair Texto por Expressão. API
:::nota Referência rápida
Ponto final: POST /api/v2/ExtractTextByExpression · Obrigatório: api-key, docContent, docName, expression, pageSequence
:::
Use o formulário abaixo para enviar sua API chave, PDF (Base64), e um padrão regex (por exemplo, %, \d+, padrão de e-mail). A resposta é JSON Com todas as correspondências de texto. Nenhum código é necessário, preencha os campos e clique. Enviar solicitação.
Visão geral, parâmetros e casos de uso
- Overview
- Parameters
- Use cases
O que é Extrair Texto por Expressão?
Este endpoint extrai texto de um PDF que corresponde a uma expressão regular. Você fornece o PDF (Base64), expression (padrão regex), pageSequence (por exemplo, 1- para todas as páginas, 1-3 para um intervalo, 1,2,3 para páginas específicas) e, opcionalmente, async. O API retornos JSON com todas as correspondências de texto. Use-o para extrair e-mails, números, datas, URLs, ou qualquer padrão de PDFs.
Principais características
- Padrões de expressão regular: expression: por exemplo
%,\d+, padrão de e-mail, padrão de data, moeda. - Segmentação de página: pageSequence:
1-(todos),1-3(faixa),1,2,3(páginas específicas). - JSON respostaTodas as correspondências para o padrão especificado.
- Assíncrono: Usar async para grandes PDFs ou muitas partidas.
Use quando precisar de dados específicos (e-mails, números, datas, valores) de PDFsPara ver o texto completo ou as imagens, use Extrair recursos; para tabelas use Extrair tabela de PDF.
API parâmetros
| Parâmetro | Tipo | Obrigatório | Descrição |
|---|---|---|---|
| api-key | corda | Sim | Seu PDF4me API chave, Base64 codificado. Obtenha-o do painel. |
| docContent | base64 | Sim | PDF conteúdo do arquivo (Base64). |
| docName | corda | Sim | PDF Nome do arquivo com extensão .pdf. |
| expression | corda | Sim | Padrão de expressão regular (ex.: %, \d+, padrão de e-mail). |
| pageSequence | corda | Sim | Intervalo de páginas: 1- (todas), 1,2,3, 1-5, etc. |
| async | booleano | Não | Ativar o processamento assíncrono. |
Quando usar Extrair Texto por Expressão
- E-mails e URLsExtrair e-mails, números de telefone ou links de PDFs.
- Números e quantidadesExtrair percentagens, valores monetários ou IDs.
- DatasExtrair datas em vários formatos (MM/DD/AAAA, ISO, etc.).
- Dados estruturadosExtrair padrões específicos (por exemplo, números de faturas, números de segurança social) para fluxos de trabalho.
Para esquemas de requisição/resposta e exemplos de código, consulte Extrair texto por expressão no PDF4me API documentos.
Pré-requisitos
Antes de usar este endpoint, certifique-se de que você possui:
- Um válido PDF4me API chave (Adquira o seu API Chave)
- A PDF documento em Base64 formato ou um público URL para um PDF arquivo
- Um padrão de expressão regular para pesquisar
Exemplos de expressões
- Basic Patterns
- Currency & Percentages
- Contact Information
- Dates
- Text Patterns
- Advanced
- Quick Test Examples
Padrões básicos comuns de expressões regulares:
%- Exiba o símbolo de porcentagem (por exemplo, 50%, 100%)\d+- Combine um ou mais dígitos (ex.: 123, 4567)\d+\.\d+- Compare os números decimais (ex.: 3,14, 99,99)[A-Za-z]+- Combine uma ou mais letras\d{4}- Combine exatamente 4 dígitos (por exemplo, anos como 2024)
Padrões para extração de dados financeiros:
\d+%- Associe as porcentagens aos números (ex.: 50%, 100%)\$[\d,]+\.?\d*- Corresponder aos valores em dólares americanos (ex.: $100, $1.234,56)€[\d,]+\.?\d*- Corresponder valores em euros (ex.: €50, €1.000,00)£[\d,]+\.?\d*- Corresponder a valores em Libras Esterlinas (ex.: £50, £1.000,00)
Extrair informações de contato de documentos:
[a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\.[a-zA-Z]{2,}- Combinar endereços de e-mail (por exemplo, usuá[email protected])\+?[\d\s\-\(\)]{10,}- Combinar números de telefone (vários formatos)https?://[^\s]+- Corresponder URLs (por exemplo, https://example.com)
Extrair datas em vários formatos:
\d{1,2}/\d{1,2}/\d{2,4}- Datas compatíveis, como 25/12/2024 ou 05/01/2024\d{4}-\d{2}-\d{2}- As datas devem estar de acordo com a norma ISO (ex.: 2024-12-25)[A-Z]{2,3}\s+\d{1,2}\s+\d{4}- Combinar datas como "25 de dezembro de 2024"
Extrair padrões de texto específicos:
PDF|pdf- Combine a palavra "PDF(padrão que não diferencia maiúsculas de minúsculas)Chapter\s+\d+- Combine "Capítulo" seguido de um número (ex.: Capítulo 1)[A-Z][a-z]+\s+[A-Z][a-z]+- Identificar nomes com inicial maiúscula (ex.: John Doe)
Padrões complexos para casos de uso específicos:
\b\d{3}-\d{2}-\d{4}\b- Corresponder ao formato do número de segurança social (ex.: 123-45-6789)\b\d{4}\s\d{4}\s\d{4}\s\d{4}\b- Compare os números de cartão de crédito (16 dígitos com espaços)[A-Z]{2}\d{2}\s?\d{4}\s?\d{4}\s?\d{4}\s?\d{4}\s?\d{4}\s?\d{4}- Corresponder IBAN formato
Expressões recomendadas para testar com seu sample (2).pdf arquivo:
%- Encontre todos os símbolos de porcentagem (comece pelos mais simples)\d+- Extrair todos os números do documento[a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\.[a-zA-Z]{2,}- Extrair endereços de e-mailhttps?://[^\s]+- Extrair links da web\d{1,2}/\d{1,2}/\d{2,4}- Extrair datas\$[\d,]+\.?\d*- Extrair valores em dólares
Exemplos de sequência de páginas:
1-- Todas as páginas, da página 1 até o final1-3- Páginas 1, 2 e 31,2,3- Páginas específicas 1, 2 e 3all- Todas as páginas (se houver suporte)
Formato de resposta
O API retorna um JSON Resposta com todas as correspondências de texto encontradas para o padrão de expressão regular especificado.