Pular para o conteúdo principal

Extrair texto por expressão usando n8n Ação

PDF4me Extrair texto por expressão Extrai conteúdo de texto específico de PDF documentos usando correspondência de padrões e filtragem baseada em expressões por meio de n8n Fluxos de trabalho de automação. Processo PDFs de distância n8n gatilhos, dados binários, strings base64 ou públicos URLPermite localizar e extrair texto usando padrões curinga (%), expressões regulares, campos de dados específicos, segmentação por página e regras de extração flexíveis com saída estruturada. Essa solução é ideal para extração de números de faturas, captura de campos de dados, recuperação de texto baseada em padrões, extração automatizada de dados, análise de documentos e fluxos de trabalho de análise de conteúdo que exigem segmentação precisa de texto com correspondência flexível e integração perfeita.

Artigos relacionados no blogue
Ainda não há nenhuma publicação no blogue sobre esta funcionalidade — em breve.
Entretanto, explore o blogue da PDF4me para encontrar tutoriais e fluxos de trabalho para todas as plataformas.
Visite o blogue

Configurar

Adicione o PDF4me nó "Extrair texto por expressão" para o seu n8n fluxo de trabalho e configure os parâmetros necessários. Para obter instruções de configuração inicial, consulte nosso n8n Guia de integração.

Pré-requisitos:

  • PDF4me API credenciais
  • n8n acesso ao fluxo de trabalho

Configuração:

  1. Adicionar PDF4me nó para fluxo de trabalho
  2. Selecione a ação "Extrair texto por expressão".
  3. Configure os parâmetros de entrada (veja abaixo)
Extrair texto por configuração de expressão

Parâmetros

Lista completa de parâmetros para a ação Extrair Texto por Expressão. Configure esses parâmetros para controlar a extração de texto.

Importante: Os parâmetros marcados com um asterisco (***) são obrigatórios e devem ser fornecidos para que a ação funcione corretamente.

ParâmetroTipoDescriçãoExemplo
Tipo de dados de entrada***StringPDF Seleção do formato de entrada
• Escolha o formato do seu PDF entrada de dados
PDF4me Suporta vários tipos de entrada
• Opções: Dados binários, Base64 Corda, ou URL
Binary Data
Campo binário de entradaBinárioBinário PDF Entrada de arquivo (Obrigatório se os dados forem binários)
• Referência PDF arquivo do anterior n8n upload de nó ou arquivo
PDF4me processos binários PDF arquivos com detecção automática de formato
• Obrigatório quando o tipo de dados de entrada for "Dados binários"
{{ $binary.data }}
Conteúdo do PDF em Base64StringBase64 Codificado PDF Entrada (Obrigatório se) Base64 Corda)
• Fornecer PDF conteúdo como string codificada em base64
PDF4me decodifica e processa automaticamente o PDF contente
• Obrigatório quando o tipo de dados de entrada for "Base64 Corda"
JVBER...
URL do PDFStringPúblico PDF URL Entrada (Obrigatório se) URL)
• Fornecer uma permissão pública/aberta URL para o PDF arquivo
PDF4me baixa e processa o arquivo de URL
• Obrigatório quando o tipo de dados de entrada for "URL"
https://abc.com/document.pdf
Nome do documento***StringNome do arquivo de entrada
• Especifique o nome da entrada PDF arquivo
• Utilizado para detecção de formato e otimização de processamento
• Deve incluir a extensão .pdf
document.pdf
Expressão***StringPadrão de Extração de Texto
• Defina o padrão ou expressão para corresponder ao conteúdo do texto
• Suporta padrões regex, curingas e expressões personalizadas
• Usar % para correspondência com curingas ou padrões de regex específicos
%
Sequência de páginas***StringEspecificação de intervalo de páginas
• Defina quais páginas processar para extração de texto.
• Use "todos" para o documento inteiro ou para números/intervalos de páginas específicos.
• Exemplos: "1,3,5" (específico), "1-5" (intervalo), "1-" (da página 1 até o final)
1-

Opções avançadas

Os seguintes parâmetros estão disponíveis na seção Opções Avançadas e são opcionais:

ParâmetroTipoDescriçãoExemplo
Perfis personalizadosStringPerfis de configuração personalizados
• Defina opções adicionais usando perfis personalizados
JSONformato semelhante a - contendo parâmetros predefinidos
• Permite configurações avançadas de processamento de extração.
• Opcional para requisitos específicos
{ "outputDataFormat": "json" }

Saída

Parâmetros de saída

ParâmetroTipoDescriçãoExemplo
nome_do_arquivoStringPDF4me nome do arquivo gerado - O nome completo do arquivo do documento processado com sucesso, incluindo a extensão e o carimbo de data/hora corretos. PDF4me Garante nomes exclusivos e valida a conformidade do formato do arquivo para uma integração perfeita com os processos subsequentes.text_extraction_results_1756999697398.json
tipo mimeStringPDF4me MIME identificador de tipo - O padronizado MIME tipo para o arquivo de conteúdo extraído, normalmente application/json para dados estruturados ou application/zip para vários arquivos. Isso garante o manuseio e reconhecimento adequados dos arquivos em todos os sistemas e aplicativos.application/json
tamanho do arquivoNúmeroPDF4me tamanho do arquivo em bytes - O tamanho exato do arquivo de conteúdo extraído em bytes, fornecido para planejamento de armazenamento, otimização de largura de banda e monitoramento de transferência de arquivos. Essencial para gerenciamento de documentos corporativos e automação de fluxo de trabalho.106
sucessoBooleanPDF4me indicador de status de extração - Indicador booleano que aponta o sucesso ou a falha do processo de extração de texto. Retorna true para extrações bem-sucedidas e false para quaisquer erros, permitindo um tratamento robusto de erros em fluxos de trabalho automatizados.true
mensagemStringPDF4me mensagem de status da extração - Mensagem descritiva indicando o resultado do processo de extração de texto. Fornece mensagens de status claras para extrações bem-sucedidas e informações detalhadas sobre erros para fins de solução de problemas.Text extraction by expression completed successfully
nomeDoDocumentoStringPDF4me referência ao nome do documento original - O nome original do arquivo de entrada PDF Arquivo que foi processado. Essa referência é mantida para fins de auditoria, depuração e rastreamento da origem do conteúdo extraído em fluxos de trabalho corporativos.document.pdf
expressãoStringPDF4me expressão de extração usada - O padrão ou expressão que foi usado para a extração de texto. Este campo mostra a expressão real que foi aplicada durante o processo de extração para fins de verificação e depuração.%
Sequência de páginasStringPDF4me intervalo de páginas processadas - O intervalo de páginas que foi processado durante a extração de texto. Este campo mostra as páginas reais que foram verificadas em busca da expressão especificada, útil para verificação e resolução de problemas.1-2

N8N Resposta à ação

O PDF4me Extrair texto por expressão API Retorna uma resposta que pode ser visualizada em vários formatos. Escolha a visualização que melhor se adapta às suas necessidades:

JSON Formato de resposta

O bruto JSON resposta do API:

{
"fileName": "text_extraction_results_1756999697398.json",
"mimeType": "application/json",
"fileSize": 106,
"success": true,
"message": "Text extraction by expression completed successfully",
"docName": "document.pdf",
"expression": "%",
"pageSequence": "1-2"
}

Casos de uso

Mineração de Dados e Extração de Informação

  • Extraia padrões de dados específicos, informações de contato e dados estruturados de PDF documentos que utilizam expressões personalizadas para mineração de dados e inteligência de negócios
  • Processar documentos legais, contratos e registros oficiais, extraindo cláusulas, termos e informações jurídicas específicas por meio de expressões direcionadas.
  • Transforme relatórios financeiros, faturas e documentos contábeis extraindo dados financeiros específicos, valores e informações de transações usando expressões personalizadas.

Análise e pesquisa de conteúdo

  • Extrair dados de pesquisa, citações e informações acadêmicas de PDF documentos que utilizam expressões personalizadas para pesquisa acadêmica e análise de conteúdo
  • Processar artigos científicos, documentos de pesquisa e publicações técnicas, extraindo dados específicos, medições e resultados de pesquisa por meio de expressões direcionadas.
  • Transforme relatórios de negócios, pesquisas de mercado e análises setoriais extraindo métricas, estatísticas e dados comerciais específicos usando expressões personalizadas.

Processamento de Conformidade e Regulamentação

  • Extraia dados de conformidade, informações regulatórias e detalhes de auditoria de PDF documentos que utilizam expressões personalizadas para processamento de conformidade regulatória e auditoria
  • Processar documentos de controle de qualidade, relatórios de inspeção e materiais de certificação, extraindo dados específicos de conformidade, normas e informações regulamentares.
  • Transforme documentos oficiais, licenças e registros regulatórios extraindo dados regulatórios específicos, métricas de conformidade e informações oficiais usando expressões personalizadas.

Obtenha ajuda