Extrair texto por expressão usando n8n Ação
PDF4me Extrair texto por expressão Extrai conteúdo de texto específico de PDF documentos usando correspondência de padrões e filtragem baseada em expressões por meio de n8n Fluxos de trabalho de automação. Processo PDFs de distância n8n gatilhos, dados binários, strings base64 ou públicos URLPermite localizar e extrair texto usando padrões curinga (%), expressões regulares, campos de dados específicos, segmentação por página e regras de extração flexíveis com saída estruturada. Essa solução é ideal para extração de números de faturas, captura de campos de dados, recuperação de texto baseada em padrões, extração automatizada de dados, análise de documentos e fluxos de trabalho de análise de conteúdo que exigem segmentação precisa de texto com correspondência flexível e integração perfeita.
Configurar
Adicione o PDF4me nó "Extrair texto por expressão" para o seu n8n fluxo de trabalho e configure os parâmetros necessários. Para obter instruções de configuração inicial, consulte nosso n8n Guia de integração.
Pré-requisitos:
- PDF4me API credenciais
- n8n acesso ao fluxo de trabalho
Configuração:
- Adicionar PDF4me nó para fluxo de trabalho
- Selecione a ação "Extrair texto por expressão".
- Configure os parâmetros de entrada (veja abaixo)

Parâmetros
Lista completa de parâmetros para a ação Extrair Texto por Expressão. Configure esses parâmetros para controlar a extração de texto.
Importante: Os parâmetros marcados com um asterisco (***) são obrigatórios e devem ser fornecidos para que a ação funcione corretamente.
| Parâmetro | Tipo | Descrição | Exemplo |
|---|---|---|---|
| Tipo de dados de entrada*** | String | PDF Seleção do formato de entrada • Escolha o formato do seu PDF entrada de dados • PDF4me Suporta vários tipos de entrada • Opções: Dados binários, Base64 Corda, ou URL | Binary Data |
| Campo binário de entrada | Binário | Binário PDF Entrada de arquivo (Obrigatório se os dados forem binários) • Referência PDF arquivo do anterior n8n upload de nó ou arquivo • PDF4me processos binários PDF arquivos com detecção automática de formato • Obrigatório quando o tipo de dados de entrada for "Dados binários" | {{ $binary.data }} |
| Conteúdo do PDF em Base64 | String | Base64 Codificado PDF Entrada (Obrigatório se) Base64 Corda) • Fornecer PDF conteúdo como string codificada em base64 • PDF4me decodifica e processa automaticamente o PDF contente • Obrigatório quando o tipo de dados de entrada for "Base64 Corda" | JVBER... |
| URL do PDF | String | Público PDF URL Entrada (Obrigatório se) URL) • Fornecer uma permissão pública/aberta URL para o PDF arquivo • PDF4me baixa e processa o arquivo de URL • Obrigatório quando o tipo de dados de entrada for "URL" | https://abc.com/document.pdf |
| Nome do documento*** | String | Nome do arquivo de entrada • Especifique o nome da entrada PDF arquivo • Utilizado para detecção de formato e otimização de processamento • Deve incluir a extensão .pdf | document.pdf |
| Expressão*** | String | Padrão de Extração de Texto • Defina o padrão ou expressão para corresponder ao conteúdo do texto • Suporta padrões regex, curingas e expressões personalizadas • Usar % para correspondência com curingas ou padrões de regex específicos | % |
| Sequência de páginas*** | String | Especificação de intervalo de páginas • Defina quais páginas processar para extração de texto. • Use "todos" para o documento inteiro ou para números/intervalos de páginas específicos. • Exemplos: "1,3,5" (específico), "1-5" (intervalo), "1-" (da página 1 até o final) | 1- |
Opções avançadas
Os seguintes parâmetros estão disponíveis na seção Opções Avançadas e são opcionais:
| Parâmetro | Tipo | Descrição | Exemplo |
|---|---|---|---|
| Perfis personalizados | String | Perfis de configuração personalizados • Defina opções adicionais usando perfis personalizados • JSONformato semelhante a - contendo parâmetros predefinidos • Permite configurações avançadas de processamento de extração. • Opcional para requisitos específicos | { "outputDataFormat": "json" } |
Saída
Parâmetros de saída
| Parâmetro | Tipo | Descrição | Exemplo |
|---|---|---|---|
| nome_do_arquivo | String | PDF4me nome do arquivo gerado - O nome completo do arquivo do documento processado com sucesso, incluindo a extensão e o carimbo de data/hora corretos. PDF4me Garante nomes exclusivos e valida a conformidade do formato do arquivo para uma integração perfeita com os processos subsequentes. | text_extraction_results_1756999697398.json |
| tipo mime | String | PDF4me MIME identificador de tipo - O padronizado MIME tipo para o arquivo de conteúdo extraído, normalmente application/json para dados estruturados ou application/zip para vários arquivos. Isso garante o manuseio e reconhecimento adequados dos arquivos em todos os sistemas e aplicativos. | application/json |
| tamanho do arquivo | Número | PDF4me tamanho do arquivo em bytes - O tamanho exato do arquivo de conteúdo extraído em bytes, fornecido para planejamento de armazenamento, otimização de largura de banda e monitoramento de transferência de arquivos. Essencial para gerenciamento de documentos corporativos e automação de fluxo de trabalho. | 106 |
| sucesso | Boolean | PDF4me indicador de status de extração - Indicador booleano que aponta o sucesso ou a falha do processo de extração de texto. Retorna true para extrações bem-sucedidas e false para quaisquer erros, permitindo um tratamento robusto de erros em fluxos de trabalho automatizados. | true |
| mensagem | String | PDF4me mensagem de status da extração - Mensagem descritiva indicando o resultado do processo de extração de texto. Fornece mensagens de status claras para extrações bem-sucedidas e informações detalhadas sobre erros para fins de solução de problemas. | Text extraction by expression completed successfully |
| nomeDoDocumento | String | PDF4me referência ao nome do documento original - O nome original do arquivo de entrada PDF Arquivo que foi processado. Essa referência é mantida para fins de auditoria, depuração e rastreamento da origem do conteúdo extraído em fluxos de trabalho corporativos. | document.pdf |
| expressão | String | PDF4me expressão de extração usada - O padrão ou expressão que foi usado para a extração de texto. Este campo mostra a expressão real que foi aplicada durante o processo de extração para fins de verificação e depuração. | % |
| Sequência de páginas | String | PDF4me intervalo de páginas processadas - O intervalo de páginas que foi processado durante a extração de texto. Este campo mostra as páginas reais que foram verificadas em busca da expressão especificada, útil para verificação e resolução de problemas. | 1-2 |
N8N Resposta à ação
O PDF4me Extrair texto por expressão API Retorna uma resposta que pode ser visualizada em vários formatos. Escolha a visualização que melhor se adapta às suas necessidades:
- JSON
- Table
- Schema
- Binary
JSON Formato de resposta
O bruto JSON resposta do API:
{
"fileName": "text_extraction_results_1756999697398.json",
"mimeType": "application/json",
"fileSize": 106,
"success": true,
"message": "Text extraction by expression completed successfully",
"docName": "document.pdf",
"expression": "%",
"pageSequence": "1-2"
}
Visualização em tabela
Dados de resposta em formato de tabela estruturada:
| Parâmetro | Valor |
|---|---|
| fileName | text_extraction_results_1756999697398.json |
| mimeType | application/json |
| fileSize | 106 |
| success | true |
| docName | document.pdf |
| message | Text extraction by expression completed successfully |
| expression | % |
| pageSequence | 1-2 |
Visão do esquema
A estrutura de dados e os tipos de resposta:
fileName: AB text_extraction_results_1756999697398.json
mimeType: AB application/json
fileSize: # 106
success: ✓ true
docName: AB document.pdf
message: AB Text extraction by expression completed successfully
expression: AB %
pageSequence: AB 1-2
Indicadores de tipo:
AB= String#= Número✓= Boolean
Visualização de Dados Binários
Os dados reais do conteúdo textual extraído e os metadados:
data
─────────────────────────────────────────
File Name: text_extraction_results_1756999697398.json
File Extension: json
Mime Type: application/json
File Size: 106 bytes
Casos de uso
Mineração de Dados e Extração de Informação
- Extraia padrões de dados específicos, informações de contato e dados estruturados de PDF documentos que utilizam expressões personalizadas para mineração de dados e inteligência de negócios
- Processar documentos legais, contratos e registros oficiais, extraindo cláusulas, termos e informações jurídicas específicas por meio de expressões direcionadas.
- Transforme relatórios financeiros, faturas e documentos contábeis extraindo dados financeiros específicos, valores e informações de transações usando expressões personalizadas.
Análise e pesquisa de conteúdo
- Extrair dados de pesquisa, citações e informações acadêmicas de PDF documentos que utilizam expressões personalizadas para pesquisa acadêmica e análise de conteúdo
- Processar artigos científicos, documentos de pesquisa e publicações técnicas, extraindo dados específicos, medições e resultados de pesquisa por meio de expressões direcionadas.
- Transforme relatórios de negócios, pesquisas de mercado e análises setoriais extraindo métricas, estatísticas e dados comerciais específicos usando expressões personalizadas.
Processamento de Conformidade e Regulamentação
- Extraia dados de conformidade, informações regulatórias e detalhes de auditoria de PDF documentos que utilizam expressões personalizadas para processamento de conformidade regulatória e auditoria
- Processar documentos de controle de qualidade, relatórios de inspeção e materiais de certificação, extraindo dados específicos de conformidade, normas e informações regulamentares.
- Transforme documentos oficiais, licenças e registros regulatórios extraindo dados regulatórios específicos, métricas de conformidade e informações oficiais usando expressões personalizadas.