Passa al contenuto principale

Estrai il testo tramite espressione utilizzando n8n azione

PDF4me Estrai testo tramite espressione estrae contenuti testuali specifici da PDF documenti utilizzando la corrispondenza di modelli e il filtraggio basato su espressioni attraverso n8n Flussi di lavoro automatizzati. Processo PDFs via n8n trigger, dati binari, stringhe base64 o pubblico URLConsente di individuare ed estrarre testo utilizzando modelli con caratteri jolly (%), espressioni regolari, campi dati specifici, targeting per pagina e regole di estrazione flessibili con output strutturato. Questa soluzione è ideale per l'estrazione di numeri di fattura, l'acquisizione di campi dati, il recupero di testo basato su modelli, l'estrazione automatizzata di dati, l'analisi di documenti e i flussi di lavoro di analisi dei contenuti che richiedono un targeting preciso del testo con corrispondenza flessibile e integrazione perfetta.

Articoli correlati del blog
Non ci sono ancora post sul blog dedicati a questa funzionalità — in arrivo a breve.
Nel frattempo, dai un'occhiata al blog di PDF4me per trovare tutorial e procedure operative su tutte le piattaforme.
Visita il blog

Impostare

Aggiungi il PDF4me nodo "Estrai testo tramite espressione" al tuo n8n flusso di lavoro e configurare i parametri richiesti. Per le istruzioni di configurazione iniziale, consultare il nostro n8n Guida all'integrazione.

Prerequisiti:

  • PDF4me API credenziali
  • n8n accesso al flusso di lavoro

Configurazione:

  1. Aggiungere PDF4me nodo al flusso di lavoro
  2. Seleziona l'azione "Estrai testo tramite espressione"
  3. Configura i parametri di input (vedi sotto)
Estrazione del testo tramite configurazione dell'espressione

Parametri

Elenco completo dei parametri per l'azione Estrai testo tramite espressione. Configura questi parametri per controllare l'estrazione del testo.

Importante: I parametri contrassegnati da un asterisco (***) sono obbligatori e devono essere forniti affinché l'azione funzioni correttamente.

ParametroTipoDescrizioneEsempio
Tipo di dati di input***StringPDF Selezione del formato di input
• Scegli il formato del tuo PDF immissione dati
PDF4me supporta più tipi di input
• Opzioni: Dati binari, Base64 Corda o URL
Binary Data
Campo binario di inputBinarioBinario PDF Inserimento file (Obbligatorio se si tratta di dati binari)
• Riferimento PDF file da precedente n8n caricamento del nodo o del file
PDF4me processi binari PDF file con rilevamento automatico del formato
• Obbligatorio quando il tipo di dati di input è "Dati binari"
{{ $binary.data }}
Contenuto PDF in formato Base64StringBase64 Codificato PDF Input (Obbligatorio se Base64 Corda)
• Fornire PDF contenuto come stringa codificata in base64
PDF4me decodifica ed elabora automaticamente il PDF contenuto
• Obbligatorio quando il tipo di dati di input è "Base64 Corda"
JVBER...
URL del PDFStringpubblico PDF URL Input (Obbligatorio se URL)
• Fornire un'autorizzazione pubblica/aperta URL per il PDF file
PDF4me scarica ed elabora il file da URL
• Obbligatorio quando il tipo di dati di input è "URL"
https://abc.com/document.pdf
Nome del documento***StringNome del file di input
• Specificare il nome dell'input PDF file
• Utilizzato per il rilevamento del formato e l'ottimizzazione dell'elaborazione
• Deve includere l'estensione .pdf
document.pdf
Espressione***StringModello di estrazione del testo
• Definire il modello o l'espressione per abbinare il contenuto del testo
• Supporta modelli regex, caratteri jolly ed espressioni personalizzate
• Utilizzo % per la corrispondenza con caratteri jolly o modelli regex specifici
%
Sequenza di pagine***StringSpecifiche dell'intervallo di pagine
• Definire quali pagine elaborare per l'estrazione del testo
• Utilizzare "tutto" per l'intero documento o per specifici numeri/intervalli di pagina.
• Esempi: "1,3,5" (specifico), "1-5" (intervallo), "1-" (da pagina 1 alla fine)
1-

Opzioni avanzate

Nella sezione Opzioni avanzate sono disponibili i seguenti parametri, che sono facoltativi:

ParametroTipoDescrizioneEsempio
Profili personalizzatiStringProfili di configurazione personalizzati
• Imposta opzioni aggiuntive utilizzando profili personalizzati
JSON-formato simile contenente parametri predefiniti
• Consente impostazioni avanzate per l'elaborazione dell'estrazione
• Opzionale per esigenze specifiche
{ "outputDataFormat": "json" }

Produzione

Parametri di output

ParametroTipoDescrizioneEsempio
Nome fileStringPDF4me nome file generato - Il nome completo del file del documento elaborato correttamente, con estensione e data/ora appropriate. PDF4me Garantisce una denominazione univoca e convalida la conformità del formato dei file per una perfetta integrazione con i processi a valle.text_extraction_results_1756999697398.json
tipo mimeStringPDF4me MIME tipo di dizionario - Lo standardizzato MIME tipo per il file di contenuto estratto, in genere application/json per dati strutturati o application/zip per più file. Ciò garantisce una corretta gestione e riconoscimento dei file in tutti i sistemi e le applicazioni.application/json
Dimensione fileNumeroPDF4me dimensione del file in byte - La dimensione esatta in byte del file di contenuto estratto, fornita per la pianificazione dello storage, l'ottimizzazione della larghezza di banda e il monitoraggio del trasferimento dei file. Essenziale per la gestione documentale aziendale e l'automazione dei flussi di lavoro.106
successoBooleanPDF4me indicatore dello stato di estrazione - Flag booleano che indica il successo o il fallimento del processo di estrazione del testo. Restituisce true per estrazioni riuscite e false per eventuali errori, consentendo una gestione degli errori efficace nei flussi di lavoro automatizzatitrue
messaggioStringPDF4me messaggio sullo stato dell'estrazione - Messaggio descrittivo che indica il risultato del processo di estrazione del testo. Fornisce messaggi di stato chiari per le estrazioni riuscite e informazioni dettagliate sugli errori a scopo di risoluzione dei problemi.Text extraction by expression completed successfully
docNameStringPDF4me riferimento al nome del documento originale - Il nome del file originale dell'input PDF file elaborato. Questo riferimento viene mantenuto per scopi di audit trail, debug e tracciamento dell'origine del contenuto estratto nei flussi di lavoro aziendali.document.pdf
espressioneStringPDF4me espressione di estrazione utilizzata - Il modello o l'espressione utilizzata per l'estrazione del testo. Questo campo mostra l'espressione effettiva applicata durante il processo di estrazione a scopo di verifica e debug.%
sequenza di pagineStringPDF4me intervallo di pagine elaborate - Intervallo di pagine elaborato durante l'estrazione del testo. Questo campo mostra le pagine effettivamente scansionate per l'espressione specificata, utile per la verifica e la risoluzione dei problemi.1-2

N8N Risposta all'azione

IL PDF4me Estrai testo tramite espressione API Restituisce una risposta che può essere visualizzata in diversi formati. Scegli la visualizzazione più adatta alle tue esigenze:

JSON Formato di risposta

Il grezzo JSON risposta da API:

{
"fileName": "text_extraction_results_1756999697398.json",
"mimeType": "application/json",
"fileSize": 106,
"success": true,
"message": "Text extraction by expression completed successfully",
"docName": "document.pdf",
"expression": "%",
"pageSequence": "1-2"
}

Casi d'uso

Data mining ed estrazione di informazioni

  • Estrarre modelli di dati specifici, informazioni di contatto e dati strutturati da PDF documenti che utilizzano espressioni personalizzate per il data mining e la business intelligence
  • Elabora documenti legali, contratti e registri ufficiali estraendo clausole, termini e informazioni legali specifici utilizzando espressioni mirate.
  • Trasforma report finanziari, fatture e documenti contabili estraendo dati finanziari specifici, importi e informazioni sulle transazioni utilizzando espressioni personalizzate.

Analisi e ricerca dei contenuti

  • Estrarre dati di ricerca, citazioni e informazioni accademiche da PDF documenti che utilizzano espressioni personalizzate per la ricerca accademica e l'analisi dei contenuti
  • Elabora articoli scientifici, documenti di ricerca e pubblicazioni tecniche estraendo dati specifici, misurazioni e risultati di ricerca utilizzando espressioni mirate.
  • Trasforma report aziendali, ricerche di mercato e analisi di settore estraendo metriche, statistiche e dati aziendali specifici utilizzando espressioni personalizzate.

Processi di conformità e regolamentari

  • Estrarre dati di conformità, informazioni normative e dettagli di audit da PDF documenti che utilizzano espressioni personalizzate per la conformità normativa e l'elaborazione degli audit
  • Elabora documenti di controllo qualità, rapporti di ispezione e materiali di certificazione estraendo dati specifici di conformità, standard e informazioni normative.
  • Trasforma documenti ufficiali, permessi e pratiche normative estraendo dati normativi specifici, metriche di conformità e informazioni ufficiali utilizzando espressioni personalizzate.

Richiedi assistenza