Estrai il testo tramite espressione utilizzando n8n azione
PDF4me Estrai testo tramite espressione estrae contenuti testuali specifici da PDF documenti utilizzando la corrispondenza di modelli e il filtraggio basato su espressioni attraverso n8n Flussi di lavoro automatizzati. Processo PDFs via n8n trigger, dati binari, stringhe base64 o pubblico URLConsente di individuare ed estrarre testo utilizzando modelli con caratteri jolly (%), espressioni regolari, campi dati specifici, targeting per pagina e regole di estrazione flessibili con output strutturato. Questa soluzione è ideale per l'estrazione di numeri di fattura, l'acquisizione di campi dati, il recupero di testo basato su modelli, l'estrazione automatizzata di dati, l'analisi di documenti e i flussi di lavoro di analisi dei contenuti che richiedono un targeting preciso del testo con corrispondenza flessibile e integrazione perfetta.
Impostare
Aggiungi il PDF4me nodo "Estrai testo tramite espressione" al tuo n8n flusso di lavoro e configurare i parametri richiesti. Per le istruzioni di configurazione iniziale, consultare il nostro n8n Guida all'integrazione.
Prerequisiti:
- PDF4me API credenziali
- n8n accesso al flusso di lavoro
Configurazione:
- Aggiungere PDF4me nodo al flusso di lavoro
- Seleziona l'azione "Estrai testo tramite espressione"
- Configura i parametri di input (vedi sotto)

Parametri
Elenco completo dei parametri per l'azione Estrai testo tramite espressione. Configura questi parametri per controllare l'estrazione del testo.
Importante: I parametri contrassegnati da un asterisco (***) sono obbligatori e devono essere forniti affinché l'azione funzioni correttamente.
| Parametro | Tipo | Descrizione | Esempio |
|---|---|---|---|
| Tipo di dati di input*** | String | PDF Selezione del formato di input • Scegli il formato del tuo PDF immissione dati • PDF4me supporta più tipi di input • Opzioni: Dati binari, Base64 Corda o URL | Binary Data |
| Campo binario di input | Binario | Binario PDF Inserimento file (Obbligatorio se si tratta di dati binari) • Riferimento PDF file da precedente n8n caricamento del nodo o del file • PDF4me processi binari PDF file con rilevamento automatico del formato • Obbligatorio quando il tipo di dati di input è "Dati binari" | {{ $binary.data }} |
| Contenuto PDF in formato Base64 | String | Base64 Codificato PDF Input (Obbligatorio se Base64 Corda) • Fornire PDF contenuto come stringa codificata in base64 • PDF4me decodifica ed elabora automaticamente il PDF contenuto • Obbligatorio quando il tipo di dati di input è "Base64 Corda" | JVBER... |
| URL del PDF | String | pubblico PDF URL Input (Obbligatorio se URL) • Fornire un'autorizzazione pubblica/aperta URL per il PDF file • PDF4me scarica ed elabora il file da URL • Obbligatorio quando il tipo di dati di input è "URL" | https://abc.com/document.pdf |
| Nome del documento*** | String | Nome del file di input • Specificare il nome dell'input PDF file • Utilizzato per il rilevamento del formato e l'ottimizzazione dell'elaborazione • Deve includere l'estensione .pdf | document.pdf |
| Espressione*** | String | Modello di estrazione del testo • Definire il modello o l'espressione per abbinare il contenuto del testo • Supporta modelli regex, caratteri jolly ed espressioni personalizzate • Utilizzo % per la corrispondenza con caratteri jolly o modelli regex specifici | % |
| Sequenza di pagine*** | String | Specifiche dell'intervallo di pagine • Definire quali pagine elaborare per l'estrazione del testo • Utilizzare "tutto" per l'intero documento o per specifici numeri/intervalli di pagina. • Esempi: "1,3,5" (specifico), "1-5" (intervallo), "1-" (da pagina 1 alla fine) | 1- |
Opzioni avanzate
Nella sezione Opzioni avanzate sono disponibili i seguenti parametri, che sono facoltativi:
| Parametro | Tipo | Descrizione | Esempio |
|---|---|---|---|
| Profili personalizzati | String | Profili di configurazione personalizzati • Imposta opzioni aggiuntive utilizzando profili personalizzati • JSON-formato simile contenente parametri predefiniti • Consente impostazioni avanzate per l'elaborazione dell'estrazione • Opzionale per esigenze specifiche | { "outputDataFormat": "json" } |
Produzione
Parametri di output
| Parametro | Tipo | Descrizione | Esempio |
|---|---|---|---|
| Nome file | String | PDF4me nome file generato - Il nome completo del file del documento elaborato correttamente, con estensione e data/ora appropriate. PDF4me Garantisce una denominazione univoca e convalida la conformità del formato dei file per una perfetta integrazione con i processi a valle. | text_extraction_results_1756999697398.json |
| tipo mime | String | PDF4me MIME tipo di dizionario - Lo standardizzato MIME tipo per il file di contenuto estratto, in genere application/json per dati strutturati o application/zip per più file. Ciò garantisce una corretta gestione e riconoscimento dei file in tutti i sistemi e le applicazioni. | application/json |
| Dimensione file | Numero | PDF4me dimensione del file in byte - La dimensione esatta in byte del file di contenuto estratto, fornita per la pianificazione dello storage, l'ottimizzazione della larghezza di banda e il monitoraggio del trasferimento dei file. Essenziale per la gestione documentale aziendale e l'automazione dei flussi di lavoro. | 106 |
| successo | Boolean | PDF4me indicatore dello stato di estrazione - Flag booleano che indica il successo o il fallimento del processo di estrazione del testo. Restituisce true per estrazioni riuscite e false per eventuali errori, consentendo una gestione degli errori efficace nei flussi di lavoro automatizzati | true |
| messaggio | String | PDF4me messaggio sullo stato dell'estrazione - Messaggio descrittivo che indica il risultato del processo di estrazione del testo. Fornisce messaggi di stato chiari per le estrazioni riuscite e informazioni dettagliate sugli errori a scopo di risoluzione dei problemi. | Text extraction by expression completed successfully |
| docName | String | PDF4me riferimento al nome del documento originale - Il nome del file originale dell'input PDF file elaborato. Questo riferimento viene mantenuto per scopi di audit trail, debug e tracciamento dell'origine del contenuto estratto nei flussi di lavoro aziendali. | document.pdf |
| espressione | String | PDF4me espressione di estrazione utilizzata - Il modello o l'espressione utilizzata per l'estrazione del testo. Questo campo mostra l'espressione effettiva applicata durante il processo di estrazione a scopo di verifica e debug. | % |
| sequenza di pagine | String | PDF4me intervallo di pagine elaborate - Intervallo di pagine elaborato durante l'estrazione del testo. Questo campo mostra le pagine effettivamente scansionate per l'espressione specificata, utile per la verifica e la risoluzione dei problemi. | 1-2 |
N8N Risposta all'azione
IL PDF4me Estrai testo tramite espressione API Restituisce una risposta che può essere visualizzata in diversi formati. Scegli la visualizzazione più adatta alle tue esigenze:
- JSON
- Table
- Schema
- Binary
JSON Formato di risposta
Il grezzo JSON risposta da API:
{
"fileName": "text_extraction_results_1756999697398.json",
"mimeType": "application/json",
"fileSize": 106,
"success": true,
"message": "Text extraction by expression completed successfully",
"docName": "document.pdf",
"expression": "%",
"pageSequence": "1-2"
}
Visualizzazione tabella
Dati di risposta in formato tabellare strutturato:
| Parametro | Valore |
|---|---|
| fileName | text_extraction_results_1756999697398.json |
| mimeType | application/json |
| fileSize | 106 |
| success | true |
| docName | document.pdf |
| message | Text extraction by expression completed successfully |
| expression | % |
| pageSequence | 1-2 |
Vista dello schema
Struttura dei dati e tipologie di risposta:
fileName: AB text_extraction_results_1756999697398.json
mimeType: AB application/json
fileSize: # 106
success: ✓ true
docName: AB document.pdf
message: AB Text extraction by expression completed successfully
expression: AB %
pageSequence: AB 1-2
Indicatori di tipo:
AB= String#= Numerico✓= Boolean
Visualizzazione dei dati binari
I dati e i metadati del testo effettivamente estratto:
data
─────────────────────────────────────────
File Name: text_extraction_results_1756999697398.json
File Extension: json
Mime Type: application/json
File Size: 106 bytes
Casi d'uso
Data mining ed estrazione di informazioni
- Estrarre modelli di dati specifici, informazioni di contatto e dati strutturati da PDF documenti che utilizzano espressioni personalizzate per il data mining e la business intelligence
- Elabora documenti legali, contratti e registri ufficiali estraendo clausole, termini e informazioni legali specifici utilizzando espressioni mirate.
- Trasforma report finanziari, fatture e documenti contabili estraendo dati finanziari specifici, importi e informazioni sulle transazioni utilizzando espressioni personalizzate.
Analisi e ricerca dei contenuti
- Estrarre dati di ricerca, citazioni e informazioni accademiche da PDF documenti che utilizzano espressioni personalizzate per la ricerca accademica e l'analisi dei contenuti
- Elabora articoli scientifici, documenti di ricerca e pubblicazioni tecniche estraendo dati specifici, misurazioni e risultati di ricerca utilizzando espressioni mirate.
- Trasforma report aziendali, ricerche di mercato e analisi di settore estraendo metriche, statistiche e dati aziendali specifici utilizzando espressioni personalizzate.
Processi di conformità e regolamentari
- Estrarre dati di conformità, informazioni normative e dettagli di audit da PDF documenti che utilizzano espressioni personalizzate per la conformità normativa e l'elaborazione degli audit
- Elabora documenti di controllo qualità, rapporti di ispezione e materiali di certificazione estraendo dati specifici di conformità, standard e informazioni normative.
- Trasforma documenti ufficiali, permessi e pratiche normative estraendo dati normativi specifici, metriche di conformità e informazioni ufficiali utilizzando espressioni personalizzate.