Passa al contenuto principale

Come estrarre il testo da PDF scansionati in Zapier: Guarda → OCR → Estrai (3 passaggi)

· 11 minuti di lettura
SEO and Content Writer

Fatture scansionate, moduli inviati via fax o screenshot salvati come PDF: sembrano documenti, ma il testo è solo pixel. Non è possibile selezionarlo, copiarlo o inserirlo nello Zap. La soluzione alternativa: eseguire OCR prima Per rendere il PDF ricercabile, è necessario estrarre il testo. Ecco una procedura in tre passaggi che fa esattamente questo, utilizzando Dropbox e PDF4me.

In sintesi: Trascina un PDF in Dropbox → Zap attiva → OCR lo rende ricercabile → Estrai testo estrae il contenuto in testi completiMappa quel campo in Fogli Google, Airtable, e-mail o qualsiasi altra cosa.

Cosa otterrai alla fine

Quando un PDF arriva nella tua cartella Dropbox, Zap esegue l'OCR (se necessario) ed estrae tutto il testo in un unico campo, testi completiPuoi mapparlo in Fogli Google, Airtable, e-mail o qualsiasi passaggio successivo. L'output include Traccia ID per il debug e Informazioni sul testo della pagina per i dettagli pagina per pagina.

Estrazione del testo dall'output PDF: testo completo con documento PDF di esempio e righe 1:10, ID traccia, informazioni sul testo della pagina

Output dello Zap: testo estratto, ID di tracciamento e informazioni sul testo della pagina.


Perché i PDF basati su immagini necessitano prima dell'OCR

I PDF basati su immagini memorizzano il testo come pixel. Gli strumenti di estrazione si aspettano un livello di testo, quindi non restituiscono nulla di utile. Rendi il PDF ricercabile / OCR aggiunge quello strato, poi Estrai testo da PDF Può leggere tutto. Salta il passaggio OCR solo se i tuoi PDF contengono già testo selezionabile (prova a copiare una parola in un lettore per verificarlo).


Di che cosa hai bisogno?

  • Zapier, Crea un account Zapier e avviare un nuovo Zap.
  • Chiave API di PDF4me, Ottieni la tua chiave APILo collegherai quando aggiungerai le azioni PDF4me. È la prima volta? Vedi Collega PDF4me a Zapier.
  • Dropbox, Noi usiamo Nuovo file nella cartella come elemento scatenante. Anche qualsiasi app di archiviazione che si attivi alla creazione di nuovi file funziona.

La Zap in 3 passaggi

  1. Nuovo file nella cartella (Dropbox): Orologi /pdf4metest/ExtractText ogni 2 minuti.
  2. Rendi il PDF ricercabile / OCR (PDF4me): Trasforma i PDF basati su immagini in documenti ricercabili.
  3. Estrai testo da PDF (PDF4me): trascina il testo in testi completi, Traccia ID, E Informazioni sul testo della pagina.
Flusso di lavoro Zapier: Dropbox Nuovo file nella cartella (2 min) → PDF4me Rendi il PDF ricercabile / OCR → PDF4me Estrai testo dal PDF

Ingresso: Un PDF basato su immagini (ad esempio Image To PDF.pdf) con contenuti come "Documento PDF di esempio" e righe numerate. Produzione: Tutto il testo in testi completi, pronti per il passo successivo.

Esempio di documento PDF: input basato su immagini con 10 righe numerate

Esempio di input: PDF basato su immagini che necessita di OCR prima dell'estrazione.


Passaggio 1: Nuovo file nella cartella (Trigger).

Zap finora: Solo grilletto.

  1. Aggiungere DropboxNuovo file nella cartella come elemento scatenante.
  2. Spazio: Predefinito (oppure scegli il tuo spazio).
  3. Cartella *: /pdf4metest/ExtractText (o la cartella di destinazione).
  4. Includere i file nelle sottocartelle?: Falso (oppure True per le cartelle annidate).
  5. Includere il contenuto del file?: Deve essere Sì affinché il contenuto del file venga passato alle fasi successive.
  6. Includere il link di condivisione?: (facoltativo).
  7. Fare clic Continuare e testare il grilletto.
Nuovo file nella cartella: Spazio predefinito, Cartella /pdf4metest/ExtractText, Includi contenuto file Sì, Includi link di condivisione Sì

Importante: Impostato Includere il contenuto del file? A Se la risposta è No, Zapier passa un riferimento anziché il file e le fasi di OCR ed estrazione falliranno.


Passaggio 2: Rendi il PDF ricercabile / OCR (Azione).

Zap finora: Attiva → Rendi il PDF ricercabile / OCR.

  1. Aggiungere PDF4meRendi il PDF ricercabile / OCR.
  2. File *: Mappa 1. File dal trigger di Dropbox. Utilizzare il campo con il contenuto effettivo del file, non "File: (Esiste ma non viene visualizzato)".
  3. Nome del file: Mappa 1. Nome del file E 1. Estensione file (per esempio. Image To PDF + .pdf).
  4. Tipo di qualità *: Standard per la maggior parte dei PDF.
  5. Imposta il processo come asincrono: Falso quindi Zap attende che l'OCR termini.
  6. Fare clic Continuare e testare.
Rendi il PDF ricercabile / OCR: File dal passaggio 1, Nome file Immagine in PDF.pdf, Tipo di qualità Standard, Imposta processo come asincrono Falso

La fase OCR restituisce un PDF ricercabile. La fase di estrazione utilizza questo file.


Passaggio 3: Estrarre il testo dal PDF (Azione).

Zap finora: Attiva → OCR → Estrai testo.

  1. Aggiungere PDF4meEstrai testo da PDF.
  2. File *: Mappa 2. URL del file dalla fase OCR (il PDF elaborato).
  3. Nome del file: Mappa 2. Nome completo del file (per esempio. Image To PDF.pdf).
  4. Modalità di estrazione *: Documento completo per tutto il testo in un campo, oppure Pagina per pagina per la visualizzazione pagina per pagina.
  5. Fare clic Continuare e testare.
Estrazione del testo da PDF: URL del file e nome completo del file dalla fase OCR, modalità di estrazione documento completo

Produzione: L'azione ritorna testi completi (tutto il testo estratto), Traccia ID (per esempio. 5e4ba591-94c4-4b6c-ac3f-ca062d483981), E Informazioni sul testo della pagina. Per un PDF di esempio come quello sopra, vedrai "Documento PDF di esempio" più le righe da 1 a 10 in testi completi.


Tabella di riferimento rapido

Fare un passoImpostazioni chiaveNote
GrillettoCartella: /pdf4metest/ExtractTextIncludi il contenuto del file:
OCRTipo di qualità: StandardUtilizza la modalità Esperto per scansioni di scarsa qualità (più chiamate API)
OCRImposta il processo come asincrono: FalsoMantiene lo Zap sincrono
EstrarreModalità di estrazione: Documento completoTutto il testo in un unico campo
Produzionetesti completiMappa questo passaggio alle fasi successive.

Per i dettagli completi dei parametri, vedere Estrai testo da PDF: Zapier E OCR PDF, Zapier.


Risoluzione dei problemi.

"File: (Esiste ma non viene visualizzato)"

Questa opzione spesso passa un riferimento invece del file. Seleziona il campo che contiene il contenuto effettivo del file. Vedi Suggerimenti su Zapier e Power Automate per la gestione dei file.

"Il file è vuoto" oppure non è stato estratto alcun testo.

Garantire Includere il contenuto del file? È nel trigger e che tu mappi il passaggio OCR URL del file (o output del file) nella fase di estrazione, non un percorso o metadati.

Errori API 401, 402 o di altro tipo

Risoluzione dei problemi di PDF4me Copre gli errori 401 (chiave API), 402 (crediti) e altro ancora.


Prova tu stesso l'API.

Prova l'API Extract Text senza creare uno Zap:


Prossimi passi.

Sei a posto.
  • Inserisci un PDF di prova nella tua cartella ed esegui lo Zap. Controlla l'output del passaggio Estrai per testi completi.
  • Aggiungi un passaggio dopo Estrai, ad esempio Aggiungi riga a Fogli Google, Invia e-mail o Aggiorna Airtable e mappa testi completi dentro di esso.
  • Attiva Zap in modo che si avvii quando vengono aggiunti nuovi file PDF alla cartella.