Passa al contenuto principale

PDF OCR In Make

Cosa fa questo modulo

PDF4me, PDF OCR converte immagini scansionate o basate su immagini PDFs in documenti di testo completamente ricercabili all'interno di un Make scenario. Scegli Standard qualità per dispositivi nativi digitali PDFs O Esperto qualità per documenti scansionati, fotografati o a bassa risoluzione. Abilita OCR solo quando necessario per saltare le pagine che hanno già testo selezionabile e utilizzare È asincrono per file di oltre 10 pagine per evitare timeout di scenario. L'output è ricercabile PDF pronto per l'estrazione del testo, l'archiviazione, l'indicizzazione full-text o AI elaborazione.

Articoli correlati del blog
Non ci sono ancora post sul blog dedicati a questa funzionalità — in arrivo a breve.
Nel frattempo, dai un'occhiata al blog di PDF4me per trovare tutorial e procedure operative su tutte le piattaforme.
Visita il blog

Autenticazione del tuo API Richiesta

Ogni PDF4me modulo in Make richiede un valido Connessione. Crea o selezionane uno che contenga il tuo PDF4me API chiave affinché lo scenario possa autenticarsi OCR elaborazione sicura delle richieste.

Informazioni importanti da non perdere

Qualità da esperto vs. qualità standard
Utilizzo Esperto Per i documenti scansionati o fotografati, applica due passaggi di elaborazione per pagina per una maggiore precisione. Utilizzare Standard per nati digitali PDFs Dove OCR è ancora necessario, è più veloce e costa la metà API crediti per pagina.
OCR Solo quando necessario consente di risparmiare crediti
Quando abilitato, il modulo controlla ogni pagina prima dell'elaborazione, le pagine che contengono già testo selezionabile vengono saltate e OCR viene applicato solo alle pagine basate su immagini. Ciò consente di risparmiare API crediti quando il tuo input PDF mescola pagine originali e pagine scansionate.
Utilizzare Is Async per i file di oltre 10 pagine
Senza modalità asincrona, grande PDFs può causare il Make scenario da timeout prima OCR completa. Abilita È asincrono per qualsiasi documento con più di 10 pagine per consentire al modulo di restituire i risultati in modo asincrono al termine dell'elaborazione.
Crea il modulo OCR PDF di PDF4me che mostra i file mappati dal passaggio precedente, il nome del file di output, il tipo di qualità impostato su Esperto, OCR solo quando necessario, codice lingua e i campi Asincrono.

Sono richiesti i file, il nome del file di output e il tipo di qualità. OCR Solo quando necessario, Codice lingua e È asincrono sono opzionali ma consigliati per contenuti misti e di grandi dimensioni PDFs.

Parametri

Necessario: È necessario fornire i seguenti dati: Connessione, File, Nome del file di output e Tipo di qualità. OCR Solo quando necessario, Codice lingua e È asincrono sono opzioni facoltative.

ParametroNecessarioCosa faEsempio
ConnectionYesPDF4me API connection. Click Add and paste your API key if connecting for the first time.Your PDF4me connection
FilesYesBinary PDF file mapped from a preceding module: scanned, photographed, or image-based PDFs.1. Data
Output File NameYesFilename for the searchable PDF output including the .pdf extension.scanned_searchable.pdf
Quality TypeYesStandard for born-digital PDFs (1 API call per page, faster). Expert for scanned or image-based documents (2 API calls per page, higher accuracy).Expert
OCR Only When NeededNoWhen set to Yes, pages with existing selectable text are skipped: OCR is applied only to image-based pages. Saves API credits for mixed-content PDFs.Yes
Language CodeNoISO language code for the OCR engine. Common values: eng, deu, fra, spa, ita, por. Leave blank for automatic language detection.eng
Is AsyncNoSet to Yes for PDFs with more than 10 pages to prevent Make scenario timeout. Results are returned asynchronously when processing completes.Yes

Configurazione rapida

  1. Aggiungere PDF4mePDF OCR al tuo Make scenario.
  2. Seleziona Connessione (oppure fai clic) Aggiungere per crearne uno con il tuo API chiave).
  3. Mappa File all'output binario del modulo di download precedente (ad esempio Dropbox → Scarica un file → Data).
  4. Inserisci un Nome del file di output: per esempio. scanned_searchable.pdf.
  5. Impostato Tipo di qualità A Expert per documenti scansionati o Standard per nati digitali PDFs.
  6. Abilita facoltativamente OCR Solo quando necessario E È asincrono (per file di oltre 10 pagine), quindi fare clic Salva e esegui. L'output Doc Data è ricercabile PDF.

Esempi di flusso di lavoro

Esempi di flusso di lavoroCommon Make scenario patterns using PDF OCR.
Fattura scansionata OCR e estrazione dei dati
  1. Gmail L'orologio si attiva quando arriva una nuova email con un allegato contenente la scansione di una fattura.
  2. PDF OCR esegue con il tipo di qualità impostato su Esperto e OCR Attiva l'opzione "Solo quando necessario".
  3. Il comando Extract Resources estrae il testo ricercabile dall'output Doc Data.
  4. Il testo estratto viene analizzato per individuare i campi della fattura e inviato automaticamente al sistema contabile.
Lotto di digitalizzazione di documenti preesistenti
  1. Dropbox L'orologio si attiva quando una nuova scansione arriva nella cartella di posta in arrivo.
  2. PDF OCR Elabora il file con qualità Esperto e imposta "Asincrono" su Sì per i batch di grandi dimensioni.
  3. Il ricercabile PDF viene caricato su SharePoint cartella di archivio.
  4. Slack avvisa il team quando ogni documento viene digitalizzato e indicizzato.
Contratto firmato OCR archivio con Airtable tronco d'albero
  1. OneDrive L'orologio si attiva quando la scansione di un contratto cartaceo firmato viene caricata nella cartella dei contratti.
  2. PDF OCR converte il contratto scansionato in un documento ricercabile PDF Con qualità da esperti.
  3. Google Drive salva il ricercabile PDF alla cartella Archivio contratti.
  4. Airtable crea un nuovo record con il nome del contratto, la data e un collegamento alla ricerca PDF per il monitoraggio della conformità.

Domande frequenti

Which Quality Type should I choose?+
Use Expert for scanned documents, photographed pages, or low-quality images: it applies two processing passes per page for higher accuracy. Use Standard for born-digital PDFs (e.g. generated by software or saved from Word) where OCR is still required, it is faster and uses half as many API credits per page.
What does OCR Only When Needed do?+
When enabled, the module checks each page before processing. Pages that already contain selectable text are skipped: OCR is applied only to image-based pages. This is especially useful for PDFs that mix native digital pages with scanned inserts, since it avoids processing pages that do not need OCR.
Which languages does the OCR engine support?+
Common Language Code values are eng (English), deu (German), fra (French), spa (Spanish), ita (Italian), and por (Portuguese). Leave the Language Code field blank for automatic detection. Providing the correct code when the language is known improves accuracy.
When should I enable Is Async?+
Enable Is Async for any PDF with more than 10 pages. Without async mode, large multi-page documents may cause the Make scenario to time out before OCR processing finishes. With Is Async enabled, the module returns results asynchronously once processing completes regardless of file size.
What is in the Doc Data output?+
Doc Data contains the binary of the OCR-processed searchable PDF. The text layer is embedded inside the PDF: you can pass it to the Extract Resources module to extract the text, save it directly to cloud storage, or forward it to an AI analysis step for further processing.

Moduli correlati

Richiedi assistenza