Lewati ke konten utama

PDF OCR di dalam Make

Fungsi modul ini

PDF4me, PDF OCR mengkonversi hasil pemindaian atau berbasis gambar PDFs menjadi dokumen teks yang sepenuhnya dapat dicari di dalam Make skenario. Pilih Standar kualitas untuk generasi digital PDFs atau Pakar kualitas untuk dokumen yang dipindai, difoto, atau beresolusi rendah. Aktifkan OCR Hanya Jika Diperlukan untuk melewati halaman yang sudah memiliki teks yang dapat dipilih, dan menggunakan Apakah Asinkron untuk file yang lebih dari 10 halaman untuk mencegah waktu habis skenario. Outputnya dapat dicari. PDF siap untuk ekstraksi teks, pengarsipan, pengindeksan teks lengkap, atau AI pemrosesan.

Postingan Blog Terkait
Belum ada postingan blog untuk fitur ini — akan segera hadir.
Sementara itu, jelajahi blog PDF4me untuk menemukan tutorial dan alur kerja di berbagai platform.
Kunjungi blog ini

Memverifikasi Identitas Anda API Meminta

Setiap PDF4me modul di Make memerlukan validitas KoneksiBuat atau pilih salah satu yang sesuai dengan kebutuhan Anda. PDF4me API kunci agar skenario dapat diautentikasi OCR Memproses permintaan dengan aman.

Fakta Penting yang Tidak Boleh Anda Lewatkan

Kualitas Ahli vs Kualitas Standar
Menggunakan Pakar Untuk dokumen yang dipindai atau difoto, sistem menerapkan dua proses pengolahan per halaman untuk akurasi yang lebih tinggi. Gunakan Standar untuk generasi digital PDFs Di mana OCR Meskipun masih dibutuhkan, metode ini lebih cepat dan biayanya hanya setengahnya. API kredit per halaman.
OCR Hanya Saat Dibutuhkan menghemat kredit
Saat diaktifkan, modul akan memeriksa setiap halaman sebelum diproses, halaman yang sudah berisi teks yang dapat dipilih akan dilewati dan OCR hanya diterapkan pada halaman berbasis gambar. Ini menghemat API kredit saat Anda memasukkan PDF Menggabungkan halaman asli dan halaman hasil pindai.
Gunakan Is Async untuk file yang lebih dari 10 halaman.
Tanpa mode asinkron, besar PDFs dapat menyebabkan Make skenario untuk habis waktu sebelum OCR selesai. Aktifkan Apakah Asinkron untuk dokumen apa pun yang memiliki lebih dari 10 halaman agar modul dapat mengembalikan hasil secara asinkron ketika pemrosesan selesai.
Buat modul PDF OCR PDF4me yang menampilkan File yang dipetakan dari langkah sebelumnya, Nama File Output, Jenis Kualitas diatur ke Pakar, OCR Hanya Jika Diperlukan, Kode Bahasa, dan kolom Asinkron.

File, Nama File Output, dan Tipe Kualitas wajib diisi. OCR Only When Needed, Language Code, dan Is Async bersifat opsional tetapi direkomendasikan untuk konten campuran dan ukuran besar. PDFs.

Parameter

Diperlukan: Informasi koneksi, file, nama file output, dan tipe kualitas harus disediakan. OCR Only When Needed, Language Code, dan Is Async bersifat opsional.

ParameterDiperlukanApa fungsinya?Contoh
ConnectionYesPDF4me API connection. Click Add and paste your API key if connecting for the first time.Your PDF4me connection
FilesYesBinary PDF file mapped from a preceding module: scanned, photographed, or image-based PDFs.1. Data
Output File NameYesFilename for the searchable PDF output including the .pdf extension.scanned_searchable.pdf
Quality TypeYesStandard for born-digital PDFs (1 API call per page, faster). Expert for scanned or image-based documents (2 API calls per page, higher accuracy).Expert
OCR Only When NeededNoWhen set to Yes, pages with existing selectable text are skipped: OCR is applied only to image-based pages. Saves API credits for mixed-content PDFs.Yes
Language CodeNoISO language code for the OCR engine. Common values: eng, deu, fra, spa, ita, por. Leave blank for automatic language detection.eng
Is AsyncNoSet to Yes for PDFs with more than 10 pages to prevent Make scenario timeout. Results are returned asynchronously when processing completes.Yes

Pengaturan Cepat

  1. Menambahkan PDF4mePDF OCR untuk Anda Make skenario.
  2. Pilih Koneksi (atau klik) Menambahkan untuk membuat satu dengan milikmu API kunci).
  3. Peta Berkas ke output biner dari modul unduhan sebelumnya (misalnya, Dropbox → Unduh File → Data).
  4. Masukkan sebuah Nama File Output: contohnya scanned_searchable.pdf.
  5. Mengatur Jenis Kualitas ke Expert untuk dokumen yang dipindai atau Standard untuk generasi digital PDFs.
  6. Aktifkan secara opsional OCR Hanya Saat Dibutuhkan Dan Apakah Asinkron (untuk berkas yang lebih dari 10 halaman), lalu klik Menyimpan dan jalankan. Outputnya Doc Data apakah Anda dapat dicari PDF.

Contoh Alur Kerja

Contoh Alur KerjaCommon Make scenario patterns using PDF OCR.
Faktur yang dipindai OCR dan ekstraksi data
  1. Gmail Pemberitahuan akan aktif ketika email baru dengan lampiran faktur hasil pindaian tiba.
  2. PDF OCR berjalan dengan Tipe Kualitas diatur ke Pakar dan OCR Hanya Saat Dibutuhkan diaktifkan.
  3. Ekstrak Sumber Daya mengekstrak teks yang dapat dicari dari keluaran Data Dokumen.
  4. Teks yang diekstrak diuraikan untuk kolom-kolom faktur dan diposting ke sistem akuntansi secara otomatis.
Proses digitalisasi dokumen lama secara massal.
  1. Dropbox Watch akan aktif ketika pemindaian baru masuk ke folder masuk.
  2. PDF OCR Memproses file dengan kualitas Ahli dan Is Async diatur ke Ya untuk batch besar.
  3. Yang dapat dicari PDF diunggah ke SharePoint folder arsip.
  4. Slack Memberi tahu tim ketika setiap dokumen telah didigitalisasi dan diindeks.
Kontrak yang ditandatangani OCR arsip dengan Airtable catatan
  1. OneDrive Watch akan aktif ketika hasil pindaian kontrak kertas yang telah ditandatangani diunggah ke folder kontrak.
  2. PDF OCR mengubah kontrak yang dipindai menjadi kontrak yang dapat dicari. PDF Dengan kualitas ahli.
  3. Google Drive menyimpan yang dapat dicari PDF ke folder Arsip Kontrak.
  4. Airtable membuat catatan baru dengan nama kontrak, tanggal, dan tautan ke yang dapat dicari PDF untuk pelacakan kepatuhan.

Pertanyaan yang Sering Diajukan

Which Quality Type should I choose?+
Use Expert for scanned documents, photographed pages, or low-quality images: it applies two processing passes per page for higher accuracy. Use Standard for born-digital PDFs (e.g. generated by software or saved from Word) where OCR is still required, it is faster and uses half as many API credits per page.
What does OCR Only When Needed do?+
When enabled, the module checks each page before processing. Pages that already contain selectable text are skipped: OCR is applied only to image-based pages. This is especially useful for PDFs that mix native digital pages with scanned inserts, since it avoids processing pages that do not need OCR.
Which languages does the OCR engine support?+
Common Language Code values are eng (English), deu (German), fra (French), spa (Spanish), ita (Italian), and por (Portuguese). Leave the Language Code field blank for automatic detection. Providing the correct code when the language is known improves accuracy.
When should I enable Is Async?+
Enable Is Async for any PDF with more than 10 pages. Without async mode, large multi-page documents may cause the Make scenario to time out before OCR processing finishes. With Is Async enabled, the module returns results asynchronously once processing completes regardless of file size.
What is in the Doc Data output?+
Doc Data contains the binary of the OCR-processed searchable PDF. The text layer is embedded inside the PDF: you can pass it to the Extract Resources module to extract the text, save it directly to cloud storage, or forward it to an AI analysis step for further processing.

Modul Terkait

Dapatkan Bantuan