Cara Mengekstrak Teks dari PDF Hasil Pindai di Zapier: Tonton → OCR → Ekstrak (3 Langkah)

Faktur yang dipindai, formulir yang difaks, atau tangkapan layar yang disimpan sebagai PDF, semuanya tampak seperti dokumen, tetapi teksnya hanyalah piksel. Anda tidak dapat memilihnya, menyalinnya, atau memasukkannya ke dalam Zap Anda. Solusinya: jalankan OCR pertama Untuk membuat PDF dapat dicari, lalu ekstrak teksnya. Berikut adalah Zap tiga langkah yang melakukan hal itu, menggunakan Dropbox dan PDF4me.
Pendeknya: Seret PDF ke Dropbox → Zap memicu proses → OCR membuatnya dapat dicari → Ekstrak Teks menarik konten ke dalam Teks lengkapPetakan kolom tersebut ke Google Sheets, Airtable, email, atau apa pun.
Apa yang Akan Anda Dapatkan pada Akhirnya
Saat file PDF masuk ke folder Dropbox Anda, Zap akan menjalankan OCR (jika diperlukan) dan mengekstrak semua teks ke dalam satu kolom. Teks lengkapAnda dapat memetakannya ke Google Sheets, Airtable, email, atau langkah selanjutnya. Outputnya meliputi: ID Jejak untuk debugging dan Informasi Teks Halaman untuk detail per halaman.

Output dari Zap: teks yang diekstrak, ID Jejak, dan Info Teks Halaman.
Mengapa PDF Berbasis Gambar Membutuhkan OCR Terlebih Dahulu?
PDF berbasis gambar menyimpan teks sebagai piksel. Alat ekstraksi mengharapkan lapisan teks, sehingga tidak mengembalikan apa pun yang berguna. Membuat PDF Dapat Dicari / OCR menambahkan lapisan itu, lalu Ekstrak Teks dari PDF Dapat membaca semuanya. Lewati langkah OCR hanya jika PDF Anda sudah memiliki teks yang dapat dipilih (coba salin kata di pembaca untuk memverifikasi).
Apa yang Anda Butuhkan?
- Zapier, Buat akun Zapier dan memulai Zap baru.
- Kunci API PDF4me, Dapatkan kunci API AndaAnda akan menghubungkannya saat menambahkan tindakan PDF4me. Baru pertama kali? Lihat Hubungkan PDF4me ke Zapier.
- DropboxKami menggunakan File Baru di dalam Folder sebagai pemicu. Aplikasi penyimpanan apa pun yang memicu pembaruan file baru juga bisa digunakan.
Zap dalam 3 Langkah
- File Baru di dalam Folder (Dropbox): Jam Tangan
/pdf4metest/ExtractTextsetiap 2 menit. - Membuat PDF Dapat Dicari / OCR (PDF4me): Mengubah PDF berbasis gambar menjadi dokumen yang dapat dicari.
- Ekstrak Teks dari PDF (PDF4me): Menarik teks ke dalam Teks lengkap, ID Jejak, Dan Informasi Teks Halaman.

Masukan: PDF berbasis gambar (misalnya, Image To PDF.pdf) dengan konten seperti “Contoh Dokumen PDF” dan baris bernomor. Keluaran: Semua teks dalam Teks lengkap, siap untuk langkah selanjutnya.

Contoh input: PDF berbasis gambar yang memerlukan OCR sebelum ekstraksi.
Langkah 1: File Baru di dalam Folder (Pemicu).
Sejauh ini, Zap berhasil: Hanya pemicu.
- Menambahkan Dropbox → File Baru di dalam Folder sebagai pemicunya.
- Ruang angkasa: Bawaan (atau pilih tempat Anda).
- Folder *:
/pdf4metest/ExtractText(atau folder target Anda). - Apakah file di dalam subfolder perlu disertakan?: PALSU (atau Benar untuk folder bersarang).
- Sertakan isi file?: YaHarus bernilai Ya agar konten file diteruskan ke langkah selanjutnya.
- Apakah perlu menyertakan tautan berbagi?: Ya (opsional).
- Klik Melanjutkan dan uji pemicunya.

Penting: Mengatur Sertakan isi file? ke YaJika jawabannya Tidak, Zapier akan mengirimkan referensi alih-alih file, dan langkah OCR serta Ekstraksi akan gagal.
Langkah 2: Jadikan PDF Dapat Dicari / OCR (Aksi).
Sejauh ini, Zap berhasil: Pemicu → Jadikan PDF Dapat Dicari / OCR.
- Menambahkan PDF4me → Membuat PDF Dapat Dicari / OCR.
- Berkas *: Peta 1. Berkas dari pemicu Dropbox. Gunakan kolom dengan konten file yang sebenarnya, bukan “File: (Ada tetapi tidak ditampilkan).”
- Nama File: Peta 1. Nama File Dan 1. Ekstensi File (misalnya.
Image To PDF+.pdf). - Jenis Kualitas *: Standar untuk sebagian besar PDF.
- Atur Proses sebagai Asinkron: PALSU Jadi, Zap menunggu hingga OCR selesai.
- Klik Melanjutkan dan tes.

Langkah OCR menghasilkan PDF yang dapat dicari. Langkah Ekstraksi menggunakan file tersebut.
Langkah 3: Ekstrak Teks Dari PDF (Tindakan).
Sejauh ini, Zap berhasil: Pemicu → OCR → Ekstrak Teks.
- Menambahkan PDF4me → Ekstrak Teks dari PDF.
- Berkas *: Peta 2. URL File dari langkah OCR (PDF yang telah diproses).
- Nama File: Peta 2. Nama File Lengkap (misalnya.
Image To PDF.pdf). - Mode Ekstraksi *: Dokumen Lengkap untuk semua teks dalam satu kolom, atau Per Halaman untuk output per halaman.
- Klik Melanjutkan dan tes.

Keluaran: Aksi kembali Teks lengkap (semua teks yang diekstrak), ID Jejak (misalnya. 5e4ba591-94c4-4b6c-ac3f-ca062d483981), Dan Informasi Teks HalamanUntuk contoh PDF seperti yang di atas, Anda akan melihat "Dokumen PDF Contoh" ditambah baris 1 hingga 10 di Teks lengkap.
Tabel Referensi Cepat
| Melangkah | Pengaturan utama | Catatan |
|---|---|---|
| Pemicu | Folder: /pdf4metest/ExtractText | Sertakan isi file: Ya |
| OCR | Jenis Kualitas: Standar | Gunakan Expert untuk hasil pemindaian yang buruk (lebih banyak panggilan API) |
| OCR | Atur Proses sebagai Asinkron: Salah | Menjaga agar Zap tetap sinkron. |
| Ekstrak | Mode Ekstraksi: Dokumen Lengkap | Semua teks dalam satu kolom. |
| Keluaran | Teks lengkap | Petakan ini ke langkah selanjutnya |
Untuk detail parameter selengkapnya, lihat Ekstrak Teks dari PDF: Zapier Dan OCR PDF, Zapier.
Penyelesaian masalah.
Opsi tersebut sering kali mengirimkan referensi, bukan file sebenarnya. Pilih kolom yang berisi konten file yang sebenarnya. Lihat Tips Zapier dan Power Automate untuk penanganan file.
Memastikan Sertakan isi file? adalah Ya pada pemicu, dan Anda memetakan langkah OCR. URL File (atau output file) ke langkah Ekstrak, bukan jalur atau metadata.
Panduan Pemecahan Masalah PDF4me Mencakup 401 (kunci API), 402 (kredit), dan lainnya.
Cobalah API-nya sendiri.
Uji API Ekstrak Teks tanpa membuat Zap:
Langkah Selanjutnya.
- Seret file PDF uji ke dalam folder Anda dan jalankan Zap. Periksa output langkah Ekstrak untuk
Teks lengkap. - Tambahkan langkah setelah Ekstrak, misalnya Tambahkan Baris ke Google Sheets, Kirim Email, atau Perbarui Airtable, dan petakan. Teks lengkap ke dalamnya.
- Aktifkan Zap agar berjalan saat PDF baru muncul di folder.