Lewati ke konten utama

Mengekstrak Teks dari PDF di Power Automate: Termasuk Dokumen Hasil Pindai dan Berbasis Gambar

· Satu menit membaca
SEO and Content Writer

Anda memiliki file PDF di Dropbox, SharePoint, atau email, beberapa berupa teks biasa, yang lain berupa hasil pindaian atau berbasis gambar, dan Anda perlu mengeluarkan teks tersebut dalam satu alur yang andal. Masalahnya: PDF berbasis gambar tidak memiliki teks yang dapat dipilih.Mereka membutuhkan OCR terlebih dahulu. Setelah dapat dicari, PDF4me Ekstrak Teks dan Gambar menarik semuanya ke dalam satu panggilanTidak perlu dibaca ulang, tidak ada pemborosan kredit API.

Panduan ini akan memandu Anda melalui alur yang menangani keduanya: pemicumendapatkan isi file (Dropbox) → Konversi PDF ke PDF yang dapat diedit menggunakan OCR. (untuk dokumen hasil pindai) → Ekstrak Teks dan Gambar (PDF4me). Anda akan mendapatkan struktur output yang tepat dan tautan untuk memecahkan masalah dan mencoba API sendiri.

Mengapa Satu Panggilan Itu Penting.

Saat Anda membuat alur kerja yang memisahkan dokumen, mengganti nama file, atau mengarahkan konten, Anda sering kali memerlukan teks dan gambar yang diekstrak dari setiap PDF. Membaca ulang setiap dokumen dalam sebuah loop akan menghabiskan panggilan API dan memperlambat alur kerja. Ekstrak Teks dan Gambar Mengembalikan konten teks dan gambar yang disematkan dalam satu respons. Anda mendapatkan semua yang Anda butuhkan, teks, nama file gambar, dan data gambar Base64, sehingga tindakan selanjutnya dapat mengganti nama, mengarahkan, atau mengarsipkan tanpa perlu membaca data tambahan.

Sebagai tips: Perlu memisahkan file PDF berdasarkan barcode dan mengganti nama setiap file berdasarkan barcode? Gunakan Pisahkan PDF berdasarkan Kode Batang: itu kembali barcodeText dalam respons yang sama untuk setiap pemisahan, sehingga Anda dapat mengganti nama tanpa panggilan kedua. Lihat panduan kami. Memisahkan PDF berdasarkan Barcode di Power Automate memandu.

Apa yang Anda Butuhkan?

  • Power Automate, Open Power AutomateMasuk, lalu buat alur cloud baru (Instan atau Otomatis).
  • Kunci API PDF4me, Dapatkan kunci API AndaAnda akan membuat koneksi saat menambahkan tindakan PDF4me. Baru pertama kali? Lihat Hubungkan PDF4me ke Power Automate.
  • DropboxKami menggunakannya untuk Dapatkan isi fileSharePoint, OneDrive, atau konektor apa pun yang menyediakan konten file juga bisa digunakan.

Alur Secara Singkat (4 Langkah).

  1. Memicu alur secara manual: Mulai alur sesuai permintaan (atau gunakan Saat sebuah file dibuat (di Dropbox untuk otomatisasi).
  2. Dapatkan isi file menggunakan jalur. (Dropbox): Mengambil PDF dari jalur seperti /pdf4metest/extracttext/image to pdf.pdf.
  3. PDF: Konversi PDF ke PDF yang dapat diedit menggunakan OCR (PDF4me): Mengubah PDF hasil pemindaian/gambar menjadi teks yang dapat dicari. Lewati langkah ini jika PDF Anda sudah dapat dicari teksnya.
  4. PDF: Ekstrak Teks dan Gambar (PDF4me): Mengembalikan teks lengkap dan semua gambar yang disematkan dalam satu respons.
Alur Power Automate: Pemicu manual → Dapatkan konten file → Konversi PDF ke PDF yang dapat diedit menggunakan OCR → Ekstrak Teks dan Gambar PDF

Masukan: Satu file PDF (berbasis gambar atau berbasis teks). Keluaran: Konten teks dalam texts susunan dan gambar di images susunan dengan fileName Dan streamFile (Base64).

Contoh PDF: Contoh Dokumen PDF dengan baris bernomor (input berbasis gambar)

Contoh input: PDF berbasis gambar dengan teks yang dapat diekstrak setelah OCR


Langkah 1: Picu + Dapatkan Konten File.

Alur sejauh ini: Pemicu → Dapatkan konten file.

  1. Menambahkan Memicu alur secara manual (atau Saat sebuah file dibuat (di Dropbox untuk otomatisasi).
  2. Menambahkan DropboxDapatkan isi file menggunakan jalur..
  3. Parameter:
  • Jalur File *Masukkan jalur ke file PDF Anda, misalnya. /pdf4metest/extracttext/image to pdf.pdfGunakan ikon folder untuk menelusuri jika diperlukan.
  • Parameter lanjutanMenentukan Jenis Konten: Diatur ke Ya.
  1. Koneksi: Memastikan Terhubung ke Dropbox.

Outputnya adalah isi file (biner). Petakan ke Isi File dalam tindakan OCR (dan kemudian dalam Ekstrak Teks dan Gambar).

Perhatian: Pastikan Anda memetakan lokasi sebenarnya. Isi File Output, bukan jalur file atau metadata. Power Automate terkadang menawarkan beberapa opsi di menu tarik-turun; pilih opsi yang berisi file biner.

Dapatkan isi file: Jalur File /pdf4metest/extracttext/image ke pdf.pdf, Inferensi Tipe Konten Ya

Langkah 2: Konversi PDF ke PDF yang Dapat Diedit Menggunakan OCR (untuk PDF Berbasis Gambar).

Alur sejauh ini: Pemicu → Dapatkan konten file → Konversi PDF ke PDF yang dapat diedit menggunakan OCR.

Jika PDF Anda berupa hasil pemindaian atau berbasis gambar, tambahkan langkah ini agar teks dapat dicari sebelum diekstraksi. Jika PDF Anda sudah memiliki teks yang dapat dipilih, coba salin sebuah kata di pembaca PDF, Anda dapat langsung ke Langkah 3 dan meneruskan konten file langsung ke Ekstrak Teks dan Gambar.

  1. Menambahkan PDF4mePDF: Konversi PDF ke PDF yang dapat diedit menggunakan OCR.
  2. Parameter:
  • Isi File *Peta Dapatkan isi file menggunakan jalur. keluaran (file biner PDF).
  • Nama File *Masukkan nama seperti Test.pdf atau nama file sumbernya.
  • Jenis Kualitas: Draf untuk PDF biasa (1 panggilan API per file) atau Tinggi untuk PDF hasil pemindaian/berbasis gambar (2 panggilan API per halaman).
  • OCR Hanya Jika Diperlukan: PALSU untuk selalu menjalankan OCR, atau Ya Lewati jika PDF sudah dapat dicari (menghemat panggilan API).
  • Bahasa: Diatur ke bahasa dokumen sumber (misalnya, en) jika diperlukan untuk akurasi OCR yang lebih baik.
  • Apakah Asinkron: TIDAK untuk sinkronisasi (direkomendasikan untuk alur).
  1. Koneksi: Terhubung ke PDF4me PDF.
Konversi PDF ke PDF yang dapat diedit menggunakan OCR: Konten File dari Dapatkan file, Nama File Test.pdf, Jenis Kualitas Draf, OCR Hanya Jika Diperlukan false, Bahasa, Apakah Asinkron Tidak

Langkah 3: Ekstrak Teks dan Gambar.

Alur sejauh ini: … → Konversi PDF ke PDF yang dapat diedit menggunakan OCR → Ekstrak Teks dan Gambar.

  1. Menambahkan PDF4mePDF: Ekstrak Teks dan Gambar.
  2. Parameter:
  • Isi File *, Petakan output dari PDF, Konversi PDF ke PDF yang dapat diedit menggunakan OCR (atau langsung dari) Dapatkan isi file (jika Anda melewatkan OCR).
  • Nama File *Masukkan nama seperti New.pdf atau nama file sumbernya.
  • Kutipan Teks: Ya untuk mengekstrak teks.
  • Ekstrak Gambar: Ya untuk mengekstrak gambar yang tertanam (atau TIDAK (jika Anda hanya membutuhkan teks).
  1. Koneksi: Terhubung ke PDF4me PDF.
Ekstrak Teks dan Gambar: Konten File dari langkah OCR, Nama File New.pdf, Ekstrak Teks Ya, Ekstrak Gambar Ya

Keluaran: Aksi kembali tubuh dengan:

  • teks: Array string berisi semua teks yang diekstrak (pemisah baris sebagai \n).
  • gambar: Array objek: fileName (misalnya. page001_image001.jpg) Dan streamFile (Base64). Gunakan ini dalam tindakan selanjutnya untuk menyimpan atau memproses gambar.
Output JSON mentah: statusCode 200, body dengan array teks dan array gambar (fileName, streamFile)

Parameter dan Referensi Keluaran.

Berikut adalah panduan singkat tentang apa yang kami gunakan. Sesuaikan ini agar sesuai dengan pengaturan Anda.

MelangkahParameterNilaiCatatan
Dapatkan fileJalur File/pdf4metest/ekstrakteks/...Jalur Dropbox Anda
Dapatkan fileMenentukan Jenis KontenYaMembantu Power Automate menangani file
OCRJenis KualitasDrafMenggunakan Tinggi untuk dokumen hasil pindai yang rumit
OCROCR Hanya Jika DiperlukanPALSUDitetapkan untuk Ya untuk menghemat panggilan API jika teks sudah dapat dicari.
EkstrakEkstrak Teks/GambarYa / YaMatikan apa yang tidak Anda butuhkan untuk mempercepat proses.
Keluaranteks isiSusunan stringSemua teks yang diekstrak
Keluarangambar tubuhnamafile, streamFileData gambar Base64 untuk setiap gambar

Untuk detail parameter selengkapnya, lihat Ekstrak Teks dan Gambar: Power Automate Dan Konversi PDF ke PDF yang dapat diedit menggunakan OCR..


Penyelesaian masalah.

Terkadang terjadi kesalahan. Berikut cara yang biasanya memperbaikinya:

"Berkas kosong" atau "Berkas tidak dapat dibuka"

Biasanya berarti kolom yang dipetakan salah. Gunakan kolom yang berisi data sebenarnya. isi file, bukan jalur atau referensi. Menu tarik-turun Power Automate bisa membingungkan di sini. Lihat Tips Zapier dan Power Automate untuk Base64 dan penanganan file.

Mengirimkan file JPG atau PNG, bukan PDF.

Ekstrak Teks dan Gambar membutuhkan file PDF. Jika sumber Anda berupa gambar, konversikan terlebih dahulu dengan Konversi ke PDF, lalu sampaikan hasilnya.

401, 402, atau kesalahan lainnya

Memeriksa Panduan Pemecahan Masalah PDF4me untuk kode kesalahan 401 (kunci API), 402 (kredit), dan perbaikan khusus platform.


Cobalah API secara interaktif.

Uji API Ekstrak Teks dan Gambar tanpa Power Automate menggunakan alat kami. Tes APIUnggah PDF dan lihat responsnya:


Langkah Selanjutnya.

Anda hampir selesai.
  • Masukkan file PDF uji ke dalam folder Anda dan jalankan alurnya, lalu periksa hasilnya. tubuh keluaran untuk teks Dan gambar.
  • Memberi makan teks ke dalam Compose, Parse JSON, atau Conditions; gunakan gambar dengan membuat file atau tindakan penyimpanan apa pun.
  • Menukar Memicu secara manual untuk Saat sebuah file dibuat (Dropbox) dan hubungkan jalur file pemicu ke Dapatkan isi file untuk otomatisasi tanpa campur tangan manusia.