Lewati ke konten utama

Konversi PDF ke File Teks di Power Automate: Ubah Kontrak yang Dipindai menjadi Korpus SharePoint yang Dapat Dicari dengan PDF4me

· Satu menit membaca
SEO and Content Writer

PDF4me Ekstrak Teks dan Gambar adalah tindakan Power Automate yang mengembalikan lapisan teks PDF sebagai sebuah array. Dipasangkan dengan OCR di hulu dan penggabungan Compose di hilir, alur ini mengubah setiap PDF yang dimasukkan ke dalam pustaka SharePoint menjadi teks yang sesuai. .txt berkas, siap untuk pencarian AI.

Cari cara melakukannya dan hasil pertama adalah milik Microsoft sendiri. Referensi tindakan PDF, yang menjelaskan Power Automate Desktop tindakan. Hal itu tidak ada dalam alur cloud. Detail tunggal itulah yang menyebabkan dua hasil berikutnya berupa utas Reddit dan utas komunitas Power Platform yang berisi orang-orang yang menanyakan pertanyaan yang sama dan tidak mendapatkan jawaban langsung. Alur ini adalah jawaban langsung, dan berjalan sepenuhnya di cloud pada konektor tingkat standar.

Alur secara sekilas
1. When a file is created (properties only)
SharePoint trigger on the library, scoped to the RagInput folder. Returns metadata, not bytes.
2. Get file content
Fetches the actual PDF bytes using the identifier the trigger handed over.
3. Convert PDF to editable PDF using OCR
Adds a text layer to scans. OCR Only When Needed skips PDFs that already have one.
4. Extract Text and Images
Returns the text as an array. Extract Images stays No.
5. Compose
join() flattens the texts array into one newline separated string.
6. Create file
SharePoint writes the string to /Shared Documents/RagText as .txt.
Versi singkatnya

Sebuah file PDF masuk ke pustaka SharePoint. Pemicu melaporkan item baru, fungsi Get file content mengambil byte-nya, dan PDF4me menjalankan OCR hanya jika file membutuhkannya sebelum mengekstrak teks sebagai array. Ekspresi Compose satu baris menggabungkan array tersebut menjadi satu string, dan SharePoint menulis hasilnya di sebelahnya sebagai file teks biasa. Enam tindakan, tanpa konektor premium, dan seluruh proses selesai dalam waktu sekitar dua belas detik.

Tanya Jawab Berbasis Alasan

Mengapa membuat file .txt alih-alih langsung menggunakan teks dalam alur kerja? Sebuah string di dalam alur eksekusi hanya berlaku selama alur tersebut berlangsung. Sebuah file di dalam pustaka bersifat tahan lama, dapat diindeks, dan dapat dibaca oleh apa pun yang Anda arahkan ke file tersebut nanti, baik itu pencarian SharePoint, basis data vektor, atau chatbot yang mengambil konteks.

Mengapa dibutuhkan dua tindakan untuk mendapatkan satu file? Trigger yang hanya menampilkan properti memang sengaja dibuat ringan. Trigger ini melaporkan bahwa sebuah item muncul dan memberikan metadata-nya, termasuk pengidentifikasi, tetapi tanpa byte. Fungsi "Dapatkan konten file" menukarkan pengidentifikasi tersebut dengan dokumen itu sendiri. Pemisahan keduanya membuat trigger tetap cepat dan memungkinkan Anda untuk memfilter berdasarkan metadata sebelum mengunduh apa pun.

Mengapa menjalankan OCR padahal sebagian besar PDF sudah memiliki teks? Karena Anda tidak bisa membedakannya hanya dengan melihat. Kontrak hasil pindai dan kontrak digital asli tidak dapat dibedakan dalam daftar folder. Tindakan OCR (Optical Character Recognition) OCR Hanya Jika Diperlukan Pengaturan ini memeriksa setiap file dan melewati file yang sudah memiliki lapisan teks, sehingga Anda hanya membayar biaya di tempat yang memang membutuhkan sesuatu.

Mengapa langkah Compose diperlukan? Ekstrak Teks dan Gambar mengembalikan texts Sebagai sebuah array, biasanya satu entri per halaman. Menulis array langsung ke file akan menghasilkan tanda kurung JSON dan tanda kutip yang di-escape. Compose menggabungkan entri-entri tersebut menjadi prosa yang rapi sebelum apa pun masuk ke disk.


Apa yang Akan Anda Dapatkan

Masukan: PDF apa pun yang dimasukkan ke dalam pustaka dokumen SharePoint, baik yang dipindai atau digital, tidak memerlukan konvensi penamaan. Keluaran: satu file teks biasa per PDF di pustaka kedua, yang berisi seluruh isi dokumen yang dapat dibaca.

Pustaka Dokumen SharePoint yang menampilkan folder RagInput yang berisi rag-test.pdf, rag-test2.pdf, dan services-agreement.pdf, semuanya dimodifikasi oleh akun Pdf4me Flow.

RagInput. Seret PDF ke sini dan alur kerja akan dimulai.

Pustaka Dokumen SharePoint yang menampilkan folder RagText yang berisi rag-test.pdf.txt dan rag-test2.pdf.txt yang dihasilkan oleh alur kerja.

RagText. Satu file teks biasa per PDF, siap untuk diindeks.

Berikut adalah hasil akhir dari contoh kontrak tersebut, persis seperti yang tertulis di disk:

MASTER SERVICES AGREEMENT
Between Initech LLC and Umbrella Inc.
Effective date: 1 January 2026. Auto-renews annually.
Liability cap: USD 100000. Confidentiality: 5 years.
CLEAN TEST MARKER: PDF4ME-CLEAN-TEST-2026.

Perhatikan spasi di awal. OCR mempertahankan spasi tata letak, dan itu bagus untuk pencarian dan untuk memberi masukan pada model bahasa. Pangkas nanti jika parser hilir mempermasalahkannya.


Apa yang Anda Butuhkan

  • Power Automate. Open Power AutomateIni adalah alur cloud. Semuanya di sini adalah tingkatan standar, tanpa konektor premium dan tanpa gateway.
  • Kunci API PDF4me. Dapatkan kunci API AndaHubungkan saat pertama kali Anda menambahkan aksi PDF4me.
  • Situs SharePoint dengan dua folderSatu untuk input PDF dan satu untuk output teks. Buat keduanya sebelum Anda membangun, sehingga pemilih folder memiliki tempat untuk mengarah.
  • PDF uji coba. contoh-kontrak.pdfPerjanjian layanan singkat dengan baris penanda yang dapat Anda cari menggunakan grep.

Ambil sampelnya dulu. Setelah alur kerja disimpan, unggah PDF ke folder input Anda, lalu bandingkan isi folder output dengan file teks yang diharapkan.


Gambaran Alur Secara Singkat

  1. Saat file dibuat (hanya properti) (Pemicu SharePoint) dicakup ke /Shared Documents/RagInput.
  2. Dapatkan isi file menggunakan pemicunya Identifier.
  3. PDF - Konversi PDF ke PDF yang dapat diedit menggunakan OCR dengan kualitas Draft dan OCR Hanya Jika Diperlukan true.
  4. PDF - Ekstrak Teks dan Gambar dengan Teks Ekstrak Yes dan Ekstrak Gambar No.
  5. Menyusun menjalankan sebuah join() atas yang dikembalikan texts susunan.
  6. Buat berkas (SharePoint) menulis .txt ke dalam /Shared Documents/RagText.

Gambaran alur lengkap

Riwayat eksekusi Power Automate menunjukkan enam tindakan yang berhasil secara berurutan: SharePoint Saat file dibuat (hanya properti) pada 0,3 detik, Dapatkan konten file pada 0,2 detik, PDF Konversi PDF ke PDF yang dapat diedit menggunakan OCR pada 11 detik, PDF Ekstrak Teks dan Gambar pada 0,4 detik, Buat dokumen pada 0 detik, dan SharePoint Buat file pada 0,3 detik.

OCR adalah satu-satunya tahapan yang lambat dengan waktu 11 detik. Lima tahapan lainnya selesai dalam waktu kurang dari setengah detik.


Langkah 1: Bagaimana cara memantau pustaka SharePoint untuk PDF baru?

Alur sejauh ini: Belum ada apa-apa, ini pemicunya.

Menggunakan Saat file dibuat (hanya properti)Fitur ini aktif saat ada item baru dan mengembalikan metadata-nya. Batasi cakupannya hanya pada satu folder, karena fitur pengawasan di seluruh pustaka akan aktif setiap kali ada yang mengunggah sesuatu di mana pun di pustaka tersebut.

  1. Buat sebuah Alur cloud otomatis dan pilih Saat file dibuat (hanya properti).
  2. Konfigurasi:
    • Alamat Situs: https://ynoox1.sharepoint.com/sites/PDF4meSharepoints
    • Nama Perpustakaan: memilih Dokumen dari menu tarik-turun
  3. Membuka Parameter lanjutan, menambahkan Map, dan atur ke /Shared Documents/RagInput.

Konfigurasi pemicu SharePoint

Power Automate Saat file dibuat, properti hanya memicu panel dengan Alamat Situs diatur ke PDF4me Sharepoints, Nama Pustaka diatur ke Dokumen, dan parameter Folder lanjutan diatur ke /Shared Documents/RagInput

Nama Pustaka adalah pustaka itu sendiri, yaitu Dokumen. Parameter Folder di bawahnya adalah yang mempersempit pemicu ke satu folder di dalamnya.

Tip. Anda juga akan menemukan pemicu yang disebut Saat sebuah file dibuat di dalam sebuah folder, yang mengembalikan byte file secara langsung dan menghemat tindakan Anda berikutnya. Ini ditandai sebagai usang, jadi lebih baik gunakan pasangan properti saja seperti yang ditunjukkan di sini untuk apa pun yang ingin Anda jalankan terus menerus.


Langkah 2: Mengapa Anda memerlukan "Dapatkan konten file" setelah pemicu?

Alur sejauh ini: Pemicu SharePoint.

Pemicu khusus properti menyerahkan metadata, bukan dokumen. Mendapatkan konten file menukar pemicu tersebut. Identifier untuk byte sebenarnya yang dibutuhkan PDF4me.

  1. Menambahkan SharePoint > Dapatkan isi file.
  2. Konfigurasi:
    • Alamat Situs: situs yang sama dengan pemicunya
    • Pengidentifikasi File: Identifier dari pemicu
  3. Membuka Parameter lanjutan dan mengatur Menentukan jenis konten ke Yes.

Dapatkan konfigurasi konten file

Panel tindakan Dapatkan konten file SharePoint dengan Alamat Situs diatur ke situs SharePoint PDF4me, Pengidentifikasi File dipetakan ke token Pengidentifikasi pemicu, dan Inferensi tipe konten diatur ke Ya.

Inferensi tipe konten Ya adalah yang memberikan tindakan selanjutnya berupa byte PDF asli, bukan blob generik.

Pengidentifikasi tersebut merupakan penghubung antara kedua langkah tersebut. Gunakan pemicunya Pengidentifikasi Yang dimaksud adalah kolom, bukan nama file atau jalurnya. Nama-nama tersebut berulang di berbagai folder dan berubah ketika seseorang mengganti nama dokumen. Pengidentifikasinya tidak berubah.


Langkah 3: Mengapa menjalankan OCR sebelum mengekstrak teks?

Alur sejauh ini: SharePoint trigger plus Dapatkan konten file.

Halaman yang dipindai adalah sebuah gambar. Tidak ada teks yang perlu diekstrak sampai OCR menambahkan lapisan teks di atasnya. Tindakan ini melakukan hal itu, dan cukup cerdas untuk tidak mengubah PDF yang sudah dapat dibaca.

  1. Menambahkan PDF - Konversi PDF ke PDF yang dapat diedit menggunakan OCR.
  2. Konfigurasi:
    • Isi File: File Content dari Dapatkan isi file
    • Nama File: token nama file pemicu
    • Jenis Kualitas: Draft
    • OCR Hanya Jika Diperlukan: true
    • Bahasa: Biarkan kosong kecuali jika dokumen Anda bukan dalam bahasa Inggris
    • Apakah Asinkron: No

Parameter OCR

ParameterNilai yang digunakan di siniApa yang dikendalikannya
Isi FileFile Content dari Dapatkan isi fileByte PDF yang akan diproses.
Nama Filetoken nama file pemicuNama sumber, digunakan untuk identifikasi pemrosesan.
Jenis KualitasDraftUpaya pengakuan. Draft Cukup cepat dan akurat untuk pemindaian yang bersih. Pindah ke High untuk karya asli yang berkualitas buruk.
OCR Hanya Jika DiperlukantrueMelewati file yang sudah memiliki lapisan teks, sehingga PDF yang dibuat secara digital langsung diproses.
BahasakosongPetunjuk untuk mesin pengenalan. Biarkan kosong untuk bahasa Inggris.
Apakah AsinkronNoMenunggu hasilnya secara langsung. Beralih ke Yes untuk dokumen yang sangat besar.
PDF4me Konversi PDF ke PDF yang dapat diedit menggunakan panel aksi OCR dengan Konten File dari Dapatkan konten file, Nama File dari pemicu, Jenis Kualitas Draf, OCR Hanya Saat Dibutuhkan true, Bahasa kosong, dan Apakah Asinkron Tidak

QualityType diatur ke Draft di sini. Pada pemindaian yang bersih, hasilnya sama baiknya dengan High dan membutuhkan waktu lebih sedikit.

Tip. Ini adalah langkah lambat, 11 detik dalam lari di atas dibandingkan dengan setengah detik untuk yang lainnya. Mulai pada Draft, periksa file teks, dan pindah hanya ke High jika karakter yang dikembalikan salah. Meningkatkan kualitas pada dokumen yang sebenarnya tidak membutuhkannya adalah cara termudah untuk membuat alur kerja terasa lambat.


Langkah 4: Bagaimana cara Ekstrak Teks dan Gambar mengembalikan teks?

Alur sejauh ini: SharePoint trigger plus Dapatkan konten file plus OCR.

Tindakan ini membaca lapisan teks dan mengembalikannya sebagai sebuah array yang disebut textsArahkan ke output OCR, bukan kembali ke Dapatkan konten file, atau halaman yang dipindai akan kosong.

  1. Menambahkan PDF - Ekstrak Teks dan Gambar.
  2. Konfigurasi:
    • Isi File: File Content dari Tindakan OCR
    • Nama File: token nama file pemicu
    • Kutipan Teks: Yes
    • Ekstrak Gambar: No

Ekstrak parameter Teks dan Gambar

ParameterNilai yang digunakan di siniApa yang dikendalikannya
Isi FileFile Content dari langkah OCRPDF yang dapat dicari. Menggunakan kembali salinan isi file di sini adalah kesalahan yang paling umum.
Nama Filetoken nama file pemicuNama sumber, diteruskan untuk identifikasi.
Kutipan TeksYesMengembalikan texts susunan.
Ekstrak GambarNoLewati gambar yang disematkan. Atur Yes Hanya jika Anda membutuhkannya, hal itu akan membuat responsnya jauh lebih besar.
Panel aksi PDF4me Ekstrak Teks dan Gambar dengan Konten File yang dipetakan dari aksi OCR PDF4me, Nama File dari pemicu SharePoint, Ekstrak Teks diatur ke Ya dan Ekstrak Gambar diatur ke Tidak.

Perhatikan ikon-ikonnya. Konten File memiliki tanda PDF4me karena berasal dari OCR. Nama File memiliki tanda SharePoint karena berasal dari pemicu.


Langkah 5: Bagaimana cara mengubah larik teks menjadi satu string?

Alur sejauh ini: SharePoint trigger plus Dapatkan konten file plus OCR plus Ekstrak Teks dan Gambar.

texts adalah sebuah array. Sebuah file membutuhkan sebuah string. Satu ekspresi gabungan menjembatani keduanya.

  1. Tambahkan Menyusun tindakan.
  2. Di dalam Masukan, beralihlah ke editor ekspresi dan tempelkan:
join(body('PDF_-_Extract_Text_and_Images')?['texts'], decodeUriComponent('%0A'))
  1. Klik Memperbarui.

Yang decodeUriComponent('%0A') Beginilah cara Anda menulis baris baru literal dalam ekspresi Power Automate. Tidak ada urutan escape untuk itu, jadi ini adalah idiomnya.

Susun konfigurasi

Tindakan Power Automate Compose dengan editor ekspresi terbuka yang menunjukkan penggabungan array teks PDF Extract Text dan Images dengan decodeUriComponent percent zero A sebagai pemisah.

Nama aksi di dalam body() menggunakan garis bawah untuk spasi dan tanda hubung. Ganti nama aksi tersebut dan ekspresi ini akan rusak.

Ini adalah satu baris yang menentukan apakah outputnya mudah dibaca. Lewati langkah Compose dan langsung berikan array ke Create file, dan file teks akan berisi tanda kurung JSON dan tanda kutip yang di-escape, bukan dokumen aslinya.


Langkah 6: Bagaimana cara menyimpan teks sebagai file .txt di SharePoint?

Alur sejauh ini: SharePoint trigger plus Dapatkan konten file plus OCR plus Ekstrak Teks dan Gambar plus Buat file.

Langkah terakhir menulis string yang telah digabungkan ke dalam pustaka kedua.

  1. Menambahkan SharePoint > Buat berkas.
  2. Konfigurasi:
    • Alamat Situs: situs yang sama dengan pemicunya
    • Jalur Folder: /Shared Documents/RagText
    • Nama File: token nama file pemicu diikuti oleh teks literal .txt
    • Isi File: itu Menyusun token keluaran

Konfigurasi pembuatan file SharePoint

Tindakan Buat berkas SharePoint dengan Alamat Situs PDF4me Sharepoints, Jalur Folder /Shared Documents/RagText, Nama Berkas yang dibuat dari token nama berkas pemicu ditambah .txt, dan Konten Berkas diatur ke token output Compose.

Isi berkas adalah output Compose, yang membawa ikon operasi data berwarna ungu, bukan sesuatu dari PDF4me. Teks sudah tersusun pada tahap ini.

Tip. Token nama file pemicu sudah memuat .pdf ekstensi, jadi menambahkan .txt menghasilkan contract.pdf.txt, seperti yang ditunjukkan oleh folder output di atas. Itu tidak berbahaya dan membuat tautan ke sumber tetap jelas. Jika Anda lebih suka contract.txt, bungkus token tersebut dengan mengganti() dan tukar .pdf untuk .txt alih-alih menambahkan.


Jalankan Alur dan Verifikasi

  1. Menyimpan Aliran di kanan atas.
  2. Mengunggah contract-sample.pdf ke dalam folder input. Pemicunya melakukan polling, jadi beri waktu sebentar.
  3. Buka alirannya riwayat eksekusi dan periksa apakah keenam tindakan tersebut memiliki tanda centang hijau. OCR akan menjadi proses yang lambat.
  4. Membuka /Shared Documents/RagText. A .txt File tersebut seharusnya ada di sana. Buka file tersebut dan cari... PDF4ME-CLEAN-TEST-2026Jika penanda tersebut ada, OCR dan ekstraksi keduanya bekerja dari awal hingga akhir.

Apa yang sebenarnya kamu bangun? Sebuah alur kerja pemasukan dokumen. Setiap PDF yang masuk ke pustaka secara otomatis diubah menjadi teks biasa, yang merupakan prasyarat yang tidak menarik untuk apa pun yang membaca dokumen dalam skala besar: pencarian SharePoint, indeks vektor, chatbot yang ditingkatkan dengan pengambilan data, atau grep teks lengkap biasa. Jika Anda hanya membutuhkan teks di dalam alur kerja dan bukan di disk, maka yang lebih pendek Mengekstrak Teks dari PDF di Power Automate Panduan ini mencakup hal tersebut dengan Dropbox.


Variasi Umum yang Dapat Anda Tambahkan Tanpa Membangun Ulang

Saring sebelum Anda mengunduh
Karena pemicu mengembalikan metadata terlebih dahulu, Anda dapat menambahkan Kondisi pada nama file atau kolom sebelum fungsi Dapatkan konten file dijalankan. Dengan demikian, unggahan non-PDF tidak dikenakan biaya apa pun.
Simpan juga PDF yang dapat dicari.
Tambahkan pembuatan file kedua yang menyimpan output dari tindakan OCR. Anda akan mendapatkan salinan teks untuk mesin dan PDF yang dapat dicari untuk manusia, hanya dari satu kali proses.
Tulis dalam format JSON, bukan teks biasa.
Ubah ekspresi Compose untuk membuat objek dengan nama file, tanggal, dan teks, lalu simpan sebagai .jsonSebagian besar toko vektor lebih menyukai metadata yang menyertai konten.
Alur kerja berbasis cloud vs alternatifnya
Lihat tabel perbandingan di bawah ini untuk mengetahui perbedaannya dengan Power Automate Desktop dan AI Builder.
Alur kerja berbasis cloud vs alternatifnyaBerjalan tanpa pengawasanMenangani file PDF hasil pemindaianTingkat konektor
PDF4me dalam alur kerja cloud Power Automate.YaYa, OCR sudah terintegrasi dalam alur kerja.Standar
Tindakan PDF Power Automate DesktopHanya saat mesin menyalaTidak ada OCR pada tindakan dasar.Standar, ditambah mesin
Pemrosesan formulir AI BuilderYaYaPremium, berdasarkan penggunaan kredit.

Pertanyaan umum

Bisakah Power Automate mengekstrak teks dari PDF?

Tidak bisa berdiri sendiri dalam alur kerja cloud. Tindakan PDF dalam dokumentasi Microsoft termasuk dalam Power Automate Desktop dan tidak tersedia dalam alur kerja cloud, itulah sebabnya banyak diskusi komunitas tentang pertanyaan ini tidak terselesaikan. Menambahkan konektor PDF4me memberikan alur kerja cloud solusi yang sesungguhnya. Ekstrak Teks dan Gambar Aksi yang mengembalikan teks dokumen sebagai sebuah array.

Seluruh proses ekstraksi adalah satu tindakan. Lima langkah di sekitarnya hanyalah memindahkan file masuk dan teks keluar.

Bagaimana cara mengekstrak teks dari PDF menggunakan Power Automate?

Picu pada file baru, ambil byte-nya dengan Dapatkan isi file, berlari Konversi PDF ke PDF yang dapat diedit menggunakan OCR. jadi halaman yang dipindai mendapatkan lapisan teks, lalu dijalankan Ekstrak Teks dan Gambar dengan Ekstrak Teks diatur ke YesItu mengembalikan sebuah texts array. Gabungkan dengan ekspresi Compose jika Anda menginginkan prosa daripada array.

Arahkan langkah ekstraksi ke output tindakan OCR, bukan ke file yang Anda unduh. Penggunaan kembali salinan yang diunduh adalah alasan mengapa dokumen yang dipindai kembali kosong.

Apakah Power Automate dapat melakukan OCR?

Alur kerja berbasis cloud tidak memiliki fitur OCR bawaan. AI Builder menawarkannya pada lisensi premium berbasis kredit, dan Power Automate Desktop memiliki mesin OCR sendiri yang terikat pada mesin. PDF4me Konversi PDF ke PDF yang dapat diedit menggunakan OCR. Aksi ini berjalan dalam alur cloud tingkat standar tanpa melibatkan mesin apa pun.

Dia OCR Hanya Jika Diperlukan Pengaturan ini penting untuk diketahui. Atur ke trueDengan demikian, sistem ini memeriksa setiap file dan melewati OCR jika lapisan teks sudah ada, sehingga pustaka campuran tidak perlu membayar biaya untuk setiap dokumen.

Mengapa fitur ekstraksi teks dari PDF di Power Automate tidak berfungsi?

Tiga penyebab mencakup hampir setiap kasus. Dokumen tersebut adalah hasil pemindaian dan tidak pernah melalui OCR, sehingga memang tidak ada teks yang dapat ditemukan. Langkah ekstraksi membaca file yang diunduh alih-alih output OCR, yang menghasilkan hasil kosong yang sama pada input hasil pemindaian. Atau teks diterima dengan baik tetapi ditulis ke file sebagai array mentah, sehingga terlihat seperti JSON dan bukan dokumen.

Buka riwayat eksekusi dan periksa langsung output Ekstrak Teks dan Gambar. Jika texts Jika sudah ada konten di sana, masalahnya ada di tahap selanjutnya, yaitu di Compose atau Create file.

Bagaimana cara mengkonversi PDF ke file teks secara gratis?

Untuk satu dokumen, konverter online mana pun bisa melakukannya. Alasan untuk membangun alur kerja ini adalah volume dan pengulangan: alur kerja ini berjalan tanpa pengawasan pada setiap file yang masuk ke folder, menangani pemindaian, dan tidak memerlukan siapa pun untuk berada di depan keyboard. Paket gratis PDF4me mencakup sejumlah dokumen yang signifikan per bulan, dan setiap konektor yang digunakan di sini adalah paket standar, jadi tidak ada lisensi Power Automate premium yang terlibat.


Penyelesaian Masalah

File .txt berhasil dibuat tetapi isinya kosong.

Ekstrak Teks dan Gambar membaca file yang salah. Konten File-nya harus berasal dari tindakan OCR, yang memiliki ikon PDF4me, bukan dari Dapatkan konten file. Pada PDF digital asli, keduanya berfungsi, itulah sebabnya bug ini biasanya hanya muncul setelah pemindaian sebenarnya tiba.

Outputnya terlihat seperti ["baris satu","baris dua"] bukan teks.

Pembuatan file sedang menerima data mentah. texts array. Isi File-nya harus berupa token output Compose. Jika Compose ada tetapi masih mengembalikan array, periksa apakah ekspresi join memiliki kedua argumen, yaitu array dan pemisah.

Pengambilan konten file gagal dengan pesan "file tidak ditemukan"

Pengidentifikasi berkas dipetakan ke token yang salah. Diperlukan pemicunya. PengidentifikasiBukan nama file, jalur, atau ID item. Meskipun terlihat sama dalam daftar konten dinamis, sebenarnya tidak.

Alur tersebut terus memicu dirinya sendiri.

Folder output berada di dalam folder yang dipantau oleh pemicu, sehingga setiap file teks baru memulai proses baru. Pisahkan RagInput dan RagText, sebagai folder saudara (sibling) dan bukan folder bersarang (nested).


Langkah Selanjutnya

Pola enam langkah yang sama (memantau folder, mengambil data, OCR, mengekstrak, meratakan, menyimpan) mengubah pustaka dokumen apa pun menjadi korpus yang dapat dibaca mesin.