Lewati ke konten utama

Satu pos memiliki tag "extract-text-from-pdf"

Lihat Semua Tag

Konversi PDF ke File Teks di Power Automate: Ubah Kontrak yang Dipindai menjadi Korpus SharePoint yang Dapat Dicari dengan PDF4me

· Satu menit membaca
SEO and Content Writer

PDF4me Ekstrak Teks dan Gambar adalah tindakan Power Automate yang mengembalikan lapisan teks PDF sebagai sebuah array. Dipasangkan dengan OCR di hulu dan penggabungan Compose di hilir, alur ini mengubah setiap PDF yang dimasukkan ke dalam pustaka SharePoint menjadi teks yang sesuai. .txt berkas, siap untuk pencarian AI.

Cari cara melakukannya dan hasil pertama adalah milik Microsoft sendiri. Referensi tindakan PDF, yang menjelaskan Power Automate Desktop tindakan. Hal itu tidak ada dalam alur cloud. Detail tunggal itulah yang menyebabkan dua hasil berikutnya berupa utas Reddit dan utas komunitas Power Platform yang berisi orang-orang yang menanyakan pertanyaan yang sama dan tidak mendapatkan jawaban langsung. Alur ini adalah jawaban langsung, dan berjalan sepenuhnya di cloud pada konektor tingkat standar.

Alur secara sekilas
1. When a file is created (properties only)
SharePoint trigger on the library, scoped to the RagInput folder. Returns metadata, not bytes.
2. Get file content
Fetches the actual PDF bytes using the identifier the trigger handed over.
3. Convert PDF to editable PDF using OCR
Adds a text layer to scans. OCR Only When Needed skips PDFs that already have one.
4. Extract Text and Images
Returns the text as an array. Extract Images stays No.
5. Compose
join() flattens the texts array into one newline separated string.
6. Create file
SharePoint writes the string to /Shared Documents/RagText as .txt.