Ana içeriğe geç

"extract-text-from-pdf" ile etiketlenmiş Bir gönderi

Tüm Etiketleri Görüntüle

Power Automate'te PDF'yi Metin Dosyasına Dönüştürme: Taranmış Sözleşmeleri PDF4me ile Aranabilir SharePoint Veri Kümesine Dönüştürün

· 24 dakikalık okuma
SEO and Content Writer

PDF4me Metin ve Görüntü Çıkarma Bu, bir PDF dosyasının metin katmanını dizi olarak döndüren bir Power Automate eylemidir. Yukarı akışta OCR ve aşağı akışta Compose birleştirme ile birlikte kullanıldığında, bu akış SharePoint kitaplığına bırakılan her PDF dosyasını eşleşen bir dosyaya dönüştürür. .txt Yapay zeka aramasına hazır dosya.

"Bunu nasıl yaparım" diye arama yaparsanız ilk sonuç Microsoft'un kendi çözümü olacaktır. PDF işlemleri referansıBu, Power Automate'i tanımlar. Masaüstü Eylemler. Bulut akışında mevcut değiller. Bu tek ayrıntı, sonraki iki sonucun aynı soruyu soran ve net bir cevap alamayan kişilerin yer aldığı bir Reddit başlığı ve bir Power Platform topluluk başlığı olmasının nedenidir. Bu akış, net cevaptır ve tamamen bulutta, standart katman bağlantı elemanları üzerinde çalışır.

Akışa genel bakış
1. When a file is created (properties only)
SharePoint trigger on the library, scoped to the RagInput folder. Returns metadata, not bytes.
2. Get file content
Fetches the actual PDF bytes using the identifier the trigger handed over.
3. Convert PDF to editable PDF using OCR
Adds a text layer to scans. OCR Only When Needed skips PDFs that already have one.
4. Extract Text and Images
Returns the text as an array. Extract Images stays No.
5. Compose
join() flattens the texts array into one newline separated string.
6. Create file
SharePoint writes the string to /Shared Documents/RagText as .txt.