Power Automate'te PDF'yi Metin Dosyasına Dönüştürme: Taranmış Sözleşmeleri PDF4me ile Aranabilir SharePoint Veri Kümesine Dönüştürün

PDF4me Metin ve Görüntü Çıkarma Bu, bir PDF dosyasının metin katmanını dizi olarak döndüren bir Power Automate eylemidir. Yukarı akışta OCR ve aşağı akışta Compose birleştirme ile birlikte kullanıldığında, bu akış SharePoint kitaplığına bırakılan her PDF dosyasını eşleşen bir dosyaya dönüştürür. .txt Yapay zeka aramasına hazır dosya.
"Bunu nasıl yaparım" diye arama yaparsanız ilk sonuç Microsoft'un kendi çözümü olacaktır. PDF işlemleri referansıBu, Power Automate'i tanımlar. Masaüstü Eylemler. Bulut akışında mevcut değiller. Bu tek ayrıntı, sonraki iki sonucun aynı soruyu soran ve net bir cevap alamayan kişilerin yer aldığı bir Reddit başlığı ve bir Power Platform topluluk başlığı olmasının nedenidir. Bu akış, net cevaptır ve tamamen bulutta, standart katman bağlantı elemanları üzerinde çalışır.
Bir PDF dosyası SharePoint kitaplığına ekleniyor. Tetikleyici yeni öğeyi bildiriyor, "Dosya içeriğini al" komutu baytlarını alıyor ve PDF4me, metni bir dizi olarak çıkarmadan önce yalnızca dosyanın OCR'ye ihtiyacı varsa OCR işlemini gerçekleştiriyor. Tek satırlık bir "Oluştur" ifadesi bu diziyi tek bir dizeye birleştiriyor ve SharePoint sonucu yan taraftaki sunucuya düz metin dosyası olarak yazıyor. Altı işlem, premium bağlantı yok ve tüm işlem yaklaşık on iki saniyede tamamlanıyor.
Neden Odaklı Soru-Cevap
Akışta metni kullanmak yerine neden .txt dosyası yazıyoruz? Bir akış çalıştırması içindeki bir dize, o çalıştırmanın süresi boyunca varlığını sürdürür. Bir kütüphanedeki bir dosya kalıcıdır, indekslenebilir ve daha sonra ona işaret ettiğiniz her şey tarafından okunabilir; bu, SharePoint araması, vektör veritabanı veya bağlam çeken bir sohbet botu olabilir.
Bir dosyayı almak için neden iki işlem gerekiyor? Yalnızca özellikleri gösteren tetikleyici, bilerek hafiftir. Bir öğenin göründüğünü bildirir ve size tanımlayıcı da dahil olmak üzere meta verilerini verir, ancak bayt içermez. Dosya içeriğini al seçeneği ise bu tanımlayıcıyı belgenin kendisiyle değiştirir. İkisini ayırmak, tetikleyiciyi hızlı tutar ve herhangi bir şey indirmeden önce meta veriler üzerinde filtreleme yapmanıza olanak tanır.
PDF dosyalarının çoğunda zaten metin varken neden OCR işlemine gerek duyulsun ki? Çünkü bakarak anlayamazsınız. Taranmış bir sözleşme ile dijital olarak oluşturulmuş bir sözleşme, bir klasör listesinde ayırt edilemez. OCR işleminin OCR yalnızca gerektiğinde kullanılır. Bu ayar her dosyayı inceler ve zaten metin katmanı içerenleri atlar, böylece yalnızca bir şey satın aldığında ücret ödersiniz.
Compose adımına neden ihtiyaç duyuluyor ki? Metin ve Görüntü Çıkarma sonuçları texts Genellikle sayfa başına bir giriş içeren bir dizi olarak yazılır. Bir diziyi doğrudan dosyaya yazmak, JSON parantezleri ve kaçış karakterli tırnak işaretleri oluşturur. Compose, diske hiçbir şey yazılmadan önce girişleri temiz bir metin haline getirir.
Neler Alacaksınız?
Giriş: SharePoint belge kitaplığına bırakılan, taranmış veya dijital olarak oluşturulmuş herhangi bir PDF dosyası için adlandırma kuralı gerekmez. Çıktı: İkinci bir kütüphanede, her PDF dosyası için, belgenin okunabilir tüm içeriğini içeren bir düz metin dosyası bulunur.

RagInput. Buraya bir PDF dosyası bırakın ve işlem başlasın.

RagText. Her PDF dosyası için bir adet düz metin dosyası, indekslemeye hazır.
İşte örnek sözleşmenin diske yazıldığı haliyle diğer taraftan çıkan sonuç:
MASTER SERVICES AGREEMENT
Between Initech LLC and Umbrella Inc.
Effective date: 1 January 2026. Auto-renews annually.
Liability cap: USD 100000. Confidentiality: 5 years.
CLEAN TEST MARKER: PDF4ME-CLEAN-TEST-2026.
Baştaki boşluklara dikkat edin. OCR, düzen içindeki boşlukları korur ve bu, arama ve dil modeline veri sağlama açısından sorun teşkil etmez. Daha sonraki bir ayrıştırıcı bu konuda titiz davranırsa, boşluklar daha sonra kırpılabilir.
İhtiyacınız Olanlar
- Güç Otomasyonu. Open Power AutomateBu bir bulut akışı. Buradaki her şey standart seviyede, premium bağlantı veya ağ geçidi yok.
- PDF4me API anahtarı. API anahtarınızı alınPDF4me eylemini ilk kez eklediğinizde bağlantıyı kurun.
- İki klasöre sahip bir SharePoint sitesiBiri giriş PDF'leri, diğeri çıkış metni için. Klasör seçicilerin işaret edebileceği bir yer olması için, derlemeden önce her ikisini de oluşturun.
- Bir test PDF'si. sözleşme-örneği.pdfArama yapabileceğiniz bir işaretleyici satırı içeren kısa bir hizmet sözleşmesi.
Önce örnekleri alın. İşlem kaydedildikten sonra PDF dosyasını giriş klasörünüze yükleyin, ardından çıktı klasörüne kaydedilen dosyayı beklenen metin dosyasıyla karşılaştırın.
Akışa Genel Bakış
- Bir dosya oluşturulduğunda (yalnızca özellikler) (SharePoint tetikleyicisi) kapsamı şu şekilde belirlenmiştir:
/Shared Documents/RagInput. - Dosya içeriğini al tetikleyicinin kullanımı
Identifier. - PDF - OCR kullanarak PDF dosyasını düzenlenebilir PDF'ye dönüştürün kaliteyle
Draftve OCR yalnızca gerektiğindetrue. - PDF - Metin ve Görüntüleri Çıkarma Metin Çıkarma ile
Yesve Görüntüleri ÇıkarNo. - Bestelemek koşuyor
join()geri dönenlerin üzerindentextssıralamak. - Dosya oluştur (SharePoint) yazma
.txtiçine/Shared Documents/RagText.
Akışın genel görünümü

OCR, 11 saniye ile tek yavaş adım oldu. Diğer beş adımın her biri yarım saniyenin altında tamamladı.
Adım 1: SharePoint kitaplığında yeni PDF dosyalarını nasıl izlersiniz?
Şu ana kadarki akış: Henüz bir şey olmadı, bu tetikleyici unsur.
Kullanmak Bir dosya oluşturulduğunda (yalnızca özellikler)Yeni öğeler yüklendiğinde tetiklenir ve meta verilerini döndürür. Bunu tek bir klasörle sınırlandırın, çünkü kütüphane genelinde bir izleme mekanizması, o kütüphanede herhangi birinin yaptığı her yüklemede tetiklenir.
- Bir tane oluşturun Otomatik bulut akışı ve seç Bir dosya oluşturulduğunda (yalnızca özellikler).
- Yapılandır:
- Site Adresi:
https://ynoox1.sharepoint.com/sites/PDF4meSharepoints - Kütüphane Adı: seçmek Belgeler açılır menüden
- Site Adresi:
- Açık Gelişmiş parametreler, eklemek Dosyave bunu şuna ayarla
/Shared Documents/RagInput.
SharePoint tetikleyici yapılandırması

Kütüphane Adı, kütüphanenin kendisidir, yani Belgeler. Altındaki Klasör parametresi, tetikleyiciyi içindeki bir klasörle sınırlandırır.
Uç. Ayrıca tetikleyici olarak adlandırılan bir şey de bulacaksınız. Bir klasörde dosya oluşturulduğundaBu yöntem, dosya baytlarını doğrudan döndürür ve bir sonraki adımı atlamanızı sağlar. Kullanımdan kaldırılmış olarak işaretlenmiştir, bu nedenle çalıştırmaya devam etmeyi düşündüğünüz her şey için burada gösterilen yalnızca özelliklere odaklanan yöntemi tercih edin.
Adım 2: Tetikleyiciden sonra dosya içeriğini neden almanız gerekiyor?
Şu ana kadarki akış: SharePoint tetikleyicisi.
Yalnızca özellikleri gösteren tetikleyici, belgeyi değil, meta verileri aktarır. Dosya içeriğini alma işlemi, tetikleyicinin içeriğini değiştirir. Identifier PDF4me'nin ihtiyaç duyduğu gerçek baytlar için.
- Eklemek SharePoint > Dosya içeriğini al.
- Yapılandır:
- Site Adresi: tetikleyiciyle aynı site
- Dosya Tanımlayıcısı:
Identifiertetikleyiciden
- Açık Gelişmiş parametreler ve ayarla İçerik türünü çıkarımla ile
Yes.
Dosya içeriği yapılandırmasını alın

"İçerik türünü çıkar" seçeneği, bir sonraki eyleme genel bir veri bloğu yerine gerçek PDF baytları gönderir.
Tanımlayıcı, iki adım arasındaki birleştirme noktasıdır. Tetikleyiciyi kullanın Tanımlayıcı Alan adı, dosya adı veya yol değil. İsimler klasörler arasında tekrarlanır ve birisi belgeyi yeniden adlandırdığında değişir. Tanımlayıcı değişmez.
3. Adım: Metni ayıklamadan önce neden OCR çalıştırılır?
Şu ana kadarki akış: SharePoint tetikleyicisi ve Dosya içeriğini alma özelliği.
Taranmış bir sayfa bir görüntüdür. OCR (Optik Karakter Tanıma) üzerine bir metin katmanı ekleyene kadar çıkarılacak bir metin yoktur. Bu işlem bunu yapar ve zaten okunabilir olan PDF'lere dokunmayacak kadar akıllıdır.
- Eklemek PDF - OCR kullanarak PDF dosyasını düzenlenebilir PDF'ye dönüştürün.
- Yapılandır:
- Dosya İçeriği:
File Contentitibaren Dosya içeriğini al - Dosya adı: tetikleyicinin dosya adı belirteci
- KaliteTipi:
Draft - OCR yalnızca gerektiğinde kullanılır.:
true - DilBelgeleriniz İngilizce değilse boş bırakın.
- Asenkron mu?:
No
- Dosya İçeriği:
OCR parametreleri
| Parametre | Burada kullanılan değer | Kontrol ettiği şeyler |
|---|---|---|
| Dosya İçeriği | File Content Dosya içeriğini al'dan | İşlenecek PDF baytları. |
| Dosya adı | tetikleyici dosya adı belirteci | Kimlik tespiti için kullanılan kaynak adı. |
| KaliteTipi | Draft | Tanıma çabası. Draft Hızlı ve doğru taramalar için yeterince hassas. Şuraya geçin: High Kötü orijinaller için. |
| OCR yalnızca gerektiğinde kullanılır. | true | Zaten metin katmanı içeren dosyaları atlar, bu nedenle dijital olarak oluşturulmuş PDF'ler doğrudan geçer. |
| Dil | boşluk | Tanıma motoru için ipucu. İngilizce için boş bırakın. |
| Asenkron mu? | No | Sonucu satır içi olarak bekler. Şuna geçin: Yes çok büyük belgeler için. |

Burada QualityType "Taslak" olarak ayarlanmıştır. Temiz bir taramada, "Yüksek" ile aynı kalitede okunur ve daha az zaman alır.
Uç. Bu, yavaş adımdır; yukarıdaki koşuda 11 saniye, diğer her şeyde ise yarım saniye. Başlayın... DraftMetin dosyasını kontrol edin ve yalnızca o bölüme geçin. High Karakterler yanlış dönüyorsa, bu durum sorun yaratabilir. Gereksiz yere kaliteyi artırmak, bu iş akışının yavaşlamasına neden olmanın en kolay yoludur.
4. Adım: Metin ve Görüntü Çıkarma işlemi metni nasıl döndürür?
Şu ana kadarki akış: SharePoint tetikleyicisi, dosya içeriği alma ve OCR özelliği.
Bu işlem metin katmanını okur ve onu bir dizi olarak geri döndürür. texts. Bunu OCR çıktısına yönlendirin, "Dosya içeriğini al" seçeneğine geri dönmeyin, aksi takdirde taranan sayfalar boş olarak geri döner.
- Eklemek PDF - Metin ve Görüntüleri Çıkarma.
- Yapılandır:
- Dosya İçeriği:
File Content-den OCR işlemi - Dosya adı: tetikleyicinin dosya adı belirteci
- Metni Alıntıla:
Yes - Görüntüleri Çıkar:
No
- Dosya İçeriği:
Metin ve Görüntü Çıkarma parametreleri
| Parametre | Burada kullanılan değer | Kontrol ettiği şeyler |
|---|---|---|
| Dosya İçeriği | File Content OCR adımından | Aranabilir PDF. Dosya içeriğinin kopyasını buradan almak, en sık yapılan hatadır. |
| Dosya adı | tetikleyici dosya adı belirteci | Tanımlama amacıyla kaynak adı aynen korunmuştur. |
| Metni Alıntıla | Yes | Geri döner texts sıralamak. |
| Görüntüleri Çıkar | No | Gömülü resimleri atla. Ayarla Yes Sadece ihtiyaç duyduğunuzda kullanırsınız, bu da yanıt süresini önemli ölçüde uzatır. |

İkonlara bakın. Dosya İçeriği, OCR'dan geldiği için PDF4me işaretini taşıyor. Dosya Adı ise tetikleyiciden geldiği için SharePoint işaretini taşıyor.
Adım 5: Metin dizisini tek bir dizeye nasıl dönüştürürsünüz?
Şu ana kadarki akış: SharePoint tetikleyicisi, dosya içeriği alma, OCR, metin ve görüntü çıkarma özellikleri.
texts Bu bir dizidir. Bir dosyanın bir dizeye ihtiyacı vardır. Bir ifadeye katıl İkisini birleştiriyor.
- Ekle Bestelemek aksiyon.
- İçinde Girişlerİfade düzenleyicisine geçin ve şunu yapıştırın:
join(body('PDF_-_Extract_Text_and_Images')?['texts'], decodeUriComponent('%0A'))
- Tıklamak Güncelleme.
O decodeUriComponent('%0A') Bu, Power Automate ifadesinde gerçek bir satır sonu karakteri yazmanın yoludur. Bunun için bir kaçış dizisi yoktur, bu nedenle bu bir deyimdir.
Yapılandırmayı oluştur

`body()` içindeki eylem adında boşluklar ve tireler için alt çizgi kullanılıyor. Eylemi yeniden adlandırırsanız bu ifade bozulur.
Çıktının okunabilir olup olmadığını belirleyen tek satır budur. Compose adımını atlayın ve diziyi doğrudan Create file'a iletin; böylece metin dosyası belge yerine JSON parantezleri ve kaçış karakterleriyle belirtilmiş tırnak işaretleri içerecektir.
Adım 6: SharePoint'te metni .txt dosyası olarak nasıl kaydedersiniz?
Şu ana kadarki akış: SharePoint tetikleyicisi, Dosya içeriğini alma, OCR, Metin ve Görüntüleri ayıklama ve Oluşturma.
Son adımda birleştirilen dize ikinci bir kütüphaneye yazılır.
- Eklemek SharePoint > Dosya oluştur.
- Yapılandır:
- Site Adresi: tetikleyiciyle aynı yer
- Klasör Yolu:
/Shared Documents/RagText - Dosya adı: tetikleyicinin dosya adı belirteci ve ardından gelen metin
.txt - Dosya İçeriği: Bestelemek çıktı belirteci
SharePoint Dosya yapılandırması oluşturma

Dosya içeriği, PDF4me'den değil, mor veri işlemi simgesini taşıyan Oluşturma çıktısıdır. Metin bu noktada zaten derlenmiştir.
Uç. Tetikleyicinin dosya adı belirteci zaten şunu içeriyor: .pdf uzantı, yani ekleme .txt üretir contract.pdf.txtYukarıdaki çıktı klasöründe de görüldüğü gibi, bu zararsızdır ve kaynağa olan bağlantıyı açık tutar. Eğer bunu tercih ederseniz... contract.txtbelirteci içine sarın yer değiştirmek() ve takas .pdf için .txt eklemek yerine.
Akışı Çalıştırın ve Doğrulayın
- Kaydetmek Sağ üstteki akış.
- Yüklemek
contract-sample.pdfGiriş klasörüne. Tetikleyici yoklama yapıyor, bu yüzden bir dakika bekleyin. - Akışı açın çalıştırma geçmişi Altı işlemin de yeşil onay işareti taşıdığından emin olun. OCR işlemi yavaş olacaktır.
- Açık
/Shared Documents/RagText. A.txtDosya orada olmalı. Açın ve içinde arama yapın.PDF4ME-CLEAN-TEST-2026Eğer bu işaretleyici mevcutsa, OCR ve ekstraksiyon işlemleri baştan sona sorunsuz bir şekilde çalışmıştır.
Gerçekte ne inşa ettiniz? Belge alım hattı. Kütüphaneye gelen her PDF otomatik olarak düz metne dönüştürülür; bu, büyük ölçekte belge okuyan her şey için (SharePoint araması, vektör dizini, gelişmiş bir sohbet robotu veya tam metin arama) pek de cazip olmayan bir ön koşuldur. Yalnızca akışın içindeki metne ihtiyacınız varsa, daha kısa olanı tercih edin. Power Automate'te PDF'lerden Metin Çıkarma Bu kılavuz Dropbox ile ilgili bilgileri içermektedir.
Yeniden derlemeye gerek kalmadan ekleyebileceğiniz yaygın varyasyonlar
.jsonÇoğu vektör tabanlı veri deposu, içeriğin yanı sıra meta verileri de tercih eder.| CloudFlow ve alternatifleri | Gözetimsiz çalışır | Taranmış PDF dosyalarını işler. | Bağlayıcı katmanı |
|---|---|---|---|
| PDF4me, Power Automate bulut akışında | Evet | Evet, OCR akışın içine entegre edildi. | Standart |
| Power Automate Desktop PDF işlemleri | Sadece makine açıkken | Temel eylemlerde OCR yok. | Standart, artı bir makine |
| Yapay Zeka Oluşturucu form işleme | Evet | Evet | Premium, kredi ölçülü |
Sıkça sorulan sorular
Power Automate PDF dosyalarından metin çıkarabilir mi?
Bulut akışında tek başına kullanılamaz. Microsoft'un dokümanlarındaki PDF işlemleri Power Automate Desktop'a aittir ve bulut akışlarında kullanılamaz; bu nedenle bu soruyla ilgili birçok topluluk başlığı çözümsüz kalmaktadır. PDF4me bağlayıcısını eklemek, bulut akışına gerçek bir işlevsellik kazandırır. Metin ve Görüntüleri Çıkarma Belgenin metnini dizi olarak döndüren işlem.
Tüm çıkarma işlemi tek bir eylemdir. Çevredeki beş adım sadece dosyayı içeri ve metni dışarı taşımaktan ibarettir.
Power Automate kullanarak PDF'den metin nasıl çıkarılır?
Yeni dosyayı tetikle, baytlarını şu şekilde al: Dosya içeriğini al, koşmak OCR kullanarak PDF dosyasını düzenlenebilir PDF dosyasına dönüştürün. Böylece taranan sayfalara bir metin katmanı eklenir, ardından işlem yapılır. Metin ve Görüntüleri Çıkarma Metin Çıkarma ayarı ile YesBu da şunu döndürür: texts Dizi. Eğer dizi yerine metin istiyorsanız, bunu bir Compose ifadesiyle birleştirin.
Çıkarma adımını indirdiğiniz dosyaya değil, OCR işleminin çıktısına yönlendirin. İndirilen kopyanın yeniden kullanılması, taranan belgelerin boş çıkmasının nedenidir.
Power Automate optik karakter tanıma (OCR) yapabilir mi?
Bulut akışında yerleşik bir OCR işlemi bulunmamaktadır. AI Builder, ücretli, kredi bazlı bir lisansla bu özelliği sunarken, Power Automate Desktop'ın ise makineye bağlı kendi OCR motoru vardır. PDF4me OCR kullanarak PDF dosyasını düzenlenebilir PDF dosyasına dönüştürün. Bu işlem, herhangi bir makinenin dahil olmadığı standart bir bulut akışında çalışır.
Onun OCR yalnızca gerektiğinde kullanılır. Ayarlar hakkında bilgi sahibi olmakta fayda var. Ayarlar şu şekilde ayarlanmıştır: trueBu sistem, her dosyayı inceler ve metin katmanı zaten mevcutsa OCR işlemini atlar; böylece karma bir kütüphane her belge için maliyet ödemez.
Power Automate'in PDF'den metin çıkarma özelliği neden çalışmıyor?
Üç neden neredeyse her durumu kapsar. Belge taranmış ve OCR işleminden geçmemiş, bu nedenle gerçekten bulunacak bir metin yok. Çıkarma adımı, OCR çıktısı yerine indirilen dosyayı okuyor ve bu da taranmış girdide aynı boş sonucu üretiyor. Veya metin sorunsuz bir şekilde ulaşmış ancak dosyaya ham bir dizi olarak yazılmış, bu nedenle belge yerine JSON gibi görünüyor.
Çalıştırma geçmişini açın ve Metin ve Görüntü Çıkarma çıktısını doğrudan inceleyin. texts İçerik orada mevcut, sorun Compose veya Create dosyasında daha sonraki aşamalarda ortaya çıkıyor.
PDF dosyasını ücretsiz olarak metin dosyasına nasıl dönüştürebilirsiniz?
Tek bir belge için herhangi bir çevrimiçi dönüştürücü işinizi görecektir. Bu akışı oluşturmanın nedeni hacim ve tekrarlanabilirliktir: klasöre gelen her dosyada otomatik olarak çalışır, taramaları yönetir ve kimsenin klavye başında olmasına gerek kalmaz. PDF4me'nin ücretsiz sürümü ayda anlamlı sayıda belgeyi kapsar ve burada kullanılan her bağlantı standart seviyededir, bu nedenle premium Power Automate lisansı gerekmez.
Sorun giderme
"Metin ve Görüntüleri Çıkar" işlevi yanlış dosyayı okuyor. Dosya içeriği, "Dosya içeriğini al" işlevinden değil, PDF4me simgesini taşıyan OCR işleminden gelmelidir. Dijital olarak oluşturulmuş bir PDF dosyasında her ikisi de çalışır; bu nedenle bu hata genellikle yalnızca gerçek bir tarama geldiğinde ortaya çıkar.
Dosya oluşturma işlemi ham verileri alıyor. texts Dizi. Dosya İçeriği, Compose çıktı belirteci olmalıdır. Compose mevcutsa ancak yine de bir dizi döndürüyorsa, birleştirme ifadesinin hem diziyi hem de ayırıcıyı içerdiğinden emin olun.
Dosya tanımlayıcısı yanlış belirtece eşlenmiş. Tetikleyicinin belirtecine ihtiyaç duyuyor. TanımlayıcıDosya adı, yol veya öğe kimliği değil. Bunlar dinamik içerik listesinde birbirinin yerine kullanılabilir gibi görünse de aslında öyle değiller.
Çıktı klasörü, tetikleyicinin izlediği klasörün içinde yer alır, bu nedenle her yeni metin dosyası yeni bir çalıştırma başlatır. RagInput ve RagText'i iç içe değil, kardeş klasörler olarak ayrı tutun.
Sonraki Adımlar
Power Automate'te Metin ve Görüntüleri Çıkarma
OCR kullanarak PDF dosyasını düzenlenebilir PDF dosyasına dönüştürün.
API anahtarınızı alın
Aynı altı adımlı yöntem (klasörü izleme, getirme, OCR, ayıklama, düzleştirme, kaydetme), herhangi bir belge kütüphanesini makine tarafından okunabilir bir metin kümesine dönüştürür.