Power Automate'te Metne Göre PDF'leri Bölme: PDF4me ile Taranmış Tek Bir Dosya Grubunu Ayrı Dosyalara Dönüştürme

PDF4me Metne Göre PDF'leri Bölme Bu, bir PDF dosyasını metin işaretçisinin göründüğü her yerde birden fazla dosyaya bölen bir Power Automate eylemidir. Bu akış, bir SharePoint klasörünü izler ve her yeni taramayı bir dosyaya böler. Serial#: İşaretleyiciyi kullanır, ardından sonuçları Dropbox'a aktarır. Tek bir toplu tarama, manuel sayfa seçimine gerek kalmadan üç adet adlandırılmış dosya oluşturur.
Tarayıcı kullanan herkes bu sorunu bilir. Birisi besleme ünitesine bir yığın belge bırakır, bir kez tarama düğmesine basar ve yirmi tane birbirinden bağımsız belge içeren tek bir PDF dosyası elde edersiniz. Google'ın ilk sayfasındaki her çevrimiçi dosya bölme aracı, dosyayı bir insan yüklediği, sayfa seçiciye tıkladığı ve parçaları indirdiği sürece bunu memnuniyetle düzeltir. Bu bir kez sorun değil. Ancak tarayıcı her sabah çalıştığında sorun yaratır. Bu işlem, insanı döngüden tamamen çıkarır.
Bir tarama sonucu SharePoint kitaplığına kaydedilir. PDF4me metin katmanını okur, yeni bir kaydı başlatan her sayfayı bulur ve ayrı PDF'lerden oluşan bir dizi döndürür. Bir "Her biri için" döngüsü bu diziyi dolaşır ve her dosyayı Dropbox'a bırakır. Dört işlem, yazılacak ifade yok ve tüm çalışma altı saniyeden kısa sürede tamamlanıyor.
Neden Odaklı Soru-Cevap
Neden sayfa sayısına göre değil de metne göre bölme yapılıyor? Sayfa sayımı yalnızca her kaydın aynı uzunlukta olması durumunda işe yarar. Gerçek partiler homojen değildir. Bir fatura bir sayfayı, diğeri dört sayfayı kaplar. Metin işaretleyicisi kayıtla birlikte hareket eder, bu nedenle uzunluklar nasıl değişirse değişsin bölme doğru kalır.
PDF dosyasının neden metin katmanına ihtiyacı var? Bu işlem, belgenin içindeki metni arar, pikselleri değil. OCR uygulanmamış bir fotoğraf veya düz tarayıcı taramasında bulunacak metin yoktur, bu nedenle her eşleşme boş sonuç döndürür. Önce OCR çalıştırıldığında, aynı akış kağıt orijinallerde de çalışır.
Bölme işleminden sonra neden bir For each döngüsü var? Bu işlem tek bir dosya değil, bir dizi döndürür. Power Automate bir diziyi tek seferde depolama alanına yazamaz, bu nedenle döngü "üç belgeyi" üç ayrı Dosya Oluştur çağrısına dönüştürür.
Çıktıyı SharePoint'e geri göndermek yerine neden Dropbox'a gönderiyoruz? Çoğunlukla alışkanlık, ayrıca test ederken giriş ve çıkış klasörlerini görünür şekilde ayrı tutar. Son işlemi SharePoint Dosya Oluştur olarak değiştirin ve akıştaki başka hiçbir şey değişmez.
Neler Alacaksınız?
Giriş: SharePoint belge kitaplığına bırakılan, her kaydın şu satırla başladığı, birden fazla kayıt içeren bir PDF dosyası. Serial#: SPTEST-A, Serial#: SPTEST-B, ve benzeri. Çıktı: Dropbox klasöründe her kayıt için bir PDF dosyası bulunur ve her dosya o kayda ait sayfaları içerir.

İzlenen SharePoint klasörü. Buraya gelen her şey bir çalıştırma başlatır.

Üç sayfalık tek bir tarama dosyası girilir, ayrı ayrı numaralandırılmış üç PDF dosyası çıkar.
İhtiyacınız Olanlar
- Güç Otomasyonu. Open Power AutomateBurada kullanılan her şey standart bir Microsoft 365 lisansı kapsamındadır. Bu bir bulut akışıdır, Power Automate Desktop değildir.
- PDF4me API anahtarı. API anahtarınızı alınPDF4me eylemini ilk kez eklediğinizde bağlantıyı kurun.
- Bir SharePoint sitesi ve bir Dropbox hesabıAkışı oluşturmadan önce, her iki seçicinin de işaret edeceği bir yer olması için SharePoint belge kitaplığında bir giriş klasörü ve Dropbox'ta bir çıkış klasörü oluşturun.
- Tekrarlayan metin işaretleyicileri içeren bir test PDF'si. tarama-toplu-örnek.pdfÜç sayfa, her biri kendi seri numarası satırıyla başlıyor.
Önce örnekleri alın. Giriş PDF dosyasını indirin ve akış kaydedildikten sonra SharePoint giriş klasörünüze yükleyin. Beklenen üç çıktı dosyası da burada yer alıyor, böylece kendi çalıştırmanızın sonuçlarıyla karşılaştırabilirsiniz.
Akışa Genel Bakış
- Bir klasörde dosya oluşturulduğunda (SharePoint tetikleyicisi) şuraya işaret etti:
/Shared Documents/ScanSplitInput. - PDF - Metne Göre PDF'yi Bölme (PDF4me) arama metniyle
Serial#:(.*)ve Bölünmüş Tipbefore. - Her biri için yineleme
body/splitedDocuments. - Dosya oluştur (Dropbox) içine yazma
/ScanSplitOutput.
Akışın genel görünümü

Tüm akış dört aşamadan oluşuyor. Her sayaç okuması için "1/3" ifadesi, bölme işleminin görevini yerine getirdiğini gösteriyor.
Adım 1: SharePoint klasöründeki yeni taramaları nasıl izlersiniz?
Şu ana kadarki akış: Henüz bir şey olmadı, bu tetikleyici unsur.
Bu tetikleyici, belirli bir belge kitaplığı klasöründe bir dosya göründüğünde çalışır. Klasörü dar bir şekilde seçin. Bunu paylaşılan bir kitaplığın kök dizinine yönlendirmek, ilgisiz her yüklemenin bir çalıştırma başlatması anlamına gelir.
- Yeni bir tane oluşturun Otomatik bulut akışı ve tetikleyici listesinde arama yapın Bir klasörde dosya oluşturulduğunda.
- Yapılandır:
- Site Adresi: örneğin siteniz
PDF4me Sharepoints - https://ynoox1.sharepoint.com/sites/PDF4meSharepoints - Klasör Kimliği:
/Shared Documents/ScanSplitInput
- Site Adresi: örneğin siteniz
- Açık Gelişmiş parametreler ve açın İçerik türünü çıkarımlaardından bunu şuna ayarlayın:
Yes.
SharePoint tetikleyici yapılandırması

"İçerik türünü 'Evet' olarak ayarlamak, tetikleyicinin size genel bir veri bloğu yerine gerçek PDF baytları vermesini sağlar."
Uç. Bu tetikleyici, seçici içinde "(kullanımdan kaldırılmış)" etiketi taşır. Hala çalışır ve burada gösterilen de budur, ancak yeni bir üretim akışı için şunu tercih edin: Bir dosya oluşturulduğunda (yalnızca özellikler) ardından Dosya içeriğini alGeri kalan akış aynıdır, çünkü her iki yol da eldeki dosya baytlarıyla sona erer. Microsoft, her tetikleyiciyi ve durumunu listeler. SharePoint bağlayıcısı referansı.
Adım 2: Metne Göre PDF Bölme işlemi, kesme işleminin nerede yapılacağına nasıl karar verir?
Şu ana kadarki akış: SharePoint tetikleyicisi.
Asıl işi yapan işlem bu. Belgenin metin katmanını okuyor, arama metninizi içeren her sayfayı buluyor ve belgeyi bu sayfalarda kesiyor. Geri kalan her şey yardımcı işlem.
- Yeni bir adım ekleyin ve arama yapın. PDF - Metne Göre PDF'yi Bölme.
- Yapılandır:
- Dosya İçeriği:
File Contenttetikleyiciden - Dosya adı:
x-ms-file-name-encodedtetikleyiciden - Metin:
Serial#:(.*) - Bölünmüş Tip:
before - Bölünmüş Dosya Adlandırma:
NameAsPerOrder
- Dosya İçeriği:
- Bağlantı istendiğinde PDF4me hesabınızı bağlayın.
PDF'i Metne Göre Bölme Parametreleri
| Parametre | Burada kullanılan değer | Kontrol ettiği şeyler |
|---|---|---|
| Dosya İçeriği | File Content tetikleyiciden | Bölünecek PDF baytları. Aranabilir metin katmanına sahip gerçek bir PDF dosyası olmalıdır. |
| Dosya adı | x-ms-file-name-encoded | Tanımlama işleminin gerçekleştirilmesi için kullanılan ve çıktı adlarının kökü olarak işlev gören kaynak adı. |
| Metin | Serial#:(.*) | Yeni bir kaydı başlatan işaretleyici. Eşleştirme büyük/küçük harf duyarlıdır, bu nedenle serial#: Hiçbir şey bulamazdı. |
| Bölünmüş Tip | before | Her eşleşen sayfadan hemen önce kesim yapar, böylece işaretleyici sayfa kendi belgesini açar. Kullanın after Öncekini kapatmak için. |
| Bölünmüş Dosya Adlandırma | NameAsPerOrder | Çıktıları kesildikleri sıraya göre numaralandırır, böylece name 1.pdf, name 2.pdf, name 3.pdf. |

"Split Type before" ifadesi, bir işaretçinin kendi kaydını açması ve üstündeki kaydı kapatması arasındaki farkı ifade eder. Bunu tersine çevirirseniz, her dosya bir sayfa kaymış olur.
Uç. Belgenin başka hiçbir yerinde görünmeyecek bir işaretleyici seçin. Serial#: güvenlidir. Basit bir kelime gibi. Invoice Hayır, çünkü sayfanın ortasında yer alan "Fatura toplamı" ifadesiyle de eşleşecek ve orada da bölünecektir.
3. Adım: Burada neden bir "For each" döngüsüne ihtiyacınız var?
Şu ana kadarki akış: SharePoint tetikleyicisi ve metne göre PDF bölme özelliği.
Bölme işlemi, adlı bir dizi döndürür. splitedDocumentsHer giriş bir çıktı dosyası içerir. Power Automate'in tüm diziyi tek bir işlemde depolama alanına yazma yöntemi yoktur, bu nedenle dizi tek tek girişler halinde gezilmelidir.
- Ekle Kontrol eylem ve seçim Her biri için.
- Yapılandır:
- Önceki adımlardan bir çıktı seçin.:
body/splitedDocumentsMetne Göre PDF'yi Bölme işleminden
- Önceki adımlardan bir çıktı seçin.:
- Döngünün eşzamanlılık seviyesini varsayılan değerinde bırakın. Bu dosyalar küçüktür ve çalıştırmalar ardışık kaldığında okuma sırası daha kolaydır. Microsoft, eşzamanlılık ve iç içe geçme sınırlarını şurada belgelendiriyor: Her bir referansa uygulayın..
Her bir konfigürasyon için

Tek bir belirteç, tüm yapılandırmayı temsil eder. Eğer Power Automate, "Dosya oluştur" eyleminizi otomatik olarak bir döngüye aldıysa, bunu zaten sizin için yapmıştır.
Akışın düzgün çalışıp çalışmayacağına karar veren tek satır bu. Döngüyü aşağıdakiler dışında herhangi bir şeye yönlendirirseniz gövde/bölünmüşBelgelerİçindeki "Dosya oluştur" eylemi ya yanlış veri yüküyle bir kez çalışacak ya da hiç çalışmayacaktır.
Adım 4: Bölünmüş dosyaların her birini Dropbox'a nasıl kaydedersiniz?
Şu ana kadarki akış: SharePoint tetikleyicisi, Metne Göre PDF Bölme ve Her Biri İçin özelliği.
Döngünün içinde, her yineleme mevcut bölünmüş dosyayı iki belirteç aracılığıyla ortaya çıkarır: fileName Ve streamFileBunları doğrudan birbirine paralel olarak haritalandırın.
- İçeride Her biri için blok ekle Dropbox eylem ve seçim Dosya oluştur.
- Yapılandır:
- Klasör Yolu:
/ScanSplitOutput - Dosya adı:
fileName - Dosya İçeriği:
streamFile
- Klasör Yolu:
- İstenildiğinde Dropbox hesabınızı bağlayın.
Dropbox Dosya yapılandırması oluşturma

fileName ve streamFile, tetikleyiciden değil, mevcut döngü öğesinden gelir. Her iki belirteç de PDF4me simgesini taşır.
Uç. Çıktı klasörünü girdi klasöründen farklı tutun. Bölünmüş dosyaları tetikleyicinin izlediği klasöre geri yazmak, kendi çıktısında tekrar tetiklenen bir döngü oluşturur; bu da sorunu keşfetmenin maliyetli bir yoludur.
Akışı Çalıştırın ve Doğrulayın
- Kaydetmek Sağ üstteki akış.
- Yüklemek
scan-batch-sample.pdfTetikleyicinin izlediği SharePoint klasörüne girin. Tetikleyici yoklama yapar, bu nedenle anında çalışmasını beklemek yerine bir dakika kadar bekleyin. - Akışı açın çalıştırma geçmişi ve dört işlemin de yeşil onay işareti taşıdığını doğrulayın. "Her biri için" bloğu bir sayaç gösterir ve şu şekilde olmalıdır: 1/3 Örnek dosya için.
- Açık
/ScanSplitOutputDropbox'ta. 1, 2 ve 3 numaralı üç PDF dosyası görmelisiniz; her birinde tam olarak bir Seri Numarası kaydı bulunuyor.
Gerçekte ne inşa ettiniz? İçeriğe duyarlı bir belge ayırıcı. Her kaydın kendisini tutarlı bir dizeyle duyurduğu herhangi bir toplu işlemde aynı dört işlem çalışır; bu bir fatura numarası, hasta kimliği, vaka referansı veya bölüm başlığı olabilir. Aynı PDF4me işlemi şurada da mevcuttur: Yapmak, Zapier Ve n8nBu nedenle, yalnızca tetikleme ve depolama adımları değişerek kalıp platformdan platforma taşınır.
Yeniden derlemeye gerek kalmadan ekleyebileceğiniz yaygın varyasyonlar
| CloudFlow ve alternatifleri | Gözetimsiz çalışır | İçerik konusunda görüş ayrılıkları | Masaüstü bilgisayara ihtiyaç duyuyor. |
|---|---|---|---|
| PDF4me, Power Automate bulut akışında | Evet | Evet, herhangi bir metin işaretleyicisinde. | HAYIR |
| Manuel çevrimiçi ayırıcı | Hayır, dosyaların her birini bir insan yüklüyor. | Bazen, sayfa seçici aracılığıyla | HAYIR |
| Power Automate Masaüstü | Sadece makine açıkken | Yüklenen eylemlere bağlıdır. | Evet |
Sıkça sorulan sorular
Power Automate'te PDF dosyaları nasıl bölünür?
Ekle PDF - Metne Göre PDF'yi Bölme PDF4me'den bulut akışına eylem, PDF baytlarını eşle Dosya İçeriğive ona bir şans verin. Metin Aranacak değer. Bu işlem, ayrı PDF dosyalarından oluşan bir dizi döndürür. body/splitedDocumentsDropbox gibi bir depolama işlemini sarmalayın. Dosya oluştur bir Her biri için Bu diziyi döngüye alıp her bir parçayı kaydediyoruz.
Burada herhangi bir ifade yazımı söz konusu değil. Bu gönderide gösterilen dört adım, tüm akışı oluşturuyor.
Power Automate, bir PDF dosyasını içeriğe göre bölebilir mi?
Evet, bu akış tam olarak bunu yapıyor. Power Automate'in yerleşik bir PDF bölme işlemi yok, bu nedenle içerik farkındalığı PDF4me bağlayıcısından geliyor. Belgenin metin katmanını okuyor ve arama dizenizin göründüğü her yerde kesiyor; bu da bölmenin sabit bir sayfa sayısına değil, kayıtlara göre yapıldığı anlamına geliyor.
Tek şart, gerçek bir metin katmanı olmasıdır. OCR'den geçmemiş bir tarama, arama açısından sadece kelimelerin resimlerinden ibarettir.
Power Automate'te bir PDF dosyasını birden fazla dosyaya nasıl bölersiniz?
Bölme işlemi tek bir eylemdir, ancak bu işlemden birden fazla dosya çıkarmak iki eylem gerektirir. PDF'i Metne Göre Böl diziyi üretir ve bir Her biri için Döngü, bu diziyi belge başına tek bir dosya oluşturma çağrısına dönüştürür. Döngüyü atlamak, insanların birden fazla dosya yerine tek bir çıktı dosyası elde etmesinin en yaygın nedenidir.
Burada gösterilen örnek çalıştırmada, üç kayıtlık bir tarama, üç dosya üretir. sharepoint-trigger-test 1.pdf başından sonuna kadar sharepoint-trigger-test 3.pdf, Çünkü Bölünmüş Dosya Adlandırma ayarlanmıştı NameAsPerOrder.
Power Automate Desktop'ta PDF'leri bölme işlemi çalışıyor mu?
Bu akış bulut tabanlı bir akıştır ve bu kasıtlıdır. Bir dosya SharePoint'e ulaştığında Microsoft'un altyapısında çalışır; açık tutulması gereken bir makine veya bakımı gereken bir ağ geçidi yoktur. Power Automate Desktop aynı PDF4me API'sini çağırabilir, ancak bu durumda zamanlanmış bir makine ve onun çalışma süresini üstlenmeniz gerekir.
Belgeleriniz zaten SharePoint, OneDrive veya Dropbox'ta bulunuyorsa, bulut tabanlı çözüm daha basit bir kurulum sunar.
PDF dosyasını metne göre değil de yer işaretine göre bölebilir misiniz?
Bu eylemle olmaz. PDF'i Metne Göre Böl Yalnızca metin katmanındaki eşleşmeleri gösterir. Kaynak belgeleriniz güvenilir yer imleri içeriyorsa, en yakın PDF4me karşılıkları şunlardır: PDF'i Bölünmüş sayfa numarasına göre veya Barkoda Göre PDF'i Böl Ayırıcı levhalar kullanıldığında.
Pratikte, taranmış materyallerde metin işaretleyici, yer iminden daha güvenilirdir, çünkü tarayıcılar yer imi oluşturmaz ancak sayfada basılı olan her şeyi korur.
Sorun giderme
Dosya oluşturma işlemi "For each" döngüsünün dışında yer alıyor veya döngü yanlış belirteci işaret ediyor. Döngüyü açın ve doğru şekilde okunduğunu doğrulayın. gövde/bölünmüşBelgelerAyrıca, "Dosya oluştur" komutunun döngünün sınırları içinde yer aldığından, altında yer almadığından emin olun.
Arama metniyle eşleşen bir sayfa bulunamadı, bu nedenle kesilecek bir şey yoktu. Öncelikle büyük/küçük harf duyarlılığına dikkat edin, çünkü eşleştirme büyük/küçük harf duyarlıdır. Ardından PDF dosyasını açın ve imlecinizle işaretleyici metni seçmeyi deneyin. Eğer vurgulanmazsa, belgede metin katmanı yoktur ve bu işlemin herhangi bir şey görebilmesi için önce OCR'ye ihtiyaç duyar.
Bölme Türü yanlış değere ayarlanmış. önceİşaretleyiciyi içeren sayfa yeni bir belge başlatır. sonrasındaÖnceki işlemi sonlandırır. Ayarları tersine çevirin ve yeniden çalıştırın.
Çıktı klasörü, tetikleyicinin izlediği klasörle aynıdır, bu nedenle her bölünmüş dosya yeni bir çalıştırma başlatır. Oluşturma dosyasını ayrı bir klasöre, bu durumda Dropbox'a yönlendirin. /ScanSplitOutput yol ve döngü durur.
Sonraki Adımlar
Aynı dört adımlı yöntem (bir klasörü izleme, bir işaretleyiciye göre bölme, diziyi döngüye alma, her parçayı kaydetme), çok sayıda parçaya dönüştürülmesi gereken herhangi bir toplu belgeyi ele alır.