Ana içeriğe geç

Belge için Ayrıştırma Bilgilerini Hazırlayın

Bu kılavuz neleri kapsıyor?

Ayrıştırma Bilgilerini Hazırla Bu, ham verileri dönüştüren gösterge paneli kurulumudur. PDF içine otomatik PDF veri çıkarmaYakalama anahtarlarını tanımlarsınız, örnek bir belge üzerinde bölgeler çizersiniz ve her anahtara aşağıdaki yöntemlerden birini kullanarak bir çıkarma kuralı atarsınız. Düzenli İfade istikrarlı kalıplar için veya JavaScript İfade Koşullu mantık için. Kaydedildikten sonra, aynı şablon tekrar çalıştırılır. REST API, Make, Zapier, Power Automate, Ve n8n onun adına atıfta bulunarak Şablon Kimliği.

İlgili Blog Yazıları
Bu özellik için henüz bir blog yazısı yok — yakında yayınlanacak.
Bu arada, her platforma yönelik eğitimler ve iş akışları için PDF4me bloguna göz atın.
Blogu ziyaret edin

Kurulumunuzun Kimlik Doğrulaması

Ayrıştırma şablonu oluşturma işlemi şu aşamada gerçekleşir: PDF4me Geliştirici paneli. Hesabınızla giriş yapın, ardından bir geliştirici paneli oluşturun veya kopyalayın. API Belgeyi Ayrıştırma anahtarı API Burada oluşturduğunuz şablonu kullanan çağrılar.

Kaçırmamanız Gereken Önemli Bilgiler

Önce Regex, JavaScript sadece gerektiğinde
Kullanmak Düzenli İfade Sabit bir şekle sahip herhangi bir alan için (fatura numarası, tarih, toplam, vergi kimlik numarası). Kullanın JavaScript İfade Yalnızca koşullu mantık, çoklu kural dallanması veya belge sınıflandırmasına ihtiyaç duyduğunuzda kullanın. İkisini aynı şablonda birleştirmek sorun değil ve önerilir.
Her stabil düzen ailesi için bir şablon.
Tek bir şablon, yazı tipi değişiklikleri veya kaydırılmış konumlar gibi küçük varyasyonları ele alır. Gerçekten farklı düzenler için (farklı fatura tasarımlarına sahip iki tedarikçi), ayrı şablonlar oluşturun ve Parse Document'ı çağırmadan önce dosyaları sınıflandırıcı veya kaynak sistem aracılığıyla doğru olana yönlendirin.
Kaydet TemplateIdisim değil
Değişiklikleri Kaydetme işleminden sonra, kontrol paneli bir GUID oluşturur. Şablon Kimliği Şablon için. Her zaman geçin. Şablon Kimliği üretimde API aramalar. Şablon Adı Bu da işe yarıyor ancak şablonun adını değiştirmek, adıyla ona referans veren tüm otomasyonları bozuyor.

Adım 1: Ayrıştırma şablonunu oluşturun

  1. Açın Belgeyi Ayrıştırma kontrol paneli.
  2. Tıklamak Eklemek ve açık bir şablon adı girin (örneğin, invoice veya vendor-statement).
  3. Tıklamak Kaydetmek Boş şablonu oluşturmak için.
  4. Şablonu açın Düzenlemek Yakalama tuşlarını yapılandırmaya başlamak için mod.
Geliştirici kontrol panelinde PDF4me Ayrıştırma Belgesi şablon listesi ve otomatik PDF veri çıkarma için yeni bir ayrıştırma şablonu oluşturmak üzere Ekle düğmesi bulunur.

Adım 2: Bir örnek yükleyin ve yakalama anahtarlarını yapılandırın.

Kontrol paneli yüklenen bir içeriği görüntüler. PDF sağda yer alır ve gösterir Ayrıştırma Bilgisi Soldaki formu kullanın. Sentetik test dosyaları değil, gerçek üretim ortamında kullanılan örnekleri kullanın, böylece yakalama alanları canlı trafikte göreceğiniz alanlarla eşleşsin.

  1. Tıklamak Şablon Dosyasını Yükle ve temsili bir örnek seçin (fatura, sözleşme, form).
  2. Altında Anahtarlar, tıklamak + Yakalama tuşu eklemek için. Ona camelCase formatında bir ad verin: invoiceNumber, customerName, totalAmount.
  3. Seçmek İfade türünü seçin Anahtar için: Javascript Expression veya Regex Expression.
  4. Açılan alana ifade gövdesini yapıştırın.
  5. Ayarlamak Sayfalar ile all Her sayfayı taramak veya belirli bir sayfa numarasına kadar taramak (1, 2Kapsamı sınırlamak için (vb.)
  6. Açma/Kapama Sayfanın tamamında ara Değer sabit bir konumda olmadığında açılır. Kapalıyken, yalnızca çizilen yakalama alanı aranır.
PDF4me Belge Ayrıştırma yapılandırma arayüzü. Sol panelde Şablon Adı (fatura), Ayrıştırma Kimliği ve Anahtar Adı (KeyName) anahtarı ile Ayrıştırma Bilgileri gösterilir; burada İfade Türü (JavaScript İfadesi), Javascript İfade Gövdesi (JavaScript İfadesi), Sayfalar (tüm sayfalar) ve Tüm Sayfayı Ara (Search Whole Page) seçenekleri bulunur. Sağ panelde ise yüklenen fatura PDF'si, soldan sağa doğru işlem sırasına göre üstte bulunan Şablon Dosyasını Yükle, Ayrıştırmayı Test Et ve Değişiklikleri Kaydet işlem düğmeleriyle birlikte görüntülenir.

Belge Ayrıştırma kurulum ekranı. Sol: Anahtarlar ve ifade türüyle Ayrıştırma Bilgi formu. Sağ: Yüklenen örnek PDFİşlem düğmeleri soldan sağa doğru sıralanır: Şablon Dosyasını Yükle, Ayrıştırmayı Test Et, Değişiklikleri Kaydet.

Adım 3: Her tuş için ifade türünü seçin

İfade TürüEn iyisiTipik kullanımKarmaşıklık
Regex ExpressionFixed text patternsInvoice number, dates, totals, tax IDs, postal codesLow
JavaScript ExpressionConditional and multi-rule extractionDocument classification, fallback logic, rule orchestrationMedium to High

Düzenli İfade Kalıpları (düzenli ifade PDF ayrıştırıcısının temelleri)

Kullanmak Düzenli İfade Saha istikrarlı ve tahmin edilebilir bir şekle sahip olduğunda, yakalanan alan ilk eşleşme için taranır.

INV-\d{6,10}
\d{2}/\d{2}/\d{4}
\$?\d{1,3}(?:,\d{3})*(?:\.\d{2})?

Fatura için yaygın tuş atamaları:

  • invoiceNumberINV-\d{6,10}
  • invoiceDate\d{2}/\d{2}/\d{4}
  • totalAmount\$?\d{1,3}(?:,\d{3})*(?:\.\d{2})?

Aynı kalıplar, tedarikçi ekstrelerinde, satın alma siparişlerinde ve sevkiyat belgelerinde de aynı alanlar için geçerlidir çünkü fatura numaraları, tarihleri ve tutarları çoğu ticari belgede aynı şekle sahiptir.

JavaScript Koşullu mantık için ifade

Kullanmak JavaScript İfade Çıktının, belgedeki birden fazla işaretleyicinin varlığına veya kombinasyonuna bağlı olduğu durumlarda. PDF4me Çıkarılan metni değişken olarak fonksiyonunuza aktarır. textFonksiyonunuz metni değerlendirir ve anahtarın değeri olacak bir dize döndürür.

Örnek 1: İçerik işaretleyicilerine göre sınıflandırma

Şartlar ve Koşullar belgesini, Sipariş belgesinden hangi belirleyici ifadelerin yer aldığını kontrol ederek ayırt eder:

function functionFormatTextDate1(text) {
console.log("Hello");
var term = [...text.matchAll(/General Terms and Conditions/gi)];
var order = [...text.matchAll(/your ordernumber/gi)];

if (term.length) {
if (order.length) {
return "Order document";
} else {
return "Terms and Conditions";
}
} else {
return "Not Terms and Conditions";
}
}

return functionFormatTextDate1(text);

Örnek 2: Fatura ve sipariş tespiti

Belgenin fatura mı yoksa sipariş mi olduğuna, içerdiği kelimelere göre karar veren kısa bir sınıflandırıcı. invoice Ve ordernumber:

function functionGetInvoiceOrder(text) {
// You get all PDF text in `text`
var invoice = [...text.matchAll(/invoice/gi)];
var order = [...text.matchAll(/ordernumber/gi)];

if (invoice.length) {
if (order.length) {
return "Order document";
} else {
return "invoice";
}
} else {
return "";
}
}

return functionGetInvoiceOrder(text);

Uygulama ipucu: Mantığınızı adlandırılmış bir fonksiyon içine alın ve onu şu şekilde çağırın: return functionName(text); En altta. Kontrol paneli, ifade gövdesini, nihai dönüş değeri anahtarı dolduran bir fonksiyon olarak yürütür.

Adım 4: Ayrıştırmayı Test Edin ve Değişiklikleri Kaydedin

Editörün üst kısmındaki işlem düğmeleri, onları kullandığınız sıraya göre soldan sağa doğru sıralanır:

  1. Şablon Dosyasını Yükle örneği yükler PDF Yakalama alanlarını çizmek için kullanılır.
  2. Test Ayrıştırma Yüklenen örnek üzerinde tüm anahtarları çalıştırır ve çıkarılan değerleri satır içi olarak gösterir. Bunu her bir Regex'i doğrulamak için kullanın. JavaScript Kaydetmeden önce ifadeyi kullanın.
  3. Değişiklikleri Kaydet Şablonu kalıcı hale getirir ve istikrarlı bir değer atar. TemplateId (GUID). Bu GUID'yi kullanmak üzere kopyalayın. API Çağrı ve otomasyon platformları.

Her bir tuş üzerinde yinele, ta ki Test Ayrıştırma Her alan için beklenen değeri döndürür. Komşu metin görüyorsanız yakalama alanını daraltın veya desen eşleşmeleri çok gevşekse ifadeyi iyileştirin.

Şablonu şurada kullanın: API veya otomasyon çağrıları

Bir kere Değişiklikleri Kaydet bir atar TemplateIdAynı ayrıştırma şablonu, referans yoluyla her yerde çalışır. Her platformda yapılandırmayı yeniden oluşturmanıza gerek yoktur.

AlanKaynakAmaç
TemplateIdKaydetme işleminden sonra şablon detay panelinde gösterilen GUID.Üretim otomasyonu için istikrarlı tanımlayıcı. Her zaman bunu tercih edin. TemplateName.
TemplateName1. adımda yazdığınız isimArama için alternatif. Şablonun yeniden adlandırılması, ona adıyla referans veren çağrıları bozar.
ParseIdİstemci tarafında oluşturduğunuz bir GUID (her çağrı için bir tane).İsteğinizi ayrıştırma çıktısıyla ilişkilendirir; bu, günlük kaydı ve denetim izleri için kullanışlıdır.
docNameKaynak PDF dosya adıTakip ve hata mesajları için kullanılır.
docContentKaynak PDF kodlanmış olarak Base64Ayrıştırılacak dosya.
asyncfalse senkron için, true anket içinYanıt iletimini kontrol eder.

Örnek REST İstek gövdesi:

{
"docName": "invoice.pdf",
"docContent": "BASE64_ENCODED_PDF_CONTENT",
"TemplateId": "12345678-1234-1234-1234-123456789abc",
"ParseId": "87654321-4321-4321-4321-cba987654321",
"async": false
}

Yanıt, şablonda tanımladığınız her anahtar için bir alan içerir. Bu alan, ilgili rotayı takip eder. JSON herhangi bir alt düğüme: Google Sheets, AirtableVeritabanı, Excel veya webhook gibi.

Ortak iş akışları

Tipik ayrıştırma şablonu kalıplarıHow a saved parse template moves from dashboard to production.
Fatura gelen kutusundan muhasebe elektronik tablosuna
  1. Bir tedarikçi faturası PDF Takip edilen bir e-posta adresine veya bulut klasörüne gelir.
  2. Make, Zapier, Power Automate, veya n8n Parse Document'ı sizin adınıza çağırır. TemplateId.
  3. Yapılandırılmış JSON Çıktı (fatura numarası, toplam tutar, fatura tarihi) satır olarak eklenir. Google Sheets veya Excel.
  4. Muhasebe departmanı, elektronik tablo üzerinden doğrudan inceleme ve onay işlemlerini gerçekleştirir.
Formdan veri tabanına kayıt
  1. Bir müşteri doldurulmuş bir formu yüklüyor. PDF Portalınız üzerinden form doldurun.
  2. Arka uç sisteminiz Parse Document'ı şu şekilde çağırır: TemplateId ve Base64 PDF.
  3. Ayrıştırılan JSON Bu, şablon anahtarı başına bir sütun içeren bir veritabanı INSERT işlemine eşlenir.
  4. Müşteriye, ayrıştırılan ad ve referans numarası kullanılarak bir onay e-postası gönderilir.
Belge sınıflandırıcı ve çıkarıcı
  1. Tek bir takip edilen klasöre çeşitli belgeler (faturalar, siparişler, sözleşmeler) kaydedilir.
  2. A JavaScript Şablondaki ifade anahtarı belge türünü döndürür (yukarıdaki Örnek 2'ye bakın).
  3. İş akışınız, döndürülen dosya türüne bağlı olarak her dosyayı doğru alt sisteme yönlendirir.
  4. Fatura olarak tanımlanan dosyalar, aynı şablon çağrısında Regex tabanlı alan ayıklama işlemine devam eder.

Şablon yapılandırması için en iyi uygulamalar

  • Yakalama alanlarını beklenen değerden biraz daha büyük çizin, böylece yazı tipi veya konum kayması değeri çerçeve dışına itmesin.
  • Şablonlar arasında anahtar adlarını camelCase formatında tutarlı tutun, böylece elektronik tablolarda, veritabanlarında ve web kancalarında sonraki aşama eşlemeler öngörülebilir kalır.
  • Her bir anahtarı, eksik isteğe bağlı alanlar, ikinci sayfa faturaları gibi uç durumlar da dahil olmak üzere en az üç gerçek örnekle test edin. OCR-taranmış metinden türetilmiştir PDFs.
  • Kullanmak JavaScript Regex'in kuralı ifade edemediği durumlarda yalnızca ifade kullanılır. Mantığı basit tutmak, şablonun hata ayıklamasını kolaylaştırır.
  • Şablonlarınızı isme göre sürümlendirin (invoice-v1, invoice-v2(Kırıcı değişiklikler yapılırken) böylece üretim otomasyonu kendi hızında geçiş yapabilir.
  • Çalıştırma taraması yapıldı. PDFs başından sonuna kadar OCR ilk (o PDF4me OCR Ayrıştırmadan önce uç noktayı tarar. Şablonlar, taranan metin katmanından çıkarılır. PDFs sahip değilim, ta ki OCR uygulanır.

İlgili işlemler

Belgeyi Ayrıştır API
REST Kaydedilmiş şablonunuzu herhangi bir şeye karşı çalıştıran uç nokta. PDF kullanarak TemplateId ve yapılandırılmış getiriler JSON.
Sınıflandırma Belgesini Kur
Alan ayıklaması yapılmayan, yalnızca kategori içeren çıktılar için yardımcı kılavuz. Parse Document işleminden önce ön yönlendirici olarak kullanışlıdır.
Belgeyi ayrıştırma işleminde Make
Şablonunuzu, alt yönlendirme, depolama ve bildirim modülleri içeren görsel iş akışlarında uygulayın.
Belgeyi ayrıştırma işleminde Zapier
Tetikleyici tabanlı şablon ayrıştırma işlemini çalıştırın. SaaS 6.000'den fazla uygulamada otomasyonlar.
Belgeyi ayrıştırma işleminde Power Automate
Ayrıştırma çıktısını şunlarla entegre edin: Microsoft 365 onay akışları, SharePoint kayıtlar ve Dynamics boru hatları.
Belgeyi ayrıştırma işleminde n8n
Düzenli ifadeler içeren kendi sunucunuzda barındırılan iş akışı veya JavaScript ifadeye dayalı PDF Veri çıkarma ve alt düğümler üzerinde tam kontrol.

Sıkça Sorulan Sorular

Should I use Regex Expression or JavaScript Expression first?+
Start with Regex Expression for fixed-shape fields like invoice numbers, dates, totals, and tax IDs. Move to JavaScript Expression when extraction depends on multiple conditions, fallback rules, or document classification. Most production templates use Regex for around 80% of keys and JavaScript for the rest.
Where does the text variable in JavaScript Expression come from?+
PDF4me passes the extracted text of the captured region (or the full PDF when Search Whole Page is enabled) into the expression context as the variable named text. Your function evaluates that string and returns a string for the configured key.
Does parse template extraction work on scanned PDFs?+
Yes, when the PDF has been OCR-processed first. Scanned PDFs are images until OCR is applied. Run the source file through the PDF4me OCR endpoint or upload an already-OCR'd PDF to the dashboard before drawing capture areas. The template then extracts from the OCR text layer.
Can one template handle multiple invoice layouts?+
It can absorb small differences in font, position, or page count. For genuinely different layouts (two vendors with different invoice designs) create separate templates and route files to the right one by classifier or source system before calling Parse Document.
What do I need to call the parse template from the API?+
Send docName, docContent (the PDF as Base64), TemplateId (the GUID copied from the dashboard after Save Changes), ParseId (a client-generated GUID), and async (false for immediate response, true for polling). TemplateName works instead of TemplateId but TemplateId is recommended for stable automation.
How do I move extracted data into Excel, Google Sheets, or a database?+
The parse output is structured JSON, with one field per key you defined in the template. Route that JSON to any destination from your automation platform: Add Row in Google Sheets, Insert Row in Airtable or a database, or write to Excel via the Excel module in Make, Power Automate, n8n, or Zapier. The same TemplateId works on every platform.
How does this compare with Python PDF data extraction libraries?+
Tools like pdfplumber, PyMuPDF, and pdfminer give you raw extraction primitives in Python, but you write and maintain the matching logic yourself. PDF4me parse templates give you a saved, named template you configure once in a dashboard and call from any language or platform. Use Python libraries when you need full programmatic control inside a single codebase; use PDF4me parse templates when you want the same extraction running across the REST API, Make, Zapier, Power Automate, and n8n without copying logic between systems.
How should I test a parse template before production?+
Validate each key against at least three real samples, including edge cases such as missing optional fields, alternate fonts, multi-page documents, and second-page positions. Use Test Parse in the dashboard for each sample, confirm the output matches expectations, then run a small automation against live files in monitor mode before enabling end-to-end automation.
How do I connect this setup to no-code platforms?+
Use the platform-specific guides under Related actions. Each platform exposes the same TemplateId and ParseId fields so the parsing logic stays identical to what you tested in the dashboard. The output structure also matches across platforms.

Yardım Alın