Lewati ke konten utama

Siapkan Informasi Penguraian untuk Dokumen

Apa yang dibahas dalam panduan ini?

Siapkan Informasi Parse adalah pengaturan dasbor yang mengubah data mentah PDF ke dalam otomatis PDF ekstraksi dataAnda menentukan kunci tangkapan, menggambar zona pada dokumen sampel, dan menetapkan aturan ekstraksi untuk setiap kunci menggunakan salah satu cara berikut. Ekspresi Regex untuk pola yang stabil atau JavaScript Ekspresi untuk logika kondisional. Setelah disimpan, template yang sama akan dijalankan dari REST API, Make, Zapier, Power Automate, Dan n8n dengan merujuk pada ID Templat.

Postingan Blog Terkait
Belum ada postingan blog untuk fitur ini — akan segera hadir.
Sementara itu, jelajahi blog PDF4me untuk menemukan tutorial dan alur kerja di berbagai platform.
Kunjungi blog ini

Memverifikasi Pengaturan Anda

Pembuatan templat parse terjadi di PDF4me Dasbor pengembang. Masuk dengan akun Anda, lalu buat atau salin sebuah API kunci untuk Mengurai Dokumen API panggilan yang menggunakan templat yang Anda buat di sini.

Fakta Penting yang Tidak Boleh Anda Lewatkan

Pertama, gunakan Regex. JavaScript hanya jika diperlukan
Menggunakan Ekspresi Regex untuk bidang apa pun dengan bentuk tetap (nomor faktur, tanggal, total, ID pajak). Gunakan JavaScript Ekspresi Hanya jika Anda membutuhkan logika kondisional, percabangan multi-aturan, atau klasifikasi dokumen. Menggabungkan keduanya dalam templat yang sama tidak masalah dan direkomendasikan.
Satu templat per keluarga tata letak stabil.
Satu templat menangani variasi kecil seperti perubahan font atau pergeseran posisi. Untuk tata letak yang benar-benar berbeda (dua vendor dengan desain faktur yang berbeda), buat templat terpisah dan arahkan file ke templat yang tepat berdasarkan pengklasifikasi atau sistem sumber sebelum memanggil Parse Document.
Selamatkan TemplateId, bukan namanya
Setelah menyimpan perubahan, dasbor akan menghasilkan GUID. ID Templat untuk templatnya. Selalu berikan ID Templat dalam produksi API panggilan. Nama Templat Cara ini juga berhasil, tetapi mengganti nama templat akan merusak otomatisasi apa pun yang merujuknya berdasarkan nama tersebut.

Langkah 1: Buat templat parse

  1. Buka Dasbor Parse Dokumen.
  2. Klik Menambahkan dan masukkan nama templat yang jelas (misalnya, invoice atau vendor-statement).
  3. Klik Menyimpan untuk membuat templat kosong.
  4. Buka templat di Edit mode untuk memulai konfigurasi tombol tangkap.
Daftar templat penguraian dokumen PDF4me di dasbor pengembang, dengan tombol Tambah untuk membuat templat penguraian baru untuk ekstraksi data PDF otomatis.

Langkah 2: Unggah sampel dan konfigurasikan kunci pengambilan data.

Dasbor menampilkan data yang diunggah. PDF di sebelah kanan dan menunjukkan Informasi Penguraian formulir di sebelah kiri. Gunakan sampel berbentuk produksi nyata, bukan file uji sintetis, sehingga area tangkapan sesuai dengan apa yang akan Anda lihat di lalu lintas langsung.

  1. Klik Unggah File Templat dan pilihlah contoh yang representatif (faktur, kontrak, formulir).
  2. Di bawah Kunci, klik + Untuk menambahkan tombol tangkap. Beri nama dalam format camelCase: invoiceNumber, customerName, totalAmount.
  3. Memilih Pilih jenis ekspresi untuk kuncinya: Javascript Expression atau Regex Expression.
  4. Tempelkan isi ekspresi ke dalam kolom yang muncul.
  5. Mengatur Halaman ke all untuk memindai setiap halaman, atau ke nomor halaman tertentu (1, 2, dll.) untuk membatasi ruang lingkup.
  6. Alihkan Cari di Seluruh Halaman Diaktifkan saat nilai tidak berada pada posisi tetap. Jika dimatikan, hanya area tangkapan yang digambar yang dicari.
Antarmuka pengguna konfigurasi PDF4me Parse Document. Panel kiri menampilkan Informasi Parse dengan Nama Template invoice, ID Parse, dan kunci KeyName dengan pilihan tipe ekspresi Javascript Expression, isi Javascript Expression, semua halaman, dan tombol Search Whole Page. Panel kanan menampilkan PDF invoice yang diunggah yang dirender dengan tombol aksi Upload Template File, Test Parse, dan Save Changes di bagian atas dalam urutan eksekusi dari kiri ke kanan.

Layar pengaturan Parse Document. Kiri: Formulir Info Parse dengan Kunci dan tipe ekspresi. Kanan: contoh yang diunggah. PDFTombol aksi dari kiri ke kanan: Unggah File Templat, Uji Parsing, Simpan Perubahan.

Langkah 3: Pilih jenis ekspresi per tombol

Jenis EkspresiTerbaik untukPenggunaan umumKompleksitas
Regex ExpressionFixed text patternsInvoice number, dates, totals, tax IDs, postal codesLow
JavaScript ExpressionConditional and multi-rule extractionDocument classification, fallback logic, rule orchestrationMedium to High

Pola Ekspresi Regex (dasar-dasar parser pdf regex)

Menggunakan Ekspresi Regex ketika medan memiliki bentuk yang stabil dan dapat diprediksi. Area yang ditangkap dipindai untuk mencari kecocokan pertama.

INV-\d{6,10}
\d{2}/\d{2}/\d{4}
\$?\d{1,3}(?:,\d{3})*(?:\.\d{2})?

Pemetaan kunci umum untuk faktur:

  • invoiceNumberINV-\d{6,10}
  • invoiceDate\d{2}/\d{2}/\d{4}
  • totalAmount\$?\d{1,3}(?:,\d{3})*(?:\.\d{2})?

Pola yang sama juga berlaku untuk bidang yang sama dalam laporan vendor, pesanan pembelian, dan dokumen pengiriman karena nomor faktur, tanggal, dan jumlah memiliki bentuk yang sama di sebagian besar dokumen bisnis.

JavaScript Ekspresi untuk logika kondisional

Menggunakan JavaScript Ekspresi ketika output bergantung pada keberadaan atau kombinasi beberapa penanda dalam dokumen. PDF4me meneruskan teks yang diekstrak ke fungsi Anda sebagai variabel. textFungsi Anda mengevaluasi teks dan mengembalikan string yang menjadi nilai untuk kunci tersebut.

Contoh 1: mengklasifikasikan berdasarkan penanda konten

Membedakan dokumen Syarat dan Ketentuan dari dokumen Pesanan dengan memeriksa frasa penanda mana yang muncul:

function functionFormatTextDate1(text) {
console.log("Hello");
var term = [...text.matchAll(/General Terms and Conditions/gi)];
var order = [...text.matchAll(/your ordernumber/gi)];

if (term.length) {
if (order.length) {
return "Order document";
} else {
return "Terms and Conditions";
}
} else {
return "Not Terms and Conditions";
}
}

return functionFormatTextDate1(text);

Contoh 2: deteksi faktur vs pesanan

Sebuah pengklasifikasi singkat yang menentukan apakah dokumen tersebut adalah faktur atau pesanan berdasarkan keberadaan kata-kata tertentu. invoice Dan ordernumber:

function functionGetInvoiceOrder(text) {
// You get all PDF text in `text`
var invoice = [...text.matchAll(/invoice/gi)];
var order = [...text.matchAll(/ordernumber/gi)];

if (invoice.length) {
if (order.length) {
return "Order document";
} else {
return "invoice";
}
} else {
return "";
}
}

return functionGetInvoiceOrder(text);

Tips implementasi: Bungkus logika Anda dalam fungsi bernama dan panggil dengan kembalikan nama fungsi(teks); Di bagian bawah. Dasbor mengeksekusi isi ekspresi sebagai fungsi yang nilai kembaliannya pada akhirnya mengisi kunci tersebut.

Langkah 4: Uji Parsing dan Simpan Perubahan

Tombol aksi di bagian atas editor berurutan dari kiri ke kanan sesuai urutan penggunaannya:

  1. Unggah File Templat memuat sampel PDF Digunakan untuk menggambar area tangkapan.
  2. Tes Parse Menjalankan semua kunci terhadap sampel yang diunggah dan menampilkan nilai yang diekstrak secara langsung. Gunakan ini untuk memvalidasi setiap Regex atau JavaScript ekspresi sebelum menyimpan.
  3. Simpan Perubahan mempertahankan templat dan menetapkan nilai yang stabil. TemplateId (GUID). Salin GUID tersebut untuk digunakan di API panggilan dan platform otomatisasi.

Ulangi setiap kunci hingga Tes Parse Mengembalikan nilai yang diharapkan untuk setiap bidang. Persempit area tangkapan jika Anda melihat teks di sekitarnya, atau perbaiki ekspresi jika pencocokan pola terlalu longgar.

Gunakan templat di API atau panggilan otomatisasi

Sekali Simpan Perubahan menugaskan TemplateIdDengan demikian, template parse yang sama dapat dijalankan di mana saja melalui referensi. Anda tidak perlu membuat ulang konfigurasi di setiap platform.

BidangSumberTujuan
TemplateIdGUID ditampilkan di panel detail templat setelah disimpan.Pengidentifikasi stabil untuk otomatisasi produksi. Selalu lebih memilih ini daripada TemplateName.
TemplateNameNama yang Anda ketik di Langkah 1Alternatif untuk pencarian. Mengganti nama templat akan merusak panggilan yang merujuknya berdasarkan nama.
ParseIdGUID yang Anda hasilkan di sisi klien (satu per panggilan)Menghubungkan permintaan Anda dengan output parse, berguna untuk pencatatan dan jejak audit.
docNameSumber PDF nama fileDigunakan untuk pelacakan dan pesan kesalahan.
docContentSumber PDF dikodekan sebagai Base64Berkas yang akan diurai.
asyncfalse untuk sinkron, true untuk jajak pendapatMengontrol penyampaian respons.

Contoh REST Isi permintaan:

{
"docName": "invoice.pdf",
"docContent": "BASE64_ENCODED_PDF_CONTENT",
"TemplateId": "12345678-1234-1234-1234-123456789abc",
"ParseId": "87654321-4321-4321-4321-cba987654321",
"async": false
}

Respons tersebut berisi satu kolom untuk setiap kunci yang Anda definisikan dalam templat. Arahkan respons tersebut. JSON ke node hilir mana pun: Google Sheets, Airtable, basis data, Excel, atau webhook.

Alur kerja umum

Pola templat parse tipikalHow a saved parse template moves from dashboard to production.
Kotak masuk faktur ke spreadsheet akuntansi
  1. Faktur vendor PDF tiba di folder email atau cloud yang dipantau.
  2. Make, Zapier, Power Automate, atau n8n memanggil Parse Document dengan milik Anda TemplateId.
  3. Struktur JSON output (invoiceNumber, totalAmount, invoiceDate) ditambahkan sebagai baris di Google Sheets atau Excel.
  4. Bagian akuntansi meninjau dan menyetujui langsung dari spreadsheet.
Formulir dimasukkan ke dalam catatan basis data.
  1. Seorang pelanggan mengunggah formulir yang telah diisi. PDF formulir melalui portal Anda.
  2. Backend Anda memanggil Parse Document dengan TemplateId dan Base64 PDF.
  3. yang diuraikan JSON dipetakan ke dalam perintah INSERT basis data, dengan satu kolom per kunci templat.
  4. Email konfirmasi akan dikirimkan kembali kepada pelanggan menggunakan nama dan nomor referensi yang telah diuraikan.
Pengklasifikasi dan ekstraksi dokumen
  1. Satu folder yang dipantau menerima berbagai macam dokumen (faktur, pesanan, kontrak).
  2. A JavaScript Kunci ekspresi dalam templat mengembalikan tipe dokumen (lihat Contoh 2 di atas).
  3. Alur kerja Anda mengarahkan setiap file ke sistem hilir yang tepat berdasarkan tipe yang dikembalikan.
  4. Berkas yang diidentifikasi sebagai faktur melanjutkan ekstraksi bidang berbasis Regex dalam panggilan templat yang sama.

Praktik terbaik konfigurasi templat

  • Gambarlah area tangkapan yang sedikit lebih besar daripada nilai yang diharapkan agar pergeseran font atau posisi tidak mendorong nilai tersebut keluar dari bingkai.
  • Pertahankan konsistensi nama kunci dalam format camelCase di seluruh templat agar pemetaan selanjutnya di spreadsheet, basis data, dan webhook tetap dapat diprediksi.
  • Uji setiap kunci terhadap setidaknya tiga sampel nyata, termasuk kasus-kasus khusus seperti kolom opsional yang hilang, faktur halaman kedua, dan OCR-teks yang diperoleh dari hasil pemindaian PDFs.
  • Menggunakan JavaScript Ekspresi hanya digunakan jika Regex tidak dapat mengekspresikan aturan. Menjaga logika tetap sederhana membuat template lebih mudah untuk di-debug.
  • Buat versi templat Anda berdasarkan nama (invoice-v1, invoice-v2) saat melakukan perubahan yang merusak, sehingga otomatisasi produksi dapat bermigrasi dengan kecepatannya sendiri.
  • Jalankan pemindaian PDFs melalui OCR pertama (yang PDF4me OCR (titik akhir) sebelum diurai. Templat diekstrak dari lapisan teks, yang dipindai PDFs tidak punya sampai OCR diterapkan.

Tindakan terkait

Uraikan Dokumen API
REST titik akhir yang menjalankan templat tersimpan Anda terhadap apa pun PDF menggunakan TemplateId dan pengembalian terstruktur JSON.
Siapkan Klasifikasi Dokumen
Panduan pelengkap untuk keluaran khusus kategori tanpa ekstraksi bidang. Berguna sebagai pra-router sebelum Parse Document.
Uraikan Dokumen di Make
Terapkan templat Anda dalam alur kerja visual dengan modul perutean, penyimpanan, dan pemberitahuan selanjutnya.
Uraikan Dokumen di Zapier
Jalankan penguraian templat dari pemicu berbasis SaaS otomatisasi di lebih dari 6.000 aplikasi.
Uraikan Dokumen di Power Automate
Integrasikan output parse dengan Microsoft 365 alur persetujuan, SharePoint catatan, dan Dynamics saluran pipa.
Uraikan Dokumen di n8n
Alur kerja yang dihosting sendiri dengan regex atau JavaScript ekspresi berdasarkan PDF ekstraksi data, ditambah kendali penuh atas node hilir.

Pertanyaan yang Sering Diajukan

Should I use Regex Expression or JavaScript Expression first?+
Start with Regex Expression for fixed-shape fields like invoice numbers, dates, totals, and tax IDs. Move to JavaScript Expression when extraction depends on multiple conditions, fallback rules, or document classification. Most production templates use Regex for around 80% of keys and JavaScript for the rest.
Where does the text variable in JavaScript Expression come from?+
PDF4me passes the extracted text of the captured region (or the full PDF when Search Whole Page is enabled) into the expression context as the variable named text. Your function evaluates that string and returns a string for the configured key.
Does parse template extraction work on scanned PDFs?+
Yes, when the PDF has been OCR-processed first. Scanned PDFs are images until OCR is applied. Run the source file through the PDF4me OCR endpoint or upload an already-OCR'd PDF to the dashboard before drawing capture areas. The template then extracts from the OCR text layer.
Can one template handle multiple invoice layouts?+
It can absorb small differences in font, position, or page count. For genuinely different layouts (two vendors with different invoice designs) create separate templates and route files to the right one by classifier or source system before calling Parse Document.
What do I need to call the parse template from the API?+
Send docName, docContent (the PDF as Base64), TemplateId (the GUID copied from the dashboard after Save Changes), ParseId (a client-generated GUID), and async (false for immediate response, true for polling). TemplateName works instead of TemplateId but TemplateId is recommended for stable automation.
How do I move extracted data into Excel, Google Sheets, or a database?+
The parse output is structured JSON, with one field per key you defined in the template. Route that JSON to any destination from your automation platform: Add Row in Google Sheets, Insert Row in Airtable or a database, or write to Excel via the Excel module in Make, Power Automate, n8n, or Zapier. The same TemplateId works on every platform.
How does this compare with Python PDF data extraction libraries?+
Tools like pdfplumber, PyMuPDF, and pdfminer give you raw extraction primitives in Python, but you write and maintain the matching logic yourself. PDF4me parse templates give you a saved, named template you configure once in a dashboard and call from any language or platform. Use Python libraries when you need full programmatic control inside a single codebase; use PDF4me parse templates when you want the same extraction running across the REST API, Make, Zapier, Power Automate, and n8n without copying logic between systems.
How should I test a parse template before production?+
Validate each key against at least three real samples, including edge cases such as missing optional fields, alternate fonts, multi-page documents, and second-page positions. Use Test Parse in the dashboard for each sample, confirm the output matches expectations, then run a small automation against live files in monitor mode before enabling end-to-end automation.
How do I connect this setup to no-code platforms?+
Use the platform-specific guides under Related actions. Each platform exposes the same TemplateId and ParseId fields so the parsing logic stays identical to what you tested in the dashboard. The output structure also matches across platforms.

Dapatkan Bantuan