Lewati ke konten utama

Ekstrak Teks Berdasarkan Ekspresi menggunakan n8n tindakan

PDF4me Ekstrak Teks Berdasarkan Ekspresi mengekstrak konten teks tertentu dari PDF dokumen menggunakan pencocokan pola dan penyaringan berbasis ekspresi melalui n8n Alur kerja otomatisasi. Proses PDFpergi n8n pemicu, data biner, string base64, atau publik URLSolusi ini ideal untuk ekstraksi nomor faktur, pengambilan bidang data, pengambilan teks berbasis pola, ekstraksi data otomatis, penguraian dokumen, dan alur kerja analisis konten yang membutuhkan penargetan teks yang tepat dengan pencocokan yang fleksibel dan integrasi yang mulus. Solusi ini mampu menemukan dan mengekstrak teks menggunakan pola wildcard (%), ekspresi reguler, bidang data spesifik, penargetan khusus halaman, dan aturan ekstraksi yang fleksibel dengan output terstruktur.

Postingan Blog Terkait
Belum ada postingan blog untuk fitur ini — akan segera hadir.
Sementara itu, jelajahi blog PDF4me untuk menemukan tutorial dan alur kerja di berbagai platform.
Kunjungi blog ini

Pengaturan

Tambahkan PDF4me Tambahkan node "Ekstrak Teks Berdasarkan Ekspresi" ke n8n alur kerja dan konfigurasikan parameter yang diperlukan. Untuk petunjuk pengaturan awal, lihat halaman kami. n8n Panduan Integrasi.

Prasyarat:

  • PDF4me API kredensial
  • n8n akses alur kerja

Konfigurasi:

  1. Menambahkan PDF4me simpul ke alur kerja
  2. Pilih tindakan "Ekstrak Teks Berdasarkan Ekspresi"
  3. Konfigurasikan parameter input (lihat di bawah)
Ekstrak Teks Berdasarkan Konfigurasi Ekspresi

Parameter

Daftar lengkap parameter untuk tindakan Ekstrak Teks Berdasarkan Ekspresi. Konfigurasikan parameter ini untuk mengontrol ekstraksi teks.

Penting: Parameter yang ditandai dengan tanda bintang (***) wajib diisi dan harus diberikan agar tindakan dapat berfungsi dengan benar.

ParameterJenisKeteranganContoh
Tipe Data Masukan***StringPDF Pemilihan Format Input
• Pilih format Anda PDF masukan data
PDF4me mendukung berbagai tipe input
• Opsi: Data Biner, Base64 Tali, atau URL
Binary Data
Bidang Biner MasukanBinerBiner PDF Masukan Berkas (Diperlukan jika Data Biner)
• Referensi PDF berkas dari sebelumnya n8n unggahan node atau file
PDF4me proses biner PDF file dengan deteksi format otomatis
• Diperlukan jika Tipe Data Input adalah "Data Biner"
{{ $binary.data }}
Konten PDF Base64StringBase64 Dikodekan PDF Masukan (Diperlukan jika) Base64 Rangkaian)
• Menyediakan PDF konten sebagai string yang dikodekan base64
PDF4me secara otomatis mendekode dan memproses PDF isi
• Diperlukan ketika Tipe Data Input adalah "Base64 Rangkaian"
JVBER...
URL PDFStringPublik PDF URL Masukan (Diperlukan jika) URL)
• Berikan izin publik/terbuka URL ke PDF berkas
PDF4me mengunduh dan memproses file dari URL
• Diperlukan ketika Tipe Data Input adalah "URL"
https://abc.com/document.pdf
Nama Dokumen***StringNama File Masukan
• Tentukan nama input PDF berkas
• Digunakan untuk deteksi format dan optimasi pemrosesan
• Harus menyertakan ekstensi .pdf
document.pdf
Ekspresi***StringPola Ekstraksi Teks
• Tentukan pola atau ekspresi yang sesuai dengan isi teks.
• Mendukung pola regex, wildcard, dan ekspresi kustom.
• Menggunakan % untuk pencocokan wildcard atau pola regex tertentu
%
Urutan Halaman***StringSpesifikasi Rentang Halaman
• Tentukan halaman mana yang akan diproses untuk ekstraksi teks.
• Gunakan "all" untuk seluruh dokumen atau nomor/rentang halaman tertentu
• Contoh: "1,3,5" (spesifik), "1-5" (rentang), "1-" (dari halaman 1 hingga akhir)
1-

Opsi Lanjutan

Parameter berikut tersedia di bagian Opsi Lanjutan dan bersifat opsional:

ParameterJenisKeteranganContoh
Profil KustomStringProfil Konfigurasi Kustom
• Atur opsi tambahan menggunakan profil khusus
JSONformat seperti yang berisi parameter yang telah ditentukan sebelumnya
• Mengaktifkan pengaturan pemrosesan ekstraksi tingkat lanjut
• Opsional untuk kebutuhan khusus
{ "outputDataFormat": "json" }

Keluaran

Parameter Keluaran

ParameterJenisKeteranganContoh
nama fileStringPDF4me nama file yang dihasilkan - Nama file lengkap dari dokumen yang berhasil diproses beserta ekstensi dan stempel waktu yang tepat. PDF4me Memastikan penamaan yang unik dan memvalidasi kepatuhan format file untuk integrasi yang lancar dengan proses selanjutnya.text_extraction_results_1756999697398.json
mimeTypeStringPDF4me MIME pengidentifikasi tipe - Standarisasi MIME tipe untuk file konten yang diekstrak, biasanya application/json untuk data terstruktur atau application/zip untuk beberapa file. Ini memastikan penanganan dan pengenalan file yang tepat di semua sistem dan aplikasi.application/json
Ukuran berkasNomorPDF4me ukuran file dalam byte - Ukuran pasti file konten yang diekstrak dalam byte, disediakan untuk perencanaan penyimpanan, optimasi bandwidth, dan pemantauan transfer file. Penting untuk manajemen dokumen perusahaan dan otomatisasi alur kerja.106
kesuksesanBooleanPDF4me indikator status ekstraksi - Bendera Boolean yang menunjukkan keberhasilan atau kegagalan proses ekstraksi teks. Mengembalikan true untuk keberhasilan ekstraksi dan false untuk setiap kesalahan, memungkinkan penanganan kesalahan yang andal dalam alur kerja otomatis.true
pesanStringPDF4me pesan status ekstraksi - Pesan deskriptif yang menunjukkan hasil proses ekstraksi teks. Memberikan pesan status yang jelas untuk ekstraksi yang berhasil dan informasi kesalahan terperinci untuk tujuan pemecahan masalah.Text extraction by expression completed successfully
Nama dokumenStringPDF4me referensi nama dokumen asli - Nama file asli dari input PDF berkas yang telah diproses. Referensi ini dipelihara untuk jejak audit, tujuan debugging, dan pelacakan sumber konten yang diekstrak dalam alur kerja perusahaan.document.pdf
ekspresiStringPDF4me menggunakan ekspresi ekstraksi - Pola atau ekspresi yang digunakan untuk ekstraksi teks. Bidang ini menunjukkan ekspresi aktual yang diterapkan selama proses ekstraksi untuk tujuan verifikasi dan debugging.%
Urutan halamanStringPDF4me rentang halaman yang diproses - Rentang halaman yang diproses selama ekstraksi teks. Bidang ini menunjukkan halaman sebenarnya yang dipindai untuk ekspresi yang ditentukan, berguna untuk verifikasi dan pemecahan masalah.1-2

N8N Tindakan dan Respons

Yang PDF4me Ekstrak Teks Berdasarkan Ekspresi API Mengembalikan respons yang dapat dilihat dalam berbagai format. Pilih tampilan yang paling sesuai dengan kebutuhan Anda:

JSON Format Respons

Mentah JSON tanggapan dari API:

{
"fileName": "text_extraction_results_1756999697398.json",
"mimeType": "application/json",
"fileSize": 106,
"success": true,
"message": "Text extraction by expression completed successfully",
"docName": "document.pdf",
"expression": "%",
"pageSequence": "1-2"
}

Kasus Penggunaan

Penambangan Data dan Ekstraksi Informasi

  • Ekstrak pola data spesifik, informasi kontak, dan data terstruktur dari PDF dokumen yang menggunakan ekspresi khusus untuk penambangan data dan kecerdasan bisnis
  • Memproses dokumen hukum, kontrak, dan catatan resmi dengan mengekstrak klausul, ketentuan, dan informasi hukum tertentu menggunakan ekspresi yang ditargetkan.
  • Ubah laporan keuangan, faktur, dan dokumen akuntansi dengan mengekstrak data keuangan spesifik, jumlah, dan informasi transaksi menggunakan ekspresi khusus.

Analisis dan Penelitian Konten

  • Ekstrak data penelitian, kutipan, dan informasi akademis dari PDF dokumen yang menggunakan ekspresi khusus untuk penelitian akademis dan analisis konten
  • Memproses makalah ilmiah, dokumen penelitian, dan publikasi teknis dengan mengekstrak data, pengukuran, dan temuan penelitian spesifik menggunakan ekspresi yang tepat sasaran.
  • Ubah laporan bisnis, riset pasar, dan analisis industri dengan mengekstrak metrik, statistik, dan data bisnis spesifik menggunakan ekspresi khusus.

Kepatuhan dan Pemrosesan Regulasi

  • Ekstrak data kepatuhan, informasi peraturan, dan detail audit dari PDF dokumen yang menggunakan ekspresi khusus untuk kepatuhan peraturan dan pemrosesan audit
  • Memproses dokumen pengendalian mutu, laporan inspeksi, dan materi sertifikasi dengan mengekstrak data kepatuhan spesifik, standar, dan informasi peraturan.
  • Ubah dokumen resmi, izin, dan pengajuan peraturan dengan mengekstrak data peraturan spesifik, metrik kepatuhan, dan informasi resmi menggunakan ekspresi khusus.

Dapatkan Bantuan