Ekstrak Teks Berdasarkan Ekspresi menggunakan n8n tindakan
PDF4me Ekstrak Teks Berdasarkan Ekspresi mengekstrak konten teks tertentu dari PDF dokumen menggunakan pencocokan pola dan penyaringan berbasis ekspresi melalui n8n Alur kerja otomatisasi. Proses PDFpergi n8n pemicu, data biner, string base64, atau publik URLSolusi ini ideal untuk ekstraksi nomor faktur, pengambilan bidang data, pengambilan teks berbasis pola, ekstraksi data otomatis, penguraian dokumen, dan alur kerja analisis konten yang membutuhkan penargetan teks yang tepat dengan pencocokan yang fleksibel dan integrasi yang mulus. Solusi ini mampu menemukan dan mengekstrak teks menggunakan pola wildcard (%), ekspresi reguler, bidang data spesifik, penargetan khusus halaman, dan aturan ekstraksi yang fleksibel dengan output terstruktur.
Pengaturan
Tambahkan PDF4me Tambahkan node "Ekstrak Teks Berdasarkan Ekspresi" ke n8n alur kerja dan konfigurasikan parameter yang diperlukan. Untuk petunjuk pengaturan awal, lihat halaman kami. n8n Panduan Integrasi.
Prasyarat:
- PDF4me API kredensial
- n8n akses alur kerja
Konfigurasi:
- Menambahkan PDF4me simpul ke alur kerja
- Pilih tindakan "Ekstrak Teks Berdasarkan Ekspresi"
- Konfigurasikan parameter input (lihat di bawah)

Parameter
Daftar lengkap parameter untuk tindakan Ekstrak Teks Berdasarkan Ekspresi. Konfigurasikan parameter ini untuk mengontrol ekstraksi teks.
Penting: Parameter yang ditandai dengan tanda bintang (***) wajib diisi dan harus diberikan agar tindakan dapat berfungsi dengan benar.
| Parameter | Jenis | Keterangan | Contoh |
|---|---|---|---|
| Tipe Data Masukan*** | String | PDF Pemilihan Format Input • Pilih format Anda PDF masukan data • PDF4me mendukung berbagai tipe input • Opsi: Data Biner, Base64 Tali, atau URL | Binary Data |
| Bidang Biner Masukan | Biner | Biner PDF Masukan Berkas (Diperlukan jika Data Biner) • Referensi PDF berkas dari sebelumnya n8n unggahan node atau file • PDF4me proses biner PDF file dengan deteksi format otomatis • Diperlukan jika Tipe Data Input adalah "Data Biner" | {{ $binary.data }} |
| Konten PDF Base64 | String | Base64 Dikodekan PDF Masukan (Diperlukan jika) Base64 Rangkaian) • Menyediakan PDF konten sebagai string yang dikodekan base64 • PDF4me secara otomatis mendekode dan memproses PDF isi • Diperlukan ketika Tipe Data Input adalah "Base64 Rangkaian" | JVBER... |
| URL PDF | String | Publik PDF URL Masukan (Diperlukan jika) URL) • Berikan izin publik/terbuka URL ke PDF berkas • PDF4me mengunduh dan memproses file dari URL • Diperlukan ketika Tipe Data Input adalah "URL" | https://abc.com/document.pdf |
| Nama Dokumen*** | String | Nama File Masukan • Tentukan nama input PDF berkas • Digunakan untuk deteksi format dan optimasi pemrosesan • Harus menyertakan ekstensi .pdf | document.pdf |
| Ekspresi*** | String | Pola Ekstraksi Teks • Tentukan pola atau ekspresi yang sesuai dengan isi teks. • Mendukung pola regex, wildcard, dan ekspresi kustom. • Menggunakan % untuk pencocokan wildcard atau pola regex tertentu | % |
| Urutan Halaman*** | String | Spesifikasi Rentang Halaman • Tentukan halaman mana yang akan diproses untuk ekstraksi teks. • Gunakan "all" untuk seluruh dokumen atau nomor/rentang halaman tertentu • Contoh: "1,3,5" (spesifik), "1-5" (rentang), "1-" (dari halaman 1 hingga akhir) | 1- |
Opsi Lanjutan
Parameter berikut tersedia di bagian Opsi Lanjutan dan bersifat opsional:
| Parameter | Jenis | Keterangan | Contoh |
|---|---|---|---|
| Profil Kustom | String | Profil Konfigurasi Kustom • Atur opsi tambahan menggunakan profil khusus • JSONformat seperti yang berisi parameter yang telah ditentukan sebelumnya • Mengaktifkan pengaturan pemrosesan ekstraksi tingkat lanjut • Opsional untuk kebutuhan khusus | { "outputDataFormat": "json" } |
Keluaran
Parameter Keluaran
| Parameter | Jenis | Keterangan | Contoh |
|---|---|---|---|
| nama file | String | PDF4me nama file yang dihasilkan - Nama file lengkap dari dokumen yang berhasil diproses beserta ekstensi dan stempel waktu yang tepat. PDF4me Memastikan penamaan yang unik dan memvalidasi kepatuhan format file untuk integrasi yang lancar dengan proses selanjutnya. | text_extraction_results_1756999697398.json |
| mimeType | String | PDF4me MIME pengidentifikasi tipe - Standarisasi MIME tipe untuk file konten yang diekstrak, biasanya application/json untuk data terstruktur atau application/zip untuk beberapa file. Ini memastikan penanganan dan pengenalan file yang tepat di semua sistem dan aplikasi. | application/json |
| Ukuran berkas | Nomor | PDF4me ukuran file dalam byte - Ukuran pasti file konten yang diekstrak dalam byte, disediakan untuk perencanaan penyimpanan, optimasi bandwidth, dan pemantauan transfer file. Penting untuk manajemen dokumen perusahaan dan otomatisasi alur kerja. | 106 |
| kesuksesan | Boolean | PDF4me indikator status ekstraksi - Bendera Boolean yang menunjukkan keberhasilan atau kegagalan proses ekstraksi teks. Mengembalikan true untuk keberhasilan ekstraksi dan false untuk setiap kesalahan, memungkinkan penanganan kesalahan yang andal dalam alur kerja otomatis. | true |
| pesan | String | PDF4me pesan status ekstraksi - Pesan deskriptif yang menunjukkan hasil proses ekstraksi teks. Memberikan pesan status yang jelas untuk ekstraksi yang berhasil dan informasi kesalahan terperinci untuk tujuan pemecahan masalah. | Text extraction by expression completed successfully |
| Nama dokumen | String | PDF4me referensi nama dokumen asli - Nama file asli dari input PDF berkas yang telah diproses. Referensi ini dipelihara untuk jejak audit, tujuan debugging, dan pelacakan sumber konten yang diekstrak dalam alur kerja perusahaan. | document.pdf |
| ekspresi | String | PDF4me menggunakan ekspresi ekstraksi - Pola atau ekspresi yang digunakan untuk ekstraksi teks. Bidang ini menunjukkan ekspresi aktual yang diterapkan selama proses ekstraksi untuk tujuan verifikasi dan debugging. | % |
| Urutan halaman | String | PDF4me rentang halaman yang diproses - Rentang halaman yang diproses selama ekstraksi teks. Bidang ini menunjukkan halaman sebenarnya yang dipindai untuk ekspresi yang ditentukan, berguna untuk verifikasi dan pemecahan masalah. | 1-2 |
N8N Tindakan dan Respons
Yang PDF4me Ekstrak Teks Berdasarkan Ekspresi API Mengembalikan respons yang dapat dilihat dalam berbagai format. Pilih tampilan yang paling sesuai dengan kebutuhan Anda:
- JSON
- Table
- Schema
- Binary
JSON Format Respons
Mentah JSON tanggapan dari API:
{
"fileName": "text_extraction_results_1756999697398.json",
"mimeType": "application/json",
"fileSize": 106,
"success": true,
"message": "Text extraction by expression completed successfully",
"docName": "document.pdf",
"expression": "%",
"pageSequence": "1-2"
}
Tampilan Tabel
Data respons dalam format tabel terstruktur:
| Parameter | Nilai |
|---|---|
| fileName | text_extraction_results_1756999697398.json |
| mimeType | application/json |
| fileSize | 106 |
| success | true |
| docName | document.pdf |
| message | Text extraction by expression completed successfully |
| expression | % |
| pageSequence | 1-2 |
Tampilan Skema
Struktur data dan tipe respons:
fileName: AB text_extraction_results_1756999697398.json
mimeType: AB application/json
fileSize: # 106
success: ✓ true
docName: AB document.pdf
message: AB Text extraction by expression completed successfully
expression: AB %
pageSequence: AB 1-2
Indikator Tipe:
AB= String#= Angka✓= Boolean
Tampilan Data Biner
Data dan metadata konten teks yang diekstrak sebenarnya:
data
─────────────────────────────────────────
File Name: text_extraction_results_1756999697398.json
File Extension: json
Mime Type: application/json
File Size: 106 bytes
Kasus Penggunaan
Penambangan Data dan Ekstraksi Informasi
- Ekstrak pola data spesifik, informasi kontak, dan data terstruktur dari PDF dokumen yang menggunakan ekspresi khusus untuk penambangan data dan kecerdasan bisnis
- Memproses dokumen hukum, kontrak, dan catatan resmi dengan mengekstrak klausul, ketentuan, dan informasi hukum tertentu menggunakan ekspresi yang ditargetkan.
- Ubah laporan keuangan, faktur, dan dokumen akuntansi dengan mengekstrak data keuangan spesifik, jumlah, dan informasi transaksi menggunakan ekspresi khusus.
Analisis dan Penelitian Konten
- Ekstrak data penelitian, kutipan, dan informasi akademis dari PDF dokumen yang menggunakan ekspresi khusus untuk penelitian akademis dan analisis konten
- Memproses makalah ilmiah, dokumen penelitian, dan publikasi teknis dengan mengekstrak data, pengukuran, dan temuan penelitian spesifik menggunakan ekspresi yang tepat sasaran.
- Ubah laporan bisnis, riset pasar, dan analisis industri dengan mengekstrak metrik, statistik, dan data bisnis spesifik menggunakan ekspresi khusus.
Kepatuhan dan Pemrosesan Regulasi
- Ekstrak data kepatuhan, informasi peraturan, dan detail audit dari PDF dokumen yang menggunakan ekspresi khusus untuk kepatuhan peraturan dan pemrosesan audit
- Memproses dokumen pengendalian mutu, laporan inspeksi, dan materi sertifikasi dengan mengekstrak data kepatuhan spesifik, standar, dan informasi peraturan.
- Ubah dokumen resmi, izin, dan pengajuan peraturan dengan mengekstrak data peraturan spesifik, metrik kepatuhan, dan informasi resmi menggunakan ekspresi khusus.