Ekstrak Teks berdasarkan Ekspresi - Pencarian RegEx API
PDF4me Ekstrak Teks berdasarkan Ekspresi memungkinkan Anda untuk mengekstrak teks tertentu dari PDF dokumen yang menggunakan ekspresi reguler. Ini API proses layanan PDF file dan mengekstrak teks yang cocok dengan pola/ekspresi tertentu dari PDF dokumen. Itu API menerima PDF konten dan pola ekspresi reguler melalui REST API panggilan, memanfaatkan Base64 Pengkodean untuk transmisi yang aman. Dengan dukungan untuk ekspresi reguler yang kompleks dan penargetan halaman yang fleksibel, solusi ini ideal untuk alur kerja pemrosesan dokumen dan ekstraksi data.
Memverifikasi Identitas Anda API Meminta
Untuk mengakses PDF4me REST APISetiap permintaan harus menyertakan kredensial otentikasi yang tepat. Otentikasi memastikan komunikasi yang aman dan memvalidasi identitas Anda sebagai pengguna yang berwenang. REST API.
Fitur Utama
- Dukungan Ekspresi RegulerEkstrak teks menggunakan pola regex untuk pencocokan teks yang tepat.
- Penargetan Halaman yang Fleksibel: Memproses halaman tertentu atau seluruh dokumen dengan urutan halaman khusus
- Pencocokan PolaDukungan untuk ekspresi reguler kompleks dan pengenalan pola.
- Base64 Pengkodean: Transmisi konten file yang aman menggunakan Base64 pengkodean
- Sederhana API Integrasi: RESTful API dirancang untuk alur kerja ekstraksi teks otomatis
REST API Titik akhir
Yang PDF4me REST API menggunakan standar HTTP Metode untuk berinteraksi dengan sumber daya. Semua operasi ekstraksi teks berdasarkan ekspresi dilakukan melalui satu titik akhir:
- Metode: POST
- Titik akhir:
/api/v2/ExtractTextByExpression
REST API Parameter
Daftar lengkap parameter untuk Ekstrak Teks berdasarkan Ekspresi REST APIParameter-parameter tersebut diorganisir berdasarkan kategori untuk pemahaman dan implementasi yang lebih baik.
Penting: Parameter yang ditandai dengan tanda bintang (*) wajib diisi dan harus diberikan agar dapat digunakan. API agar berfungsi dengan benar.
Parameter yang Diperlukan
| Parameter | Jenis | Keterangan | Contoh |
|---|---|---|---|
| docContent* | Base64 (String) | Isi dari input PDF berkas di Base64 format | JVBERi... |
| docName* | String | Sumber PDF nama file dengan ekstensi file yang tepat | output.pdf |
| expression* | String | Pola ekspresi reguler untuk ekstraksi teks. Mendukung sintaks regex standar termasuk grup, kuantifikasi, dan jangkar. | % atau [A-Za-z]+ |
| pageSequence* | String | Tentukan halaman mana yang akan diproses. Gunakan "1-" untuk semua halaman, "1-3" untuk rentang halaman, atau "1,2,3" untuk halaman tertentu. | 1-3 |
Parameter Opsional
| Parameter | Jenis | Keterangan | Contoh |
|---|---|---|---|
| async | Boolean | Aktifkan pemrosesan asinkron. Saat true, itu API pengembalian 202 Accepted dengan Location header untuk mengambil hasil polling | true |
Keluaran
Yang PDF4me Ekstrak Teks berdasarkan Ekspresi REST API Mengembalikan respons yang berbeda berdasarkan mode pemrosesan. API mengembalikan kecocokan teks yang diekstrak sebagai JSON tanggapan.
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
Pemrosesan Sinkron (Default)
Kapan async adalah false atau tidak disediakan, maka API Mengembalikan kecocokan teks yang diekstrak secara langsung.
Kode Status: 200 OK
Format Tanggapan:
{
"textList": ["extracted text 1", "extracted text 2", "extracted text 3"]
}
Respons tersebut berisi larik string teks yang cocok dengan pola ekspresi reguler yang ditentukan.
Pemrosesan Asinkron
Kapan async adalah true, itu API memproses dokumen secara asinkron.
Tanggapan Awal:
Kode Status: 202 Accepted
Header Respons:
Location: https://api.pdf4me.com/api/v2/ExtractTextByExpressionStatus/{operationId}
Isi Tanggapan:
{
"traceId": "operation-trace-id"
}
Jajak Pendapat untuk Mendapatkan Hasil:
Gunakan Location judul URL untuk melakukan jajak pendapat guna memastikan kelengkapannya:
const response = await fetch(locationUrl, {
headers: { 'Authorization': 'Basic ' + apiKey }
});
// Continue polling until status code is 200
if (response.status === 200) {
const result = await response.json();
// Process extracted text matches
}
Respons Kesalahan
| Kode Status | Keterangan | Contoh Jawaban |
|---|---|---|
| 400 Bad Request | Parameter permintaan tidak valid, kolom wajib hilang, atau pola regex tidak valid. | {"error": "Missing required parameter: expression"} |
| 401 Unauthorized | Tidak valid atau hilang API kunci | {"error": "Unauthorized"} |
| 408 Permintaan Habis Waktu | Batas waktu pemrosesan permintaan | {"error": "Request timeout"} |
| 500 Internal Server Error | Terjadi kesalahan server selama pemrosesan. | {"error": "Internal server error"} |
Memahami JSON Tanggapan
Respons ekstraksi teks adalah JSON objek yang berisi:
- Daftar teks: Array berupa string yang berisi semua kecocokan teks yang sesuai dengan pola ekspresi reguler yang ditentukan.
Format Urutan Halaman:
"1-": Proses semua halaman dari halaman 1 hingga halaman terakhir"1-3": Proses halaman 1, 2, dan 3"1,2,3": Proses khusus halaman 1, 2, dan 3
Contoh Ekspresi:
"%": Cocokkan simbol persentase"\\d+"Cocokkan satu atau lebih angka"[a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\\.[a-zA-Z]{2,}"Cocokkan alamat email"https?://[^\\s]+": Cocokkan URL
Contoh Permintaan
Judul
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
Catatan:
- Dapatkan milikmu API kunci dari PDF4me Dasbor
- Yang API kunci harus Base64 dikodekan dan diawali dengan "Basic" di dalam Authorization judul
- Contoh: Jika Anda API kuncinya adalah
abc123, mengkodekannya menjadi Base64 dan menggunakanAuthorization: Basic YWJjMTIz
Muatan
Permintaan Dasar:
{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output.pdf",
"expression": "%",
"pageSequence": "1-3"
}
Dengan Pemrosesan Asinkron:
{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output.pdf",
"expression": "\\d+",
"pageSequence": "1-3",
"async": true
}
Contoh Kode
Yang PDF4me Ekstrak Teks berdasarkan Ekspresi REST API Menyediakan contoh kode dalam berbagai bahasa pemrograman. Pilih bahasa yang paling sesuai dengan lingkungan pengembangan Anda:
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
C# (CSharp) Contoh
Menyelesaikan C# implementasi untuk mengekstrak teks berdasarkan ekspresi dari PDF:
Java Contoh
Java Implementasi dengan penanganan kesalahan dan pemrosesan respons yang lengkap:
JavaScript Contoh
Node.js dan kompatibel dengan browser JavaScript implementasi:
Google Apps Script Contoh
Google Apps Script implementasi untuk Google Workspace integrasi:
Fitur Ekstraksi Teks
Pemrosesan Ekspresi Reguler
- Pencocokan PolaDukungan penuh untuk sintaks dan pola ekspresi reguler standar.
- Pola KompleksDukungan untuk fitur regex tingkat lanjut termasuk grup, kuantifikasi, dan jangkar.
- Ekspresi KustomPembuatan pola yang fleksibel untuk kebutuhan ekstraksi teks tertentu.
- Validasi Pola: Validasi bawaan untuk sintaks dan kompatibilitas pola regex
- Hasil ProfesionalEkstraksi teks yang andal dengan pencocokan pola yang akurat.
Pemrosesan Halaman
- Penargetan HalamanEkstrak teks dari halaman tertentu atau seluruh dokumen.
- Urutan HalamanDukungan untuk rentang halaman khusus dan pemilihan halaman individual.
- Pemrosesan Fleksibel: Memproses kombinasi halaman apa pun dengan kontrol yang tepat
- Pemrosesan Batch: Menangani banyak halaman secara efisien dalam satu tempat API panggilan
- Tata Letak ProfesionalEkstraksi teks yang konsisten di semua halaman target.
Fitur Lanjutan
- Analisis TeksAnalisis dan identifikasi pola teks yang komprehensif.
- Penyaringan KustomOpsi penyaringan lanjutan untuk kebutuhan ekstraksi teks tertentu.
- Ekstraksi ProfesionalEkstraksi teks berkualitas tinggi dengan visibilitas yang jelas.
- Pola Fleksibel: Mendukung semua pola ekspresi reguler dan persyaratan pencocokan teks
Studi Kasus & Aplikasi Industri
- Legal & Professional Services
- Finance & Banking
- Business & Enterprise
- Education & Research
- Government & Compliance
Studi Kasus Layanan Hukum & Profesional
- Analisis DokumenEkstrak pola data spesifik dari kontrak, faktur, dan dokumen hukum.
- Analisis KontrakEkstrak istilah kunci dan pola data dari kontrak hukum.
- Pemantauan KepatuhanEkstrak informasi peraturan dan data kepatuhan dari dokumen.
- Ekstraksi Data HukumEkstrak pola data spesifik dari dokumen hukum.
Studi Kasus Keuangan & Perbankan
- Pemrosesan FakturEkstrak data faktur dan nilai kolom menggunakan pencocokan pola.
- Laporan KeuanganEkstrak metrik dan titik data spesifik dari PDF laporan
- Pemantauan KepatuhanEkstrak informasi peraturan dan data kepatuhan dari dokumen.
- Penambangan Data KeuanganEkstrak data terstruktur dari dokumen keuangan.
Kasus Penggunaan Bisnis & Perusahaan
- Penambangan Data: Mengidentifikasi dan mengekstrak data terstruktur dari data tidak terstruktur PDF dokumen
- Pemrosesan KontenEkstrak pola teks spesifik untuk manajemen dan analisis konten.
- Pemrosesan FormulirEkstrak data formulir dan nilai kolom menggunakan pencocokan pola.
- Intelijen BisnisEkstrak metrik bisnis utama dan indikator kinerja dari PDF laporan
Studi Kasus Pendidikan & Penelitian
- Aplikasi PenelitianEkstrak pola data spesifik dari makalah penelitian dan dokumen akademis.
- Ekstraksi Data AkademikEkstrak data terstruktur dari makalah penelitian.
- Analisis PenelitianEkstrak metrik spesifik dari dokumen akademis.
- Pengolahan Konten PendidikanEkstrak pola teks dari dokumen pendidikan.
Studi Kasus Pemerintahan & Kepatuhan
- Pemantauan KepatuhanEkstrak informasi peraturan dan data kepatuhan dari dokumen.
- Ekstraksi Data RegulasiEkstrak data terstruktur dari dokumen peraturan.
- Laporan PemerintahEkstrak metrik spesifik dari laporan pemerintah.
- Catatan PublikEkstraksi pola data dari catatan dan dokumen publik.