Ekstrak Teks berdasarkan Ekspresi
Ekstrak → Ekstrak Teks berdasarkan Ekspresi
Yang Ekstrak Teks berdasarkan Ekspresi API mengekstrak teks dari sebuah PDF yang sesuai dengan ekspresi reguler. Anda mengirimkan PDF sebagai Base64 (docContent), docName, expression (pola regex), pageSequence (misalnya 1-, 1-3, 1,2,3), dan opsional async. Itu API pengembalian JSON dengan semua kecocokan. Gunakan penguji di bawah ini untuk mencobanya; detail lebih lanjut dan contoh ekspresi ada di bagian selanjutnya.
Coba Ekstrak Teks berdasarkan Ekspresi API
:::catatan Referensi cepat
Titik akhir: POST /api/v2/ExtractTextByExpression · Diperlukan: api-key, docContent, docName, expression, pageSequence
:::
Gunakan formulir di bawah ini untuk mengirimkan API kunci, PDF (Base64), dan pola regex (misalnya %, \d+(pola email). Tanggapannya adalah JSON dengan semua kecocokan teks. Tidak perlu kode, isi kolom dan klik. Kirim permintaan.
Gambaran umum, parameter, dan kasus penggunaan.
- Overview
- Parameters
- Use cases
Apa itu Ekstrak Teks berdasarkan Ekspresi?
Endpoint ini mengekstrak teks dari sebuah PDF yang sesuai dengan ekspresi reguler. Anda memberikan PDF (Base64), expression (pola regex), pageSequence (misalnya 1- untuk semua halaman, 1-3 untuk rentang, 1,2,3 untuk halaman tertentu), dan opsional async. Itu API pengembalian JSON dengan semua kecocokan teks. Gunakan untuk mengambil email, angka, tanggal, URLs, atau pola apa pun dari PDFs.
Fitur utama
- Pola Regex: expression: contohnya
%,\d+Pola email, pola tanggal, mata uang. - Penargetan halaman: pageSequence:
1-(semua),1-3(jangkauan),1,2,3(halaman tertentu). - JSON tanggapan: Semua kecocokan untuk pola yang ditentukan.
- Asinkron: Menggunakan async untuk ukuran besar PDFs atau banyak pertandingan.
Gunakan saat Anda membutuhkan data spesifik (email, angka, tanggal, jumlah) dari PDFsUntuk teks atau gambar lengkap, gunakan Ekstrak Sumber Daya; untuk tabel gunakan Ekstrak Tabel dari PDF.
API parameter
| Parameter | Jenis | Diperlukan | Keterangan |
|---|---|---|---|
| api-key | rangkaian | Ya | Milikmu PDF4me API kunci, Base64 dikodekan. Dapatkan dari dasbor. |
| docContent | base64 | Ya | PDF isi berkas (Base64). |
| docName | rangkaian | Ya | PDF nama file dengan ekstensi .pdf. |
| expression | rangkaian | Ya | Pola ekspresi reguler (misalnya %, \d+, pola email). |
| pageSequence | rangkaian | Ya | Rentang halaman: 1- (semua), 1,2,3, 1-5, dst. |
| async | boolean | TIDAK | Aktifkan pemrosesan asinkron. |
Kapan menggunakan Ekstrak Teks berdasarkan Ekspresi?
- Email dan URLsEkstrak alamat email, nomor telepon, atau tautan dari PDFs.
- Angka dan jumlahEkstrak persentase, jumlah mata uang, atau ID.
- TanggalEkstrak tanggal dalam berbagai format (MM/DD/YYYY, ISO, dll.).
- Data terstrukturMengambil pola spesifik (misalnya, nomor faktur, nomor Jaminan Sosial) untuk alur kerja.
Untuk skema permintaan/respons dan contoh kode, lihat Ekstrak Teks berdasarkan Ekspresi di dalam PDF4me API dokumen.
Prasyarat
Sebelum menggunakan endpoint ini, pastikan Anda telah:
- Sebuah valid PDF4me API kunci (Dapatkan milikmu API Kunci)
- A PDF dokumen di Base64 format atau publik URL ke sebuah PDF berkas
- Pola ekspresi reguler untuk dicari
Contoh Ekspresi
- Basic Patterns
- Currency & Percentages
- Contact Information
- Dates
- Text Patterns
- Advanced
- Quick Test Examples
Pola ekspresi reguler dasar yang umum:
%- Cocokkan simbol persentase (misalnya, 50%, 100%)\d+- Cocokkan satu atau lebih angka (misalnya, 123, 4567)\d+\.\d+- Cocokkan angka desimal (misalnya, 3,14, 99,99)[A-Za-z]+- Cocokkan satu atau lebih huruf\d{4}- Cocokkan tepat 4 digit (misalnya, tahun seperti 2024)
Pola untuk mengekstrak data keuangan:
\d+%- Cocokkan persentase dengan angka (misalnya, 50%, 100%)\$[\d,]+\.?\d*- Cocokkan jumlah dalam dolar AS (misalnya, $100, $1.234,56)€[\d,]+\.?\d*- Cocokkan jumlah Euro (misalnya, €50, €1.000,00)£[\d,]+\.?\d*- Cocokkan dengan jumlah Poundsterling Inggris (misalnya, £50, £1.000,00)
Ekstrak detail kontak dari dokumen:
[a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\.[a-zA-Z]{2,}- Cocokkan alamat email (misalnya, [email protected])\+?[\d\s\-\(\)]{10,}- Mencocokkan nomor telepon (berbagai format)https?://[^\s]+- Cocok URLs (misalnya., https://example.com)
Ekstrak tanggal dalam berbagai format:
\d{1,2}/\d{1,2}/\d{2,4}- Tanggal pertandingan seperti 25/12/2024 atau 05/01/2024\d{4}-\d{2}-\d{2}- Cocokkan tanggal ISO (misalnya, 2024-12-25)[A-Z]{2,3}\s+\d{1,2}\s+\d{4}- Cocokkan tanggal seperti "25 Desember 2024"
Ekstrak pola teks tertentu:
PDF|pdf- Cocokkan kata "PDF"(pola tidak peka huruf besar/kecil)"Chapter\s+\d+- Cocokkan "Bab" diikuti dengan angka (misalnya, Bab 1)[A-Z][a-z]+\s+[A-Z][a-z]+- Cocokkan nama yang diawali dengan huruf kapital (misalnya, John Doe)
Pola kompleks untuk kasus penggunaan spesifik:
\b\d{3}-\d{2}-\d{4}\b- Cocokkan format SSN (misalnya, 123-45-6789)\b\d{4}\s\d{4}\s\d{4}\s\d{4}\b- Cocokkan nomor kartu kredit (16 digit termasuk spasi)[A-Z]{2}\d{2}\s?\d{4}\s?\d{4}\s?\d{4}\s?\d{4}\s?\d{4}\s?\d{4}- Cocok IBAN format
Ekspresi yang direkomendasikan untuk diuji dengan Anda sample (2).pdf berkas:
%- Temukan semua simbol persentase (mulai dari yang sederhana)\d+- Ekstrak semua angka dalam dokumen[a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\.[a-zA-Z]{2,}- Ekstrak alamat emailhttps?://[^\s]+- Ekstrak tautan web\d{1,2}/\d{1,2}/\d{2,4}- Ekstrak tanggal\$[\d,]+\.?\d*- Ekstrak jumlah dolar
Contoh Urutan Halaman:
1-- Semua halaman dari halaman 1 hingga akhir1-3- Halaman 1, 2, dan 31,2,3- Halaman khusus 1, 2, dan 3all- Semua halaman (jika didukung)
Format Respons
Yang API mengembalikan JSON Respons yang berisi semua kecocokan teks yang ditemukan untuk pola ekspresi reguler yang ditentukan.