Ekstrak Sumber Daya - Ekstraktor Teks & Gambar API
PDF4me Ekstrak Sumber Daya memungkinkan Anda mengekstrak konten teks dan gambar yang disematkan dari PDF dokumen. Ini API proses layanan PDF mengambil file dan mengekstrak sumber daya teks dan gambar darinya. PDF dokumen. Itu API menerima PDF konten melalui REST API panggilan, memanfaatkan Base64 Pengkodean untuk transmisi yang aman. Dengan dukungan untuk ekstraksi teks dan gambar secara selektif, solusi ini ideal untuk alur kerja pemrosesan konten dan platform ekstraksi data.
Memverifikasi Identitas Anda API Meminta
Untuk mengakses PDF4me REST APISetiap permintaan harus menyertakan kredensial otentikasi yang tepat. Otentikasi memastikan komunikasi yang aman dan memvalidasi identitas Anda sebagai pengguna yang berwenang. REST API.
Fitur Utama
- Ekstraksi TeksEkstrak semua konten teks dari PDF dokumen
- Ekstraksi Gambar: Mengambil semua gambar dan elemen visual dari PDF dokumen
- Ekstraksi SelektifPilih untuk mengekstrak teks saja, gambar saja, atau keduanya sesuai kebutuhan Anda.
- Base64 Pengkodean: Transmisi konten file yang aman menggunakan Base64 pengkodean
- Sederhana API Integrasi: RESTful API dirancang untuk alur kerja ekstraksi konten otomatis
REST API Titik akhir
Yang PDF4me REST API menggunakan standar HTTP Metode untuk berinteraksi dengan sumber daya. Semua operasi ekstraksi sumber daya dilakukan melalui satu titik akhir:
- Metode: POST
- Titik akhir:
/api/v2/ExtractResources
REST API Parameter
Daftar lengkap parameter untuk Ekstraksi Sumber Daya REST APIParameter-parameter tersebut diorganisir berdasarkan kategori untuk pemahaman dan implementasi yang lebih baik.
Penting: Parameter yang ditandai dengan tanda bintang (*) wajib diisi dan harus diberikan agar dapat digunakan. API agar berfungsi dengan benar.
Parameter yang Diperlukan
| Parameter | Jenis | Keterangan | Contoh |
|---|---|---|---|
| docContent* | Base64 (String) | Isi dari input PDF berkas yang dikodekan dalam Base64 format untuk ekstraksi sumber daya dan pemrosesan analisis konten | JVBERi... |
| docName* | String | Sumber PDF Nama file dengan ekstensi .pdf yang tepat untuk identifikasi dokumen dan pemrosesan ekstraksi sumber daya. | sample.pdf |
| extractText* | Boolean | Pilih apakah akan mengekstrak konten teks dari PDF: BENAREkstrak seluruh konten teks beserta formatnya. PALSULewati ekstraksi teks dan hanya pemrosesan gambar. | true |
| extractImages* | Boolean | Pilih apakah akan mengekstrak gambar dari PDF: BENAREkstrak gambar dan elemen visual, PALSULewati ekstraksi gambar untuk pemrosesan teks saja yang lebih cepat. | true |
Parameter Opsional
| Parameter | Jenis | Keterangan | Contoh |
|---|---|---|---|
| async | Boolean | Aktifkan pemrosesan asinkron. Saat true, itu API pengembalian 202 Accepted dengan Location header untuk mengambil hasil polling | true |
Keluaran
Yang PDF4me Ekstrak Sumber Daya REST API Mengembalikan respons yang berbeda berdasarkan mode pemrosesan. API mengembalikan teks dan gambar yang diekstrak sebagai JSON tanggapan.
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
Pemrosesan Sinkron (Default)
Kapan async adalah false atau tidak disediakan, maka API Mengembalikan sumber daya yang diekstrak secara langsung.
Kode Status: 200 OK
Format Tanggapan:
{
"textList": ["extracted text content...", "more text..."],
"imageList": [
{
"fileName": "image1.png",
"imageContent": "base64-encoded-image-content..."
},
{
"fileName": "image2.jpg",
"imageContent": "base64-encoded-image-content..."
}
]
}
Respons tersebut berisi teks yang diekstrak sebagai larik string dan gambar yang diekstrak sebagai larik objek dengan nama file dan Base64-konten yang dikodekan.
Pemrosesan Asinkron
Kapan async adalah true, itu API memproses dokumen secara asinkron.
Tanggapan Awal:
Kode Status: 202 Accepted
Header Respons:
Location: https://api.pdf4me.com/api/v2/ExtractResourcesStatus/{operationId}
Isi Tanggapan:
{
"traceId": "operation-trace-id"
}
Jajak Pendapat untuk Mendapatkan Hasil:
Gunakan Location judul URL untuk melakukan jajak pendapat guna memastikan kelengkapannya:
const response = await fetch(locationUrl, {
headers: { 'Authorization': 'Basic ' + apiKey }
});
// Continue polling until status code is 200
if (response.status === 200) {
const result = await response.json();
// Process extracted resources
}
Respons Kesalahan
| Kode Status | Keterangan | Contoh Jawaban |
|---|---|---|
| 400 Bad Request | Parameter permintaan tidak valid atau kolom wajib hilang. | {"error": "Missing required parameter: docContent"} |
| 401 Unauthorized | Tidak valid atau hilang API kunci | {"error": "Unauthorized"} |
| 408 Permintaan Habis Waktu | Batas waktu pemrosesan permintaan | {"error": "Request timeout"} |
| 500 Internal Server Error | Terjadi kesalahan server selama pemrosesan. | {"error": "Internal server error"} |
Memahami JSON Tanggapan
Respons ekstraksi sumber daya adalah JSON objek yang berisi:
- Daftar teks: Array dari string yang berisi konten teks yang diekstrak (jika
extractTextadalahtrue) - Daftar gambar: Array dari objek gambar (jika
extractImagesadalahtrue) - nama file: Nama file gambar yang diekstrak
- Konten gambar: Base64-konten gambar yang dikodekan
Mendekode Base64 Konten Gambar:
Untuk mendekode dan menyimpan Base64-gambar yang dikodekan:
// JavaScript
const decoded = atob(base64String);
const blob = new Blob([decoded], { type: 'image/png' });
const url = URL.createObjectURL(blob);
# Python
import base64
image_data = base64.b64decode(base64_string)
with open('extracted_image.png', 'wb') as f:
f.write(image_data)
Contoh Permintaan
Judul
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
Catatan:
- Dapatkan milikmu API kunci dari PDF4me Dasbor
- Yang API kunci harus Base64 dikodekan dan diawali dengan "Basic" di dalam Authorization judul
- Contoh: Jika Anda API kuncinya adalah
abc123, mengkodekannya menjadi Base64 dan menggunakanAuthorization: Basic YWJjMTIz
Muatan
Permintaan Dasar:
{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "sample.pdf",
"extractText": true,
"extractImages": true
}
Dengan Pemrosesan Asinkron:
{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "sample.pdf",
"extractText": true,
"extractImages": true,
"async": true
}
Contoh Kode
Yang PDF4me Ekstrak Sumber Daya REST API Menyediakan contoh kode dalam berbagai bahasa pemrograman. Pilih bahasa yang paling sesuai dengan lingkungan pengembangan Anda:
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
C# (CSharp) Contoh
Menyelesaikan C# implementasi untuk mengekstrak sumber daya dari PDF:
Java Contoh
Java Implementasi dengan penanganan kesalahan dan pemrosesan respons yang lengkap:
JavaScript Contoh
Node.js dan kompatibel dengan browser JavaScript implementasi:
Google Apps Script Contoh
Google Apps Script implementasi untuk Google Workspace integrasi:
Fitur Ekstraksi Gambar
- Gambar berkualitas tinggiEkstrak gambar dengan resolusi dan kualitas asli.
- Berbagai Format: Dukungan untuk berbagai format gambar (JPG, PNG, GIF, dll.)
- Grafik VektorEkstrak grafik vektor dan bagan yang dapat diskalakan.
- Pelestarian Metadata: Memelihara properti dan metadata gambar
Pemrosesan Lanjutan
- Ekstraksi SelektifPilih antara ekstraksi teks saja, gambar saja, atau kombinasi keduanya.
- Pemrosesan Batch: Proses beberapa PDFs dan mengekstraksi sumber daya secara efisien.
- Analisis KontenMenganalisis dan mengkategorikan jenis konten yang diekstrak.
- Hasil ProfesionalEkstraksi berkualitas tinggi yang cocok untuk aplikasi perusahaan.
Studi Kasus & Aplikasi Industri
- Document Management & Processing
- Business & Finance
- Legal & Compliance
- Healthcare & Medical
- Education & Research
- Marketing & Content
Studi Kasus Manajemen & Pemrosesan Dokumen
- Digitalisasi KontenEkstrak teks dan gambar dari dokumen yang dipindai untuk arsip digital.
- Analisis DokumenAnalisis PDF konten untuk ekstraksi dan pengolahan informasi
- Migrasi DataEkstraksi konten selama migrasi dokumen dan pembaruan sistem.
- Pengindeksan Konten: Buat indeks yang dapat dicari dari PDF konten teks dan gambar
Studi Kasus Bisnis & Keuangan
- Pemrosesan FakturEkstrak teks dan gambar dari faktur untuk pemrosesan otomatis.
- Analisis LaporanEkstrak data dan grafik dari laporan dan pernyataan keuangan.
- Manajemen KontrakEkstrak teks dan elemen visual dari kontrak dan perjanjian.
- Dokumentasi Kepatuhan: Memproses dokumen peraturan dan mengekstrak informasi yang dibutuhkan
Studi Kasus Hukum & Kepatuhan
- Pemrosesan Dokumen Hukum: Mengekstrak teks dan bukti dari dokumen hukum
- Manajemen KasusEkstrak konten dari berkas kasus dan ringkasan hukum.
- Kepatuhan Regulasi: Memproses dokumen kepatuhan dan mengekstrak data yang dibutuhkan
- Pengumpulan BuktiEkstrak teks dan gambar untuk bukti dan dokumentasi hukum.
Kasus Penggunaan di Bidang Kesehatan & Medis
- Rekam medisEkstrak teks dan gambar dari rekam medis pasien dan laporan medis.
- Data Penelitian: Memproses dokumen penelitian dan mengekstrak data serta grafik
- Uji KlinisEkstrak informasi dari dokumen studi klinis.
- Pencitraan MedisEkstrak gambar medis dan konten diagnostik dari PDFs
Studi Kasus Pendidikan & Penelitian
- Makalah AkademikEkstrak teks dan gambar dari makalah dan publikasi penelitian.
- Konten Pendidikan: Memproses buku teks dan materi pendidikan
- Data PenelitianEkstrak data dan grafik dari dokumen penelitian.
- Digitalisasi Perpustakaan: Mendigitalkan koleksi perpustakaan dan mengekstrak konten yang dapat dicari
Studi Kasus Pemasaran & Konten
- Pembuatan KontenEkstrak teks dan gambar untuk pemasaran konten dan media sosial.
- Aset MerekEkstrak logo dan elemen merek dari PDF dokumen
- Sumber Daya DesainEkstrak elemen desain dan grafis untuk proyek kreatif.
- Penggunaan Kembali KontenEkstrak konten untuk digunakan kembali dalam berbagai format dan platform.