Ekstrak Teks dari Word - Pengurai Konten API
PDF4me Ekstrak Teks dari Word Memungkinkan Anda mengekstrak konten teks dari dokumen Word dengan opsi rentang halaman dan pemfilteran konten. Ini API Layanan ini memproses file Word dan mengekstrak konten teks dari dokumen Word dengan opsi yang dapat disesuaikan. API menerima konten dokumen Word melalui REST API panggilan, memanfaatkan Base64 Pengkodean untuk transmisi yang aman. Dengan dukungan untuk pemilihan rentang halaman, penghapusan komentar, pemfilteran header/footer, dan penerimaan perubahan, solusi ini ideal untuk alur kerja pemrosesan dokumen dan analisis konten.
Memverifikasi Identitas Anda API Meminta
Untuk mengakses PDF4me REST APISetiap permintaan harus menyertakan kredensial otentikasi yang tepat. Otentikasi memastikan komunikasi yang aman dan memvalidasi identitas Anda sebagai pengguna yang berwenang. REST API.
Fitur Utama
- Dukungan Dokumen WordEkstrak teks dari dokumen Microsoft Word (.doc, .docx)
- Pemilihan Rentang Halaman: Memproses rentang halaman tertentu atau seluruh dokumen dengan nomor halaman awal dan akhir yang disesuaikan
- Penyaringan KontenHapus komentar, header, footer, dan lacak perubahan untuk ekstraksi teks yang bersih.
- Base64 Pengkodean: Transmisi konten file yang aman menggunakan Base64 pengkodean
- Sederhana API Integrasi: RESTful API dirancang untuk alur kerja pemrosesan dokumen Word otomatis
REST API Titik akhir
Yang PDF4me REST API menggunakan standar HTTP Metode untuk berinteraksi dengan sumber daya. Semua operasi ekstraksi teks Word dilakukan melalui satu titik akhir:
- Metode: POST
- Titik akhir:
/api/v2/ExtractTextFromWord
REST API Parameter
Daftar lengkap parameter untuk Ekstrak Teks dari Word REST APIParameter-parameter tersebut diorganisir berdasarkan kategori untuk pemahaman dan implementasi yang lebih baik.
Penting: Parameter yang ditandai dengan tanda bintang (*) wajib diisi dan harus diberikan agar dapat digunakan. API agar berfungsi dengan benar.
Parameter yang Diperlukan
| Parameter | Jenis | Keterangan | Contoh |
|---|---|---|---|
| docName* | String | Nama file dokumen Word sumber (tanpa ekstensi atau dengan ekstensi .docx/.doc) | output |
| docContent* | Base64 (String) | Isi dokumen Word masukan di Base64 format | JVBERi... |
| StartPageNumber* | Integer | Nomor halaman awal untuk ekstraksi teks | 1 |
| EndPageNumber* | Integer | Nomor halaman akhir untuk ekstraksi teks | 3 |
| RemoveComments* | Boolean | Pilih apakah akan menghapus komentar dari teks yang diekstrak: BENARHapus komentar, PALSUSertakan komentar | true |
| RemoveHeaderFooter* | Boolean | Pilih apakah akan menghapus header dan footer: BENARHapus header/footer, PALSUSertakan header/footer | true |
| AcceptChanges* | Boolean | Pilih apakah akan menerima perubahan yang dilacak: BENARTerima perubahan, PALSUTolak perubahan | true |
Parameter Opsional
| Parameter | Jenis | Keterangan | Contoh |
|---|---|---|---|
| async | Boolean | Aktifkan pemrosesan asinkron. Saat true, itu API pengembalian 202 Accepted dengan Location header untuk mengambil hasil polling | false |
Keluaran
Yang PDF4me Ekstrak Teks dari Word REST API Mengembalikan respons yang berbeda berdasarkan mode pemrosesan. API mengembalikan teks yang diekstrak sebagai JSON tanggapan atau berkas teks.
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
Pemrosesan Sinkron (Default)
Kapan async adalah false atau tidak disediakan, maka API Mengembalikan teks yang diekstrak secara langsung.
Kode Status: 200 OK
Format Tanggapan:
{
"extractedText": "Extracted text content from Word document pages 1 to 3...",
"fileName": "output.txt"
}
Atau sebagai file teks:
Extracted text content from Word document pages 1 to 3...
Respons tersebut berisi konten teks yang diekstrak dari rentang halaman yang ditentukan.
Pemrosesan Asinkron
Kapan async adalah true, itu API memproses dokumen secara asinkron.
Tanggapan Awal:
Kode Status: 202 Accepted
Header Respons:
Location: https://api.pdf4me.com/api/v2/ExtractTextFromWordStatus/{operationId}
Isi Tanggapan:
{
"traceId": "operation-trace-id"
}
Jajak Pendapat untuk Mendapatkan Hasil:
Gunakan Location judul URL untuk melakukan jajak pendapat guna memastikan kelengkapannya:
const response = await fetch(locationUrl, {
headers: { 'Authorization': 'Basic ' + apiKey }
});
// Continue polling until status code is 200
if (response.status === 200) {
const result = await response.json();
// Process extracted text
}
Respons Kesalahan
| Kode Status | Keterangan | Contoh Jawaban |
|---|---|---|
| 400 Bad Request | Parameter permintaan tidak valid atau kolom wajib hilang. | {"error": "Missing required parameter: docContent"} |
| 401 Unauthorized | Tidak valid atau hilang API kunci | {"error": "Unauthorized"} |
| 408 Permintaan Habis Waktu | Batas waktu pemrosesan permintaan | {"error": "Request timeout"} |
| 500 Internal Server Error | Terjadi kesalahan server selama pemrosesan. | {"error": "Internal server error"} |
Memahami Respons
Respons hasil ekstraksi teks dapat berupa dua format:
- JSON Format: Berisi
extractedText(tali) danfileName(rangkaian) - Format Teks: Berkas teks biasa berisi konten yang diekstrak
Detail Parameter:
- StartPageNumber Dan EndPageNumber: Tentukan rentang halaman (pengindeksan berbasis 1)
- RemoveComments: Kapan
trueMenghapus semua komentar dari dokumen Word sebelum ekstraksi. - RemoveHeaderFooter: Kapan
true, menghapus header dan footer dari setiap halaman sebelum ekstraksi - AcceptChanges: Kapan
true, menerima semua perubahan yang dilacak dalam dokumen Word sebelum ekstraksi
Format Word yang Didukung:
.docx(Word 2007 dan versi yang lebih baru).doc(Word 97-2003)
Contoh Permintaan
Judul
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
Catatan:
- Dapatkan milikmu API kunci dari PDF4me Dasbor
- Yang API kunci harus Base64 dikodekan dan diawali dengan "Basic" di dalam Authorization judul
- Contoh: Jika Anda API kuncinya adalah
abc123, mengkodekannya menjadi Base64 dan menggunakanAuthorization: Basic YWJjMTIz
Muatan
Permintaan Dasar:
{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output",
"StartPageNumber": 1,
"EndPageNumber": 3,
"RemoveComments": true,
"RemoveHeaderFooter": true,
"AcceptChanges": true
}
Dengan Pemrosesan Asinkron:
{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output",
"StartPageNumber": 1,
"EndPageNumber": 3,
"RemoveComments": true,
"RemoveHeaderFooter": true,
"AcceptChanges": true,
"async": true
}
Contoh Kode
Yang PDF4me Ekstrak Teks dari Word REST API Menyediakan contoh kode dalam berbagai bahasa pemrograman. Pilih bahasa yang paling sesuai dengan lingkungan pengembangan Anda:
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
C# (CSharp) Contoh
Menyelesaikan C# Implementasi untuk mengekstrak teks dari dokumen Word:
Java Contoh
Java Implementasi dengan penanganan kesalahan dan pemrosesan respons yang lengkap:
JavaScript Contoh
Node.js dan kompatibel dengan browser JavaScript implementasi:
Google Apps Script Contoh
Google Apps Script implementasi untuk Google Workspace integrasi:
Fitur Ekstraksi Teks Kata
Pemrosesan Dokumen
- Dukungan Format WordDukungan penuh untuk format dokumen Microsoft Word .doc dan .docx
- Pelestarian FormatMempertahankan format dan struktur teks selama ekstraksi.
- Dokumen KompleksMenangani dokumen Word kompleks yang berisi tabel, gambar, dan konten tersemat.
- Pemrosesan ProfesionalEkstraksi teks berkualitas tinggi dengan pelestarian konten yang akurat.
- Input FleksibelDukungan untuk berbagai versi dan format dokumen Word.
Pemrosesan Halaman
- Pemilihan Rentang HalamanEkstrak teks dari rentang halaman tertentu dengan nomor halaman awal dan akhir.
- Penargetan Fleksibel: Memproses halaman individual, rentang halaman, atau seluruh dokumen
- Pemrosesan Khusus: Dukungan untuk kombinasi halaman apa pun dengan kontrol yang tepat
- Pemrosesan Batch: Menangani banyak halaman secara efisien dalam satu tempat API panggilan
- Tata Letak ProfesionalEkstraksi teks yang konsisten di semua halaman target.
Penyaringan Konten
- Penghapusan KomentarOpsi untuk mengecualikan komentar dan anotasi dari teks yang diekstrak.
- Penyaringan Header/FooterHapus header dan footer untuk ekstraksi konten yang bersih.
- Pelacakan Perubahan: Terima atau tolak perubahan yang dilacak selama ekstraksi teks
- Pembersihan KontenOpsi penyaringan lanjutan untuk kebutuhan ekstraksi teks tertentu.
- Hasil ProfesionalOutput teks yang bersih dan terformat dengan pelestarian konten yang akurat.
Studi Kasus & Aplikasi Industri
- Business & Enterprise
- Legal & Professional Services
- Education & Research
- Government & Compliance
- Technology & Development
Kasus Penggunaan Bisnis & Perusahaan
- Analisis DokumenEkstrak konten teks dari dokumen Word untuk analisis dan pemrosesan.
- Manajemen KontenEkstrak teks dari dokumen Word untuk sistem manajemen konten.
- Pemrosesan LaporanEkstrak teks dari laporan Word untuk pemrosesan dan analisis otomatis.
- Intelijen BisnisEkstrak teks dari dokumen bisnis Word untuk analisis data.
Studi Kasus Layanan Hukum & Profesional
- Pemrosesan Dokumen HukumEkstrak teks dari dokumen Word hukum untuk manajemen kasus.
- Analisis KontrakEkstrak teks dari kontrak dan dokumen hukum.
- Manajemen KasusEkstrak teks dari dokumen hukum untuk sistem manajemen kasus.
- Penelitian HukumEkstrak teks dari dokumen hukum untuk keperluan penelitian dan analisis.
Studi Kasus Pendidikan & Penelitian
- Penelitian AkademikEkstrak teks dari dokumen Word akademis untuk keperluan penelitian dan analisis.
- Dokumen PenelitianEkstrak teks dari makalah penelitian dan dokumen akademik.
- Konten PendidikanEkstrak teks dari dokumen Word pendidikan.
- Analisis AkademikEkstrak teks dari dokumen akademis untuk dianalisis.
Studi Kasus Pemerintahan & Kepatuhan
- Pemantauan KepatuhanEkstrak teks dari dokumen kepatuhan Word untuk keperluan pemantauan dan audit.
- Dokumentasi RegulasiEkstrak teks dari dokumen Word peraturan.
- Laporan PemerintahEkstrak teks dari dokumen Word pemerintah.
- Catatan PublikEkstrak teks dari dokumen Word catatan publik.
Studi Kasus Teknologi & Pengembangan
- Migrasi DataKonversi konten dokumen Word ke format lain untuk migrasi data.
- Pemrosesan KontenEkstrak teks dari dokumen Word untuk integrasi sistem.
- API IntegrasiEkstrak teks dari dokumen Word untuk API pemrosesan
- Ekstraksi DataEkstrak teks dari dokumen Word untuk pemrosesan data.