Ekstrak Teks Dari Word di n8n
Ekstrak Teks dari Word adalah sebuah n8n simpul oleh PDF4me Alat ini mengekstrak konten teks bersih dari file .docx, dengan opsi untuk menghapus komentar, header, footer, dan menyelesaikan perubahan yang dilacak sebelum ekstraksi. Gunakan alat ini untuk migrasi konten, penambangan teks, atau memasukkan teks dokumen ke dalam analisis selanjutnya tanpa perlu menyalin dan menempel secara manual.
Fungsi node ini
PDF4meEkstrak Teks dari Word Membaca file .docx dan mengembalikan konten teksnya, secara opsional dibatasi pada rentang halaman dan dibersihkan dari komentar, header/footer, atau perubahan yang dilacak yang belum terselesaikan. Menerima input melalui Data Biner. Base64 Tali, atau URLIdeal untuk migrasi konten, pembersihan editorial, pengindeksan pencarian, dan memasukkan teks dokumen ke dalam pipeline penambangan teks atau analisis.
Memverifikasi Identitas Anda API Meminta
Setiap PDF4me simpul di n8n memerlukan validitas Kredensial untuk terhubung denganBuat atau pilih salah satu yang sesuai dengan kebutuhan Anda. PDF4me API kunci agar alur kerja dapat mengautentikasi permintaan ekstraksi dengan aman.
Fakta Penting yang Tidak Boleh Anda Lewatkan

PDF4me Ekstrak Teks Dari panel parameter node Word di n8n
Parameter apa saja yang dibutuhkan untuk mengekstrak teks dari Word?
Diperlukan: Masukkan Tipe Data dan Nama Dokumen, ditambah kolom yang sesuai dengan tipe input yang Anda pilih (Kolom Biner Input, Base64 Konten Word, atau URL Word). Nomor Halaman Awal, Nomor Halaman Akhir, Nama Bidang Biner Keluaran, dan ketiga tombol pengaktifan Opsi Ekstraksi semuanya bersifat opsional.
| Parameter | Diperlukan | Apa fungsinya? | Contoh |
|---|---|---|---|
| Input Data Type | Required | Format of the source Word document. Choose Binary Data (from a previous node), Base64 String, or URL. | Binary Data |
| Input Binary Field | Conditional | Name of the binary property on the incoming n8n item that holds the Word file. Required when Input Data Type is Binary Data. | data |
| Base64 Word Content | Conditional | Base64-encoded Word content. Required when Input Data Type is Base64 String. | UEsDBBQAAAAIAA... |
| Word URL | Conditional | Publicly reachable HTTPS URL to the source Word file. Required when Input Data Type is URL. | https://example.com/document.docx |
| Document Name | Required | Filename of the input Word file, including the .docx extension, used for format detection. | document.docx |
| Start Page Number | Optional | First page to include in extraction. Leave unset to start from page 1. | 1 |
| End Page Number | Optional | Last page to include in extraction. Leave unset to extract through the last page. | 3 |
| Remove Comments | Optional | Strips reviewer comments from the extracted text when enabled. | true |
| Remove Header/Footer | Optional | Excludes running headers and footers when enabled, leaving only body content. | true |
| Accept Changes | Optional | Finalizes all tracked changes before extraction when enabled, so text reflects the edited version. | true |
| Output Binary Field Name | Optional | Name of the binary property the output item exposes. Default is data. | data |
Opsi Lanjutan
{ "outputDataFormat": "json" }, berlapis di atas bidang-bidang individual di atasnya.Bidang Keluaran
| Bidang | Jenis | Isi di dalamnya |
|---|---|---|
success | Boolean | True when extraction succeeded. Use to route error-handling branches. |
fileName | String | Generated filename for the extracted content file, typically ending in .json. |
mimeType | String | MIME type of the output, typically application/json or text/plain. |
fileSize | Number | Size of the extracted content file in bytes. |
docName | String | Original filename of the input Word document, kept for audit and tracking. |
message | String | Human-readable status message for the extraction result. |
Binary (data) | Binary | The extracted text content under Output Binary Field Name (default data). Pass into a downstream node to read or store the text. |
Bagaimana Cara Mengatur Ekstrak Teks dari Word? n8n?
- Menambahkan PDF4me untuk Anda n8n alur kerja dan pilih Ekstrak Teks dari Word tindakan.
- Di dalam Kredensial untuk terhubung dengan, pilih milikmu PDF4me kredensial atau klik Buat Kredensial Baru dan tempelkan milik Anda API kunci.
- Mengatur Tipe Data Masukan ke Data Biner (bawaan), Base64 Rangkaian, atau URL dan berikan kolom sumber yang sesuai.
- Mengatur Nama Dokumen dengan
.docxEkstensi. - Pengaturan opsional Nomor Halaman Awal Dan Nomor Halaman Akhir untuk membatasi ekstraksi ke rentang halaman tertentu.
- Mengatur Hapus Komentar, Hapus Header/Footer, Dan Terima Perubahan sesuai kebutuhan untuk ekstraksi versi bersih atau yang telah diedit.
- Jalankan node dan arahkan teks yang diekstrak ke dalam pipeline konten, indeks pencarian, atau alur kerja analisis Anda.
Pengaturan Umum
Contoh Alur KerjaCommon n8n workflow patterns using Extract Text From Word.
- Pemicu Google Drive akan aktif ketika dokumen Word lama ditambahkan ke folder migrasi.
- PDF4me Ekstrak Teks dari Word dijalankan dengan opsi Hapus Header/Footer dan Hapus Komentar diaktifkan untuk ekstraksi teks bersih hanya bagian isi.
- Teks yang diekstrak kemudian diposting ke CMS tanpa antarmuka pengguna (headless CMS) sebagai entri konten baru.
- Naskah yang telah direview beserta perubahan dan komentar yang dilacak diunggah melalui sebuah formulir.
- PDF4me Ekstrak Teks dari Word dijalankan dengan opsi Terima Perubahan dan Hapus Komentar diaktifkan untuk menghasilkan versi akhir yang bersih.
- Teks final kemudian dikirim ke proses penyuntingan atau penerbitan.
- Node Loop Over Items mengiterasi dokumen Word dari SharePoint perpustakaan dokumen.
- PDF4me Ekstrak Teks dari Word berjalan pada setiap file dengan opsi ekstraksi default.
- Teks yang diekstrak kemudian diindeks ke dalam mesin pencari seperti Elasticsearch atau Algolia.
- Alur kerja hanya membutuhkan ringkasan eksekutif dari laporan yang panjang.
- PDF4me Ekstrak Teks Dari Word dijalankan dengan Nomor Halaman Awal 1 dan Nomor Halaman Akhir 2 untuk membatasi ekstraksi hanya pada halaman ringkasan.
- Teks ringkasan yang diekstrak kemudian dikirim ke tahap peringkasan atau analisis teks.
Tips Praktis
Lembar Panduan Singkat
| Bidang | Nilai |
|---|---|
| Action | Extract Text From Word |
| Input Data Type | Binary Data |
| Input Binary Field | data |
| Document Name | document.docx |
| Start Page Number | 1 (optional) |
| End Page Number | (optional, defaults to last page) |
| Remove Comments | true |
| Remove Header/Footer | true |
| Accept Changes | true |
| Credentials | PDF4me API credential |