Lewati ke konten utama

Ekstrak Teks Dari Word di n8n

Ekstrak Teks dari Word adalah sebuah n8n simpul oleh PDF4me Alat ini mengekstrak konten teks bersih dari file .docx, dengan opsi untuk menghapus komentar, header, footer, dan menyelesaikan perubahan yang dilacak sebelum ekstraksi. Gunakan alat ini untuk migrasi konten, penambangan teks, atau memasukkan teks dokumen ke dalam analisis selanjutnya tanpa perlu menyalin dan menempel secara manual.

Fungsi node ini

PDF4meEkstrak Teks dari Word Membaca file .docx dan mengembalikan konten teksnya, secara opsional dibatasi pada rentang halaman dan dibersihkan dari komentar, header/footer, atau perubahan yang dilacak yang belum terselesaikan. Menerima input melalui Data Biner. Base64 Tali, atau URLIdeal untuk migrasi konten, pembersihan editorial, pengindeksan pencarian, dan memasukkan teks dokumen ke dalam pipeline penambangan teks atau analisis.

Postingan Blog Terkait
Belum ada postingan blog untuk fitur ini — akan segera hadir.
Sementara itu, jelajahi blog PDF4me untuk menemukan tutorial dan alur kerja di berbagai platform.
Kunjungi blog ini

Memverifikasi Identitas Anda API Meminta

Setiap PDF4me simpul di n8n memerlukan validitas Kredensial untuk terhubung denganBuat atau pilih salah satu yang sesuai dengan kebutuhan Anda. PDF4me API kunci agar alur kerja dapat mengautentikasi permintaan ekstraksi dengan aman.

Fakta Penting yang Tidak Boleh Anda Lewatkan

Hanya 2 kolom yang benar-benar wajib diisi.
Input dokumen Word (melalui Tipe Data Input) dan Nama Dokumen. Rentang halaman dan ketiga tombol pembersihan semuanya memiliki pengaturan default yang berfungsi, sesuai dengan pola yang sama seperti yang telah diverifikasi sebelumnya. Make versi dari tindakan ini.
Opsi "Terima Perubahan" dijalankan sebelum ekstraksi, bukan setelahnya.
Mengaktifkan opsi "Terima Perubahan" akan menyelesaikan setiap perubahan yang dilacak dalam dokumen terlebih dahulu, sehingga teks yang diekstrak mencerminkan versi yang telah diedit. Nonaktifkan opsi ini jika Anda memerlukan teks yang secara logis sesuai dengan sumber sebelum diedit.
Outputnya berupa file biner, bukan string biasa.
Teks yang diekstrak dikembalikan sebagai file biner di bawah Nama Bidang Biner Keluaran, biasanya JSONTeruskan ke node hilir untuk membaca, mengurai, atau menyimpan konten teks sebenarnya.
Node n8n Ekstrak Teks Dari Word dikonfigurasi dengan Aksi Ekstrak Teks Dari Word, Tipe Data Masukan Data Biner, Bidang Masukan Biner data, Nama Dokumen document.docx, Nomor Halaman Awal 1, Nomor Halaman Akhir 3, dan Opsi Ekstraksi mengaktifkan/menonaktifkan Hapus Komentar, Hapus Header/Footer, dan Terima Perubahan.

PDF4me Ekstrak Teks Dari panel parameter node Word di n8n

Parameter apa saja yang dibutuhkan untuk mengekstrak teks dari Word?

Diperlukan: Masukkan Tipe Data dan Nama Dokumen, ditambah kolom yang sesuai dengan tipe input yang Anda pilih (Kolom Biner Input, Base64 Konten Word, atau URL Word). Nomor Halaman Awal, Nomor Halaman Akhir, Nama Bidang Biner Keluaran, dan ketiga tombol pengaktifan Opsi Ekstraksi semuanya bersifat opsional.

ParameterDiperlukanApa fungsinya?Contoh
Input Data TypeRequiredFormat of the source Word document. Choose Binary Data (from a previous node), Base64 String, or URL.Binary Data
Input Binary FieldConditionalName of the binary property on the incoming n8n item that holds the Word file. Required when Input Data Type is Binary Data.data
Base64 Word ContentConditionalBase64-encoded Word content. Required when Input Data Type is Base64 String.UEsDBBQAAAAIAA...
Word URLConditionalPublicly reachable HTTPS URL to the source Word file. Required when Input Data Type is URL.https://example.com/document.docx
Document NameRequiredFilename of the input Word file, including the .docx extension, used for format detection.document.docx
Start Page NumberOptionalFirst page to include in extraction. Leave unset to start from page 1.1
End Page NumberOptionalLast page to include in extraction. Leave unset to extract through the last page.3
Remove CommentsOptionalStrips reviewer comments from the extracted text when enabled.true
Remove Header/FooterOptionalExcludes running headers and footers when enabled, leaving only body content.true
Accept ChangesOptionalFinalizes all tracked changes before extraction when enabled, so text reflects the edited version.true
Output Binary Field NameOptionalName of the binary property the output item exposes. Default is data.data

Opsi Lanjutan

Profil Kustom (Opsional)
A JSON-seperti blok parameter yang telah ditentukan sebelumnya untuk konfigurasi ekstraksi khusus, seperti { "outputDataFormat": "json" }, berlapis di atas bidang-bidang individual di atasnya.

Bidang Keluaran

BidangJenisIsi di dalamnya
successBooleanTrue when extraction succeeded. Use to route error-handling branches.
fileNameStringGenerated filename for the extracted content file, typically ending in .json.
mimeTypeStringMIME type of the output, typically application/json or text/plain.
fileSizeNumberSize of the extracted content file in bytes.
docNameStringOriginal filename of the input Word document, kept for audit and tracking.
messageStringHuman-readable status message for the extraction result.
Binary (data)BinaryThe extracted text content under Output Binary Field Name (default data). Pass into a downstream node to read or store the text.

Bagaimana Cara Mengatur Ekstrak Teks dari Word? n8n?

  1. Menambahkan PDF4me untuk Anda n8n alur kerja dan pilih Ekstrak Teks dari Word tindakan.
  2. Di dalam Kredensial untuk terhubung dengan, pilih milikmu PDF4me kredensial atau klik Buat Kredensial Baru dan tempelkan milik Anda API kunci.
  3. Mengatur Tipe Data Masukan ke Data Biner (bawaan), Base64 Rangkaian, atau URL dan berikan kolom sumber yang sesuai.
  4. Mengatur Nama Dokumen dengan .docx Ekstensi.
  5. Pengaturan opsional Nomor Halaman Awal Dan Nomor Halaman Akhir untuk membatasi ekstraksi ke rentang halaman tertentu.
  6. Mengatur Hapus Komentar, Hapus Header/Footer, Dan Terima Perubahan sesuai kebutuhan untuk ekstraksi versi bersih atau yang telah diedit.
  7. Jalankan node dan arahkan teks yang diekstrak ke dalam pipeline konten, indeks pencarian, atau alur kerja analisis Anda.

Pengaturan Umum

Contoh Alur KerjaCommon n8n workflow patterns using Extract Text From Word.
Migrasi konten ke dalam CMS
  1. Pemicu Google Drive akan aktif ketika dokumen Word lama ditambahkan ke folder migrasi.
  2. PDF4me Ekstrak Teks dari Word dijalankan dengan opsi Hapus Header/Footer dan Hapus Komentar diaktifkan untuk ekstraksi teks bersih hanya bagian isi.
  3. Teks yang diekstrak kemudian diposting ke CMS tanpa antarmuka pengguna (headless CMS) sebagai entri konten baru.
Pembersihan editorial setelah peninjauan
  1. Naskah yang telah direview beserta perubahan dan komentar yang dilacak diunggah melalui sebuah formulir.
  2. PDF4me Ekstrak Teks dari Word dijalankan dengan opsi Terima Perubahan dan Hapus Komentar diaktifkan untuk menghasilkan versi akhir yang bersih.
  3. Teks final kemudian dikirim ke proses penyuntingan atau penerbitan.
Indeks pencarian dibangun dari pustaka dokumen.
  1. Node Loop Over Items mengiterasi dokumen Word dari SharePoint perpustakaan dokumen.
  2. PDF4me Ekstrak Teks dari Word berjalan pada setiap file dengan opsi ekstraksi default.
  3. Teks yang diekstrak kemudian diindeks ke dalam mesin pencari seperti Elasticsearch atau Algolia.
Ekstraksi tingkat bagian untuk laporan besar
  1. Alur kerja hanya membutuhkan ringkasan eksekutif dari laporan yang panjang.
  2. PDF4me Ekstrak Teks Dari Word dijalankan dengan Nomor Halaman Awal 1 dan Nomor Halaman Akhir 2 untuk membatasi ekstraksi hanya pada halaman ringkasan.
  3. Teks ringkasan yang diekstrak kemudian dikirim ke tahap peringkasan atau analisis teks.

Tips Praktis

Only Input and Document Name are required
Page range and the three cleanup toggles all have working defaults; set them only when your workflow needs the behavior to differ.
Use page range for large documents
Set Start Page Number and End Page Number to extract only the section you need instead of processing an entire long document.
Accept Changes changes the output text
With Accept Changes on, deleted text in tracked changes will not appear in the extraction; with it off, the pre-edit text may still be present.
Output is binary, read it downstream
The extracted text arrives as a binary file, not a plain n8n string field; use a node that reads binary content to access the actual text.
Document Name still matters with Binary Data
The extension drives format detection regardless of input type; keep it accurate even when the file itself comes from a previous node.
Remove Header/Footer helps content analysis
Running headers and footers (page numbers, document titles) can pollute text-mining results; strip them for cleaner analysis.

Lembar Panduan Singkat

BidangNilai
ActionExtract Text From Word
Input Data TypeBinary Data
Input Binary Fielddata
Document Namedocument.docx
Start Page Number1 (optional)
End Page Number(optional, defaults to last page)
Remove Commentstrue
Remove Header/Footertrue
Accept Changestrue
CredentialsPDF4me API credential

Pertanyaan Umum

Which fields are required for Extract Text From Word?+
Two: the Word document input (via Input Data Type) and Document Name. Start Page Number, End Page Number, Remove Comments, Remove Header/Footer, and Accept Changes are all optional; the node applies sensible defaults.
What do Remove Comments, Remove Header/Footer, and Accept Changes do?+
Remove Comments strips reviewer comments from the extracted text. Remove Header/Footer excludes running headers and footers so only body content comes through. Accept Changes finalizes tracked changes before extraction, so the text reflects the edited version rather than the original with revision marks.
Can I extract text from only part of the document?+
Yes. Set Start Page Number and End Page Number to limit extraction to a specific page range, leave them unset to extract the entire document.
What format is the extracted text returned in?+
A binary file (typically JSON) exposed under Output Binary Field Name, alongside metadata fields like fileName, fileSize, and success. Pass the binary into a downstream node to read or store the text, similar to how the general-purpose Python approach in this Word text-extraction guide returns structured content rather than a raw string.
Does Accept Changes run before or after extraction?+
Before. Setting Accept Changes finalizes every tracked change in the document first, so the extracted text reflects the edited version, the same distinction raised in Microsoft Q&A discussions on extracting text from Word documents about edited versus original content.

Tindakan Terkait

Tugas yang Sama di Platform Lain

Dapatkan Bantuan