Ana içeriğe geç

Word'den Metin Çıkarma n8n

Word'den Metin Çıkarma bir n8n düğüm tarafından PDF4me Bu araç, .docx dosyasından temiz metin içeriği çıkarır ve yorumları, başlıkları, altbilgileri kaldırma ve çıkarılmadan önce izlenen değişiklikleri sonlandırma seçenekleri sunar. İçerik geçişi, metin madenciliği veya belge metnini manuel kopyala-yapıştır yapmadan sonraki analizlere beslemek için kullanabilirsiniz.

Bu düğüm ne işe yarıyor?

PDF4meWord'den Metin Çıkarma Bir .docx dosyasını okur ve isteğe bağlı olarak sayfa aralığıyla sınırlı ve yorumlardan, üstbilgilerden/altbilgilerden veya çözümlenmemiş izlenen değişikliklerden arındırılmış metin içeriğini döndürür. Girişi İkili Veri yoluyla kabul eder. Base64 Dize veya URLİçerik geçişi, editoryal temizlik, arama indeksleme ve belge metnini metin madenciliği veya analiz işlem hatlarına beslemek için idealdir.

İlgili Blog Yazıları
Bu özellik için henüz bir blog yazısı yok — yakında yayınlanacak.
Bu arada, her platforma yönelik eğitimler ve iş akışları için PDF4me bloguna göz atın.
Blogu ziyaret edin

Kimliğinizi Doğrulama API Rica etmek

Her PDF4me düğümde n8n geçerli bir belge gerektirir Bağlantı kurmak için kimlik bilgisi. İçeriğinizi barındıran birini oluşturun veya seçin. PDF4me API Bu sayede iş akışı, veri çıkarma isteklerini güvenli bir şekilde doğrulayabilir.

Kaçırmamanız Gereken Önemli Bilgiler

Sadece 2 alan gerçekten zorunludur.
Word belgesi girişi (Giriş Veri Türü aracılığıyla) ve Belge Adı. Sayfa aralığı ve üç temizleme düğmesinin tümü, daha önce doğrulanmış olanla aynı desene uyan çalışan varsayılan değerlere sahiptir. Make Bu eylemin bir versiyonu.
Değişiklikleri Kabul Et işlemi, veri çıkarma işleminden sonra değil, önce çalışır.
"Değişiklikleri Kabul Et" seçeneğini ayarlamak, belgedeki izlenen tüm değişiklikleri önce kesinleştirir, böylece çıkarılan metin düzenlenmiş sürümü yansıtır. Düzenleme öncesi kaynakla mantıksal olarak eşleşen bir metne ihtiyacınız varsa bu seçeneği devre dışı bırakın.
Çıktı, düz metin dizesi değil, ikili bir dosyadır.
Çıkarılan metin, genellikle Çıktı İkili Alan Adı altında ikili bir dosya olarak döndürülür. JSONBu veriyi, metin içeriğini okumak, ayrıştırmak veya depolamak için bir sonraki düğüme iletin.
Word'den Metin Çıkarma n8n düğümü, Eylem olarak Word'den Metin Çıkarma, Giriş Veri Türü İkili Veri, Giriş İkili Alan Verisi, Belge Adı document.docx, Başlangıç Sayfa Numarası 1, Bitiş Sayfa Numarası 3 ve Çıkarma Seçenekleri bölümünde Yorumları Kaldır, Üst Bilgiyi/Alt Bilgiyi Kaldır ve Değişiklikleri Kabul Et seçeneklerinin tümü etkinleştirilmiş şekilde yapılandırılmıştır.

PDF4me Word'den Metin Çıkarma düğümü parametreleri panelinde n8n

Word'den metin çıkarmak için hangi parametrelere ihtiyaç duyulur?

Gerekli: Giriş Veri Türü ve Belge Adı, ayrıca seçtiğiniz giriş türüyle eşleşen alan (Giriş İkili Alanı, Base64 Word İçeriği veya Word URL'si). Başlangıç Sayfa Numarası, Bitiş Sayfa Numarası, Çıktı İkili Alan Adı ve üç Çıkarma Seçeneği düğmesi isteğe bağlıdır.

ParametreGerekliNe işe yarar?Örnek
Input Data TypeRequiredFormat of the source Word document. Choose Binary Data (from a previous node), Base64 String, or URL.Binary Data
Input Binary FieldConditionalName of the binary property on the incoming n8n item that holds the Word file. Required when Input Data Type is Binary Data.data
Base64 Word ContentConditionalBase64-encoded Word content. Required when Input Data Type is Base64 String.UEsDBBQAAAAIAA...
Word URLConditionalPublicly reachable HTTPS URL to the source Word file. Required when Input Data Type is URL.https://example.com/document.docx
Document NameRequiredFilename of the input Word file, including the .docx extension, used for format detection.document.docx
Start Page NumberOptionalFirst page to include in extraction. Leave unset to start from page 1.1
End Page NumberOptionalLast page to include in extraction. Leave unset to extract through the last page.3
Remove CommentsOptionalStrips reviewer comments from the extracted text when enabled.true
Remove Header/FooterOptionalExcludes running headers and footers when enabled, leaving only body content.true
Accept ChangesOptionalFinalizes all tracked changes before extraction when enabled, so text reflects the edited version.true
Output Binary Field NameOptionalName of the binary property the output item exposes. Default is data.data

Gelişmiş Seçenekler

Özel Profiller (İsteğe bağlı)
A JSON-Özel çıkarma yapılandırmaları için önceden tanımlanmış parametreler bloğu gibi { "outputDataFormat": "json" }Yukarıdaki ayrı alanların üzerine katman halinde yerleştirilmiştir.

Çıkış Alanları

AlanTipİçeriğinde neler var?
successBooleanTrue when extraction succeeded. Use to route error-handling branches.
fileNameStringGenerated filename for the extracted content file, typically ending in .json.
mimeTypeStringMIME type of the output, typically application/json or text/plain.
fileSizeNumberSize of the extracted content file in bytes.
docNameStringOriginal filename of the input Word document, kept for audit and tracking.
messageStringHuman-readable status message for the extraction result.
Binary (data)BinaryThe extracted text content under Output Binary Field Name (default data). Pass into a downstream node to read or store the text.

Word'de Metin Çıkarma İşlemini Nasıl Kurarım? n8n?

  1. Eklemek PDF4me senin n8n iş akışını seçin ve Word'den Metin Çıkarma aksiyon.
  2. İçinde Bağlantı kurmak için kimlik bilgisi, sizinkini seçin PDF4me kimlik bilgileri veya tıklayın Yeni Kimlik Bilgisi Oluştur ve yapıştırın API anahtar.
  3. Ayarlamak Giriş Veri Türü ile İkili Veri (varsayılan), Base64 Sicim, veya URL ve eşleşen kaynak alanını sağlayın.
  4. Ayarlamak Belge Adı ile .docx eklenti.
  5. İsteğe bağlı olarak ayarlanabilir. Başlangıç Sayfa Numarası Ve Sayfa Sonu Numarası Çıkarma işlemini belirli bir sayfa aralığıyla sınırlandırmak.
  6. Ayarlamak Yorumları Kaldır, Üstbilgiyi/Altbilgiyi Kaldır, Ve Değişiklikleri Kabul Et Temiz veya düzenlenmiş sürümün çıkarılması için gerektiği gibi.
  7. Düğümü çalıştırın ve çıkarılan metni içerik işlem hattınıza, arama dizininize veya analiz iş akışınıza yönlendirin.

Tipik Kurulumlar

İş Akışı ÖrnekleriCommon n8n workflow patterns using Extract Text From Word.
İçerik taşıma işlemi bir CMS'ye aktarılıyor.
  1. Eski bir Word belgesi geçiş klasörüne eklendiğinde Google Drive tetikleyicisi çalışır.
  2. PDF4me Word'den Metin Çıkarma işlevi, yalnızca metin gövdesinin temiz bir şekilde çıkarılması için Üstbilgi/Altbilgi Kaldırma ve Yorumları Kaldırma seçenekleri etkinleştirilmiş olarak çalışır.
  3. Çıkarılan metin, yeni bir içerik girişi olarak başsız bir CMS'ye gönderilir.
İnceleme sonrası editoryal düzeltmeler
  1. Değişiklikler ve yorumlar takip edilmiş, incelenmiş bir makale bir form aracılığıyla yüklenir.
  2. PDF4me Word'den Metin Çıkarma işlemi, temiz bir son sürüm için Değişiklikleri Kabul Et ve Yorumları Kaldır seçenekleri etkinleştirilmiş olarak çalışır.
  3. Son hali verilen metin, redaksiyon veya yayıncılık sürecine gönderilir.
Belge kitaplığından oluşturulan arama dizini
  1. Bir "Öğeler Üzerinde Döngü" düğümü, Word belgelerini bir kaynaktan başlayarak yineleyerek işlem yapar. SharePoint Belge kütüphanesi.
  2. PDF4me Word'den Metin Çıkarma işlemi, her dosyada varsayılan çıkarma seçenekleriyle çalışır.
  3. Çıkarılan metin, Elasticsearch veya Algolia gibi bir arama motoruna indekslenir.
Büyük raporlar için bölüm düzeyinde veri çıkarma
  1. Bir iş akışı, uzun bir rapordan yalnızca özet bölümüne ihtiyaç duyar.
  2. PDF4me Word'den Metin Çıkarma özelliği, çıkarma işlemini özet sayfalarla sınırlandırmak için Başlangıç Sayfa Numarası 1 ve Bitiş Sayfa Numarası 2 ile çalışır.
  3. Çıkarılan özet metin, metin özetleme veya analiz adımına gönderilir.

Pratik İpuçları

Only Input and Document Name are required
Page range and the three cleanup toggles all have working defaults; set them only when your workflow needs the behavior to differ.
Use page range for large documents
Set Start Page Number and End Page Number to extract only the section you need instead of processing an entire long document.
Accept Changes changes the output text
With Accept Changes on, deleted text in tracked changes will not appear in the extraction; with it off, the pre-edit text may still be present.
Output is binary, read it downstream
The extracted text arrives as a binary file, not a plain n8n string field; use a node that reads binary content to access the actual text.
Document Name still matters with Binary Data
The extension drives format detection regardless of input type; keep it accurate even when the file itself comes from a previous node.
Remove Header/Footer helps content analysis
Running headers and footers (page numbers, document titles) can pollute text-mining results; strip them for cleaner analysis.

Kopya Kağıdı

AlanDeğer
ActionExtract Text From Word
Input Data TypeBinary Data
Input Binary Fielddata
Document Namedocument.docx
Start Page Number1 (optional)
End Page Number(optional, defaults to last page)
Remove Commentstrue
Remove Header/Footertrue
Accept Changestrue
CredentialsPDF4me API credential

Sıkça Sorulan Sorular

Which fields are required for Extract Text From Word?+
Two: the Word document input (via Input Data Type) and Document Name. Start Page Number, End Page Number, Remove Comments, Remove Header/Footer, and Accept Changes are all optional; the node applies sensible defaults.
What do Remove Comments, Remove Header/Footer, and Accept Changes do?+
Remove Comments strips reviewer comments from the extracted text. Remove Header/Footer excludes running headers and footers so only body content comes through. Accept Changes finalizes tracked changes before extraction, so the text reflects the edited version rather than the original with revision marks.
Can I extract text from only part of the document?+
Yes. Set Start Page Number and End Page Number to limit extraction to a specific page range, leave them unset to extract the entire document.
What format is the extracted text returned in?+
A binary file (typically JSON) exposed under Output Binary Field Name, alongside metadata fields like fileName, fileSize, and success. Pass the binary into a downstream node to read or store the text, similar to how the general-purpose Python approach in this Word text-extraction guide returns structured content rather than a raw string.
Does Accept Changes run before or after extraction?+
Before. Setting Accept Changes finalizes every tracked change in the document first, so the extracted text reflects the edited version, the same distinction raised in Microsoft Q&A discussions on extracting text from Word documents about edited versus original content.

İlgili Eylemler

Diğer Platformlarda Aynı Görev

Yardım Alın