Word'den Metin Çıkarma n8n
Word'den Metin Çıkarma bir n8n düğüm tarafından PDF4me Bu araç, .docx dosyasından temiz metin içeriği çıkarır ve yorumları, başlıkları, altbilgileri kaldırma ve çıkarılmadan önce izlenen değişiklikleri sonlandırma seçenekleri sunar. İçerik geçişi, metin madenciliği veya belge metnini manuel kopyala-yapıştır yapmadan sonraki analizlere beslemek için kullanabilirsiniz.
Bu düğüm ne işe yarıyor?
PDF4meWord'den Metin Çıkarma Bir .docx dosyasını okur ve isteğe bağlı olarak sayfa aralığıyla sınırlı ve yorumlardan, üstbilgilerden/altbilgilerden veya çözümlenmemiş izlenen değişikliklerden arındırılmış metin içeriğini döndürür. Girişi İkili Veri yoluyla kabul eder. Base64 Dize veya URLİçerik geçişi, editoryal temizlik, arama indeksleme ve belge metnini metin madenciliği veya analiz işlem hatlarına beslemek için idealdir.
Kimliğinizi Doğrulama API Rica etmek
Her PDF4me düğümde n8n geçerli bir belge gerektirir Bağlantı kurmak için kimlik bilgisi. İçeriğinizi barındıran birini oluşturun veya seçin. PDF4me API Bu sayede iş akışı, veri çıkarma isteklerini güvenli bir şekilde doğrulayabilir.
Kaçırmamanız Gereken Önemli Bilgiler

PDF4me Word'den Metin Çıkarma düğümü parametreleri panelinde n8n
Word'den metin çıkarmak için hangi parametrelere ihtiyaç duyulur?
Gerekli: Giriş Veri Türü ve Belge Adı, ayrıca seçtiğiniz giriş türüyle eşleşen alan (Giriş İkili Alanı, Base64 Word İçeriği veya Word URL'si). Başlangıç Sayfa Numarası, Bitiş Sayfa Numarası, Çıktı İkili Alan Adı ve üç Çıkarma Seçeneği düğmesi isteğe bağlıdır.
| Parametre | Gerekli | Ne işe yarar? | Örnek |
|---|---|---|---|
| Input Data Type | Required | Format of the source Word document. Choose Binary Data (from a previous node), Base64 String, or URL. | Binary Data |
| Input Binary Field | Conditional | Name of the binary property on the incoming n8n item that holds the Word file. Required when Input Data Type is Binary Data. | data |
| Base64 Word Content | Conditional | Base64-encoded Word content. Required when Input Data Type is Base64 String. | UEsDBBQAAAAIAA... |
| Word URL | Conditional | Publicly reachable HTTPS URL to the source Word file. Required when Input Data Type is URL. | https://example.com/document.docx |
| Document Name | Required | Filename of the input Word file, including the .docx extension, used for format detection. | document.docx |
| Start Page Number | Optional | First page to include in extraction. Leave unset to start from page 1. | 1 |
| End Page Number | Optional | Last page to include in extraction. Leave unset to extract through the last page. | 3 |
| Remove Comments | Optional | Strips reviewer comments from the extracted text when enabled. | true |
| Remove Header/Footer | Optional | Excludes running headers and footers when enabled, leaving only body content. | true |
| Accept Changes | Optional | Finalizes all tracked changes before extraction when enabled, so text reflects the edited version. | true |
| Output Binary Field Name | Optional | Name of the binary property the output item exposes. Default is data. | data |
Gelişmiş Seçenekler
{ "outputDataFormat": "json" }Yukarıdaki ayrı alanların üzerine katman halinde yerleştirilmiştir.Çıkış Alanları
| Alan | Tip | İçeriğinde neler var? |
|---|---|---|
success | Boolean | True when extraction succeeded. Use to route error-handling branches. |
fileName | String | Generated filename for the extracted content file, typically ending in .json. |
mimeType | String | MIME type of the output, typically application/json or text/plain. |
fileSize | Number | Size of the extracted content file in bytes. |
docName | String | Original filename of the input Word document, kept for audit and tracking. |
message | String | Human-readable status message for the extraction result. |
Binary (data) | Binary | The extracted text content under Output Binary Field Name (default data). Pass into a downstream node to read or store the text. |
Word'de Metin Çıkarma İşlemini Nasıl Kurarım? n8n?
- Eklemek PDF4me senin n8n iş akışını seçin ve Word'den Metin Çıkarma aksiyon.
- İçinde Bağlantı kurmak için kimlik bilgisi, sizinkini seçin PDF4me kimlik bilgileri veya tıklayın Yeni Kimlik Bilgisi Oluştur ve yapıştırın API anahtar.
- Ayarlamak Giriş Veri Türü ile İkili Veri (varsayılan), Base64 Sicim, veya URL ve eşleşen kaynak alanını sağlayın.
- Ayarlamak Belge Adı ile
.docxeklenti. - İsteğe bağlı olarak ayarlanabilir. Başlangıç Sayfa Numarası Ve Sayfa Sonu Numarası Çıkarma işlemini belirli bir sayfa aralığıyla sınırlandırmak.
- Ayarlamak Yorumları Kaldır, Üstbilgiyi/Altbilgiyi Kaldır, Ve Değişiklikleri Kabul Et Temiz veya düzenlenmiş sürümün çıkarılması için gerektiği gibi.
- Düğümü çalıştırın ve çıkarılan metni içerik işlem hattınıza, arama dizininize veya analiz iş akışınıza yönlendirin.
Tipik Kurulumlar
İş Akışı ÖrnekleriCommon n8n workflow patterns using Extract Text From Word.
- Eski bir Word belgesi geçiş klasörüne eklendiğinde Google Drive tetikleyicisi çalışır.
- PDF4me Word'den Metin Çıkarma işlevi, yalnızca metin gövdesinin temiz bir şekilde çıkarılması için Üstbilgi/Altbilgi Kaldırma ve Yorumları Kaldırma seçenekleri etkinleştirilmiş olarak çalışır.
- Çıkarılan metin, yeni bir içerik girişi olarak başsız bir CMS'ye gönderilir.
- Değişiklikler ve yorumlar takip edilmiş, incelenmiş bir makale bir form aracılığıyla yüklenir.
- PDF4me Word'den Metin Çıkarma işlemi, temiz bir son sürüm için Değişiklikleri Kabul Et ve Yorumları Kaldır seçenekleri etkinleştirilmiş olarak çalışır.
- Son hali verilen metin, redaksiyon veya yayıncılık sürecine gönderilir.
- Bir "Öğeler Üzerinde Döngü" düğümü, Word belgelerini bir kaynaktan başlayarak yineleyerek işlem yapar. SharePoint Belge kütüphanesi.
- PDF4me Word'den Metin Çıkarma işlemi, her dosyada varsayılan çıkarma seçenekleriyle çalışır.
- Çıkarılan metin, Elasticsearch veya Algolia gibi bir arama motoruna indekslenir.
- Bir iş akışı, uzun bir rapordan yalnızca özet bölümüne ihtiyaç duyar.
- PDF4me Word'den Metin Çıkarma özelliği, çıkarma işlemini özet sayfalarla sınırlandırmak için Başlangıç Sayfa Numarası 1 ve Bitiş Sayfa Numarası 2 ile çalışır.
- Çıkarılan özet metin, metin özetleme veya analiz adımına gönderilir.
Pratik İpuçları
Kopya Kağıdı
| Alan | Değer |
|---|---|
| Action | Extract Text From Word |
| Input Data Type | Binary Data |
| Input Binary Field | data |
| Document Name | document.docx |
| Start Page Number | 1 (optional) |
| End Page Number | (optional, defaults to last page) |
| Remove Comments | true |
| Remove Header/Footer | true |
| Accept Changes | true |
| Credentials | PDF4me API credential |