Ana içeriğe geç

Belgeyi ayrıştırma işleminde n8n

Bu düğüm ne işe yarıyor?

PDF4me Belgeyi Ayrıştır Kaydedilmiş ayrıştırma şablonunuzu bir PDF bir içinde n8n İş akışını çalıştırır ve çıkarılan alanları yapılandırılmış veri olarak döndürür. Önceki bir düğümden ikili veri besleyin, Base64 dize veya halka açık URLŞablonu şu şekilde referans alın: Ayrıştırma Kimliğive elde edilen sonucu boruya aktarın. JSON, XML, veya CSV doğrudan Set, IF, HTTP Request veya herhangi bir alt akışa n8n Şablon, veri çıkarma mantığını içerir; bu nedenle aynı düğüm faturaları, sözleşmeleri, makbuzları ve yapılandırdığınız özel düzenleri çıkarır.

İlgili Blog Yazıları(1)

Bu düğümü çalıştırmadan önce: ayrıştırma şablonu oluşturun PDF4me Kontrol paneli. Yakalama tuşlarınızı tanımlayın ve seçin. Düzenli İfade istikrarlı kalıplar için veya JavaScript İfade Koşullu mantık için. n8n Düğüm, bu şablona şu şekilde referans verir: Ayrıştırma Kimliği. Görmek Belge için Ayrıştırma Bilgilerini Hazırlayın Tam kurulum için, Regex örnekleri (INV-\d{6,10}, \d{2}/\d{2}/\d{4}ve iki çalışan JavaScript İfade sınıflandırıcı örnekleri.

Kimliğinizi Doğrulama API Rica etmek

O PDF4me düğümde n8n gereklilikler PDF4me API kimlik bilgileriKimlik bilgilerini bir kez oluşturun. n8n sizinle API Kontrol panelinden anahtarı alın, ardından her yerden ona referans verin. PDF4me İş akışınızdaki düğüm.

Kaçırmamanız Gereken Önemli Bilgiler

Ayrıştırma kimliği gereklidir (bu sizin Şablon Kimliğinizdir).
Ayrıştırma Kimliği, şablon üzerinde Değişiklikleri Kaydet seçeneği kullanıldığında kontrol paneli tarafından atanan GUID'dir. Bunu şablon detay panelinden kopyalayın ve ilgili alana yapıştırın. n8n Düğüm. Bu olmadan düğümün hangi alanları çıkaracağına dair bir haritası olmaz.
Kararlı desenler için düzenli ifadeler, JavaScript koşullu mantık için
Şablon içinde anahtarları canlı olarak yakalayın. Fatura numaraları, tarihler, tutarlar, vergi kimlik numaraları (üretim anahtarlarının yaklaşık %80'i) için Regex ifadesi kullanın. JavaScript İfade ile metin Sınıflandırma ve yedekleme kuralları için değişken.
Çıktı, ikili veri değil, yapılandırılmış veridir. PDF
Compress, Protect veya Convert düğümlerinin aksine, bunlar ham veri döndürmez. PDF bayt, Belgeyi Ayrıştırma döndürür JSON (varsayılan), XML, veya CSV Adını verdiğiniz ikili alanda. Değerleri aşağıya yönlendirmek için bunu Set veya IF düğümlerine bağlayın.
n8n'de Belgeyi Ayrıştırma düğümü yapılandırması

Parametreler

ParametreGerekliNe işe yarar?Örnek
Input Data TypeYesHow the PDF reaches the node. Binary Data (from a prior node), Base64 String (inline encoded), or URL (public file URL).Binary Data
Input Binary FieldConditionalName of the binary field on the input item containing the PDF. Required when Input Data Type is Binary Data.data
Base64 PDF ContentConditionalBase64 encoded PDF content. Required when Input Data Type is Base64 String. No data: prefix.JVBERi0xLjQK...
PDF URLConditionalPublicly reachable URL of the PDF. Required when Input Data Type is URL. The PDF4me service downloads and processes it.https://example.com/invoice.pdf
Document NameYesSource filename including .pdf extension. Used for format detection and error tracing.invoice.pdf
Parse IDYesTemplateId GUID from the PDF4me dashboard. Identifies the parse template (capture keys + extraction rules) to apply.12345678-1234-1234-1234-123456789abc
Output FormatYesShape of the returned data. JSON (default, structured object), XML (hierarchical), or CSV (flat tabular). JSON is the right choice for almost every n8n workflow.JSON
Output Binary Field NameYesName of the binary field the node attaches the parsed output to on the output item. Reference it from downstream nodes.data
Custom ProfilesNoAdvanced JSON-style overrides for parsing behaviour (output sub-format, include metadata flag, etc). Leave empty for default behaviour.{ "outputDataFormat": "json", "includeMetadata": true }

Ayrıştırma şablonunuzdaki ifade türleri

Yakalama kuralları şablonda yer alır, dosyada değil. n8n Her iki ifade türü de her düğümle birlikte gelir. PDF4me hesap.

Düzenli İfadeİstikrarlı desenler
Fatura numaraları (INV-\d{6,10}), tarihler (\d{2}/\d{2}/\d{4}), miktarlar ($?\d{1,3}(?:,\d{3})*(?:.\d{2})?Üretim anahtarlarının yaklaşık %80'i.
JavaScript İfadesiKoşullu mantık ve sınıflandırıcılar
Yakalama alanı metni şu şekilde iletilir: metin; bir dize döndürür. Çoklu işaretleyici sınıflandırması, yedek kurallar, tarih normalizasyonu. Bkz. Belge için Ayrıştırma Bilgilerini Hazırlayın iki çalışma örneği için.

Çıktı

AlanTipİçeriğinde neler var?
fileNameStringGenerated output filename with timestamp and extension matching Output Format (.json / .xml / .csv).
mimeTypeStringMIME type of the output (application/json, application/xml, text/csv).
fileSizeNumberSize of the parsed output in bytes.
successBooleantrue on a successful parse, false otherwise. Wire into an IF node for branching.
messageStringStatus message. Document parsed successfully on the happy path, or a descriptive error.
docNameStringOriginal input filename, preserved for audit trails.

Ayrıştırılan anahtar/değer verisi, belirttiğiniz ikili alanda yer almaktadır. Çıktı İkili Alan Adı.

İş akışı örnekleri

N8n iş akışında sık kullanılan kalıplarTypical ways to chain Parse Document into an n8n workflow.
Postgres'e e-posta eki
  1. Gmail tetikleyicisi, "tedarikçi faturası" olarak etiketlenmiş yeni faturalar için çalışır.
  2. Filtre yalnızca .pdf uzantılı dosyaları geçirir.
  3. Parse Document, fatura şablonunu ikili ek dosya üzerinde çalıştırır.
  4. Düğüm eşlemelerinin ayrıştırılması invoiceNumber, totalAmount, invoiceDate.
  5. Postgres INSERT işlemi, ilgili satırı accounts_payable tablosuna yazar.
Sınıflandırma ve ayıklama işlemlerini tek bir iş akışında gerçekleştirin.
  1. Webhook bir mesaj alıyor. PDF İş ortağı yükleme portalından.
  2. Parse Document, bir şablonu çalıştırır. JavaScript Belge türünü döndüren ifade anahtarı.
  3. Döndürülen türe (fatura / sipariş / makbuz) göre düğüm rotalarını türe özgü alt dallara yönlendirin.
  4. Her bir dal, ayrıştırılmış alanları doğru hedef sisteme gönderir.
S3'ten Airtable'a toplu ayrıştırma
  1. Zamanlama tetikleyicisi her 15 dakikada bir çalışır.
  2. S3 List + Get Object her yeni yüklemede PDF Gelen kovada.
  3. Parse Document, şablonu her bir ikili öğeye karşı çalıştırır.
  4. Airtable Create Record, ayrıştırılan alanları izleme veritabanına yazar.

Sıkça Sorulan Sorular

What is a Parse ID and where do I get it?+
Parse ID is the TemplateId GUID generated by the PDF4me dashboard when you click Save Changes on a parse template. Find it in the template detail panel. Pin it in your n8n node so the same template runs every execution.
Do I need a template, or can the node parse any PDF without one?+
A template is required for field-level extraction in n8n. Without a Parse ID the node has no map of which regions to capture. Build a template once in the dashboard, then reuse the same Parse ID across runs and across platforms (Make, Zapier, Power Automate).
How does the n8n node know what fields to extract?+
The capture keys live in the template, not in n8n. Each capture area gets a key name (camelCase) and an extraction rule: Regex Expression for stable patterns or JavaScript Expression for conditional logic. The output has one field per key.
Which Input Data Type should I pick?+
Binary Data for files arriving from upstream nodes (Read Binary Files, HTTP Request with response format File, Gmail attachment, Dropbox Download). Base64 String when the PDF is encoded inline. URL when the file lives at a public web address.
Can I extract data using JavaScript Expression in addition to regex?+
Yes. The capture area text is passed as the variable text inside your JavaScript Expression and you return a string. Use it for multi-marker classification, fallback rules, or date normalization. See the Prepare Parse Info for Document guide for two working classifier samples.
JSON, XML, or CSV. Which Output Format should I use?+
JSON for almost every n8n workflow. It maps cleanly into Set, IF, and HTTP Request nodes. XML when your downstream system requires it natively. CSV for spreadsheet uploads and bulk imports.
Is the output a file I can save, or just a JSON object?+
Both. The parsed data is attached to the binary field you set under Output Binary Field Name, so you can Write Binary File to disk, send it as an email attachment, or upload it to storage. The structured data is also available on the regular json output for downstream node mapping.

İlgili işlemler

Diğer platformlarda aynı görev

Yardım Alın