Ana içeriğe geç

Kaynakları şuradan çıkarın: PDF içinde Make

Bu modülün işlevi

PDF4meKaynakları Çıkarın Bir dosyadan gömülü tüm resimleri ve metin içeriğini çıkarır. PDF ve bunları yapılandırılmış veri olarak size geri döndürür. Make senaryo. Aç/Kapat Görüntüleri Çıkar Belgeye gömülü her görüntüyü adlandırılmış olarak almak için, Base64-kodlanmış dosya. Aç/Kapat Metni Alıntıla Tam metin içeriğini düz metin dizesi olarak almak için. Her ikisi de tek bir modül çağrısında eş zamanlı olarak çalıştırılabilir. Çıkarılan görüntüleri varlık kitaplıkları oluşturmak için, çıkarılan metni analiz, arama dizinleme veya çeviri için kullanın, bunların hepsini dosyayı açmadan yapabilirsiniz. PDF manuel olarak.

İlgili Blog Yazıları
Bu özellik için henüz bir blog yazısı yok — yakında yayınlanacak.
Bu arada, her platforma yönelik eğitimler ve iş akışları için PDF4me bloguna göz atın.
Blogu ziyaret edin

Kimliğinizi Doğrulama API Rica etmek

Her PDF4me modül içinde Make geçerli bir belge gerektirir Bağlantı. İçeriğinizi barındıran birini oluşturun veya seçin. PDF4me API Bu sayede senaryo, veri çıkarma isteklerini güvenli bir şekilde doğrulayabilir.

Kaçırmamanız Gereken Önemli Bilgiler

Görüntü dizisinin her birini ayrı ayrı işlemek için bir yineleyiciye ihtiyacı vardır.
Görüntüler çıktısı, gömülü her görüntü için bir öğe içeren bir dizidir. Her görüntüyü ayrı ayrı yüklemek veya işlemek için bir ekleyin. Make Yineleyici Kaynakları Çıkarma işleminden hemen sonra modülü çalıştırın ve onu Görüntüler dizisine yönlendirin. Her yineleme size bir görüntü verir. İsim alan (dosya adı) ve bir Veri alan (Base64 içeriği). Yineleyici olmadan, aşağı akışta tek tek görüntülere erişemezsiniz.
Görüntü Verileri Base64Yüklemeden önce kodunu çözün.
Her bir görüntünün Veri Bu alan Base64 ile kodlanmıştır. Bulut depolama modülleri (Dropbox, Google Drive, SharePointİkili veri bekleniyor, değil Base64 metin. Kullanın. Make'nin yerleşik toBinary(Veri, 'base64') Veri alanını yükleme modülüne aktarmadan önce ikili sayıya dönüştüren fonksiyon. İsim Bu alan size uzantısıyla birlikte orijinal dosya adını verir (örneğin, resim_001.png).
Metin çıkarma işlemi yerel olarak çalışır. PDFstaranmadı
"Metni Çıkar" seçeneği, arama yapılabilir metni içeriğe gömülü olarak getirir. PDF Yapı. Tarandı. PDFs Görüntü tabanlı olduklarından, gömülü metin katmanı içermezler; bu nedenle taranmış belgelerdeki Metin çıktısı boş veya minimal olacaktır. Taranmış sayfalardan metin çıkarmak için şunu çalıştırın: PDF OCR Öncelikle bir metin katmanı oluşturmak için modülü kullanın, ardından metni çekmek için Kaynakları Çıkarma özelliğini kullanın. Görüntü çıkarma işlemi tümünde çalışır. PDFs taranmış olanlar da dahil.
PDF4me Kaynakları Çıkarma modülünü, Bağlantı ayarını "PDF4me bağlantım" olarak, Dosya Adı'nı 1. adımdan eşleştirilen şekilde, Belge'yi 1. adımdaki verilerden eşleştirilen şekilde, Görüntüleri Çıkarma'yı Evet, Metni Çıkarma'yı Evet olarak ayarlayarak oluşturun.

Görüntüleri Çıkarma ve Metni Çıkarma bağımsız seçeneklerdir; ihtiyacınıza bağlı olarak birini, her ikisini veya yalnızca birini etkinleştirebilirsiniz. Görüntüler dizi olarak, metin ise düz metin dizesi olarak döndürülür.

Parametreler

Gerekli: Bağlantı, Dosya Adı, Belge, Görüntüleri Çıkarma ve Metni Çıkarma seçeneklerinin tümü belirtilmelidir. Görüntüleri Çıkarma veya Metni Çıkarma seçeneklerinden en az birini Evet olarak ayarlayın; ikisini de etkinleştirmemek içerik döndürmez.

ParametreGerekliNe işe yarar?Örnek
ConnectionYesPDF4me API connection. Click Add and paste your API key if connecting for the first time.My PDF4me connection
File NameYesFilename of the source PDF including .pdf extension. Map from the prior module's file name output.catalog.pdf
DocumentYesBinary content of the source PDF. Map from the prior module's data output: Dropbox, Google Drive, HTTP, or email attachment.1. Data
Extract ImagesYesToggle to extract all embedded images. Set to Yes to retrieve images as a named Base64 array. Set to No to skip image extraction. Can be combined with Extract Text.Yes
Extract TextYesToggle to extract all text content. Set to Yes to retrieve the full document text as a plain string. Set to No to skip text extraction. Works on native PDFs only: not scanned.Yes

Çıkış Alanları

AlanTipTanım
MetinlerStringTam metin içeriği şuradan çıkarılmıştır: PDF Düz metin olarak. Metni Çıkar seçeneği Hayır olarak ayarlanmışsa boş. PDF taranıyor.
GörsellerArrayGömülü tüm resimlerin dizisi. Her öğenin bir İsim (dosya adı ve uzantısı) ve Veri (Base64-kodlanmış görüntü içeriği). Görüntüleri Çıkar seçeneği "Hayır" ise boş dizi.

Hızlı Kurulum

  1. Eklemek PDF4meKaynakları Çıkarın senin Make Dosya indirme adımından sonraki senaryo.
  2. Seçme Bağlantı (veya tıklayın) Eklemek sizinle bir tane oluşturmak için API anahtar).
  3. Harita Dosya adı Ve Belge Önceki modülden.
  4. Ayarlamak Görüntüleri Çıkar ve/veya Metni Alıntıla ile Evet İhtiyacınıza bağlı olarak.
  5. Görüntüleri çıkarıyorsanız, bir tane ekleyin. Yineleyici modül işaret ediyor Görseller Dizi. Yineleyici içinde şunu kullanın: toBinary(Data, 'base64') Her bir görüntüyü çözmek ve bir yükleme modülüne aktarmak.
  6. Metin çıkarıyorsanız, haritalama işlemini gerçekleştirin. Metinler alanı doğrudan Google Sheets satırına, veritabanına ekleme veya HTTP POST gövdesi.

İş Akışı Örnekleri

İş Akışı ÖrnekleriCommon Make scenario patterns using Extract Resources.
Ürün kataloğundan bir resim kütüphanesi oluşturun. PDFs
  1. Dropbox İzleme Klasörü, yeni bir katalog eklendiğinde tetiklenir. PDF yüklendi.
  2. Dropbox'tan dosya indirme işlemi, dosyayı getirir. PDF ikili.
  3. Kaynakları Çıkarma işlemi, Görüntüleri Çıkarma seçeneği Evet, Metni Çıkarma seçeneği Hayır olarak ayarlanmış şekilde çalıştırılır.
  4. Yineleyici, Images dizisindeki her bir görüntüyü tek tek işleyerek döngü yapar.
  5. Her yineleme, Veri alanını şu şekilde çözümler: toBinary(Veri, 'base64') ve Ad alanını dosya adı olarak kullanarak görüntüyü Google Drive'daki "Ürün Görselleri" klasörüne yükler.
Tam metin araması için indeks sözleşme metni
  1. Google Drive Dosya İzleme özelliği, yeni bir sözleşme eklendiğinde tetiklenir. PDF "Sözleşmeler" klasörüne eklenir.
  2. Google Drive'dan Dosya Al seçeneği, ikili dosyayı indirir.
  3. Kaynakları Çıkarma işlemi, Metni Çıkarma seçeneği Evet, Görüntüleri Çıkarma seçeneği Hayır olarak ayarlanmış şekilde çalıştırılır.
  4. Metin çıktısı, dosya adı ve yükleme tarihiyle birlikte bir Airtable kaydına yazılır.
  5. Sözleşme artık Airtable'da tam metin olarak aranabilir, manuel kopyala-yapıştır işlemine gerek yok.
Eski verileri taşı PDFsMetni veritabanına, görselleri medya kütüphanesine dönüştür.
  1. Google Sheets'te bir satır PDF URL, geçiş listesindeki her eski belge için senaryoyu tetikler.
  2. Bir HTTP modül indiriyor PDF URL'den.
  3. Kaynakları Çıkarma işlemi, hem Metni Çıkarma hem de Görüntüleri Çıkarma seçenekleri Evet olarak ayarlanmış şekilde çalıştırılır.
  4. Metinler alanı bir MySQL Tam metin araması için veritabanı kaydı.
  5. Yineleyici, çıkarılan her görüntüyü bir yere yükler. SharePoint medya kütüphanesi, içeriğin taşınmasını hiç açmadan tamamlıyor. PDFs manuel olarak.

Sıkça Sorulan Sorular

How do I save each extracted image to cloud storage?+
Add a Make Iterator module after Extract Resources and point it at the Images array output. Each iteration yields one image object with a Name field (original filename with extension, e.g. image_001.png) and a Data field (Base64-encoded content). Convert Data to binary using Make's toBinary(Data, 'base64') function, then pipe the binary into a Dropbox Upload a File, Google Drive Upload a File, or SharePoint module: using the Name field as the destination filename.
Can I extract only images, only text, or both?+
The two toggles are fully independent. Set Extract Images to Yes and Extract Text to No to retrieve only images. Set Extract Text to Yes and Extract Images to No for text only. Enable both to retrieve everything in a single module call: PDF4me processes the document once and returns both outputs together, which is more efficient than running the module twice.
Will text extraction work on scanned PDFs?+
Scanned PDFs are essentially images of pages: they contain no embedded text layer. The Extract Text toggle retrieves text from the PDF's internal text structure, which only exists in digitally created (native) PDFs. For scanned documents, the Texts output will be empty or contain only minimal metadata. Run a PDF OCR module first to add a text layer to the scanned PDF, then use Extract Resources to pull the text.
What image formats are returned: PNG, JPG, or something else?+
The format depends on how each image is stored inside the PDF. Most PDFs embed images as JPEG or PNG. The Name field in each Images array item includes the original extension (e.g. image_001.jpg or image_002.png) so you know the format before saving. The Data field is always Base64 regardless of the underlying format.
Does the module modify or damage the source PDF?+
No. Extract Resources is a read-only operation. It reads the PDF content and returns copies of the embedded text and images: the source file in Dropbox, Google Drive, SharePoint, or any other location is completely untouched. You can run Extract Resources on the same PDF multiple times without any side effects.

İlgili Modüller

Yardım Alın