Lewati ke konten utama

Ekstrak Sumber Daya dari PDF di dalam Make

Fungsi modul ini

PDF4me, Ekstrak Sumber Daya mengekstrak semua gambar dan konten teks yang tertanam dari sebuah PDF dan mengembalikannya sebagai data terstruktur di dalam Make skenario. Beralih Ekstrak Gambar untuk mengambil setiap gambar yang tertanam dalam dokumen sebagai gambar bernama, Base64-file yang dienkode. Beralih Kutipan Teks untuk mengambil konten teks lengkap sebagai string biasa. Keduanya dapat berjalan secara bersamaan dalam satu panggilan modul. Gunakan gambar yang diekstrak untuk membangun pustaka aset, gunakan teks yang diekstrak untuk analisis, pengindeksan pencarian, atau terjemahan, semuanya tanpa membuka PDF secara manual.

Postingan Blog Terkait
Belum ada postingan blog untuk fitur ini — akan segera hadir.
Sementara itu, jelajahi blog PDF4me untuk menemukan tutorial dan alur kerja di berbagai platform.
Kunjungi blog ini

Memverifikasi Identitas Anda API Meminta

Setiap PDF4me modul di Make memerlukan validitas KoneksiBuat atau pilih salah satu yang sesuai dengan kebutuhan Anda. PDF4me API kunci agar skenario tersebut dapat mengautentikasi permintaan ekstraksi dengan aman.

Fakta Penting yang Tidak Boleh Anda Lewatkan

Array gambar membutuhkan Iterator untuk memprosesnya satu per satu.
Output Gambar berupa array, satu item untuk setiap gambar yang disematkan. Untuk mengunggah atau memproses setiap gambar secara terpisah, tambahkan Make Iterator Setelah modul Extract Resources, arahkan ke array Images. Setiap iterasi akan memberikan Anda satu gambar dengan Nama kolom (nama file) dan sebuah Data bidang (konten Base64). Tanpa Iterator, Anda tidak dapat mengakses gambar individual di hilir.
Data Gambar adalah Base64, dekode sebelum mengunggah
Setiap gambar Data Kolom tersebut dikodekan dalam Base64. Modul penyimpanan cloud (Dropbox, Google Drive, SharePoint) mengharapkan data biner, bukan Base64 teks. Gunakan Makebawaan keBiner(Data, 'base64') Fungsi untuk mengkonversi kolom Data ke biner sebelum memasukkannya ke dalam modul unggahan. Nama Kolom ini memberikan nama file asli beserta ekstensinya (misalnya, gambar_001.png).
Ekstraksi teks berfungsi pada bahasa asli. PDFs, tidak dipindai
Tombol Ekstrak Teks mengambil teks yang dapat dicari yang tertanam di dalam PDF struktur. Dipindai PDFs Karena berbasis gambar, dokumen tersebut tidak mengandung lapisan teks yang tertanam, sehingga output Teks akan kosong atau minimal pada dokumen yang dipindai. Untuk mengekstrak teks dari halaman yang dipindai, jalankan perintah berikut: PDF OCR Pertama, buat lapisan teks menggunakan modul ini, lalu gunakan Ekstrak Sumber Daya untuk mengambil teks. Ekstraksi gambar berfungsi pada semua PDFs termasuk yang dipindai.
Pastikan modul Ekstrak Sumber Daya PDF4me menampilkan Koneksi diatur ke Koneksi PDF4me saya, Nama File dipetakan dari langkah 1, Dokumen dipetakan dari data langkah 1, Ekstrak Gambar diatur ke Ya, Ekstrak Teks diatur ke Ya.

Ekstrak Gambar dan Ekstrak Teks adalah tombol yang terpisah, aktifkan satu, keduanya, atau salah satunya tergantung kebutuhan Anda. Gambar dikembalikan sebagai array; Teks dikembalikan sebagai string biasa.

Parameter

Diperlukan: Koneksi, Nama File, Dokumen, Ekstrak Gambar, dan Ekstrak Teks semuanya harus disediakan. Atur setidaknya salah satu dari Ekstrak Gambar atau Ekstrak Teks ke Ya; jika tidak diaktifkan, tidak akan ada konten yang dihasilkan.

ParameterDiperlukanApa fungsinya?Contoh
ConnectionYesPDF4me API connection. Click Add and paste your API key if connecting for the first time.My PDF4me connection
File NameYesFilename of the source PDF including .pdf extension. Map from the prior module's file name output.catalog.pdf
DocumentYesBinary content of the source PDF. Map from the prior module's data output: Dropbox, Google Drive, HTTP, or email attachment.1. Data
Extract ImagesYesToggle to extract all embedded images. Set to Yes to retrieve images as a named Base64 array. Set to No to skip image extraction. Can be combined with Extract Text.Yes
Extract TextYesToggle to extract all text content. Set to Yes to retrieve the full document text as a plain string. Set to No to skip text extraction. Works on native PDFs only: not scanned.Yes

Bidang Keluaran

BidangJenisKeterangan
TeksStringIsi teks lengkap diekstrak dari PDF sebagai string biasa. Kosong jika Ekstrak Teks diatur ke Tidak atau PDF dipindai.
GambarArrayArray dari semua gambar yang disematkan. Setiap item memiliki Nama (nama file dengan ekstensi) dan Data (Base64-konten gambar yang dikodekan). Array kosong jika Ekstrak Gambar adalah Tidak.

Pengaturan Cepat

  1. Menambahkan PDF4meEkstrak Sumber Daya untuk Anda Make skenario setelah langkah pengunduhan file.
  2. Pilih Koneksi (atau klik) Menambahkan untuk membuat satu dengan milikmu API kunci).
  3. Peta Nama File Dan Dokumen dari modul sebelumnya.
  4. Mengatur Ekstrak Gambar dan/atau Kutipan Teks ke Ya tergantung pada apa yang Anda butuhkan.
  5. Jika mengekstrak gambar, tambahkan Iterator modul menunjuk ke Gambar array. Di dalam iterator, gunakan toBinary(Data, 'base64') untuk mendekode setiap gambar dan mengirimkannya ke modul unggah.
  6. Jika mengekstrak teks, petakan Teks memasukkan kolom secara langsung ke dalam baris Google Sheets, menyisipkan ke dalam basis data, atau HTTP Isi POST.

Contoh Alur Kerja

Contoh Alur KerjaCommon Make scenario patterns using Extract Resources.
Buat pustaka gambar dari katalog produk PDFs
  1. Fitur Pantauan Folder Dropbox aktif ketika ada katalog baru. PDF sudah diunggah.
  2. Dropbox Download a File mengambil PDF biner.
  3. Ekstraksi Sumber Daya dijalankan dengan Ekstraksi Gambar diatur ke Ya, Ekstraksi Teks diatur ke Tidak.
  4. Iterator melakukan perulangan melalui array Images, satu gambar per iterasi.
  5. Setiap iterasi mendekode bidang Data dengan keBiner(Data, 'base64') dan mengunggah gambar ke folder "Gambar Produk" di Google Drive menggunakan kolom Nama sebagai nama file.
Indeks teks kontrak untuk pencarian teks lengkap.
  1. Fitur "Watch Files" di Google Drive akan aktif ketika ada kontrak baru. PDF ditambahkan ke folder "Kontrak".
  2. Google Drive Get a File mengunduh file biner.
  3. Ekstraksi Sumber Daya dijalankan dengan Ekstraksi Teks diatur ke Ya, Ekstraksi Gambar diatur ke Tidak.
  4. Output teks akan ditulis ke dalam catatan Airtable bersama dengan nama file dan tanggal unggah.
  5. Kontrak tersebut kini dapat dicari teks lengkapnya di Airtable, tanpa perlu salin-tempel manual.
Migrasi sistem lama PDFs, teks ke basis data, gambar ke perpustakaan media
  1. Baris Google Sheets dengan PDF URL memicu skenario untuk setiap dokumen lama dalam daftar migrasi.
  2. Sebuah HTTP modul mengunduh PDF dari URL tersebut.
  3. Ekstrak Sumber Daya dijalankan dengan Ekstrak Teks dan Ekstrak Gambar sama-sama diatur ke Ya.
  4. Kolom Teks dimasukkan ke dalam MySQL catatan basis data untuk pencarian teks lengkap.
  5. Iterator mengunggah setiap gambar yang diekstrak ke sebuah SharePoint perpustakaan media, menyelesaikan migrasi konten tanpa pernah membukanya. PDFs secara manual.

Pertanyaan yang Sering Diajukan

How do I save each extracted image to cloud storage?+
Add a Make Iterator module after Extract Resources and point it at the Images array output. Each iteration yields one image object with a Name field (original filename with extension, e.g. image_001.png) and a Data field (Base64-encoded content). Convert Data to binary using Make's toBinary(Data, 'base64') function, then pipe the binary into a Dropbox Upload a File, Google Drive Upload a File, or SharePoint module: using the Name field as the destination filename.
Can I extract only images, only text, or both?+
The two toggles are fully independent. Set Extract Images to Yes and Extract Text to No to retrieve only images. Set Extract Text to Yes and Extract Images to No for text only. Enable both to retrieve everything in a single module call: PDF4me processes the document once and returns both outputs together, which is more efficient than running the module twice.
Will text extraction work on scanned PDFs?+
Scanned PDFs are essentially images of pages: they contain no embedded text layer. The Extract Text toggle retrieves text from the PDF's internal text structure, which only exists in digitally created (native) PDFs. For scanned documents, the Texts output will be empty or contain only minimal metadata. Run a PDF OCR module first to add a text layer to the scanned PDF, then use Extract Resources to pull the text.
What image formats are returned: PNG, JPG, or something else?+
The format depends on how each image is stored inside the PDF. Most PDFs embed images as JPEG or PNG. The Name field in each Images array item includes the original extension (e.g. image_001.jpg or image_002.png) so you know the format before saving. The Data field is always Base64 regardless of the underlying format.
Does the module modify or damage the source PDF?+
No. Extract Resources is a read-only operation. It reads the PDF content and returns copies of the embedded text and images: the source file in Dropbox, Google Drive, SharePoint, or any other location is completely untouched. You can run Extract Resources on the same PDF multiple times without any side effects.

Modul Terkait

Dapatkan Bantuan