Ekstrak Sumber Daya dari PDF di dalam Make
Fungsi modul ini
PDF4me, Ekstrak Sumber Daya mengekstrak semua gambar dan konten teks yang tertanam dari sebuah PDF dan mengembalikannya sebagai data terstruktur di dalam Make skenario. Beralih Ekstrak Gambar untuk mengambil setiap gambar yang tertanam dalam dokumen sebagai gambar bernama, Base64-file yang dienkode. Beralih Kutipan Teks untuk mengambil konten teks lengkap sebagai string biasa. Keduanya dapat berjalan secara bersamaan dalam satu panggilan modul. Gunakan gambar yang diekstrak untuk membangun pustaka aset, gunakan teks yang diekstrak untuk analisis, pengindeksan pencarian, atau terjemahan, semuanya tanpa membuka PDF secara manual.
Memverifikasi Identitas Anda API Meminta
Setiap PDF4me modul di Make memerlukan validitas KoneksiBuat atau pilih salah satu yang sesuai dengan kebutuhan Anda. PDF4me API kunci agar skenario tersebut dapat mengautentikasi permintaan ekstraksi dengan aman.
Fakta Penting yang Tidak Boleh Anda Lewatkan
Nama kolom (nama file) dan sebuah Data bidang (konten Base64). Tanpa Iterator, Anda tidak dapat mengakses gambar individual di hilir.Data Kolom tersebut dikodekan dalam Base64. Modul penyimpanan cloud (Dropbox, Google Drive, SharePoint) mengharapkan data biner, bukan Base64 teks. Gunakan Makebawaan keBiner(Data, 'base64') Fungsi untuk mengkonversi kolom Data ke biner sebelum memasukkannya ke dalam modul unggahan. Nama Kolom ini memberikan nama file asli beserta ekstensinya (misalnya, gambar_001.png).
Ekstrak Gambar dan Ekstrak Teks adalah tombol yang terpisah, aktifkan satu, keduanya, atau salah satunya tergantung kebutuhan Anda. Gambar dikembalikan sebagai array; Teks dikembalikan sebagai string biasa.
Parameter
Diperlukan: Koneksi, Nama File, Dokumen, Ekstrak Gambar, dan Ekstrak Teks semuanya harus disediakan. Atur setidaknya salah satu dari Ekstrak Gambar atau Ekstrak Teks ke Ya; jika tidak diaktifkan, tidak akan ada konten yang dihasilkan.
| Parameter | Diperlukan | Apa fungsinya? | Contoh |
|---|---|---|---|
| Connection | Yes | PDF4me API connection. Click Add and paste your API key if connecting for the first time. | My PDF4me connection |
| File Name | Yes | Filename of the source PDF including .pdf extension. Map from the prior module's file name output. | catalog.pdf |
| Document | Yes | Binary content of the source PDF. Map from the prior module's data output: Dropbox, Google Drive, HTTP, or email attachment. | 1. Data |
| Extract Images | Yes | Toggle to extract all embedded images. Set to Yes to retrieve images as a named Base64 array. Set to No to skip image extraction. Can be combined with Extract Text. | Yes |
| Extract Text | Yes | Toggle to extract all text content. Set to Yes to retrieve the full document text as a plain string. Set to No to skip text extraction. Works on native PDFs only: not scanned. | Yes |
Bidang Keluaran
| Bidang | Jenis | Keterangan |
|---|---|---|
| Teks | String | Isi teks lengkap diekstrak dari PDF sebagai string biasa. Kosong jika Ekstrak Teks diatur ke Tidak atau PDF dipindai. |
| Gambar | Array | Array dari semua gambar yang disematkan. Setiap item memiliki Nama (nama file dengan ekstensi) dan Data (Base64-konten gambar yang dikodekan). Array kosong jika Ekstrak Gambar adalah Tidak. |
Pengaturan Cepat
- Menambahkan PDF4me → Ekstrak Sumber Daya untuk Anda Make skenario setelah langkah pengunduhan file.
- Pilih Koneksi (atau klik) Menambahkan untuk membuat satu dengan milikmu API kunci).
- Peta Nama File Dan Dokumen dari modul sebelumnya.
- Mengatur Ekstrak Gambar dan/atau Kutipan Teks ke Ya tergantung pada apa yang Anda butuhkan.
- Jika mengekstrak gambar, tambahkan Iterator modul menunjuk ke Gambar array. Di dalam iterator, gunakan
toBinary(Data, 'base64')untuk mendekode setiap gambar dan mengirimkannya ke modul unggah. - Jika mengekstrak teks, petakan Teks memasukkan kolom secara langsung ke dalam baris Google Sheets, menyisipkan ke dalam basis data, atau HTTP Isi POST.
Contoh Alur Kerja
Contoh Alur KerjaCommon Make scenario patterns using Extract Resources.
- Fitur Pantauan Folder Dropbox aktif ketika ada katalog baru. PDF sudah diunggah.
- Dropbox Download a File mengambil PDF biner.
- Ekstraksi Sumber Daya dijalankan dengan Ekstraksi Gambar diatur ke Ya, Ekstraksi Teks diatur ke Tidak.
- Iterator melakukan perulangan melalui array Images, satu gambar per iterasi.
- Setiap iterasi mendekode bidang Data dengan
keBiner(Data, 'base64')dan mengunggah gambar ke folder "Gambar Produk" di Google Drive menggunakan kolom Nama sebagai nama file.
- Fitur "Watch Files" di Google Drive akan aktif ketika ada kontrak baru. PDF ditambahkan ke folder "Kontrak".
- Google Drive Get a File mengunduh file biner.
- Ekstraksi Sumber Daya dijalankan dengan Ekstraksi Teks diatur ke Ya, Ekstraksi Gambar diatur ke Tidak.
- Output teks akan ditulis ke dalam catatan Airtable bersama dengan nama file dan tanggal unggah.
- Kontrak tersebut kini dapat dicari teks lengkapnya di Airtable, tanpa perlu salin-tempel manual.
- Baris Google Sheets dengan PDF URL memicu skenario untuk setiap dokumen lama dalam daftar migrasi.
- Sebuah HTTP modul mengunduh PDF dari URL tersebut.
- Ekstrak Sumber Daya dijalankan dengan Ekstrak Teks dan Ekstrak Gambar sama-sama diatur ke Ya.
- Kolom Teks dimasukkan ke dalam MySQL catatan basis data untuk pencarian teks lengkap.
- Iterator mengunggah setiap gambar yang diekstrak ke sebuah SharePoint perpustakaan media, menyelesaikan migrasi konten tanpa pernah membukanya. PDFs secara manual.