Passa al contenuto principale

Estrai risorse da PDF In Make

Cosa fa questo modulo

PDF4me, Estrazione di risorse estrae tutte le immagini e il contenuto testuale incorporati da un PDF e li restituisce come dati strutturati nel tuo Make scenario. Attiva/disattiva Estrai immagini per recuperare ogni immagine incorporata nel documento come denominata, Base64-file codificato. Attiva/disattiva Testo estratto per recuperare il contenuto completo del testo come stringa semplice. Entrambi possono essere eseguiti simultaneamente in una singola chiamata di modulo. Utilizza le immagini estratte per creare librerie di risorse, utilizza il testo estratto per l'analisi, l'indicizzazione della ricerca o la traduzione, il tutto senza aprire il PDF automaticamente.

Articoli correlati del blog
Non ci sono ancora post sul blog dedicati a questa funzionalità — in arrivo a breve.
Nel frattempo, dai un'occhiata al blog di PDF4me per trovare tutorial e procedure operative su tutte le piattaforme.
Visita il blog

Autenticazione del tuo API Richiesta

Ogni PDF4me modulo in Make richiede un valido Connessione. Crea o selezionane uno che contenga il tuo PDF4me API chiave affinché lo scenario possa autenticare in modo sicuro le richieste di estrazione.

Informazioni importanti da non perdere

L'array di immagini necessita di un iteratore per elaborarle singolarmente
L'output delle immagini è un array, un elemento per ogni immagine incorporata. Per caricare o elaborare ogni immagine separatamente, aggiungere un Make Iteratore modulo subito dopo Estrai risorse e puntalo all'array Immagini. Ogni iterazione ti dà un'immagine con un Nome campo (nome file) e un Dati campo (contenuto Base64). Senza un iteratore, non è possibile accedere alle singole immagini a valle.
I dati dell'immagine sono Base64decodifica prima del caricamento
Ogni immagine Dati il campo è codificato in Base64. Moduli di archiviazione cloud (Dropbox, Google Drive, SharePoint) aspettarsi dati binari, non Base64 testo. Usa Makeintegrato toBinary(Data, 'base64') funzione per convertire il campo Dati in binario prima di inviarlo tramite pipe a un modulo di caricamento. Nome il campo fornisce il nome del file originale con estensione (ad esempio image_001.png).
L'estrazione del testo funziona sul nativo PDFs, non scansionato
L'interruttore Estrai testo recupera il testo ricercabile incorporato nel PDF struttura. Scansionata PDFs sono basati su immagini, non contengono un livello di testo incorporato, quindi l'output dei testi sarà vuoto o minimo sui documenti scansionati. Per estrarre il testo dalle pagine scansionate, eseguire un PDF OCR modulo prima per creare un livello di testo, quindi usa Estrai risorse per estrarre il testo. L'estrazione delle immagini funziona su tutti PDFs comprese quelle scansionate.
Crea il modulo PDF4me Extract Resources che mostra Connessione impostata su La mia connessione PDF4me, Nome file mappato dal passaggio 1, Documento mappato dai dati del passaggio 1, Estrai immagini impostato su Sì, Estrai testo impostato su Sì

Le opzioni "Estrai immagini" ed "Estrai testo" sono interruttori indipendenti; è possibile attivarne uno, entrambi o uno dei due a seconda delle necessità. Le immagini vengono restituite come array, mentre il testo viene restituito come stringa semplice.

Parametri

Necessario: È necessario specificare Connessione, Nome file, Documento, Estrai immagini ed Estrai testo. Imposta almeno una delle opzioni Estrai immagini o Estrai testo su Sì; l'attivazione di entrambe non restituirà alcun contenuto.

ParametroNecessarioCosa faEsempio
ConnectionYesPDF4me API connection. Click Add and paste your API key if connecting for the first time.My PDF4me connection
File NameYesFilename of the source PDF including .pdf extension. Map from the prior module's file name output.catalog.pdf
DocumentYesBinary content of the source PDF. Map from the prior module's data output: Dropbox, Google Drive, HTTP, or email attachment.1. Data
Extract ImagesYesToggle to extract all embedded images. Set to Yes to retrieve images as a named Base64 array. Set to No to skip image extraction. Can be combined with Extract Text.Yes
Extract TextYesToggle to extract all text content. Set to Yes to retrieve the full document text as a plain string. Set to No to skip text extraction. Works on native PDFs only: not scanned.Yes

Campi di output

CampoTipoDescrizione
TestiStringContenuto testuale completo estratto da PDF come una semplice stringa. Vuoto se Estrai testo è impostato su No o PDF viene scansionato.
ImmaginiArrayArray di tutte le immagini incorporate. Ogni elemento ha un Nome (nome del file con estensione) e Dati Base64-contenuto dell'immagine codificata). Array vuoto se Extract Images è No.

Configurazione rapida

  1. Aggiungere PDF4meEstrarre risorse al tuo Make scenario successivo alla fase di download di un file.
  2. Seleziona Connessione (oppure fai clic) Aggiungere per crearne uno con il tuo API chiave).
  3. Mappa Nome del file E Documento dal modulo precedente.
  4. Impostato Estrai immagini e/o Testo estratto A a seconda delle tue esigenze.
  5. Se si estraggono immagini, aggiungere un Iteratore modulo puntato al Immagini array. All'interno dell'iteratore, usa toBinary(Data, 'base64') decodificare ciascuna immagine e inviarla a un modulo di caricamento.
  6. Se si estrae il testo, mappare il Testi campo direttamente in una riga di Fogli Google, inserimento nel database o HTTP Corpo del messaggio POST.

Esempi di flusso di lavoro

Esempi di flusso di lavoroCommon Make scenario patterns using Extract Resources.
Creare una libreria di immagini dal catalogo prodotti PDFs
  1. La cartella di monitoraggio di Dropbox si attiva quando viene creato un nuovo catalogo PDF viene caricato.
  2. Dropbox Scarica un file recupera il PDF binario
  3. L'estrazione delle risorse viene eseguita con l'opzione "Estrai immagini" impostata su "Sì" e "Estrai testo" impostata su "No".
  4. L'iteratore scorre l'array Images, un'immagine per iterazione.
  5. Ogni iterazione decodifica il campo Dati con toBinary(Data, 'base64') e carica l'immagine in una cartella di Google Drive denominata "Immagini prodotto" utilizzando il campo Nome come nome del file.
Testo del contratto di indicizzazione per la ricerca a testo completo
  1. Google Drive Watch Files si attiva quando viene stipulato un nuovo contratto PDF viene aggiunto alla cartella "Contratti".
  2. Google Drive "Ottieni un file" scarica il file binario.
  3. L'estrazione delle risorse viene eseguita con l'opzione "Estrai testo" impostata su "Sì" e "Estrai immagini" impostata su "No".
  4. L'output dei testi viene scritto in un record di Airtable insieme al nome del file e alla data di caricamento.
  5. Il contratto è ora ricercabile a testo completo in Airtable, senza bisogno di copia e incolla manuale.
Migrare l'eredità PDFstesto nel database, immagini nella libreria multimediale
  1. Una riga di Fogli Google con un PDF L'URL attiva lo scenario per ogni documento legacy presente nell'elenco di migrazione.
  2. UN HTTP il modulo scarica il PDF dall'URL.
  3. L'estrazione delle risorse viene eseguita con entrambe le opzioni "Estrai testo" e "Estrai immagini" impostate su "Sì".
  4. Il campo Testi viene inserito in un MySQL record del database per la ricerca full-text.
  5. Un iteratore carica ogni immagine estratta su un SharePoint libreria multimediale, completando la migrazione dei contenuti senza mai aprire la PDFs automaticamente.

Domande frequenti

How do I save each extracted image to cloud storage?+
Add a Make Iterator module after Extract Resources and point it at the Images array output. Each iteration yields one image object with a Name field (original filename with extension, e.g. image_001.png) and a Data field (Base64-encoded content). Convert Data to binary using Make's toBinary(Data, 'base64') function, then pipe the binary into a Dropbox Upload a File, Google Drive Upload a File, or SharePoint module: using the Name field as the destination filename.
Can I extract only images, only text, or both?+
The two toggles are fully independent. Set Extract Images to Yes and Extract Text to No to retrieve only images. Set Extract Text to Yes and Extract Images to No for text only. Enable both to retrieve everything in a single module call: PDF4me processes the document once and returns both outputs together, which is more efficient than running the module twice.
Will text extraction work on scanned PDFs?+
Scanned PDFs are essentially images of pages: they contain no embedded text layer. The Extract Text toggle retrieves text from the PDF's internal text structure, which only exists in digitally created (native) PDFs. For scanned documents, the Texts output will be empty or contain only minimal metadata. Run a PDF OCR module first to add a text layer to the scanned PDF, then use Extract Resources to pull the text.
What image formats are returned: PNG, JPG, or something else?+
The format depends on how each image is stored inside the PDF. Most PDFs embed images as JPEG or PNG. The Name field in each Images array item includes the original extension (e.g. image_001.jpg or image_002.png) so you know the format before saving. The Data field is always Base64 regardless of the underlying format.
Does the module modify or damage the source PDF?+
No. Extract Resources is a read-only operation. It reads the PDF content and returns copies of the embedded text and images: the source file in Dropbox, Google Drive, SharePoint, or any other location is completely untouched. You can run Extract Resources on the same PDF multiple times without any side effects.

Moduli correlati

Richiedi assistenza