Estrai risorse da PDF In Make
Cosa fa questo modulo
PDF4me, Estrazione di risorse estrae tutte le immagini e il contenuto testuale incorporati da un PDF e li restituisce come dati strutturati nel tuo Make scenario. Attiva/disattiva Estrai immagini per recuperare ogni immagine incorporata nel documento come denominata, Base64-file codificato. Attiva/disattiva Testo estratto per recuperare il contenuto completo del testo come stringa semplice. Entrambi possono essere eseguiti simultaneamente in una singola chiamata di modulo. Utilizza le immagini estratte per creare librerie di risorse, utilizza il testo estratto per l'analisi, l'indicizzazione della ricerca o la traduzione, il tutto senza aprire il PDF automaticamente.
Autenticazione del tuo API Richiesta
Ogni PDF4me modulo in Make richiede un valido Connessione. Crea o selezionane uno che contenga il tuo PDF4me API chiave affinché lo scenario possa autenticare in modo sicuro le richieste di estrazione.
Informazioni importanti da non perdere
Nome campo (nome file) e un Dati campo (contenuto Base64). Senza un iteratore, non è possibile accedere alle singole immagini a valle.Dati il campo è codificato in Base64. Moduli di archiviazione cloud (Dropbox, Google Drive, SharePoint) aspettarsi dati binari, non Base64 testo. Usa Makeintegrato toBinary(Data, 'base64') funzione per convertire il campo Dati in binario prima di inviarlo tramite pipe a un modulo di caricamento. Nome il campo fornisce il nome del file originale con estensione (ad esempio image_001.png).
Le opzioni "Estrai immagini" ed "Estrai testo" sono interruttori indipendenti; è possibile attivarne uno, entrambi o uno dei due a seconda delle necessità. Le immagini vengono restituite come array, mentre il testo viene restituito come stringa semplice.
Parametri
Necessario: È necessario specificare Connessione, Nome file, Documento, Estrai immagini ed Estrai testo. Imposta almeno una delle opzioni Estrai immagini o Estrai testo su Sì; l'attivazione di entrambe non restituirà alcun contenuto.
| Parametro | Necessario | Cosa fa | Esempio |
|---|---|---|---|
| Connection | Yes | PDF4me API connection. Click Add and paste your API key if connecting for the first time. | My PDF4me connection |
| File Name | Yes | Filename of the source PDF including .pdf extension. Map from the prior module's file name output. | catalog.pdf |
| Document | Yes | Binary content of the source PDF. Map from the prior module's data output: Dropbox, Google Drive, HTTP, or email attachment. | 1. Data |
| Extract Images | Yes | Toggle to extract all embedded images. Set to Yes to retrieve images as a named Base64 array. Set to No to skip image extraction. Can be combined with Extract Text. | Yes |
| Extract Text | Yes | Toggle to extract all text content. Set to Yes to retrieve the full document text as a plain string. Set to No to skip text extraction. Works on native PDFs only: not scanned. | Yes |
Campi di output
| Campo | Tipo | Descrizione |
|---|---|---|
| Testi | String | Contenuto testuale completo estratto da PDF come una semplice stringa. Vuoto se Estrai testo è impostato su No o PDF viene scansionato. |
| Immagini | Array | Array di tutte le immagini incorporate. Ogni elemento ha un Nome (nome del file con estensione) e Dati Base64-contenuto dell'immagine codificata). Array vuoto se Extract Images è No. |
Configurazione rapida
- Aggiungere PDF4me → Estrarre risorse al tuo Make scenario successivo alla fase di download di un file.
- Seleziona Connessione (oppure fai clic) Aggiungere per crearne uno con il tuo API chiave).
- Mappa Nome del file E Documento dal modulo precedente.
- Impostato Estrai immagini e/o Testo estratto A SÌ a seconda delle tue esigenze.
- Se si estraggono immagini, aggiungere un Iteratore modulo puntato al Immagini array. All'interno dell'iteratore, usa
toBinary(Data, 'base64')decodificare ciascuna immagine e inviarla a un modulo di caricamento. - Se si estrae il testo, mappare il Testi campo direttamente in una riga di Fogli Google, inserimento nel database o HTTP Corpo del messaggio POST.
Esempi di flusso di lavoro
Esempi di flusso di lavoroCommon Make scenario patterns using Extract Resources.
- La cartella di monitoraggio di Dropbox si attiva quando viene creato un nuovo catalogo PDF viene caricato.
- Dropbox Scarica un file recupera il PDF binario
- L'estrazione delle risorse viene eseguita con l'opzione "Estrai immagini" impostata su "Sì" e "Estrai testo" impostata su "No".
- L'iteratore scorre l'array Images, un'immagine per iterazione.
- Ogni iterazione decodifica il campo Dati con
toBinary(Data, 'base64')e carica l'immagine in una cartella di Google Drive denominata "Immagini prodotto" utilizzando il campo Nome come nome del file.
- Google Drive Watch Files si attiva quando viene stipulato un nuovo contratto PDF viene aggiunto alla cartella "Contratti".
- Google Drive "Ottieni un file" scarica il file binario.
- L'estrazione delle risorse viene eseguita con l'opzione "Estrai testo" impostata su "Sì" e "Estrai immagini" impostata su "No".
- L'output dei testi viene scritto in un record di Airtable insieme al nome del file e alla data di caricamento.
- Il contratto è ora ricercabile a testo completo in Airtable, senza bisogno di copia e incolla manuale.
- Una riga di Fogli Google con un PDF L'URL attiva lo scenario per ogni documento legacy presente nell'elenco di migrazione.
- UN HTTP il modulo scarica il PDF dall'URL.
- L'estrazione delle risorse viene eseguita con entrambe le opzioni "Estrai testo" e "Estrai immagini" impostate su "Sì".
- Il campo Testi viene inserito in un MySQL record del database per la ricerca full-text.
- Un iteratore carica ogni immagine estratta su un SharePoint libreria multimediale, completando la migrazione dei contenuti senza mai aprire la PDFs automaticamente.