Rohstoffe gewinnen PDF In Make
Was dieses Modul bewirkt
PDF4me, Ressourcen extrahieren extrahiert alle eingebetteten Bilder und Textinhalte aus einem PDF und gibt sie als strukturierte Daten in Ihrem Make Szenario. Umschalten. Bilder extrahieren um jedes im Dokument eingebettete Bild als benanntes Bild abzurufen, Base64-kodierte Datei. Umschalten Text aus dem Text extrahieren Um den vollständigen Textinhalt als einfachen String abzurufen. Beides kann gleichzeitig in einem einzigen Modulaufruf ausgeführt werden. Verwenden Sie extrahierte Bilder zum Erstellen von Asset-Bibliotheken und extrahierten Text für Analysen, Suchindizierung oder Übersetzungen – alles ohne die Datei zu öffnen. PDF manuell.
Authentifizierung Ihres API Anfrage
Jeder PDF4me Modul in Make erfordert eine gültige VerbindungErstellen oder wählen Sie einen Eintrag aus, der Ihre Daten enthält. PDF4me API Der Schlüssel dient dazu, dass das Szenario Extraktionsanfragen sicher authentifizieren kann.
Wichtige Fakten, die Sie nicht verpassen sollten
Name Feld (Dateiname) und ein Daten Feld (Base64-Inhalt). Ohne einen Iterator können Sie nicht auf einzelne Bilder in nachfolgenden Prozessen zugreifen.Daten Das Feld ist Base64-kodiert. Cloud-Speichermodule (Dropbox, Google Drive, SharePoint) Erwarte Binärdaten, nicht Base64 Text. Verwenden Sie Makeeingebaut toBinary(Data, 'base64') Funktion zur Konvertierung des Datenfelds in Binärdaten, bevor es an ein Upload-Modul weitergeleitet wird. Name Das Feld gibt Ihnen den ursprünglichen Dateinamen mit Erweiterung an (z.B. image_001.png).
„Bilder extrahieren“ und „Text extrahieren“ sind unabhängige Schalter. Aktivieren Sie je nach Bedarf einen, beide oder nur einen. Bilder werden als Array, Text als einfacher String zurückgegeben.
Parameter
Erforderlich: Verbindung, Dateiname, Dokument, Bilder extrahieren und Text extrahieren müssen angegeben werden. Setzen Sie mindestens eine der Optionen „Bilder extrahieren“ oder „Text extrahieren“ auf „Ja“. Andernfalls werden keine Inhalte angezeigt.
| Parameter | Erforderlich | Was es tut | Beispiel |
|---|---|---|---|
| Connection | Yes | PDF4me API connection. Click Add and paste your API key if connecting for the first time. | My PDF4me connection |
| File Name | Yes | Filename of the source PDF including .pdf extension. Map from the prior module's file name output. | catalog.pdf |
| Document | Yes | Binary content of the source PDF. Map from the prior module's data output: Dropbox, Google Drive, HTTP, or email attachment. | 1. Data |
| Extract Images | Yes | Toggle to extract all embedded images. Set to Yes to retrieve images as a named Base64 array. Set to No to skip image extraction. Can be combined with Extract Text. | Yes |
| Extract Text | Yes | Toggle to extract all text content. Set to Yes to retrieve the full document text as a plain string. Set to No to skip text extraction. Works on native PDFs only: not scanned. | Yes |
Ausgabefelder
| Feld | Typ | Beschreibung |
|---|---|---|
| Texte | String | Vollständiger Textinhalt extrahiert aus dem PDF als einfacher String. Leer, wenn „Text extrahieren“ auf „Nein“ gesetzt ist oder die PDF wird gescannt. |
| Bilder | Array | Array aller eingebetteten Bilder. Jedes Element hat eine Name (Dateiname mit Erweiterung) und Daten (Base64(kodierter Bildinhalt). Leeres Array, wenn "Bilder extrahieren" auf "Nein" gesetzt ist. |
Schnellkonfiguration
- Hinzufügen PDF4me → Rohstoffgewinnung zu Ihrem Make Szenario nach dem Herunterladen einer Datei.
- Wählen Verbindung (oder klicken Sie hier) Hinzufügen um einen mit Ihrem API Schlüssel).
- Karte Dateiname Und Dokumentieren aus dem vorherigen Modul.
- Satz Bilder extrahieren und/oder Text aus dem Text extrahieren Zu Ja je nachdem, was Sie benötigen.
- Wenn Sie Bilder extrahieren, fügen Sie ein Iterator Modul, das auf das Bilder Array. Innerhalb des Iterators verwenden Sie
toBinary(Data, 'base64')Jedes Bild wird dekodiert und an ein Upload-Modul weitergeleitet. - Wenn Sie Text extrahieren, ordnen Sie die folgenden Elemente zu: Texte ein Feld direkt in eine Google Sheets-Zeile einfügen, in die Datenbank einfügen oder HTTP POST-Text.
Workflow-Beispiele
Workflow-BeispieleCommon Make scenario patterns using Extract Resources.
- Der Dropbox-Überwachungsordner wird ausgelöst, wenn ein neuer Katalog erstellt wird. PDF wurde hochgeladen.
- Dropbox lädt eine Datei herunter PDF Binär.
- Extract Resources wird ausgeführt, wenn Extract Images auf Yes und Extract Text auf No gesetzt ist.
- Der Iterator durchläuft das Images-Array, wobei in jeder Iteration ein Bild vorkommt.
- In jeder Iteration wird das Datenfeld dekodiert mit
toBinary(Data, 'base64')und lädt das Bild in einen Google Drive-Ordner namens „Produktbilder“ hoch, wobei das Feld „Name“ als Dateiname verwendet wird.
- Google Drive-Dateienüberwachung wird ausgelöst, wenn ein neuer Vertrag erstellt wird PDF wird dem Ordner „Verträge“ hinzugefügt.
- Google Drive „Datei abrufen“ lädt die Binärdatei herunter.
- Extract Resources wird ausgeführt, wenn Extract Text auf Ja und Extract Images auf Nein eingestellt ist.
- Die Textausgabe wird zusammen mit dem Dateinamen und dem Upload-Datum in einem Airtable-Datensatz gespeichert.
- Der Vertrag ist jetzt in Airtable im Volltext durchsuchbar, manuelles Kopieren und Einfügen ist nicht mehr erforderlich.
- Eine Google Sheets-Zeile mit einem PDF Die URL löst das Szenario für jedes Legacy-Dokument in der Migrationsliste aus.
- Ein HTTP Modul lädt die PDF von der URL.
- Extract Resources wird ausgeführt, wenn sowohl Extract Text als auch Extract Images auf Ja eingestellt sind.
- Das Textfeld wird in ein MySQL Datenbankeintrag für die Volltextsuche.
- Ein Iterator lädt jedes extrahierte Bild in einen SharePoint Medienbibliothek, wobei die Inhaltsmigration abgeschlossen wird, ohne dass sie jemals geöffnet wird PDFs manuell.