Zum Hauptinhalt springen

Rohstoffe gewinnen PDF In Make

Was dieses Modul bewirkt

PDF4me, Ressourcen extrahieren extrahiert alle eingebetteten Bilder und Textinhalte aus einem PDF und gibt sie als strukturierte Daten in Ihrem Make Szenario. Umschalten. Bilder extrahieren um jedes im Dokument eingebettete Bild als benanntes Bild abzurufen, Base64-kodierte Datei. Umschalten Text aus dem Text extrahieren Um den vollständigen Textinhalt als einfachen String abzurufen. Beides kann gleichzeitig in einem einzigen Modulaufruf ausgeführt werden. Verwenden Sie extrahierte Bilder zum Erstellen von Asset-Bibliotheken und extrahierten Text für Analysen, Suchindizierung oder Übersetzungen – alles ohne die Datei zu öffnen. PDF manuell.

Verwandte Blog-Beiträge
Zu dieser Funktion gibt es noch keinen Blogbeitrag – folgt in Kürze.
Schauen Sie sich in der Zwischenzeit im PDF4me-Blog Tutorials und Arbeitsabläufe für alle Plattformen an.
Besuchen Sie den Blog

Authentifizierung Ihres API Anfrage

Jeder PDF4me Modul in Make erfordert eine gültige VerbindungErstellen oder wählen Sie einen Eintrag aus, der Ihre Daten enthält. PDF4me API Der Schlüssel dient dazu, dass das Szenario Extraktionsanfragen sicher authentifizieren kann.

Wichtige Fakten, die Sie nicht verpassen sollten

Das Array „Bilder“ benötigt einen Iterator, um jedes einzelne Bild zu verarbeiten.
Die Ausgabe der Bilder ist ein Array, wobei jedes Bild ein Element enthält. Um jedes Bild einzeln hochzuladen oder zu verarbeiten, fügen Sie einen Befehl hinzu. Make Iterator Das Modul wird unmittelbar nach „Ressourcen extrahieren“ ausgeführt und auf das Array „Bilder“ verwiesen. Jede Iteration liefert ein Bild mit einem Name Feld (Dateiname) und ein Daten Feld (Base64-Inhalt). Ohne einen Iterator können Sie nicht auf einzelne Bilder in nachfolgenden Prozessen zugreifen.
Bilddaten sind Base64, vor dem Hochladen dekodieren
Jedes Bild Daten Das Feld ist Base64-kodiert. Cloud-Speichermodule (Dropbox, Google Drive, SharePoint) Erwarte Binärdaten, nicht Base64 Text. Verwenden Sie Makeeingebaut toBinary(Data, 'base64') Funktion zur Konvertierung des Datenfelds in Binärdaten, bevor es an ein Upload-Modul weitergeleitet wird. Name Das Feld gibt Ihnen den ursprünglichen Dateinamen mit Erweiterung an (z.B. image_001.png).
Die Textextraktion funktioniert auf nativen PDFsnicht gescannt
Die Option „Text extrahieren“ ruft durchsuchbaren Text ab, der im Code eingebettet ist. PDF Struktur. Gescannt PDFs Da sie bildbasiert sind und keine eingebettete Textebene enthalten, ist die Textausgabe bei gescannten Dokumenten leer oder minimal. Um Text aus gescannten Seiten zu extrahieren, führen Sie einen PDF OCR Zuerst wird ein Modul erstellt, um eine Textebene zu erstellen. Anschließend wird der Text mithilfe von „Ressourcen extrahieren“ extrahiert. Die Bildextraktion funktioniert auf allen Modulen. PDFs einschließlich gescannter Exemplare.
Das PDF4me-Modul „Ressourcen extrahieren“ zeigt folgende Einstellungen an: Verbindung auf „Meine PDF4me-Verbindung“ eingestellt, Dateiname aus Schritt 1 zugeordnet, Dokument aus den Daten von Schritt 1 zugeordnet, Bilder extrahieren auf „Ja“ gesetzt, Text extrahieren auf „Ja“ gesetzt.

„Bilder extrahieren“ und „Text extrahieren“ sind unabhängige Schalter. Aktivieren Sie je nach Bedarf einen, beide oder nur einen. Bilder werden als Array, Text als einfacher String zurückgegeben.

Parameter

Erforderlich: Verbindung, Dateiname, Dokument, Bilder extrahieren und Text extrahieren müssen angegeben werden. Setzen Sie mindestens eine der Optionen „Bilder extrahieren“ oder „Text extrahieren“ auf „Ja“. Andernfalls werden keine Inhalte angezeigt.

ParameterErforderlichWas es tutBeispiel
ConnectionYesPDF4me API connection. Click Add and paste your API key if connecting for the first time.My PDF4me connection
File NameYesFilename of the source PDF including .pdf extension. Map from the prior module's file name output.catalog.pdf
DocumentYesBinary content of the source PDF. Map from the prior module's data output: Dropbox, Google Drive, HTTP, or email attachment.1. Data
Extract ImagesYesToggle to extract all embedded images. Set to Yes to retrieve images as a named Base64 array. Set to No to skip image extraction. Can be combined with Extract Text.Yes
Extract TextYesToggle to extract all text content. Set to Yes to retrieve the full document text as a plain string. Set to No to skip text extraction. Works on native PDFs only: not scanned.Yes

Ausgabefelder

FeldTypBeschreibung
TexteStringVollständiger Textinhalt extrahiert aus dem PDF als einfacher String. Leer, wenn „Text extrahieren“ auf „Nein“ gesetzt ist oder die PDF wird gescannt.
BilderArrayArray aller eingebetteten Bilder. Jedes Element hat eine Name (Dateiname mit Erweiterung) und Daten (Base64(kodierter Bildinhalt). Leeres Array, wenn "Bilder extrahieren" auf "Nein" gesetzt ist.

Schnellkonfiguration

  1. Hinzufügen PDF4meRohstoffgewinnung zu Ihrem Make Szenario nach dem Herunterladen einer Datei.
  2. Wählen Verbindung (oder klicken Sie hier) Hinzufügen um einen mit Ihrem API Schlüssel).
  3. Karte Dateiname Und Dokumentieren aus dem vorherigen Modul.
  4. Satz Bilder extrahieren und/oder Text aus dem Text extrahieren Zu Ja je nachdem, was Sie benötigen.
  5. Wenn Sie Bilder extrahieren, fügen Sie ein Iterator Modul, das auf das Bilder Array. Innerhalb des Iterators verwenden Sie toBinary(Data, 'base64') Jedes Bild wird dekodiert und an ein Upload-Modul weitergeleitet.
  6. Wenn Sie Text extrahieren, ordnen Sie die folgenden Elemente zu: Texte ein Feld direkt in eine Google Sheets-Zeile einfügen, in die Datenbank einfügen oder HTTP POST-Text.

Workflow-Beispiele

Workflow-BeispieleCommon Make scenario patterns using Extract Resources.
Erstellen Sie eine Bildbibliothek aus dem Produktkatalog PDFs
  1. Der Dropbox-Überwachungsordner wird ausgelöst, wenn ein neuer Katalog erstellt wird. PDF wurde hochgeladen.
  2. Dropbox lädt eine Datei herunter PDF Binär.
  3. Extract Resources wird ausgeführt, wenn Extract Images auf Yes und Extract Text auf No gesetzt ist.
  4. Der Iterator durchläuft das Images-Array, wobei in jeder Iteration ein Bild vorkommt.
  5. In jeder Iteration wird das Datenfeld dekodiert mit toBinary(Data, 'base64') und lädt das Bild in einen Google Drive-Ordner namens „Produktbilder“ hoch, wobei das Feld „Name“ als Dateiname verwendet wird.
Indexvertragstext für die Volltextsuche
  1. Google Drive-Dateienüberwachung wird ausgelöst, wenn ein neuer Vertrag erstellt wird PDF wird dem Ordner „Verträge“ hinzugefügt.
  2. Google Drive „Datei abrufen“ lädt die Binärdatei herunter.
  3. Extract Resources wird ausgeführt, wenn Extract Text auf Ja und Extract Images auf Nein eingestellt ist.
  4. Die Textausgabe wird zusammen mit dem Dateinamen und dem Upload-Datum in einem Airtable-Datensatz gespeichert.
  5. Der Vertrag ist jetzt in Airtable im Volltext durchsuchbar, manuelles Kopieren und Einfügen ist nicht mehr erforderlich.
Legacy-Migration PDFsText in Datenbank, Bilder in Medienbibliothek
  1. Eine Google Sheets-Zeile mit einem PDF Die URL löst das Szenario für jedes Legacy-Dokument in der Migrationsliste aus.
  2. Ein HTTP Modul lädt die PDF von der URL.
  3. Extract Resources wird ausgeführt, wenn sowohl Extract Text als auch Extract Images auf Ja eingestellt sind.
  4. Das Textfeld wird in ein MySQL Datenbankeintrag für die Volltextsuche.
  5. Ein Iterator lädt jedes extrahierte Bild in einen SharePoint Medienbibliothek, wobei die Inhaltsmigration abgeschlossen wird, ohne dass sie jemals geöffnet wird PDFs manuell.

Häufig gestellte Fragen

How do I save each extracted image to cloud storage?+
Add a Make Iterator module after Extract Resources and point it at the Images array output. Each iteration yields one image object with a Name field (original filename with extension, e.g. image_001.png) and a Data field (Base64-encoded content). Convert Data to binary using Make's toBinary(Data, 'base64') function, then pipe the binary into a Dropbox Upload a File, Google Drive Upload a File, or SharePoint module: using the Name field as the destination filename.
Can I extract only images, only text, or both?+
The two toggles are fully independent. Set Extract Images to Yes and Extract Text to No to retrieve only images. Set Extract Text to Yes and Extract Images to No for text only. Enable both to retrieve everything in a single module call: PDF4me processes the document once and returns both outputs together, which is more efficient than running the module twice.
Will text extraction work on scanned PDFs?+
Scanned PDFs are essentially images of pages: they contain no embedded text layer. The Extract Text toggle retrieves text from the PDF's internal text structure, which only exists in digitally created (native) PDFs. For scanned documents, the Texts output will be empty or contain only minimal metadata. Run a PDF OCR module first to add a text layer to the scanned PDF, then use Extract Resources to pull the text.
What image formats are returned: PNG, JPG, or something else?+
The format depends on how each image is stored inside the PDF. Most PDFs embed images as JPEG or PNG. The Name field in each Images array item includes the original extension (e.g. image_001.jpg or image_002.png) so you know the format before saving. The Data field is always Base64 regardless of the underlying format.
Does the module modify or damage the source PDF?+
No. Extract Resources is a read-only operation. It reads the PDF content and returns copies of the embedded text and images: the source file in Dropbox, Google Drive, SharePoint, or any other location is completely untouched. You can run Extract Resources on the same PDF multiple times without any side effects.

Verwandte Module

Hilfe erhalten