Zum Hauptinhalt springen

PDF OCR In Make

Was dieses Modul bewirkt

PDF4me, PDF OCR konvertiert gescannte oder bildbasierte PDFs in vollständig durchsuchbare Textdokumente innerhalb eines Make Szenario auswählen. Standard Qualität für Digital Natives PDFs oder Experte Qualität für gescannte, fotografierte oder niedrig aufgelöste Dokumente. Aktivieren OCR nur bei Bedarf Seiten überspringen, die bereits auswählbaren Text enthalten, und verwenden Ist asynchron Um Szenario-Timeouts bei Dateien mit mehr als 10 Seiten zu vermeiden, wird eine Ausnahme ausgelöst. Die Ausgabe ist durchsuchbar. PDF bereit für Textextraktion, Archivierung, Volltextindizierung oder AI Verarbeitung.

Verwandte Blog-Beiträge
Zu dieser Funktion gibt es noch keinen Blogbeitrag – folgt in Kürze.
Schauen Sie sich in der Zwischenzeit im PDF4me-Blog Tutorials und Arbeitsabläufe für alle Plattformen an.
Besuchen Sie den Blog

Authentifizierung Ihres API Anfrage

Jeder PDF4me Modul in Make erfordert eine gültige VerbindungErstellen oder wählen Sie einen Eintrag aus, der Ihre Daten enthält. PDF4me API Schlüssel, damit das Szenario authentifiziert werden kann OCR Anfragen werden sicher verarbeitet.

Wichtige Fakten, die Sie nicht verpassen sollten

Expertenqualität vs. Standardqualität
Verwenden Experte Bei gescannten oder fotografierten Dokumenten werden zwei Verarbeitungsdurchgänge pro Seite durchgeführt, um eine höhere Genauigkeit zu erzielen. Standard für Digital Natives PDFs Wo OCR wird weiterhin benötigt, ist aber schneller und kostet nur die Hälfte. API Credits pro Seite.
OCR Nur bei Bedarf spart Guthaben.
Wenn das Modul aktiviert ist, prüft es jede Seite vor der Verarbeitung; Seiten, die bereits auswählbaren Text enthalten, werden übersprungen. OCR wird nur auf bildbasierte Seiten angewendet. Dadurch wird Speicherplatz gespart. API Gutschriften für Ihre Eingabe PDF Vermengt Originalseiten und gescannte Seiten.
Verwenden Sie „Asynchron“ für Dateien mit mehr als 10 Seiten.
Ohne asynchronen Modus, große PDFs kann verursachen Make Szenario, das vor Ablauf der Zeit abläuft OCR wird abgeschlossen. Aktivieren Ist asynchron für jedes Dokument mit mehr als 10 Seiten, damit das Modul die Ergebnisse asynchron zurückgeben kann, wenn die Verarbeitung abgeschlossen ist.
Das PDF4me PDF-OCR-Modul zeigt die im vorherigen Schritt zugeordneten Dateien, den Ausgabedateinamen, den Qualitätstyp „Experte“, die Option „OCR nur bei Bedarf“, den Sprachcode und die Felder „Asynchron“ an.

Dateien, Ausgabedateiname und Qualitätstyp sind erforderlich. OCR Nur bei Bedarf, Sprachcode und Ist Asynchron sind optional, werden aber für gemischte Inhalte und große Datenmengen empfohlen. PDFsDie

Parameter

Erforderlich: Verbindung, Dateien, Ausgabedateiname und Qualitätstyp müssen alle angegeben werden. OCR Nur bei Bedarf, Sprachcode und Ist Asynchron sind optional.

ParameterErforderlichWas es tutBeispiel
ConnectionYesPDF4me API connection. Click Add and paste your API key if connecting for the first time.Your PDF4me connection
FilesYesBinary PDF file mapped from a preceding module: scanned, photographed, or image-based PDFs.1. Data
Output File NameYesFilename for the searchable PDF output including the .pdf extension.scanned_searchable.pdf
Quality TypeYesStandard for born-digital PDFs (1 API call per page, faster). Expert for scanned or image-based documents (2 API calls per page, higher accuracy).Expert
OCR Only When NeededNoWhen set to Yes, pages with existing selectable text are skipped: OCR is applied only to image-based pages. Saves API credits for mixed-content PDFs.Yes
Language CodeNoISO language code for the OCR engine. Common values: eng, deu, fra, spa, ita, por. Leave blank for automatic language detection.eng
Is AsyncNoSet to Yes for PDFs with more than 10 pages to prevent Make scenario timeout. Results are returned asynchronously when processing completes.Yes

Schnellkonfiguration

  1. Hinzufügen PDF4mePDF OCR zu Ihrem Make Szenario.
  2. Wählen Verbindung (oder klicken Sie hier) Hinzufügen um einen mit Ihrem API Schlüssel).
  3. Karte Dateien zur Binärausgabe des vorhergehenden Downloadmoduls (z.B. Dropbox → Datei herunterladen → Data).
  4. Geben Sie eine Name der Ausgabedateiz.B. scanned_searchable.pdfDie
  5. Satz Qualitätsart Zu Expert für gescannte Dokumente oder Standard für Digital Natives PDFsDie
  6. Optional aktivieren OCR Nur bei Bedarf Und Ist asynchron (Bei Dateien mit mehr als 10 Seiten) klicken Sie dann auf Speichern und ausführen. Die Ausgabe Doc Data ist Ihre durchsuchbare PDFDie

Workflow-Beispiele

Workflow-BeispieleCommon Make scenario patterns using PDF OCR.
Eingescannte Rechnung OCR und Datenextraktion
  1. Gmail Die Uhr wird ausgelöst, wenn eine neue E-Mail mit einer gescannten Rechnung im Anhang eingeht.
  2. PDF OCR Läuft mit der Qualitätseinstellung Experte und OCR „Nur bei Bedarf“ aktiviert.
  3. Extract Resources extrahiert den durchsuchbaren Text aus der Dokumentdatenausgabe.
  4. Der extrahierte Text wird nach Rechnungsfeldern durchsucht und automatisch an das Buchhaltungssystem übermittelt.
Stapelverarbeitung der Digitalisierung von Altdokumenten
  1. Dropbox Watch wird ausgelöst, wenn ein neuer Scan im Eingangsordner landet.
  2. PDF OCR Die Datei wird mit der Qualitätsstufe „Experte“ verarbeitet, wobei „Asynchron“ für große Stapel auf „Ja“ gesetzt ist.
  3. Die durchsuchbare PDF wird hochgeladen auf SharePoint Archivordner.
  4. Slack Benachrichtigt das Team, sobald ein Dokument digitalisiert und indexiert ist.
Unterzeichneter Vertrag OCR Archiv mit Airtable Protokoll
  1. OneDrive Die Uhr wird ausgelöst, wenn ein Scan eines unterschriebenen Papiervertrags in den Vertragsordner hochgeladen wird.
  2. PDF OCR wandelt den gescannten Vertrag in ein durchsuchbares Format um PDF mit Expertenqualität.
  3. Google Drive speichert die durchsuchbaren PDF zum Ordner „Vertragsarchiv“.
  4. Airtable Erstellt einen neuen Datensatz mit dem Vertragsnamen, dem Datum und einem Link zur Suchfunktion. PDF zur Überwachung der Einhaltung von Vorschriften.

Häufig gestellte Fragen

Which Quality Type should I choose?+
Use Expert for scanned documents, photographed pages, or low-quality images: it applies two processing passes per page for higher accuracy. Use Standard for born-digital PDFs (e.g. generated by software or saved from Word) where OCR is still required, it is faster and uses half as many API credits per page.
What does OCR Only When Needed do?+
When enabled, the module checks each page before processing. Pages that already contain selectable text are skipped: OCR is applied only to image-based pages. This is especially useful for PDFs that mix native digital pages with scanned inserts, since it avoids processing pages that do not need OCR.
Which languages does the OCR engine support?+
Common Language Code values are eng (English), deu (German), fra (French), spa (Spanish), ita (Italian), and por (Portuguese). Leave the Language Code field blank for automatic detection. Providing the correct code when the language is known improves accuracy.
When should I enable Is Async?+
Enable Is Async for any PDF with more than 10 pages. Without async mode, large multi-page documents may cause the Make scenario to time out before OCR processing finishes. With Is Async enabled, the module returns results asynchronously once processing completes regardless of file size.
What is in the Doc Data output?+
Doc Data contains the binary of the OCR-processed searchable PDF. The text layer is embedded inside the PDF: you can pass it to the Extract Resources module to extract the text, save it directly to cloud storage, or forward it to an AI analysis step for further processing.

Verwandte Module

Hilfe erhalten