Zum Hauptinhalt springen

So extrahieren Sie Text aus gescannten PDFs in Zapier: Video ansehen → OCR → Extrahieren (3 Schritte)

· 11 Minuten Lesezeit
SEO and Content Writer

Gescannte Rechnungen, gefaxte Formulare oder als PDFs gespeicherte Screenshots sehen zwar aus wie Dokumente, der Text besteht aber nur aus Pixeln. Sie können ihn weder auswählen, kopieren noch in Ihren Zap einfügen. Die Lösung: Führen Sie folgenden Befehl aus: OCR zuerst Um die PDF-Datei durchsuchbar zu machen, extrahieren Sie anschließend den Text. Hier ist ein dreistufiger Zap, der genau das mit Dropbox und PDF4me erledigt.

Kurzgesagt: PDF in Dropbox hochladen → Zap wird ausgelöst → OCR macht es durchsuchbar → Text extrahieren zieht den Inhalt in vollständiger TextOrdnen Sie dieses Feld Google Sheets, Airtable, E-Mails oder anderen Systemen zu.

Was Sie am Ende erhalten werden

Wenn eine PDF-Datei in Ihrem Dropbox-Ordner landet, führt der Zap (falls erforderlich) eine OCR-Texterkennung durch und extrahiert den gesamten Text in ein einziges Feld. vollständiger TextDiese Daten können Sie in Google Sheets, Airtable, E-Mails oder für weitere Schritte verwenden. Die Ausgabe umfasst: Trace-ID zum Debuggen und Seitentextinformationen Details pro Seite finden Sie hier.

Text aus PDF-Ausgabe extrahieren: Vollständiger Text mit Beispiel-PDF-Dokument und Zeilen 1:10, Trace-ID, Seitentextinformationen

Ausgabe des Zaps: extrahierter Text, Trace-ID und Seitentextinformationen.


Warum bildbasierte PDFs zuerst OCR benötigen

Bildbasierte PDFs speichern Text als Pixel. Extraktionswerkzeuge erwarten eine Textebene und liefern daher keine brauchbaren Ergebnisse. PDF durchsuchbar machen / OCR fügt diese Ebene hinzu, dann Text aus PDF extrahieren Kann alles lesen. Überspringen Sie den OCR-Schritt nur dann, wenn Ihre PDFs bereits auswählbaren Text enthalten (versuchen Sie, ein Wort in einem Reader zu kopieren, um dies zu überprüfen).


Was brauchen Sie?


Der Zap in 3 Schritten

  1. Neue Datei im Ordner (Dropbox): Uhren /pdf4metest/ExtractText alle 2 Minuten.
  2. PDF durchsuchbar machen / OCR (PDF4me): Wandelt bildbasierte PDFs in durchsuchbare Dokumente um.
  3. Text aus PDF extrahieren (PDF4me): Zieht den Text in vollständiger Text, Trace-ID, Und SeitentextinformationenDie
Zapier-Workflow: Dropbox: Neue Datei in Ordner (2 Min.) → PDF4me: PDF durchsuchbar machen/OCR → PDF4me: Text aus PDF extrahieren

Eingang: Ein bildbasiertes PDF (z.B. Image To PDF.pdf) mit Inhalten wie „Beispiel-PDF-Dokument“ und nummerierten Zeilen. Ausgabe: Der gesamte Text in vollständiger Text, bereit für den nächsten Schritt.

Beispiel-PDF-Dokument: Bildbasierte Eingabe mit 10 nummerierten Zeilen

Beispiel-Eingabe: bildbasierte PDF-Datei, die vor der Extraktion eine OCR-Texterkennung benötigt.


Schritt 1: Neue Datei im Ordner (Auslöser).

Bisheriger Zap: Nur Auslöser.

  1. Hinzufügen DropboxNeue Datei im Ordner als Auslöser.
  2. Raum: Standard (oder wählen Sie Ihren Bereich).
  3. Ordner *: /pdf4metest/ExtractText (oder Ihr Zielordner).
  4. Sollen auch Dateien in Unterordnern enthalten sein?: FALSCH (oder „Wahr“ für verschachtelte Ordner).
  5. Dateiinhalte einbeziehen?: Ja. Muss auf Ja gesetzt werden, damit der Dateiinhalt an die nächsten Schritte weitergeleitet wird.
  6. Link zum Teilen hinzufügen?: Ja (optional).
  7. Klicken Weitermachen und den Auslöser testen.
Neue Datei im Ordner: Standardbereich, Ordner /pdf4metest/ExtractText, Dateiinhalt einbeziehen: Ja, Freigabelink einbeziehen: Ja

Wichtig: Satz Dateiinhalte einbeziehen? Zu JaWenn die Antwort „Nein“ lautet, übergibt Zapier eine Referenz anstelle der Datei, und die Schritte OCR und Extrahieren schlagen fehl.


Schritt 2: PDF durchsuchbar machen / OCR (Aktion).

Bisheriger Zap: Auslöser → PDF durchsuchbar machen / OCR.

  1. Hinzufügen PDF4mePDF durchsuchbar machen / OCRDie
  2. Datei *: Karte 1. Datei Verwenden Sie vom Dropbox-Trigger das Feld mit dem tatsächlichen Dateiinhalt, nicht „Datei: (Vorhanden, wird aber nicht angezeigt)“.
  3. Dateiname: Karte 1. Dateiname Und 1. Dateierweiterung (z.B. Image To PDF + .pdf).
  4. Qualitätsart *: Standard für die meisten PDFs.
  5. Prozess als asynchron festlegen: FALSCH Der Zap wartet also, bis die OCR-Operation abgeschlossen ist.
  6. Klicken Weitermachen und testen.
PDF durchsuchbar machen / OCR: Datei aus Schritt 1, Dateiname: ImageToPDF.pdf, Qualitätstyp: Standard, Prozess auf „Asynchron“ setzen: Nein

Der OCR-Schritt liefert eine durchsuchbare PDF-Datei. Der Extraktionsschritt verwendet diese Datei.


Schritt 3: Text aus PDF extrahieren (Aktion).

Bisheriger Zap: Auslöser → OCR → Text extrahieren.

  1. Hinzufügen PDF4meText aus PDF extrahierenDie
  2. Datei *: Karte 2. Datei-URL aus dem OCR-Schritt (dem verarbeiteten PDF).
  3. Dateiname: Karte 2. Vollständiger Dateiname (z.B. Image To PDF.pdf).
  4. Extraktionsmodus *: Vollständiges Dokument für den gesamten Text in einem Feld, oder Seitenweise für die Ausgabe pro Seite.
  5. Klicken Weitermachen und testen.
Text aus PDF extrahieren: Datei-URL und vollständiger Dateiname aus dem OCR-Schritt, Extraktionsmodus: Vollständiges Dokument

Ausgabe: Die Handlung kehrt zurück vollständiger Text (gesamter extrahierter Text), Trace-ID (z.B. 5e4ba591-94c4-4b6c-ac3f-ca062d483981), Und SeitentextinformationenBei einem Beispiel-PDF wie dem obigen sehen Sie „Beispiel-PDF-Dokument“ plus die Zeilen 1 bis 10. vollständiger TextDie


Kurzübersichtstabelle

SchrittWichtige EinstellungenAnmerkungen
AuslösenOrdner: /pdf4metest/ExtractTextInhalt der Einschlussdatei: Ja
OCRQualitätsart: StandardVerwenden Sie Expert für schlechte Scans (mehr API-Aufrufe).
OCRProzess als asynchron festlegen: FalseHält den Zap synchron
ExtraktExtraktionsmodus: Vollständiges DokumentDer gesamte Text in einem Feld
Ausgabevollständiger TextOrdnen Sie dies späteren Schritten zu.

Die vollständigen Parameterdetails finden Sie unter Text aus PDF extrahieren: Zapier Und PDF-OCR, ZapierDie


Fehlerbehebung.

"Datei: (Existiert, wird aber nicht angezeigt)"

Diese Option übergibt häufig eine Referenz anstelle der Datei. Wählen Sie das Feld aus, das den eigentlichen Dateiinhalt enthält. Siehe Zapier- und Power Automate-Tipps zur Dateiverarbeitung.

"Datei ist leer" oder es wurde kein Text extrahiert

Sicherstellen Dateiinhalte einbeziehen? Ist Ja im Auslöser und dass Sie den OCR-Schritt zuordnen Datei-URL (oder Dateiausgabe) in den Extraktionsschritt eingeben, nicht einen Pfad oder Metadaten.

401, 402 oder andere API-Fehler

PDF4me-Fehlerbehebung Beinhaltet 401 (API-Schlüssel), 402 (Credits) und mehr.


Probieren Sie die API selbst aus.

Testen Sie die Extract Text API, ohne einen Zap zu erstellen:


Nächste Schritte.

Du bist startklar.
  • Legen Sie eine Test-PDF-Datei in Ihren Ordner und führen Sie den Zap aus. Überprüfen Sie die Ausgabe des Schritts „Extrahieren“. vollständiger TextDie
  • Fügen Sie nach „Extrahieren“ einen weiteren Schritt hinzu, z. B. „Zeile zu Google Sheets hinzufügen“, „E-Mail senden“ oder „Airtable aktualisieren“, und ordnen Sie die Daten einander zu. vollständiger Text Ich bin dabei.
  • Aktivieren Sie den Zap, damit er ausgeführt wird, sobald neue PDFs im Ordner erscheinen.