Zum Hauptinhalt springen

Ein Post getaggt mit "extract-text-from-pdf"

Alle Tags anzeigen

PDF in Power Automate in Textdatei konvertieren: Gescannte Verträge mit PDF4me in einen durchsuchbaren SharePoint-Datensatz umwandeln.

· 26 Minuten Lesezeit
SEO and Content Writer

PDF4me: Text und Bilder extrahieren ist eine Power Automate-Aktion, die die Textebene eines PDFs als Array zurückgibt. In Kombination mit OCR im vorgelagerten Bereich und einem Compose-Join im nachgelagerten Bereich wandelt dieser Flow jedes in einer SharePoint-Bibliothek abgelegte PDF in ein passendes Dokument um. .txt Datei, bereit für die KI-Suche.

Wenn man nach einer Anleitung sucht, wie das geht, ist das erste Ergebnis Microsofts eigene Anleitung. PDF-Aktionsreferenz, das Power Automate beschreibt Desktop Aktionen existieren in einem Cloud-Flow nicht. Genau deshalb sind die nächsten beiden Ergebnisse ein Reddit-Thread und ein Thread in der Power Platform-Community, in denen dieselbe Frage gestellt, aber keine klare Antwort erhalten wird. Dieser Flow liefert die klare Antwort und läuft vollständig in der Cloud mit Standard-Konnektoren.

Der Fluss im Überblick
1. When a file is created (properties only)
SharePoint trigger on the library, scoped to the RagInput folder. Returns metadata, not bytes.
2. Get file content
Fetches the actual PDF bytes using the identifier the trigger handed over.
3. Convert PDF to editable PDF using OCR
Adds a text layer to scans. OCR Only When Needed skips PDFs that already have one.
4. Extract Text and Images
Returns the text as an array. Extract Images stays No.
5. Compose
join() flattens the texts array into one newline separated string.
6. Create file
SharePoint writes the string to /Shared Documents/RagText as .txt.