Pular para o conteúdo principal

Uma publicação com a etiqueta "extract-text-from-pdf"

Ver todas as etiquetas

Converter PDF em arquivo de texto no Power Automate: Transforme contratos digitalizados em um acervo pesquisável do SharePoint com o PDF4me.

· 28 min para ler
SEO and Content Writer

PDF4me Extrai Texto e Imagens é uma ação do Power Automate que retorna a camada de texto de um PDF como uma matriz. Combinada com OCR a montante e uma junção Compose a jusante, essa ação transforma cada PDF adicionado a uma biblioteca do SharePoint em um documento correspondente. .txt Arquivo pronto para busca por IA.

Pesquise como fazer isso e o primeiro resultado será o da própria Microsoft. Referência de ações em PDF, que descreve o Power Automate Área de trabalho Ações. Elas não existem em um fluxo na nuvem. Esse único detalhe é o motivo pelo qual os dois próximos resultados são um tópico do Reddit e um tópico da comunidade do Power Platform, ambos com pessoas fazendo a mesma pergunta e não obtendo uma resposta direta. Este fluxo é a resposta direta e é executado inteiramente na nuvem, em conectores de nível padrão.

O fluxo em resumo
1. When a file is created (properties only)
SharePoint trigger on the library, scoped to the RagInput folder. Returns metadata, not bytes.
2. Get file content
Fetches the actual PDF bytes using the identifier the trigger handed over.
3. Convert PDF to editable PDF using OCR
Adds a text layer to scans. OCR Only When Needed skips PDFs that already have one.
4. Extract Text and Images
Returns the text as an array. Extract Images stays No.
5. Compose
join() flattens the texts array into one newline separated string.
6. Create file
SharePoint writes the string to /Shared Documents/RagText as .txt.