Converter PDF em arquivo de texto no Power Automate: Transforme contratos digitalizados em um acervo pesquisável do SharePoint com o PDF4me.

PDF4me Extrai Texto e Imagens é uma ação do Power Automate que retorna a camada de texto de um PDF como uma matriz. Combinada com OCR a montante e uma junção Compose a jusante, essa ação transforma cada PDF adicionado a uma biblioteca do SharePoint em um documento correspondente. .txt Arquivo pronto para busca por IA.
Pesquise como fazer isso e o primeiro resultado será o da própria Microsoft. Referência de ações em PDF, que descreve o Power Automate Área de trabalho Ações. Elas não existem em um fluxo na nuvem. Esse único detalhe é o motivo pelo qual os dois próximos resultados são um tópico do Reddit e um tópico da comunidade do Power Platform, ambos com pessoas fazendo a mesma pergunta e não obtendo uma resposta direta. Este fluxo é a resposta direta e é executado inteiramente na nuvem, em conectores de nível padrão.
Um PDF é adicionado a uma biblioteca do SharePoint. O gatilho reporta o novo item, a ação "Obter conteúdo do arquivo" extrai seus bytes e o PDF4me executa o OCR somente se o arquivo precisar, antes de extrair o texto como uma matriz. Uma expressão simples de composição une essa matriz em uma única string, e o SharePoint grava o resultado em um arquivo de texto simples. Seis ações, sem conector premium, e toda a execução é concluída em cerca de doze segundos.
Perguntas e respostas baseadas no "porquê".
Por que escrever um arquivo .txt em vez de simplesmente usar o texto no fluxo? Uma string dentro de uma execução de fluxo permanece ativa durante toda a duração dessa execução. Um arquivo em uma biblioteca é durável, indexável e legível por qualquer coisa que você apontar para ele posteriormente, seja uma pesquisa do SharePoint, um banco de dados vetorial ou um chatbot que extrai contexto.
Por que são necessárias duas ações para obter um arquivo? O gatilho somente de propriedades é propositalmente leve. Ele informa que um item apareceu e fornece seus metadados, incluindo um identificador, mas não os bytes. O gatilho "Obter conteúdo do arquivo" troca esse identificador pelo próprio documento. Separar os dois mantém o gatilho rápido e permite filtrar por metadados antes mesmo de baixar qualquer coisa.
Por que executar OCR se a maioria dos PDFs já contém texto? Porque não é possível distinguir apenas olhando. Um contrato digitalizado e um contrato original são indistinguíveis em uma lista de pastas. A ação de OCR OCR somente quando necessário A configuração inspeciona cada arquivo e ignora aqueles que já contêm uma camada de texto, portanto, você paga o custo apenas onde ela adiciona algo.
Por que é necessário um passo de Composição? A extração de texto e imagens retorna texts como um array, geralmente uma entrada por página. Escrever um array diretamente em um arquivo resulta em colchetes JSON e aspas escapadas. O Compose une as entradas em um texto limpo antes que qualquer coisa seja gravada no disco.
O que você receberá
Entrada: Qualquer PDF inserido em uma biblioteca de documentos do SharePoint, seja digitalizado ou originalmente digital, não requer nenhuma convenção de nomenclatura. Saída: Um arquivo de texto simples por PDF em uma segunda biblioteca, contendo todo o conteúdo legível do documento.

RagInput. Arraste e solte um PDF aqui e o fluxo começará.

RagText. Um arquivo de texto simples por PDF, pronto para indexação.
Eis o resultado do contrato de exemplo, exatamente como foi gravado no disco:
MASTER SERVICES AGREEMENT
Between Initech LLC and Umbrella Inc.
Effective date: 1 January 2026. Auto-renews annually.
Liability cap: USD 100000. Confidentiality: 5 years.
CLEAN TEST MARKER: PDF4ME-CLEAN-TEST-2026.
Observe os espaços iniciais. O OCR preserva os espaços em branco do layout, o que é adequado para a busca e para alimentar um modelo de linguagem. Remova-os posteriormente, caso um analisador sintático subsequente seja exigente.
Do que você precisa
- Power Automate. Abra o Power AutomateEste é um fluxo na nuvem. Tudo aqui é de nível padrão, sem conector premium e sem gateway.
- Chave da API PDF4me. Obtenha sua chave de APIConecte-o na primeira vez que adicionar uma ação do PDF4me.
- Um site do SharePoint com duas pastasUma para entrada de PDFs e outra para saída de texto. Crie ambas antes de compilar, para que os seletores de pastas tenham para onde apontar.
- Um PDF de teste. contrato-exemplo.pdfUm contrato de prestação de serviços de curta duração com uma linha de marcação que você pode usar para pesquisar com grep.
Primeiro, pegue as amostras. Após salvar o fluxo, faça o upload do PDF para a pasta de entrada e compare o conteúdo da pasta de saída com o arquivo de texto esperado.
O Fluxo em Resumo
- Quando um arquivo é criado (somente propriedades) (Gatilho do SharePoint) com escopo definido para
/Shared Documents/RagInput. - Obter conteúdo do arquivo usando o gatilho
Identifier. - PDF - Converter PDF em PDF editável usando OCR com qualidade
Drafte OCR somente quando necessário.true. - PDF - Extrair texto e imagens com Extrair Texto
Yese Extrair ImagensNo. - Compor executando um
join()sobre o retornadotextsvariedade. - Criar arquivo (SharePoint) escrita
.txtem/Shared Documents/RagText.
Visão geral completa do fluxo

A única prova lenta é a OCR, com 11 segundos. As outras cinco terminam em menos de meio segundo cada.
Passo 1: Como monitorar uma biblioteca do SharePoint em busca de novos PDFs?
Fluxo até o momento: Nada ainda, este é o gatilho.
Usar Quando um arquivo é criado (somente propriedades)Ele é acionado em novos itens e retorna seus metadados. Limite-o a uma pasta específica, pois um monitoramento em toda a biblioteca é acionado a cada upload realizado por qualquer pessoa em qualquer lugar dessa biblioteca.
- Crie um Fluxo de nuvem automatizado e escolha Quando um arquivo é criado (somente propriedades).
- Configurar:
- Endereço do site:
https://ynoox1.sharepoint.com/sites/PDF4meSharepoints - Nome da biblioteca: escolha Documentos a partir do menu suspenso
- Endereço do site:
- Abrir Parâmetros avançados, adicionar Pastae configure-o para
/Shared Documents/RagInput.
Configuração de gatilho do SharePoint

O nome da biblioteca é a própria biblioteca, Documentos. O parâmetro Pasta abaixo restringe o gatilho a uma pasta específica dentro dela.
Dica. Você também encontrará um gatilho chamado Quando um arquivo é criado em uma pasta, que retorna os bytes do arquivo diretamente e evita que você precise fazer a próxima ação. Está marcado como obsoleto, portanto, prefira o método que retorna apenas as propriedades, mostrado aqui, para qualquer comando que você pretenda manter em execução.
Passo 2: Por que você precisa obter o conteúdo do arquivo após o gatilho?
Fluxo até o momento: Gatilho do SharePoint.
O gatilho que envia apenas propriedades entrega metadados, não o documento. O gatilho que envia o conteúdo do arquivo troca os metadados do documento. Identifier para os bytes reais que o PDF4me precisa.
- Adicionar SharePoint > Obter conteúdo do arquivo.
- Configurar:
- Endereço do site: o mesmo local que o gatilho
- Identificador do arquivo:
Identifierdo gatilho
- Abrir Parâmetros avançados e definir Inferir tipo de conteúdo para
Yes.
Obter configuração de conteúdo do arquivo

A opção "Inferir tipo de conteúdo: Sim" é o que permite que a próxima ação forneça bytes reais do PDF em vez de um blob genérico.
O identificador é a junção entre as duas etapas. Use o gatilho Identificador O campo, não o nome do arquivo ou o caminho. Os nomes se repetem em pastas e mudam quando alguém renomeia um documento. O identificador não.
Etapa 3: Por que executar o OCR antes de extrair o texto?
Fluxo até o momento: Gatilho do SharePoint mais Obter conteúdo do arquivo.
Uma página digitalizada é uma imagem. Não há texto para extrair até que o OCR adicione uma camada de texto sobre ela. Esta ação faz isso e é inteligente o suficiente para não danificar PDFs já legíveis.
- Adicionar PDF - Converter PDF em PDF editável usando OCR.
- Configurar:
- Conteúdo do arquivo:
File Contentde Obter conteúdo do arquivo - Nome do arquivo: o token do nome do arquivo do gatilho
- Tipo de qualidade:
Draft - OCR somente quando necessário:
true - LinguagemDeixe em branco, a menos que seus documentos não estejam em inglês.
- É assíncrono:
No
- Conteúdo do arquivo:
parâmetros OCR
| Parâmetro | Valor utilizado aqui | O que ele controla |
|---|---|---|
| Conteúdo do arquivo | File Content a partir do conteúdo do arquivo Obter | O número de bytes do PDF a serem processados. |
| Nome do arquivo | token de nome do arquivo de gatilho | Nome da fonte, usado para identificação do processamento. |
| Tipo de qualidade | Draft | Esforço de reconhecimento. Draft É rápido e preciso o suficiente para digitalizações limpas. Mova-se para High para originais de baixa qualidade. |
| OCR somente quando necessário | true | Ignora arquivos que já possuem uma camada de texto, portanto, PDFs nativos digitais passam diretamente. |
| Linguagem | em branco | Dica para o mecanismo de reconhecimento. Deixe em branco para inglês. |
| É assíncrono | No | Aguarda o resultado em linha. Alternar para Yes Para documentos muito grandes. |

O QualityType está definido como Draft aqui. Em uma digitalização limpa, a leitura é tão boa quanto a de Alta Qualidade e leva menos tempo.
Dica. Este é o passo lento, 11 segundos na corrida acima contra meio segundo para todo o resto. Comece em Draft, verifique o arquivo de texto e só então mova-se para High Se os caracteres estiverem sendo retornados incorretamente, aumentar a qualidade de documentos que não precisavam é a maneira mais fácil de tornar esse fluxo lento.
Etapa 4: Como o programa Extrair Texto e Imagens retorna o texto?
Fluxo até o momento: Gatilho do SharePoint mais Obter conteúdo do arquivo mais OCR.
Esta ação lê a camada de texto e a retorna como uma matriz chamada textsAponte para a saída do OCR, e não para "Obter conteúdo do arquivo", ou as páginas digitalizadas retornarão vazias.
- Adicionar PDF - Extrair texto e imagens.
- Configurar:
- Conteúdo do arquivo:
File Contentdo ação OCR - Nome do arquivo: o token do nome do arquivo do gatilho
- Texto extraído:
Yes - Extrair imagens:
No
- Conteúdo do arquivo:
Parâmetros de extração de texto e imagens
| Parâmetro | Valor utilizado aqui | O que ele controla |
|---|---|---|
| Conteúdo do arquivo | File Content da etapa de OCR | O PDF pesquisável. Reutilizar o conteúdo do arquivo é o erro mais comum. |
| Nome do arquivo | token de nome do arquivo de gatilho | Nome da fonte, mantido para fins de identificação. |
| Texto extraído | Yes | Retorna o texts variedade. |
| Extrair imagens | No | Ignorar imagens incorporadas. Configurar Yes Somente se você precisar delas, isso torna a resposta muito maior. |

Observe os ícones. O conteúdo do arquivo exibe a marca PDF4me porque provém do OCR. O nome do arquivo exibe a marca SharePoint porque provém do gatilho.
Passo 5: Como transformar a matriz de textos em uma única string?
Fluxo até o momento: Gatilho do SharePoint + Obter conteúdo do arquivo + OCR + Extrair texto e imagens.
texts é uma matriz. Um arquivo precisa de uma string. Um expressão de junção une os dois.
- Adicionar um Compor Ação.
- Em Entradas, mude para o editor de expressões e cole:
join(body('PDF_-_Extract_Text_and_Images')?['texts'], decodeUriComponent('%0A'))
- Clique Atualizar.
O decodeUriComponent('%0A') É assim que você escreve uma quebra de linha literal em uma expressão do Power Automate. Não existe uma sequência de escape para isso, então essa é a forma idiomática.
Compor configuração

O nome da ação dentro de body() usa sublinhados para espaços e hífenes. Renomeie a ação e essa expressão deixará de funcionar.
Esta é a única linha que decide se a saída é legível. Ignore a etapa de composição e passe o array diretamente para a etapa de criação do arquivo. O arquivo de texto resultante conterá colchetes JSON e aspas escapadas em vez do documento.
Passo 6: Como salvar o texto como um arquivo .txt no SharePoint?
Fluxo até o momento: Gatilho do SharePoint + Obter conteúdo do arquivo + OCR + Extrair texto e imagens + Compor.
A última etapa grava a string resultante da junção em uma segunda biblioteca.
- Adicionar SharePoint > Criar arquivo.
- Configurar:
- Endereço do site: mesmo local que o gatilho
- Caminho da pasta:
/Shared Documents/RagText - Nome do arquivo: o token do nome do arquivo do gatilho seguido pelo texto literal
.txt - Conteúdo do arquivo: o Compor token de saída
Configuração de criação de arquivo do SharePoint

O conteúdo do arquivo é a saída da função Compose, representada pelo ícone roxo de operação de dados, e não algo proveniente do PDF4me. O texto já foi montado neste ponto.
Dica. O token de nome de arquivo do gatilho já carrega o .pdf extensão, portanto, acrescentando .txt produz contract.pdf.txt, que é o que a pasta de saída acima mostra. Isso é inofensivo e mantém o link para a fonte óbvio. Se você preferir ter contract.txt, envolva o token em substituir() e trocar .pdf para .txt em vez de acrescentar.
Execute o fluxo e verifique.
- Salvar o fluxo no canto superior direito.
- Carregar
contract-sample.pdfna pasta de entrada. O gatilho verifica, então aguarde um minuto. - Abra o fluxo histórico de execução e verifique se todas as seis ações têm um visto verde. OCR será a mais lenta.
- Abrir
/Shared Documents/RagText. Um.txtO arquivo deve estar lá. Abra-o e procure porPDF4ME-CLEAN-TEST-2026Se esse marcador estiver presente, o OCR e a extração funcionarão perfeitamente do início ao fim.
O que você construiu exatamente? Um pipeline de ingestão de documentos. Cada PDF que entra na biblioteca se torna automaticamente texto simples, o que é o pré-requisito pouco glamoroso para qualquer coisa que leia documentos em grande escala: pesquisa do SharePoint, um índice vetorial, um chatbot com recuperação aprimorada ou um simples grep de texto completo. Se você precisar apenas do texto dentro do fluxo, em vez de no disco, o fluxo mais curto Extrair texto de PDFs no Power Automate Este guia explica como usar o Dropbox.
Variações comuns que você pode adicionar sem reconstruir
.jsonA maioria dos armazenamentos vetoriais prefere metadados junto com o conteúdo.| Fluxo na nuvem versus as alternativas | Funciona sem supervisão | Lida com PDFs digitalizados | Camada de conectores |
|---|---|---|---|
| PDF4me em um fluxo de nuvem do Power Automate | Sim | Sim, OCR integrado ao fluxo de trabalho | Padrão |
| Ações de PDF do Power Automate Desktop | Somente enquanto a máquina estiver ligada | Sem OCR nas ações básicas | Padrão, mais uma máquina |
| Processamento de formulários do AI Builder | Sim | Sim | Premium, crédito medido |
Perguntas frequentes
O Power Automate consegue extrair texto de um PDF?
Não funciona isoladamente em um fluxo na nuvem. As ações de PDF na documentação da Microsoft pertencem ao Power Automate Desktop e não estão disponíveis em fluxos na nuvem, razão pela qual tantas discussões na comunidade sobre esse assunto permanecem sem solução. Adicionar o conector PDF4me confere ao fluxo na nuvem uma funcionalidade realmente útil. Extrair texto e imagens Ação que retorna o texto do documento como uma matriz.
A extração completa é uma única ação. Os cinco passos seguintes consistem apenas em mover o arquivo para dentro e o texto para fora.
Como extrair texto de um PDF usando o Power Automate?
Acione o gatilho no novo arquivo e obtenha seus bytes com Obter conteúdo do arquivo, correr Converter PDF em PDF editável usando OCR Assim, as páginas digitalizadas recebem uma camada de texto e, em seguida, são executadas. Extrair texto e imagens com a opção Extrair Texto definida como YesIsso retorna um texts array. Combine-o com uma expressão Compose se desejar texto em prosa em vez de um array.
Configure a etapa de extração para usar a saída da ação OCR em vez do arquivo baixado. Reutilizar a cópia baixada é o motivo pelo qual os documentos digitalizados retornam vazios.
O Power Automate consegue realizar OCR?
Um fluxo de trabalho na nuvem não possui ação OCR nativa. O AI Builder oferece uma em uma licença premium com limite de créditos, e o Power Automate Desktop tem seu próprio mecanismo OCR vinculado a uma máquina. O PDF4me Converter PDF em PDF editável usando OCR A ação é executada em um fluxo de nuvem de nível padrão, sem envolver nenhuma máquina.
Isso é OCR somente quando necessário É importante conhecer as configurações. Defina para trueEle inspeciona cada arquivo e ignora o OCR quando já existe uma camada de texto, portanto, uma biblioteca mista não paga o custo em todos os documentos.
Por que a extração de texto de PDF no Power Automate não está funcionando?
Quase todos os casos envolvem três causas. O documento é uma digitalização e nunca passou por OCR, portanto, não há texto algum para ser encontrado. A etapa de extração está lendo o arquivo baixado em vez da saída do OCR, o que produz o mesmo resultado vazio na entrada digitalizada. Ou o texto chegou corretamente, mas foi gravado no arquivo como uma matriz bruta, parecendo um JSON em vez de um documento.
Abra o histórico de execução e inspecione diretamente a saída de Extrair Texto e Imagens. Se texts O conteúdo está lá, o problema está mais adiante, na etapa de Compor ou Criar arquivo.
Como converter um PDF em um arquivo de texto gratuitamente?
Para um único documento, qualquer conversor online serve. A razão para criar esse fluxo de trabalho é o volume e a repetição: ele é executado automaticamente em todos os arquivos que chegam à pasta, lida com digitalizações e não exige que ninguém esteja digitando. O plano gratuito do PDF4me cobre um número significativo de documentos por mês, e todos os conectores usados aqui são do nível padrão, portanto, não há necessidade de uma licença premium do Power Automate.
Solução de problemas
A opção "Extrair Texto e Imagens" está lendo o arquivo errado. O conteúdo do arquivo deve vir da ação OCR, representada pelo ícone PDF4me, e não da opção "Obter conteúdo do arquivo". Em um PDF digital nativo, ambas as opções funcionam, e é por isso que esse erro geralmente só aparece quando uma digitalização real é recebida.
O arquivo de criação está recebendo o valor bruto. texts array. Seu conteúdo de arquivo deve ser o token de saída do Compose. Se o Compose estiver presente, mas ainda retornar um array, verifique se a expressão de junção possui ambos os argumentos: o array e o separador.
O identificador do arquivo está mapeado para o token errado. Ele precisa do gatilho. IdentificadorNão se trata do nome do arquivo, do caminho ou do ID do item. Esses elementos podem parecer intercambiáveis na lista de conteúdo dinâmico, mas não são.
A pasta de saída fica dentro da pasta monitorada pelo gatilho, portanto, cada novo arquivo de texto inicia uma nova execução. Mantenha RagInput e RagText separados, como diretórios irmãos em vez de aninhados.
Próximos passos
Extrair texto e imagens no Power Automate
Converter PDF em PDF editável usando OCR
Obtenha sua chave de API
O mesmo padrão de seis etapas (monitorar uma pasta, buscar, realizar OCR, extrair, achatar, salvar) transforma qualquer biblioteca de documentos em um corpus legível por máquina.