Pular para o conteúdo principal

Converter PDF em arquivo de texto no Power Automate: Transforme contratos digitalizados em um acervo pesquisável do SharePoint com o PDF4me.

· 28 min para ler
SEO and Content Writer

PDF4me Extrai Texto e Imagens é uma ação do Power Automate que retorna a camada de texto de um PDF como uma matriz. Combinada com OCR a montante e uma junção Compose a jusante, essa ação transforma cada PDF adicionado a uma biblioteca do SharePoint em um documento correspondente. .txt Arquivo pronto para busca por IA.

Pesquise como fazer isso e o primeiro resultado será o da própria Microsoft. Referência de ações em PDF, que descreve o Power Automate Área de trabalho Ações. Elas não existem em um fluxo na nuvem. Esse único detalhe é o motivo pelo qual os dois próximos resultados são um tópico do Reddit e um tópico da comunidade do Power Platform, ambos com pessoas fazendo a mesma pergunta e não obtendo uma resposta direta. Este fluxo é a resposta direta e é executado inteiramente na nuvem, em conectores de nível padrão.

O fluxo em resumo
1. When a file is created (properties only)
SharePoint trigger on the library, scoped to the RagInput folder. Returns metadata, not bytes.
2. Get file content
Fetches the actual PDF bytes using the identifier the trigger handed over.
3. Convert PDF to editable PDF using OCR
Adds a text layer to scans. OCR Only When Needed skips PDFs that already have one.
4. Extract Text and Images
Returns the text as an array. Extract Images stays No.
5. Compose
join() flattens the texts array into one newline separated string.
6. Create file
SharePoint writes the string to /Shared Documents/RagText as .txt.
A versão curta

Um PDF é adicionado a uma biblioteca do SharePoint. O gatilho reporta o novo item, a ação "Obter conteúdo do arquivo" extrai seus bytes e o PDF4me executa o OCR somente se o arquivo precisar, antes de extrair o texto como uma matriz. Uma expressão simples de composição une essa matriz em uma única string, e o SharePoint grava o resultado em um arquivo de texto simples. Seis ações, sem conector premium, e toda a execução é concluída em cerca de doze segundos.

Perguntas e respostas baseadas no "porquê".

Por que escrever um arquivo .txt em vez de simplesmente usar o texto no fluxo? Uma string dentro de uma execução de fluxo permanece ativa durante toda a duração dessa execução. Um arquivo em uma biblioteca é durável, indexável e legível por qualquer coisa que você apontar para ele posteriormente, seja uma pesquisa do SharePoint, um banco de dados vetorial ou um chatbot que extrai contexto.

Por que são necessárias duas ações para obter um arquivo? O gatilho somente de propriedades é propositalmente leve. Ele informa que um item apareceu e fornece seus metadados, incluindo um identificador, mas não os bytes. O gatilho "Obter conteúdo do arquivo" troca esse identificador pelo próprio documento. Separar os dois mantém o gatilho rápido e permite filtrar por metadados antes mesmo de baixar qualquer coisa.

Por que executar OCR se a maioria dos PDFs já contém texto? Porque não é possível distinguir apenas olhando. Um contrato digitalizado e um contrato original são indistinguíveis em uma lista de pastas. A ação de OCR OCR somente quando necessário A configuração inspeciona cada arquivo e ignora aqueles que já contêm uma camada de texto, portanto, você paga o custo apenas onde ela adiciona algo.

Por que é necessário um passo de Composição? A extração de texto e imagens retorna texts como um array, geralmente uma entrada por página. Escrever um array diretamente em um arquivo resulta em colchetes JSON e aspas escapadas. O Compose une as entradas em um texto limpo antes que qualquer coisa seja gravada no disco.


O que você receberá

Entrada: Qualquer PDF inserido em uma biblioteca de documentos do SharePoint, seja digitalizado ou originalmente digital, não requer nenhuma convenção de nomenclatura. Saída: Um arquivo de texto simples por PDF em uma segunda biblioteca, contendo todo o conteúdo legível do documento.

Biblioteca de documentos do SharePoint mostrando a pasta RagInput contendo os arquivos rag-test.pdf, rag-test2.pdf e services-agreement.pdf, todos modificados pela conta Pdf4me Flow.

RagInput. Arraste e solte um PDF aqui e o fluxo começará.

Biblioteca de documentos do SharePoint mostrando a pasta RagText contendo os arquivos rag-test.pdf.txt e rag-test2.pdf.txt gerados pelo fluxo.

RagText. Um arquivo de texto simples por PDF, pronto para indexação.

Eis o resultado do contrato de exemplo, exatamente como foi gravado no disco:

MASTER SERVICES AGREEMENT
Between Initech LLC and Umbrella Inc.
Effective date: 1 January 2026. Auto-renews annually.
Liability cap: USD 100000. Confidentiality: 5 years.
CLEAN TEST MARKER: PDF4ME-CLEAN-TEST-2026.

Observe os espaços iniciais. O OCR preserva os espaços em branco do layout, o que é adequado para a busca e para alimentar um modelo de linguagem. Remova-os posteriormente, caso um analisador sintático subsequente seja exigente.


Do que você precisa

  • Power Automate. Abra o Power AutomateEste é um fluxo na nuvem. Tudo aqui é de nível padrão, sem conector premium e sem gateway.
  • Chave da API PDF4me. Obtenha sua chave de APIConecte-o na primeira vez que adicionar uma ação do PDF4me.
  • Um site do SharePoint com duas pastasUma para entrada de PDFs e outra para saída de texto. Crie ambas antes de compilar, para que os seletores de pastas tenham para onde apontar.
  • Um PDF de teste. contrato-exemplo.pdfUm contrato de prestação de serviços de curta duração com uma linha de marcação que você pode usar para pesquisar com grep.

Primeiro, pegue as amostras. Após salvar o fluxo, faça o upload do PDF para a pasta de entrada e compare o conteúdo da pasta de saída com o arquivo de texto esperado.


O Fluxo em Resumo

  1. Quando um arquivo é criado (somente propriedades) (Gatilho do SharePoint) com escopo definido para /Shared Documents/RagInput.
  2. Obter conteúdo do arquivo usando o gatilho Identifier.
  3. PDF - Converter PDF em PDF editável usando OCR com qualidade Draft e OCR somente quando necessário. true.
  4. PDF - Extrair texto e imagens com Extrair Texto Yes e Extrair Imagens No.
  5. Compor executando um join() sobre o retornado texts variedade.
  6. Criar arquivo (SharePoint) escrita .txt em /Shared Documents/RagText.

Visão geral completa do fluxo

O histórico de execução do Power Automate mostra seis ações concluídas com sucesso, nesta ordem: SharePoint - Somente propriedades (0,3 segundos), Obter conteúdo do arquivo (0,2 segundos), PDF - Converter PDF em PDF editável usando OCR (11 segundos), PDF - Extrair texto e imagens (0,4 segundos), Compor (0 segundos) e SharePoint - Criar arquivo (0,3 segundos).

A única prova lenta é a OCR, com 11 segundos. As outras cinco terminam em menos de meio segundo cada.


Passo 1: Como monitorar uma biblioteca do SharePoint em busca de novos PDFs?

Fluxo até o momento: Nada ainda, este é o gatilho.

Usar Quando um arquivo é criado (somente propriedades)Ele é acionado em novos itens e retorna seus metadados. Limite-o a uma pasta específica, pois um monitoramento em toda a biblioteca é acionado a cada upload realizado por qualquer pessoa em qualquer lugar dessa biblioteca.

  1. Crie um Fluxo de nuvem automatizado e escolha Quando um arquivo é criado (somente propriedades).
  2. Configurar:
    • Endereço do site: https://ynoox1.sharepoint.com/sites/PDF4meSharepoints
    • Nome da biblioteca: escolha Documentos a partir do menu suspenso
  3. Abrir Parâmetros avançados, adicionar Pastae configure-o para /Shared Documents/RagInput.

Configuração de gatilho do SharePoint

No Power Automate, ao criar um arquivo, o painel de gatilho de propriedades deve estar configurado com o Endereço do Site definido como PDF4me SharePoints, o Nome da Biblioteca definido como Documentos e o parâmetro avançado da Pasta definido como /Documentos Compartilhados/RagInput.

O nome da biblioteca é a própria biblioteca, Documentos. O parâmetro Pasta abaixo restringe o gatilho a uma pasta específica dentro dela.

Dica. Você também encontrará um gatilho chamado Quando um arquivo é criado em uma pasta, que retorna os bytes do arquivo diretamente e evita que você precise fazer a próxima ação. Está marcado como obsoleto, portanto, prefira o método que retorna apenas as propriedades, mostrado aqui, para qualquer comando que você pretenda manter em execução.


Passo 2: Por que você precisa obter o conteúdo do arquivo após o gatilho?

Fluxo até o momento: Gatilho do SharePoint.

O gatilho que envia apenas propriedades entrega metadados, não o documento. O gatilho que envia o conteúdo do arquivo troca os metadados do documento. Identifier para os bytes reais que o PDF4me precisa.

  1. Adicionar SharePoint > Obter conteúdo do arquivo.
  2. Configurar:
    • Endereço do site: o mesmo local que o gatilho
    • Identificador do arquivo: Identifier do gatilho
  3. Abrir Parâmetros avançados e definir Inferir tipo de conteúdo para Yes.

Obter configuração de conteúdo do arquivo

Painel de ação "Obter conteúdo do arquivo" do SharePoint com o Endereço do Site definido para o site do SharePoint do PDF4me, o Identificador do Arquivo mapeado para o token de Identificação do gatilho e a opção "Inferir tipo de conteúdo" definida como "Sim".

A opção "Inferir tipo de conteúdo: Sim" é o que permite que a próxima ação forneça bytes reais do PDF em vez de um blob genérico.

O identificador é a junção entre as duas etapas. Use o gatilho Identificador O campo, não o nome do arquivo ou o caminho. Os nomes se repetem em pastas e mudam quando alguém renomeia um documento. O identificador não.


Etapa 3: Por que executar o OCR antes de extrair o texto?

Fluxo até o momento: Gatilho do SharePoint mais Obter conteúdo do arquivo.

Uma página digitalizada é uma imagem. Não há texto para extrair até que o OCR adicione uma camada de texto sobre ela. Esta ação faz isso e é inteligente o suficiente para não danificar PDFs já legíveis.

  1. Adicionar PDF - Converter PDF em PDF editável usando OCR.
  2. Configurar:
    • Conteúdo do arquivo: File Content de Obter conteúdo do arquivo
    • Nome do arquivo: o token do nome do arquivo do gatilho
    • Tipo de qualidade: Draft
    • OCR somente quando necessário: true
    • LinguagemDeixe em branco, a menos que seus documentos não estejam em inglês.
    • É assíncrono: No

parâmetros OCR

ParâmetroValor utilizado aquiO que ele controla
Conteúdo do arquivoFile Content a partir do conteúdo do arquivo ObterO número de bytes do PDF a serem processados.
Nome do arquivotoken de nome do arquivo de gatilhoNome da fonte, usado para identificação do processamento.
Tipo de qualidadeDraftEsforço de reconhecimento. Draft É rápido e preciso o suficiente para digitalizações limpas. Mova-se para High para originais de baixa qualidade.
OCR somente quando necessáriotrueIgnora arquivos que já possuem uma camada de texto, portanto, PDFs nativos digitais passam diretamente.
Linguagemem brancoDica para o mecanismo de reconhecimento. Deixe em branco para inglês.
É assíncronoNoAguarda o resultado em linha. Alternar para Yes Para documentos muito grandes.
O PDF4me converte PDFs em PDFs editáveis usando o painel de ação OCR com o conteúdo do arquivo selecionado, o nome do arquivo definido no gatilho, o tipo de qualidade "Rascunho", a opção "OCR somente quando necessário" ativada, o idioma em branco e a opção "Assíncrono" desativada.

O QualityType está definido como Draft aqui. Em uma digitalização limpa, a leitura é tão boa quanto a de Alta Qualidade e leva menos tempo.

Dica. Este é o passo lento, 11 segundos na corrida acima contra meio segundo para todo o resto. Comece em Draft, verifique o arquivo de texto e só então mova-se para High Se os caracteres estiverem sendo retornados incorretamente, aumentar a qualidade de documentos que não precisavam é a maneira mais fácil de tornar esse fluxo lento.


Etapa 4: Como o programa Extrair Texto e Imagens retorna o texto?

Fluxo até o momento: Gatilho do SharePoint mais Obter conteúdo do arquivo mais OCR.

Esta ação lê a camada de texto e a retorna como uma matriz chamada textsAponte para a saída do OCR, e não para "Obter conteúdo do arquivo", ou as páginas digitalizadas retornarão vazias.

  1. Adicionar PDF - Extrair texto e imagens.
  2. Configurar:
    • Conteúdo do arquivo: File Content do ação OCR
    • Nome do arquivo: o token do nome do arquivo do gatilho
    • Texto extraído: Yes
    • Extrair imagens: No

Parâmetros de extração de texto e imagens

ParâmetroValor utilizado aquiO que ele controla
Conteúdo do arquivoFile Content da etapa de OCRO PDF pesquisável. Reutilizar o conteúdo do arquivo é o erro mais comum.
Nome do arquivotoken de nome do arquivo de gatilhoNome da fonte, mantido para fins de identificação.
Texto extraídoYesRetorna o texts variedade.
Extrair imagensNoIgnorar imagens incorporadas. Configurar Yes Somente se você precisar delas, isso torna a resposta muito maior.
Painel de ação "Extrair Texto e Imagens" do PDF4me com o Conteúdo do Arquivo mapeado a partir da ação OCR do PDF4me, o Nome do Arquivo proveniente do gatilho do SharePoint, a opção "Extrair Texto" definida como "Sim" e a opção "Extrair Imagens" definida como "Não".

Observe os ícones. O conteúdo do arquivo exibe a marca PDF4me porque provém do OCR. O nome do arquivo exibe a marca SharePoint porque provém do gatilho.


Passo 5: Como transformar a matriz de textos em uma única string?

Fluxo até o momento: Gatilho do SharePoint + Obter conteúdo do arquivo + OCR + Extrair texto e imagens.

texts é uma matriz. Um arquivo precisa de uma string. Um expressão de junção une os dois.

  1. Adicionar um Compor Ação.
  2. Em Entradas, mude para o editor de expressões e cole:
join(body('PDF_-_Extract_Text_and_Images')?['texts'], decodeUriComponent('%0A'))
  1. Clique Atualizar.

O decodeUriComponent('%0A') É assim que você escreve uma quebra de linha literal em uma expressão do Power Automate. Não existe uma sequência de escape para isso, então essa é a forma idiomática.

Compor configuração

Ação do Power Automate Compose com o editor de expressões aberto, mostrando a junção da matriz de textos "Extrair Texto e Imagens" do PDF com decodeUriComponent "% zero A" como separador.

O nome da ação dentro de body() usa sublinhados para espaços e hífenes. Renomeie a ação e essa expressão deixará de funcionar.

Esta é a única linha que decide se a saída é legível. Ignore a etapa de composição e passe o array diretamente para a etapa de criação do arquivo. O arquivo de texto resultante conterá colchetes JSON e aspas escapadas em vez do documento.


Passo 6: Como salvar o texto como um arquivo .txt no SharePoint?

Fluxo até o momento: Gatilho do SharePoint + Obter conteúdo do arquivo + OCR + Extrair texto e imagens + Compor.

A última etapa grava a string resultante da junção em uma segunda biblioteca.

  1. Adicionar SharePoint > Criar arquivo.
  2. Configurar:
    • Endereço do site: mesmo local que o gatilho
    • Caminho da pasta: /Shared Documents/RagText
    • Nome do arquivo: o token do nome do arquivo do gatilho seguido pelo texto literal .txt
    • Conteúdo do arquivo: o Compor token de saída

Configuração de criação de arquivo do SharePoint

Ação "Criar arquivo" do SharePoint com o endereço do site "PDF4me SharePoints", caminho da pasta "/Shared Documents/RagText", nome do arquivo criado a partir do token de nome do arquivo do gatilho mais ".txt" e conteúdo do arquivo definido como o token de saída "Compor".

O conteúdo do arquivo é a saída da função Compose, representada pelo ícone roxo de operação de dados, e não algo proveniente do PDF4me. O texto já foi montado neste ponto.

Dica. O token de nome de arquivo do gatilho já carrega o .pdf extensão, portanto, acrescentando .txt produz contract.pdf.txt, que é o que a pasta de saída acima mostra. Isso é inofensivo e mantém o link para a fonte óbvio. Se você preferir ter contract.txt, envolva o token em substituir() e trocar .pdf para .txt em vez de acrescentar.


Execute o fluxo e verifique.

  1. Salvar o fluxo no canto superior direito.
  2. Carregar contract-sample.pdf na pasta de entrada. O gatilho verifica, então aguarde um minuto.
  3. Abra o fluxo histórico de execução e verifique se todas as seis ações têm um visto verde. OCR será a mais lenta.
  4. Abrir /Shared Documents/RagText. Um .txt O arquivo deve estar lá. Abra-o e procure por PDF4ME-CLEAN-TEST-2026Se esse marcador estiver presente, o OCR e a extração funcionarão perfeitamente do início ao fim.

O que você construiu exatamente? Um pipeline de ingestão de documentos. Cada PDF que entra na biblioteca se torna automaticamente texto simples, o que é o pré-requisito pouco glamoroso para qualquer coisa que leia documentos em grande escala: pesquisa do SharePoint, um índice vetorial, um chatbot com recuperação aprimorada ou um simples grep de texto completo. Se você precisar apenas do texto dentro do fluxo, em vez de no disco, o fluxo mais curto Extrair texto de PDFs no Power Automate Este guia explica como usar o Dropbox.


Variações comuns que você pode adicionar sem reconstruir

Filtre antes de baixar
Como o gatilho retorna primeiro os metadados, você pode adicionar uma condição ao nome do arquivo ou a uma coluna antes da execução da função "Obter conteúdo do arquivo". Dessa forma, os uploads de arquivos que não sejam PDF não terão custo adicional.
Mantenha também o PDF pesquisável.
Adicione uma segunda ação "Criar arquivo" que salve o resultado da ação de OCR. Assim, você obtém uma cópia em texto para máquinas e um PDF pesquisável para humanos, tudo em uma única execução.
Escreva JSON em vez de texto simples.
Altere a expressão Compose para criar um objeto com o nome do arquivo, a data e o texto e, em seguida, salve como .jsonA maioria dos armazenamentos vetoriais prefere metadados junto com o conteúdo.
Fluxo na nuvem versus as alternativas
Consulte a tabela comparativa abaixo para ver as diferenças entre este produto, o Power Automate Desktop e o AI Builder.
Fluxo na nuvem versus as alternativasFunciona sem supervisãoLida com PDFs digitalizadosCamada de conectores
PDF4me em um fluxo de nuvem do Power AutomateSimSim, OCR integrado ao fluxo de trabalhoPadrão
Ações de PDF do Power Automate DesktopSomente enquanto a máquina estiver ligadaSem OCR nas ações básicasPadrão, mais uma máquina
Processamento de formulários do AI BuilderSimSimPremium, crédito medido

Perguntas frequentes

O Power Automate consegue extrair texto de um PDF?

Não funciona isoladamente em um fluxo na nuvem. As ações de PDF na documentação da Microsoft pertencem ao Power Automate Desktop e não estão disponíveis em fluxos na nuvem, razão pela qual tantas discussões na comunidade sobre esse assunto permanecem sem solução. Adicionar o conector PDF4me confere ao fluxo na nuvem uma funcionalidade realmente útil. Extrair texto e imagens Ação que retorna o texto do documento como uma matriz.

A extração completa é uma única ação. Os cinco passos seguintes consistem apenas em mover o arquivo para dentro e o texto para fora.

Como extrair texto de um PDF usando o Power Automate?

Acione o gatilho no novo arquivo e obtenha seus bytes com Obter conteúdo do arquivo, correr Converter PDF em PDF editável usando OCR Assim, as páginas digitalizadas recebem uma camada de texto e, em seguida, são executadas. Extrair texto e imagens com a opção Extrair Texto definida como YesIsso retorna um texts array. Combine-o com uma expressão Compose se desejar texto em prosa em vez de um array.

Configure a etapa de extração para usar a saída da ação OCR em vez do arquivo baixado. Reutilizar a cópia baixada é o motivo pelo qual os documentos digitalizados retornam vazios.

O Power Automate consegue realizar OCR?

Um fluxo de trabalho na nuvem não possui ação OCR nativa. O AI Builder oferece uma em uma licença premium com limite de créditos, e o Power Automate Desktop tem seu próprio mecanismo OCR vinculado a uma máquina. O PDF4me Converter PDF em PDF editável usando OCR A ação é executada em um fluxo de nuvem de nível padrão, sem envolver nenhuma máquina.

Isso é OCR somente quando necessário É importante conhecer as configurações. Defina para trueEle inspeciona cada arquivo e ignora o OCR quando já existe uma camada de texto, portanto, uma biblioteca mista não paga o custo em todos os documentos.

Por que a extração de texto de PDF no Power Automate não está funcionando?

Quase todos os casos envolvem três causas. O documento é uma digitalização e nunca passou por OCR, portanto, não há texto algum para ser encontrado. A etapa de extração está lendo o arquivo baixado em vez da saída do OCR, o que produz o mesmo resultado vazio na entrada digitalizada. Ou o texto chegou corretamente, mas foi gravado no arquivo como uma matriz bruta, parecendo um JSON em vez de um documento.

Abra o histórico de execução e inspecione diretamente a saída de Extrair Texto e Imagens. Se texts O conteúdo está lá, o problema está mais adiante, na etapa de Compor ou Criar arquivo.

Como converter um PDF em um arquivo de texto gratuitamente?

Para um único documento, qualquer conversor online serve. A razão para criar esse fluxo de trabalho é o volume e a repetição: ele é executado automaticamente em todos os arquivos que chegam à pasta, lida com digitalizações e não exige que ninguém esteja digitando. O plano gratuito do PDF4me cobre um número significativo de documentos por mês, e todos os conectores usados aqui são do nível padrão, portanto, não há necessidade de uma licença premium do Power Automate.


Solução de problemas

O arquivo .txt foi criado, mas está vazio.

A opção "Extrair Texto e Imagens" está lendo o arquivo errado. O conteúdo do arquivo deve vir da ação OCR, representada pelo ícone PDF4me, e não da opção "Obter conteúdo do arquivo". Em um PDF digital nativo, ambas as opções funcionam, e é por isso que esse erro geralmente só aparece quando uma digitalização real é recebida.

A saída aparece como ["linha um","linha dois"] em vez de texto.

O arquivo de criação está recebendo o valor bruto. texts array. Seu conteúdo de arquivo deve ser o token de saída do Compose. Se o Compose estiver presente, mas ainda retornar um array, verifique se a expressão de junção possui ambos os argumentos: o array e o separador.

A obtenção do conteúdo do arquivo falha com a mensagem "arquivo não encontrado".

O identificador do arquivo está mapeado para o token errado. Ele precisa do gatilho. IdentificadorNão se trata do nome do arquivo, do caminho ou do ID do item. Esses elementos podem parecer intercambiáveis na lista de conteúdo dinâmico, mas não são.

O fluxo continua se desencadeando sozinho

A pasta de saída fica dentro da pasta monitorada pelo gatilho, portanto, cada novo arquivo de texto inicia uma nova execução. Mantenha RagInput e RagText separados, como diretórios irmãos em vez de aninhados.


Próximos passos

O mesmo padrão de seis etapas (monitorar uma pasta, buscar, realizar OCR, extrair, achatar, salvar) transforma qualquer biblioteca de documentos em um corpus legível por máquina.