Pular para o conteúdo principal

Extrair texto de PDFs no Power Automate: incluindo documentos digitalizados e baseados em imagens.

· 14 min para ler
SEO and Content Writer

Você tem PDFs no Dropbox, SharePoint ou em e-mails, alguns com texto simples, outros digitalizados ou baseados em imagens, e precisa exportar o texto de forma contínua e confiável. O problema: PDFs baseados em imagens não possuem texto selecionável.Eles precisam de OCR primeiro. Depois que puderem ser pesquisados, PDF4me Extrai Texto e Imagens puxa tudo para dentro uma chamadaSem segunda leitura, sem desperdício de créditos da API.

Este guia apresenta um fluxo de trabalho que abrange ambas as situações: acionarobter conteúdo do arquivo (Dropbox) → Converter PDF em PDF editável usando OCR (para documentos digitalizados) → Extrair texto e imagens (PDF4me). Você obtém a estrutura de saída exata e links para solucionar problemas e testar a API por conta própria.

Por que uma única ligação faz a diferença.

Ao criar fluxos que dividem documentos, renomeiam arquivos ou encaminham conteúdo, muitas vezes é necessário extrair texto e imagens de cada PDF. Reler cada documento em um loop consome chamadas de API e torna os fluxos mais lentos. Extrair texto e imagens Retorna o conteúdo de texto e as imagens incorporadas em uma única resposta. Você obtém tudo o que precisa: texto, nomes de arquivos de imagem e dados de imagem em Base64, permitindo que ações subsequentes renomeiem, direcionem ou arquivem os dados sem necessidade de leituras adicionais.

Uma dica: Precisa dividir PDFs por código de barras e renomear cada arquivo com o código de barras? Use Dividir PDF por código de barras: retorna texto do código de barras na mesma resposta para cada divisão, para que você possa renomear sem uma segunda chamada. Veja nosso Dividir PDF por código de barras no Power Automate guia.

O que você precisa?

  • Power Automate, Abra o Power AutomateFaça login e crie um novo fluxo na nuvem (instantâneo ou automatizado).
  • Chave da API PDF4me, Obtenha sua chave de APIVocê criará uma conexão ao adicionar as ações do PDF4me. Primeira vez? Veja Conecte o PDF4me ao Power Automate.
  • DropboxNós o usamos para Obter conteúdo do arquivoSharePoint, OneDrive ou qualquer conector que forneça conteúdo de arquivos também funciona.

O Fluxo em Resumo (4 Etapas).

  1. Acionar um fluxo manualmenteInicie o fluxo sob demanda (ou use Quando um arquivo é criado no Dropbox para automação).
  2. Obter o conteúdo do arquivo usando o caminho (Dropbox): Busca o PDF a partir de um caminho como /pdf4metest/extracttext/image to pdf.pdf.
  3. PDF: Converter PDF em PDF editável usando OCR (PDF4me): Converte PDFs digitalizados/baseados em imagens em texto pesquisável. Ignore esta etapa se seus PDFs já permitirem busca por texto.
  4. PDF: Extrair texto e imagens (PDF4me): Retorna o texto completo e todas as imagens incorporadas em uma única resposta.
Fluxo do Power Automate: Acionar manualmente → Obter conteúdo do arquivo → Converter para PDF editável usando OCR → Extrair texto e imagens do PDF

Entrada: Um único PDF (com base em imagens ou em texto). Saída: Conteúdo do texto em texts matriz e imagens em images matriz com fileName e streamFile (Base64).

Exemplo de PDF: Documento PDF de exemplo com linhas numeradas (entrada baseada em imagem)

Exemplo de entrada: PDF baseado em imagens com texto extraível após OCR.


Passo 1: Acionar + Obter Conteúdo do Arquivo.

Fluxo até o momento: Gatilho → Obter conteúdo do arquivo.

  1. Adicionar Acionar um fluxo manualmente (ou Quando um arquivo é criado no Dropbox para automação).
  2. Adicionar DropboxObter o conteúdo do arquivo usando o caminho.
  3. Parâmetros:
  • Caminho do arquivo *Insira o caminho para o seu PDF, por exemplo: /pdf4metest/extracttext/image to pdf.pdfUse o ícone da pasta para navegar, se necessário.
  • Parâmetros avançadosInferir tipo de conteúdo: Definir para Sim.
  1. Conexão: Garantir Conectado ao Dropbox.

A saída é o conteúdo do arquivo (binário). Mapeie-o para Conteúdo do arquivo na ação OCR (e posteriormente em Extrair Texto e Imagens).

Atenção: Certifique-se de mapear o local real. Conteúdo do arquivo O valor retornado é o caminho do arquivo, não o caminho do arquivo ou os metadados. O Power Automate às vezes oferece várias opções no menu suspenso; escolha aquela que contém o arquivo binário.

Obter conteúdo do arquivo: Caminho do arquivo /pdf4metest/extracttext/image para pdf.pdf, Inferir tipo de conteúdo Sim

Etapa 2: Converter PDF em PDF editável usando OCR (para PDFs baseados em imagens).

Fluxo até o momento: Gatilho → Obter conteúdo do arquivo → Converter PDF em PDF editável usando OCR.

Se o seu PDF for digitalizado ou baseado em imagens, adicione esta etapa para que o texto se torne pesquisável antes da extração. Se o seu PDF já contiver texto selecionável, tente copiar uma palavra em um leitor de PDF; você pode pular para a Etapa 3 e passar o conteúdo do arquivo diretamente para a opção Extrair Texto e Imagens.

  1. Adicionar PDF4mePDF: Converter PDF em PDF editável usando OCR.
  2. Parâmetros:
  • Conteúdo do arquivo *Mapa Obter o conteúdo do arquivo usando o caminho saída (o binário PDF).
  • Nome do arquivo *Digite um nome como Test.pdf ou o nome do arquivo de origem.
  • Tipo de qualidade: Rascunho para PDFs normais (1 chamada de API por arquivo) ou Alto Para PDFs digitalizados/baseados em imagens (2 chamadas de API por página).
  • OCR somente quando necessário: falso executar sempre o OCR, ou Sim Ignorar se o PDF já for pesquisável (economiza chamadas à API).
  • Linguagem: Defina para o idioma do documento de origem (por exemplo, en) se necessário para uma melhor precisão do OCR.
  • É assíncrono: Não Para fluxos síncronos (recomendado).
  1. Conexão: Conectado ao PDF4me PDF.
Converter PDF para PDF editável usando OCR: Conteúdo do arquivo de Obter arquivo, Nome do arquivo Test.pdf, Tipo de qualidade Rascunho, OCR somente quando necessário: falso, Idioma: Não, É assíncrono: Não

Etapa 3: Extrair texto e imagens.

Fluxo até o momento: … → Converter PDF em PDF editável usando OCR → Extrair texto e imagens.

  1. Adicionar PDF4mePDF: Extrair texto e imagens.
  2. Parâmetros:
  • Conteúdo do arquivo *Mapeie a saída de Converter PDF em PDF editável usando OCR (ou diretamente de Obter conteúdo do arquivo (se você pulou o OCR).
  • Nome do arquivo *Digite um nome como New.pdf ou o nome do arquivo de origem.
  • Texto extraído: Sim para extrair texto.
  • Extrair imagens: Sim para extrair imagens incorporadas (ou Não (se você precisar apenas do texto).
  1. Conexão: Conectado ao PDF4me PDF.
Extrair texto e imagens: Conteúdo do arquivo da etapa de OCR, Nome do arquivo: New.pdf, Extrair texto: Sim, Extrair imagens: Sim

Saída: A ação retorna corpo com:

  • textos: Matriz de strings com todo o texto extraído (quebras de linha como \n).
  • imagens: Matriz de objetos: fileName (por exemplo page001_image001.jpg) e streamFile (Base64). Utilize-os em ações subsequentes para salvar ou processar as imagens.
Saída JSON bruta: código de status 200, corpo com array de textos e array de imagens (nomeDoArquivo, arquivoDeFluxo)

Parâmetros e Referência de Saída.

Aqui está um guia rápido com o que usamos. Ajuste essas informações para se adequarem à sua configuração.

EtapaParâmetroValorNotas
Obter arquivoCaminho do arquivo/pdf4metest/extracttext/...Seu caminho do Dropbox
Obter arquivoInferir tipo de conteúdoSimAjuda o Power Automate a gerenciar o arquivo.
OCRTipo de qualidadeRascunhoUsar Alto para documentos digitalizados complicados
OCROCR somente quando necessáriofalsoDefinir para Sim Para economizar chamadas à API se o texto já for pesquisável.
ExtrairExtrair texto/imagensSim / SimDesative o que não for necessário para acelerar o processo.
Saídacorpo.textosMatriz de stringsTodo o texto extraído
Saídaimagens do corponomeDoArquivo, arquivoDeFluxoDados de imagem em Base64 para cada imagem

Para obter detalhes completos sobre os parâmetros, consulte Extrair texto e imagens: Power Automate e Converter PDF em PDF editável usando OCR.


Solução de problemas.

Às vezes as coisas dão errado. Veja o que geralmente resolve o problema:

"O arquivo está vazio" ou "Não foi possível abrir o arquivo"

Geralmente significa que o campo mapeado está incorreto. Use o campo que contém o valor real. conteúdo do arquivo, não o caminho ou uma referência. O menu suspenso do Power Automate pode ser complicado nesse aspecto. Veja Dicas para Zapier e Power Automate Para Base64 e manipulação de arquivos.

Enviar um arquivo JPG ou PNG em vez de um PDF.

A ferramenta Extrair Texto e Imagens requer um PDF. Se a sua fonte for uma imagem, converta-a primeiro com... Converter para PDFEm seguida, passe o resultado.

Erros 401, 402 ou outros erros

Verificar Solução de problemas do PDF4me para correções 401 (chave de API), 402 (créditos) e específicas da plataforma.


Experimente a API interativamente.

Teste a API Extract Text and Images sem o Power Automate usando nosso Testes de APIFaça o upload de um PDF e veja a resposta:


Próximos passos.

Você está quase terminando.
  • Adicione um PDF de teste à sua pasta e execute o fluxo. Verifique o resultado. corpo saída para textos e imagens.
  • Alimentar textos em Compor, Analisar JSON ou Condições; use imagens Com a opção Criar arquivo ou qualquer outra ação de armazenamento.
  • Trocar Acionar manualmente para Quando um arquivo é criado (Dropbox) e conecte o caminho do arquivo do gatilho a Obter conteúdo do arquivo Para automação sem intervenção manual.