Extrair texto de PDFs no Power Automate: incluindo documentos digitalizados e baseados em imagens.

Você tem PDFs no Dropbox, SharePoint ou em e-mails, alguns com texto simples, outros digitalizados ou baseados em imagens, e precisa exportar o texto de forma contínua e confiável. O problema: PDFs baseados em imagens não possuem texto selecionável.Eles precisam de OCR primeiro. Depois que puderem ser pesquisados, PDF4me Extrai Texto e Imagens puxa tudo para dentro uma chamadaSem segunda leitura, sem desperdício de créditos da API.
Este guia apresenta um fluxo de trabalho que abrange ambas as situações: acionar → obter conteúdo do arquivo (Dropbox) → Converter PDF em PDF editável usando OCR (para documentos digitalizados) → Extrair texto e imagens (PDF4me). Você obtém a estrutura de saída exata e links para solucionar problemas e testar a API por conta própria.
Por que uma única ligação faz a diferença.
Ao criar fluxos que dividem documentos, renomeiam arquivos ou encaminham conteúdo, muitas vezes é necessário extrair texto e imagens de cada PDF. Reler cada documento em um loop consome chamadas de API e torna os fluxos mais lentos. Extrair texto e imagens Retorna o conteúdo de texto e as imagens incorporadas em uma única resposta. Você obtém tudo o que precisa: texto, nomes de arquivos de imagem e dados de imagem em Base64, permitindo que ações subsequentes renomeiem, direcionem ou arquivem os dados sem necessidade de leituras adicionais.
Uma dica: Precisa dividir PDFs por código de barras e renomear cada arquivo com o código de barras? Use Dividir PDF por código de barras: retorna texto do código de barras na mesma resposta para cada divisão, para que você possa renomear sem uma segunda chamada. Veja nosso Dividir PDF por código de barras no Power Automate guia.
O que você precisa?
- Power Automate, Abra o Power AutomateFaça login e crie um novo fluxo na nuvem (instantâneo ou automatizado).
- Chave da API PDF4me, Obtenha sua chave de APIVocê criará uma conexão ao adicionar as ações do PDF4me. Primeira vez? Veja Conecte o PDF4me ao Power Automate.
- DropboxNós o usamos para Obter conteúdo do arquivoSharePoint, OneDrive ou qualquer conector que forneça conteúdo de arquivos também funciona.
O Fluxo em Resumo (4 Etapas).
- Acionar um fluxo manualmenteInicie o fluxo sob demanda (ou use Quando um arquivo é criado no Dropbox para automação).
- Obter o conteúdo do arquivo usando o caminho (Dropbox): Busca o PDF a partir de um caminho como
/pdf4metest/extracttext/image to pdf.pdf. - PDF: Converter PDF em PDF editável usando OCR (PDF4me): Converte PDFs digitalizados/baseados em imagens em texto pesquisável. Ignore esta etapa se seus PDFs já permitirem busca por texto.
- PDF: Extrair texto e imagens (PDF4me): Retorna o texto completo e todas as imagens incorporadas em uma única resposta.

Entrada: Um único PDF (com base em imagens ou em texto). Saída: Conteúdo do texto em texts matriz e imagens em images matriz com fileName e streamFile (Base64).

Exemplo de entrada: PDF baseado em imagens com texto extraível após OCR.
Passo 1: Acionar + Obter Conteúdo do Arquivo.
Fluxo até o momento: Gatilho → Obter conteúdo do arquivo.
- Adicionar Acionar um fluxo manualmente (ou Quando um arquivo é criado no Dropbox para automação).
- Adicionar Dropbox → Obter o conteúdo do arquivo usando o caminho.
- Parâmetros:
- Caminho do arquivo *Insira o caminho para o seu PDF, por exemplo:
/pdf4metest/extracttext/image to pdf.pdfUse o ícone da pasta para navegar, se necessário. - Parâmetros avançados → Inferir tipo de conteúdo: Definir para Sim.
- Conexão: Garantir Conectado ao Dropbox.
A saída é o conteúdo do arquivo (binário). Mapeie-o para Conteúdo do arquivo na ação OCR (e posteriormente em Extrair Texto e Imagens).
Atenção: Certifique-se de mapear o local real. Conteúdo do arquivo O valor retornado é o caminho do arquivo, não o caminho do arquivo ou os metadados. O Power Automate às vezes oferece várias opções no menu suspenso; escolha aquela que contém o arquivo binário.

Etapa 2: Converter PDF em PDF editável usando OCR (para PDFs baseados em imagens).
Fluxo até o momento: Gatilho → Obter conteúdo do arquivo → Converter PDF em PDF editável usando OCR.
Se o seu PDF for digitalizado ou baseado em imagens, adicione esta etapa para que o texto se torne pesquisável antes da extração. Se o seu PDF já contiver texto selecionável, tente copiar uma palavra em um leitor de PDF; você pode pular para a Etapa 3 e passar o conteúdo do arquivo diretamente para a opção Extrair Texto e Imagens.
- Adicionar PDF4me → PDF: Converter PDF em PDF editável usando OCR.
- Parâmetros:
- Conteúdo do arquivo *Mapa Obter o conteúdo do arquivo usando o caminho saída (o binário PDF).
- Nome do arquivo *Digite um nome como
Test.pdfou o nome do arquivo de origem. - Tipo de qualidade: Rascunho para PDFs normais (1 chamada de API por arquivo) ou Alto Para PDFs digitalizados/baseados em imagens (2 chamadas de API por página).
- OCR somente quando necessário: falso executar sempre o OCR, ou Sim Ignorar se o PDF já for pesquisável (economiza chamadas à API).
- Linguagem: Defina para o idioma do documento de origem (por exemplo,
en) se necessário para uma melhor precisão do OCR. - É assíncrono: Não Para fluxos síncronos (recomendado).
- Conexão: Conectado ao PDF4me PDF.

Etapa 3: Extrair texto e imagens.
Fluxo até o momento: … → Converter PDF em PDF editável usando OCR → Extrair texto e imagens.
- Adicionar PDF4me → PDF: Extrair texto e imagens.
- Parâmetros:
- Conteúdo do arquivo *Mapeie a saída de Converter PDF em PDF editável usando OCR (ou diretamente de Obter conteúdo do arquivo (se você pulou o OCR).
- Nome do arquivo *Digite um nome como
New.pdfou o nome do arquivo de origem. - Texto extraído: Sim para extrair texto.
- Extrair imagens: Sim para extrair imagens incorporadas (ou Não (se você precisar apenas do texto).
- Conexão: Conectado ao PDF4me PDF.

Saída: A ação retorna corpo com:
- textos: Matriz de strings com todo o texto extraído (quebras de linha como
\n). - imagens: Matriz de objetos:
fileName(por exemplopage001_image001.jpg) estreamFile(Base64). Utilize-os em ações subsequentes para salvar ou processar as imagens.

Parâmetros e Referência de Saída.
Aqui está um guia rápido com o que usamos. Ajuste essas informações para se adequarem à sua configuração.
| Etapa | Parâmetro | Valor | Notas |
|---|---|---|---|
| Obter arquivo | Caminho do arquivo | /pdf4metest/extracttext/... | Seu caminho do Dropbox |
| Obter arquivo | Inferir tipo de conteúdo | Sim | Ajuda o Power Automate a gerenciar o arquivo. |
| OCR | Tipo de qualidade | Rascunho | Usar Alto para documentos digitalizados complicados |
| OCR | OCR somente quando necessário | falso | Definir para Sim Para economizar chamadas à API se o texto já for pesquisável. |
| Extrair | Extrair texto/imagens | Sim / Sim | Desative o que não for necessário para acelerar o processo. |
| Saída | corpo.textos | Matriz de strings | Todo o texto extraído |
| Saída | imagens do corpo | nomeDoArquivo, arquivoDeFluxo | Dados de imagem em Base64 para cada imagem |
Para obter detalhes completos sobre os parâmetros, consulte Extrair texto e imagens: Power Automate e Converter PDF em PDF editável usando OCR.
Solução de problemas.
Às vezes as coisas dão errado. Veja o que geralmente resolve o problema:
Geralmente significa que o campo mapeado está incorreto. Use o campo que contém o valor real. conteúdo do arquivo, não o caminho ou uma referência. O menu suspenso do Power Automate pode ser complicado nesse aspecto. Veja Dicas para Zapier e Power Automate Para Base64 e manipulação de arquivos.
A ferramenta Extrair Texto e Imagens requer um PDF. Se a sua fonte for uma imagem, converta-a primeiro com... Converter para PDFEm seguida, passe o resultado.
Verificar Solução de problemas do PDF4me para correções 401 (chave de API), 402 (créditos) e específicas da plataforma.
Experimente a API interativamente.
Teste a API Extract Text and Images sem o Power Automate usando nosso Testes de APIFaça o upload de um PDF e veja a resposta:
Próximos passos.
- Adicione um PDF de teste à sua pasta e execute o fluxo. Verifique o resultado. corpo saída para
textoseimagens. - Alimentar
textosem Compor, Analisar JSON ou Condições; useimagensCom a opção Criar arquivo ou qualquer outra ação de armazenamento. - Trocar Acionar manualmente para Quando um arquivo é criado (Dropbox) e conecte o caminho do arquivo do gatilho a Obter conteúdo do arquivo Para automação sem intervenção manual.