Pular para o conteúdo principal

Como extrair texto de PDFs digitalizados no Zapier: Assistir → OCR → Extrair (3 etapas)

· 11 min para ler
SEO and Content Writer

Faturas digitalizadas, formulários enviados por fax ou capturas de tela salvas como PDFs podem parecer documentos, mas o texto é apenas pixel. Você não pode selecioná-lo, copiá-lo ou inseri-lo no seu Zap. A solução alternativa: execute OCR primeiro Para tornar o PDF pesquisável e, em seguida, extrair o texto, aqui está um Zap de três etapas que faz exatamente isso, usando o Dropbox e o PDF4me.

Em resumo: Arraste um PDF para o Dropbox → O recurso Zap ativa as ações → O OCR torna o conteúdo pesquisável → A função Extrair Texto importa o conteúdo para o arquivo. Texto completoMapeie esse campo para o Planilhas Google, Airtable, e-mail ou qualquer outra plataforma.

O que você receberá ao final

Quando um arquivo PDF é salvo na sua pasta do Dropbox, o Zap executa o OCR (se necessário) e extrai todo o texto para um único campo. Texto completoVocê pode mapear isso para o Google Sheets, Airtable, e-mail ou qualquer outra etapa subsequente. A saída inclui ID de rastreamento para depuração e Informações do texto da página Para obter detalhes por página.

Extrair texto do PDF: texto completo com documento PDF de exemplo e linhas 1 a 10, ID de rastreamento, informações do texto da página.

Resultado do Zap: texto extraído, ID de rastreamento e informações de texto da página.


Por que os PDFs baseados em imagens precisam de OCR primeiro

Os PDFs baseados em imagens armazenam texto como pixels. As ferramentas de extração esperam uma camada de texto, portanto, não retornam nada útil. Tornar PDF pesquisável/OCR adiciona essa camada, então Extrair texto de um PDF É possível ler tudo. Ignore a etapa de OCR somente se seus PDFs já contiverem texto selecionável (tente copiar uma palavra em um leitor de PDF para verificar).


O que você precisa?


O Zap em 3 Passos

  1. Novo arquivo na pasta (Dropbox): Relógios /pdf4metest/ExtractText a cada 2 minutos.
  2. Tornar PDF pesquisável/OCR (PDF4me): Transforma PDFs baseados em imagens em documentos pesquisáveis.
  3. Extrair texto de um PDF (PDF4me): Insere o texto em Texto completo, ID de rastreamento, e Informações do texto da página.
Fluxo de trabalho do Zapier: Dropbox: Novo arquivo na pasta (2 min) → PDF4me: Tornar o PDF pesquisável/OCR → PDF4me: Extrair texto do PDF

Entrada: Um PDF baseado em imagens (por exemplo, Image To PDF.pdf) com conteúdo como “Documento PDF de exemplo” e linhas numeradas. Saída: Todo o texto em Texto completo, pronto para o próximo passo.

Exemplo de documento PDF: entrada baseada em imagem com 10 linhas numeradas

Exemplo de entrada: PDF baseado em imagens que precisa de OCR antes da extração.


Passo 1: Novo arquivo na pasta (gatilho).

Até agora, Zap: Apenas acione.

  1. Adicionar DropboxNovo arquivo na pasta como gatilho.
  2. Espaço: Padrão (ou escolha o seu espaço).
  3. Pasta *: /pdf4metest/ExtractText (ou sua pasta de destino).
  4. Incluir arquivos em subpastas?: Falso (ou Verdadeiro para pastas aninhadas).
  5. Incluir o conteúdo do arquivo?: SimDeve ser "Sim" para que o conteúdo do arquivo seja passado para as próximas etapas.
  6. Incluir link para compartilhamento?: Sim (opcional).
  7. Clique Continuar e teste o gatilho.
Novo arquivo na pasta: Espaço padrão, Pasta /pdf4metest/ExtractText, Incluir conteúdo do arquivo: Sim, Incluir link de compartilhamento: Sim

Importante: Definir Incluir o conteúdo do arquivo? para SimSe a resposta for "Não", o Zapier enviará uma referência em vez do arquivo, e as etapas de OCR e Extração falharão.


Etapa 2: Tornar o PDF pesquisável / OCR (Ação).

Até agora, Zap: Acionador → Tornar o PDF pesquisável / OCR.

  1. Adicionar PDF4meTornar PDF pesquisável/OCR.
  2. Arquivo *Mapa 1. Arquivo A partir do gatilho do Dropbox. Use o campo com o conteúdo real do arquivo, não “Arquivo: (Existe, mas não é exibido)”.
  3. Nome do arquivoMapa 1. Nome do arquivo e 1. Extensão do arquivo (por exemplo Image To PDF + .pdf).
  4. Tipo de qualidade *: Padrão para a maioria dos PDFs.
  5. Defina o processo como assíncrono.: Falso Assim, o Zap aguarda a conclusão do OCR.
  6. Clique Continuar e teste.
Tornar PDF pesquisável/OCR: Arquivo da etapa 1, Nome do arquivo: Imagem para PDF.pdf, Tipo de qualidade: Padrão, Definir processo como assíncrono: Não

A etapa de OCR retorna um PDF pesquisável. A etapa de Extração utiliza esse arquivo.


Etapa 3: Extrair texto do PDF (Ação).

Até agora, Zap: Gatilho → OCR → Extrair texto.

  1. Adicionar PDF4meExtrair texto de um PDF.
  2. Arquivo *Mapa 2. URL do arquivo da etapa de OCR (o PDF processado).
  3. Nome do arquivoMapa 2. Nome completo do arquivo (por exemplo Image To PDF.pdf).
  4. Modo de Extração *: Documento completo para todo o texto em um campo, ou Por página para saída por página.
  5. Clique Continuar e teste.
Extrair texto de um PDF: URL do arquivo e nome completo do arquivo obtidos na etapa de OCR, Modo de extração: Documento completo

Saída: A ação retorna Texto completo (todo o texto extraído), ID de rastreamento (por exemplo 5e4ba591-94c4-4b6c-ac3f-ca062d483981), e Informações do texto da páginaPara um PDF de exemplo como o acima, você verá “Documento PDF de exemplo” mais as linhas de 1 a 10 em Texto completo.


Tabela de referência rápida

EtapaConfigurações principaisNotas
AcionarPasta: /pdf4metest/ExtractTextIncluir conteúdo do arquivo: Sim
OCRTipo de qualidade: PadrãoUse a opção Expert para varreduras de baixa qualidade (mais chamadas à API).
OCRDefinir Processo como Assíncrono: FalsoMantém o Zap sincronizado
ExtrairModo de extração: Documento completoTodo o texto em um único campo
SaídaTexto completoMapeie isso para as etapas posteriores.

Para obter detalhes completos sobre os parâmetros, consulte Extrair texto de um PDF: Zapier e OCR de PDF, Zapier.


Solução de problemas.

"Arquivo: (Existe, mas não é exibido)"

Essa opção geralmente passa uma referência em vez do arquivo. Selecione o campo que contém o conteúdo real do arquivo. Veja Dicas para Zapier e Power Automate para manipulação de arquivos.

"Arquivo vazio" ou nenhum texto extraído

Garantir Incluir o conteúdo do arquivo? é Sim no gatilho, e que você mapeie a etapa de OCR. URL do arquivo (ou saída de arquivo) na etapa de Extração, não um caminho ou metadados.

Erros 401, 402 ou outros erros de API

Solução de problemas do PDF4me Abrange os tópicos 401 (chave de API), 402 (créditos) e muito mais.


Experimente a API você mesmo.

Teste a API Extract Text sem criar um Zap:


Próximos passos.

Você está pronto.
  • Coloque um PDF de teste na sua pasta e execute o Zap. Verifique a saída da etapa de Extração para Texto completo.
  • Adicione uma etapa após "Extrair", por exemplo, "Adicionar linha à Planilhas Google", "Enviar e-mail" ou "Atualizar no Airtable", e mapeie. Texto completo nisso.
  • Ative o Zap para que ele seja executado quando novos PDFs aparecerem na pasta.