Pular para o conteúdo principal

PDF OCR em Make

O que este módulo faz

PDF4me, PDF OCR Converte imagens digitalizadas ou baseadas em imagens. PDFs em documentos de texto totalmente pesquisáveis dentro de um Make cenário. Escolha Padrão qualidade para nativos digitais PDFs ou Especialista Qualidade para documentos digitalizados, fotografados ou de baixa resolução. Ativar OCR somente quando necessário para pular páginas que já possuem texto selecionável e usar É assíncrono Para arquivos com mais de 10 páginas, a fim de evitar timeouts em cenários específicos. A saída é um arquivo pesquisável. PDF pronto para extração de texto, arquivamento, indexação de texto completo ou AI processamento.

Artigos relacionados no blogue
Ainda não há nenhuma publicação no blogue sobre esta funcionalidade — em breve.
Entretanto, explore o blogue da PDF4me para encontrar tutoriais e fluxos de trabalho para todas as plataformas.
Visite o blogue

Autenticando seu API Solicitar

Todo PDF4me módulo em Make requer um válido ConexãoCrie ou selecione um que contenha o seu PDF4me API chave para que o cenário possa ser autenticado OCR Processando solicitações com segurança.

Fatos importantes que você não deve perder

Qualidade Especialista vs. Qualidade Padrão
Usar Especialista Para documentos digitalizados ou fotografados, são aplicadas duas passagens de processamento por página para maior precisão. Use Padrão para nativos digitais PDFs onde OCR Ainda é necessário, é mais rápido e custa metade do preço. API créditos por página.
OCR A opção "Somente quando necessário" economiza créditos.
Quando ativado, o módulo verifica cada página antes do processamento; páginas que já contêm texto selecionável são ignoradas e OCR Aplica-se apenas a páginas baseadas em imagens. Isso economiza API créditos quando sua contribuição PDF Mistura páginas originais e digitalizadas.
Use Is Async para arquivos com mais de 10 páginas.
Sem o modo assíncrono, grande PDFs pode causar o Make cenário para expirar antes OCR concluído. Ativar É assíncrono Para qualquer documento com mais de 10 páginas, permitir que o módulo retorne os resultados de forma assíncrona quando o processamento terminar.
Crie um módulo PDF4me PDF OCR que mostre os campos "Arquivos mapeados da etapa anterior", "Nome do arquivo de saída", "Tipo de qualidade definido como Especialista", "OCR somente quando necessário", "Código do idioma" e "É assíncrono".

São necessários os campos Arquivos, Nome do Arquivo de Saída e Tipo de Qualidade. OCR Somente quando necessário, Código do idioma e É assíncrono são opcionais, mas recomendados para conteúdo misto e arquivos grandes. PDFs.

Parâmetros

Obrigatório: É necessário fornecer a conexão, os arquivos, o nome do arquivo de saída e o tipo de qualidade. OCR Somente quando necessário, Código do idioma e É assíncrono são opcionais.

ParâmetroObrigatórioO que fazExemplo
ConnectionYesPDF4me API connection. Click Add and paste your API key if connecting for the first time.Your PDF4me connection
FilesYesBinary PDF file mapped from a preceding module: scanned, photographed, or image-based PDFs.1. Data
Output File NameYesFilename for the searchable PDF output including the .pdf extension.scanned_searchable.pdf
Quality TypeYesStandard for born-digital PDFs (1 API call per page, faster). Expert for scanned or image-based documents (2 API calls per page, higher accuracy).Expert
OCR Only When NeededNoWhen set to Yes, pages with existing selectable text are skipped: OCR is applied only to image-based pages. Saves API credits for mixed-content PDFs.Yes
Language CodeNoISO language code for the OCR engine. Common values: eng, deu, fra, spa, ita, por. Leave blank for automatic language detection.eng
Is AsyncNoSet to Yes for PDFs with more than 10 pages to prevent Make scenario timeout. Results are returned asynchronously when processing completes.Yes

Configuração rápida

  1. Adicionar PDF4mePDF OCR para o seu Make cenário.
  2. Selecione Conexão (ou clique) Adicionar para criar um com o seu API chave).
  3. Mapa Arquivos para a saída binária do módulo de download anterior (por exemplo, Dropbox → Baixar um arquivo → Data).
  4. Digite um Nome do arquivo de saída: por exemplo scanned_searchable.pdf.
  5. Definir Tipo de qualidade para Expert para documentos digitalizados ou Standard para nativos digitais PDFs.
  6. Opcionalmente, habilite. OCR Somente quando necessário e É assíncrono (para arquivos com mais de 10 páginas), clique em Salvar e execute. A saída Doc Data é o seu pesquisável PDF.

Exemplos de fluxo de trabalho

Exemplos de fluxo de trabalhoCommon Make scenario patterns using PDF OCR.
Fatura digitalizada OCR e extração de dados
  1. Gmail O recurso Watch é acionado quando chega um novo e-mail com uma fatura digitalizada em anexo.
  2. PDF OCR executa com o Tipo de Qualidade definido como Especialista e OCR Ativado somente quando necessário.
  3. A opção Extrair Recursos extrai o texto pesquisável da saída de Dados do Documento.
  4. O texto extraído é analisado para identificar os campos da fatura e lançado automaticamente no sistema de contabilidade.
Lote de digitalização de documentos antigos
  1. Dropbox O recurso de monitoramento é acionado quando uma nova verificação é recebida na pasta de entrada.
  2. PDF OCR Processa o arquivo com qualidade Especialista e a opção Assíncrono está definida como Sim para lotes grandes.
  3. O pesquisável PDF é carregado para o SharePoint pasta de arquivo.
  4. Slack Notifica a equipe quando cada documento é digitalizado e indexado.
Contrato assinado OCR arquivar com Airtable registro
  1. OneDrive O recurso "Observar" é acionado quando uma digitalização de um contrato em papel assinado é carregada na pasta de contratos.
  2. PDF OCR Converte o contrato digitalizado em um documento pesquisável. PDF Com qualidade Expert.
  3. Google Drive salva o pesquisável PDF para a pasta Arquivo de Contratos.
  4. Airtable Cria um novo registro com o nome do contrato, a data e um link para a página de pesquisa. PDF para fins de acompanhamento da conformidade.

Perguntas frequentes

Which Quality Type should I choose?+
Use Expert for scanned documents, photographed pages, or low-quality images: it applies two processing passes per page for higher accuracy. Use Standard for born-digital PDFs (e.g. generated by software or saved from Word) where OCR is still required, it is faster and uses half as many API credits per page.
What does OCR Only When Needed do?+
When enabled, the module checks each page before processing. Pages that already contain selectable text are skipped: OCR is applied only to image-based pages. This is especially useful for PDFs that mix native digital pages with scanned inserts, since it avoids processing pages that do not need OCR.
Which languages does the OCR engine support?+
Common Language Code values are eng (English), deu (German), fra (French), spa (Spanish), ita (Italian), and por (Portuguese). Leave the Language Code field blank for automatic detection. Providing the correct code when the language is known improves accuracy.
When should I enable Is Async?+
Enable Is Async for any PDF with more than 10 pages. Without async mode, large multi-page documents may cause the Make scenario to time out before OCR processing finishes. With Is Async enabled, the module returns results asynchronously once processing completes regardless of file size.
What is in the Doc Data output?+
Doc Data contains the binary of the OCR-processed searchable PDF. The text layer is embedded inside the PDF: you can pass it to the Extract Resources module to extract the text, save it directly to cloud storage, or forward it to an AI analysis step for further processing.

Módulos relacionados

Obtenha ajuda