Pular para o conteúdo principal

Extrair recursos de PDF em Make

O que este módulo faz

PDF4meExtrair recursos Extrai todas as imagens e conteúdo de texto incorporados de um PDF e os retorna como dados estruturados em seu Make cenário. Alternar Extrair imagens para recuperar todas as imagens incorporadas no documento como um elemento nomeado, Base64Arquivo codificado. Alternar Texto extraído para recuperar o conteúdo completo do texto como uma string simples. Ambos podem ser executados simultaneamente em uma única chamada de módulo. Use as imagens extraídas para criar bibliotecas de recursos, use o texto extraído para análise, indexação de pesquisa ou tradução, tudo sem abrir o arquivo. PDF manualmente.

Artigos relacionados no blogue
Ainda não há nenhuma publicação no blogue sobre esta funcionalidade — em breve.
Entretanto, explore o blogue da PDF4me para encontrar tutoriais e fluxos de trabalho para todas as plataformas.
Visite o blogue

Autenticando seu API Solicitar

Todo PDF4me módulo em Make requer um válido ConexãoCrie ou selecione um que contenha o seu PDF4me API chave para que o cenário possa autenticar solicitações de extração com segurança.

Fatos importantes que você não deve perder

O array de imagens precisa de um iterador para ser processado individualmente.
A saída de imagens é uma matriz, com um item para cada imagem incorporada. Para carregar ou processar cada imagem separadamente, adicione um Make Iterador O módulo imediatamente após "Extrair Recursos" aponta para a matriz "Imagens". Cada iteração retorna uma imagem com um Nome campo (nome do arquivo) e um Dados campo (conteúdo Base64). Sem um Iterator, você não pode acessar imagens individuais posteriormente.
Os dados da imagem são Base64decodificar antes de enviar
Cada imagem Dados O campo é codificado em Base64. Módulos de armazenamento em nuvem (Dropbox, Google Drive, SharePoint) espera dados binários, não Base64 texto. Use Make's embutido toBinary(Data, 'base64') Função para converter o campo de dados em binário antes de enviá-lo para um módulo de upload. Nome O campo fornece o nome do arquivo original com a extensão (por exemplo, .txt). imagem_001.png).
A extração de texto funciona em nativo PDFs, não digitalizado
A opção "Extrair texto" recupera o texto pesquisável incorporado no documento. PDF Estrutura. Digitalizada PDFs Como são baseadas em imagens, não contêm nenhuma camada de texto incorporada; portanto, a saída de texto será vazia ou mínima em documentos digitalizados. Para extrair texto de páginas digitalizadas, execute um PDF OCR Primeiro, crie um módulo para criar uma camada de texto e, em seguida, use a opção "Extrair Recursos" para extrair o texto. A extração de imagens funciona em todos os casos. PDFs incluindo as digitalizadas.
O módulo "Extrair Recursos" do PDF4me deve mostrar a Conexão definida como "Minha conexão PDF4me", o Nome do Arquivo mapeado da etapa 1, o Documento mapeado dos dados da etapa 1, a opção "Extrair Imagens" definida como "Sim" e a opção "Extrair Texto" definida como "Sim".

Extrair Imagens e Extrair Texto são opções independentes; habilite uma, ambas ou qualquer uma delas, dependendo da sua necessidade. As imagens são retornadas como uma matriz; o texto é retornado como uma string simples.

Parâmetros

Obrigatório: É necessário fornecer as informações de Conexão, Nome do Arquivo, Documento, Extrair Imagens e Extrair Texto. Defina pelo menos uma das opções Extrair Imagens ou Extrair Texto como Sim; habilitar nenhuma delas não retornará nenhum conteúdo.

ParâmetroObrigatórioO que fazExemplo
ConnectionYesPDF4me API connection. Click Add and paste your API key if connecting for the first time.My PDF4me connection
File NameYesFilename of the source PDF including .pdf extension. Map from the prior module's file name output.catalog.pdf
DocumentYesBinary content of the source PDF. Map from the prior module's data output: Dropbox, Google Drive, HTTP, or email attachment.1. Data
Extract ImagesYesToggle to extract all embedded images. Set to Yes to retrieve images as a named Base64 array. Set to No to skip image extraction. Can be combined with Extract Text.Yes
Extract TextYesToggle to extract all text content. Set to Yes to retrieve the full document text as a plain string. Set to No to skip text extraction. Works on native PDFs only: not scanned.Yes

Campos de saída

CampoTipoDescrição
TextosStringConteúdo integral do texto extraído de PDF como uma string simples. Vazio se "Extrair texto" estiver definido como "Não" ou o PDF é digitalizado.
ImagensArrayMatriz com todas as imagens incorporadas. Cada item possui um Nome (nome do arquivo com extensão) e Dados (Base64(Conteúdo da imagem codificado). Matriz vazia se Extrair Imagens for Não.

Configuração rápida

  1. Adicionar PDF4meExtrair recursos para o seu Make cenário após uma etapa de download de arquivo.
  2. Selecione Conexão (ou clique) Adicionar para criar um com o seu API chave).
  3. Mapa Nome do arquivo e Documento do módulo anterior.
  4. Definir Extrair imagens e/ou Texto extraído para Sim Dependendo do que você precisar.
  5. Se estiver extraindo imagens, adicione um Iterador módulo apontando para o Imagens array. Dentro do iterador, use toBinary(Data, 'base64') Decodificar cada imagem e encaminhá-la para um módulo de upload.
  6. Se estiver extraindo texto, mapeie o Textos campo diretamente em uma linha do Google Sheets, inserção em banco de dados, ou HTTP Corpo da postagem.

Exemplos de fluxo de trabalho

Exemplos de fluxo de trabalhoCommon Make scenario patterns using Extract Resources.
Crie uma biblioteca de imagens a partir do catálogo de produtos. PDFs
  1. A função "Monitorar Pasta" do Dropbox é acionada quando um novo catálogo é adicionado. PDF foi carregado.
  2. O recurso "Baixar um arquivo" do Dropbox recupera o PDF binário.
  3. A opção Extrair Recursos é executada com a opção Extrair Imagens definida como Sim e a opção Extrair Texto definida como Não.
  4. O iterador percorre o array de imagens, uma imagem por iteração.
  5. Cada iteração decodifica o campo de dados com toBinary(Data, 'base64') e carrega a imagem para uma pasta "Imagens do Produto" do Google Drive, usando o campo Nome como nome do arquivo.
Texto do contrato indexado para pesquisa de texto completo
  1. O recurso "Monitorar arquivos" do Google Drive é acionado quando um novo contrato é criado. PDF foi adicionado à pasta "Contratos".
  2. O recurso "Obter um arquivo" do Google Drive baixa o arquivo binário.
  3. A opção Extrair Recursos é executada com a opção Extrair Texto definida como Sim e a opção Extrair Imagens definida como Não.
  4. O conteúdo do arquivo de texto é gravado em um registro do Airtable, juntamente com o nome do arquivo e a data de upload.
  5. Agora é possível pesquisar o contrato em texto completo no Airtable, sem necessidade de copiar e colar manualmente.
Migrar sistemas legados PDFs, texto para banco de dados, imagens para biblioteca de mídia
  1. Uma linha do Google Sheets com um PDF O URL aciona o cenário para cada documento legado na lista de migração.
  2. Um HTTP O módulo baixa o PDF a partir do URL.
  3. A opção Extrair Recursos é executada com as opções Extrair Texto e Extrair Imagens definidas como Sim.
  4. O campo de texto é inserido em um MySQL Registro de banco de dados para pesquisa de texto completo.
  5. Um iterador carrega cada imagem extraída para um SharePoint biblioteca de mídia, concluindo a migração de conteúdo sem nunca abrir o PDFs manualmente.

Perguntas frequentes

How do I save each extracted image to cloud storage?+
Add a Make Iterator module after Extract Resources and point it at the Images array output. Each iteration yields one image object with a Name field (original filename with extension, e.g. image_001.png) and a Data field (Base64-encoded content). Convert Data to binary using Make's toBinary(Data, 'base64') function, then pipe the binary into a Dropbox Upload a File, Google Drive Upload a File, or SharePoint module: using the Name field as the destination filename.
Can I extract only images, only text, or both?+
The two toggles are fully independent. Set Extract Images to Yes and Extract Text to No to retrieve only images. Set Extract Text to Yes and Extract Images to No for text only. Enable both to retrieve everything in a single module call: PDF4me processes the document once and returns both outputs together, which is more efficient than running the module twice.
Will text extraction work on scanned PDFs?+
Scanned PDFs are essentially images of pages: they contain no embedded text layer. The Extract Text toggle retrieves text from the PDF's internal text structure, which only exists in digitally created (native) PDFs. For scanned documents, the Texts output will be empty or contain only minimal metadata. Run a PDF OCR module first to add a text layer to the scanned PDF, then use Extract Resources to pull the text.
What image formats are returned: PNG, JPG, or something else?+
The format depends on how each image is stored inside the PDF. Most PDFs embed images as JPEG or PNG. The Name field in each Images array item includes the original extension (e.g. image_001.jpg or image_002.png) so you know the format before saving. The Data field is always Base64 regardless of the underlying format.
Does the module modify or damage the source PDF?+
No. Extract Resources is a read-only operation. It reads the PDF content and returns copies of the embedded text and images: the source file in Dropbox, Google Drive, SharePoint, or any other location is completely untouched. You can run Extract Resources on the same PDF multiple times without any side effects.

Módulos relacionados

Obtenha ajuda