Extrair recursos de PDF em Make
O que este módulo faz
PDF4meExtrair recursos Extrai todas as imagens e conteúdo de texto incorporados de um PDF e os retorna como dados estruturados em seu Make cenário. Alternar Extrair imagens para recuperar todas as imagens incorporadas no documento como um elemento nomeado, Base64Arquivo codificado. Alternar Texto extraído para recuperar o conteúdo completo do texto como uma string simples. Ambos podem ser executados simultaneamente em uma única chamada de módulo. Use as imagens extraídas para criar bibliotecas de recursos, use o texto extraído para análise, indexação de pesquisa ou tradução, tudo sem abrir o arquivo. PDF manualmente.
Autenticando seu API Solicitar
Todo PDF4me módulo em Make requer um válido ConexãoCrie ou selecione um que contenha o seu PDF4me API chave para que o cenário possa autenticar solicitações de extração com segurança.
Fatos importantes que você não deve perder
Nome campo (nome do arquivo) e um Dados campo (conteúdo Base64). Sem um Iterator, você não pode acessar imagens individuais posteriormente.Dados O campo é codificado em Base64. Módulos de armazenamento em nuvem (Dropbox, Google Drive, SharePoint) espera dados binários, não Base64 texto. Use Make's embutido toBinary(Data, 'base64') Função para converter o campo de dados em binário antes de enviá-lo para um módulo de upload. Nome O campo fornece o nome do arquivo original com a extensão (por exemplo, .txt). imagem_001.png).
Extrair Imagens e Extrair Texto são opções independentes; habilite uma, ambas ou qualquer uma delas, dependendo da sua necessidade. As imagens são retornadas como uma matriz; o texto é retornado como uma string simples.
Parâmetros
Obrigatório: É necessário fornecer as informações de Conexão, Nome do Arquivo, Documento, Extrair Imagens e Extrair Texto. Defina pelo menos uma das opções Extrair Imagens ou Extrair Texto como Sim; habilitar nenhuma delas não retornará nenhum conteúdo.
| Parâmetro | Obrigatório | O que faz | Exemplo |
|---|---|---|---|
| Connection | Yes | PDF4me API connection. Click Add and paste your API key if connecting for the first time. | My PDF4me connection |
| File Name | Yes | Filename of the source PDF including .pdf extension. Map from the prior module's file name output. | catalog.pdf |
| Document | Yes | Binary content of the source PDF. Map from the prior module's data output: Dropbox, Google Drive, HTTP, or email attachment. | 1. Data |
| Extract Images | Yes | Toggle to extract all embedded images. Set to Yes to retrieve images as a named Base64 array. Set to No to skip image extraction. Can be combined with Extract Text. | Yes |
| Extract Text | Yes | Toggle to extract all text content. Set to Yes to retrieve the full document text as a plain string. Set to No to skip text extraction. Works on native PDFs only: not scanned. | Yes |
Campos de saída
| Campo | Tipo | Descrição |
|---|---|---|
| Textos | String | Conteúdo integral do texto extraído de PDF como uma string simples. Vazio se "Extrair texto" estiver definido como "Não" ou o PDF é digitalizado. |
| Imagens | Array | Matriz com todas as imagens incorporadas. Cada item possui um Nome (nome do arquivo com extensão) e Dados (Base64(Conteúdo da imagem codificado). Matriz vazia se Extrair Imagens for Não. |
Configuração rápida
- Adicionar PDF4me → Extrair recursos para o seu Make cenário após uma etapa de download de arquivo.
- Selecione Conexão (ou clique) Adicionar para criar um com o seu API chave).
- Mapa Nome do arquivo e Documento do módulo anterior.
- Definir Extrair imagens e/ou Texto extraído para Sim Dependendo do que você precisar.
- Se estiver extraindo imagens, adicione um Iterador módulo apontando para o Imagens array. Dentro do iterador, use
toBinary(Data, 'base64')Decodificar cada imagem e encaminhá-la para um módulo de upload. - Se estiver extraindo texto, mapeie o Textos campo diretamente em uma linha do Google Sheets, inserção em banco de dados, ou HTTP Corpo da postagem.
Exemplos de fluxo de trabalho
Exemplos de fluxo de trabalhoCommon Make scenario patterns using Extract Resources.
- A função "Monitorar Pasta" do Dropbox é acionada quando um novo catálogo é adicionado. PDF foi carregado.
- O recurso "Baixar um arquivo" do Dropbox recupera o PDF binário.
- A opção Extrair Recursos é executada com a opção Extrair Imagens definida como Sim e a opção Extrair Texto definida como Não.
- O iterador percorre o array de imagens, uma imagem por iteração.
- Cada iteração decodifica o campo de dados com
toBinary(Data, 'base64')e carrega a imagem para uma pasta "Imagens do Produto" do Google Drive, usando o campo Nome como nome do arquivo.
- O recurso "Monitorar arquivos" do Google Drive é acionado quando um novo contrato é criado. PDF foi adicionado à pasta "Contratos".
- O recurso "Obter um arquivo" do Google Drive baixa o arquivo binário.
- A opção Extrair Recursos é executada com a opção Extrair Texto definida como Sim e a opção Extrair Imagens definida como Não.
- O conteúdo do arquivo de texto é gravado em um registro do Airtable, juntamente com o nome do arquivo e a data de upload.
- Agora é possível pesquisar o contrato em texto completo no Airtable, sem necessidade de copiar e colar manualmente.
- Uma linha do Google Sheets com um PDF O URL aciona o cenário para cada documento legado na lista de migração.
- Um HTTP O módulo baixa o PDF a partir do URL.
- A opção Extrair Recursos é executada com as opções Extrair Texto e Extrair Imagens definidas como Sim.
- O campo de texto é inserido em um MySQL Registro de banco de dados para pesquisa de texto completo.
- Um iterador carrega cada imagem extraída para um SharePoint biblioteca de mídia, concluindo a migração de conteúdo sem nunca abrir o PDFs manualmente.