Saltar al contenido principal

PDF OCR en Make

Lo que hace este módulo

PDF4me, PDF OCR convierte imágenes escaneadas o basadas en imágenes. PDFs en documentos de texto totalmente buscables dentro de un Make escenario. Elegir Estándar calidad para productos digitales nativos PDFs o Experto calidad para documentos escaneados, fotografiados o de baja resolución. Habilitar OCR solo cuando sea necesario para omitir páginas que ya tienen texto seleccionable y usar ¿Es asíncrono? Para archivos de más de 10 páginas, para evitar tiempos de espera en el escenario. La salida es un archivo que se puede buscar. PDF listo para extracción de texto, archivado, indexación de texto completo o AI procesamiento.

Entradas de blog relacionadas
Aún no hay ninguna entrada de blog sobre esta función; estará disponible próximamente.
Mientras tanto, echa un vistazo al blog de PDF4me para encontrar tutoriales y flujos de trabajo para todas las plataformas.
Visita el blog

Autenticando su API Pedido

Cada PDF4me módulo en Make requiere un válido Conexión. Crea o selecciona uno que contenga tu PDF4me API clave para que el escenario pueda autenticarse OCR Procesamiento seguro de las solicitudes.

Datos importantes que no debes perderte

Calidad experta frente a calidad estándar
Usar Experto Para documentos escaneados o fotografiados, aplica dos pasadas de procesamiento por página para una mayor precisión. Estándar para productos nacidos en la nube PDFs dónde OCR Todavía es necesario, es más rápido y cuesta la mitad. API créditos por página.
OCR Solo cuando sea necesario ahorra créditos.
Cuando está habilitado, el módulo comprueba cada página antes de procesarla, las páginas que ya contienen texto seleccionable se omiten y OCR Se aplica únicamente a páginas basadas en imágenes. Esto ahorra API créditos cuando tu aporte PDF Combina páginas originales y escaneadas.
Utilice Is Async para archivos de más de 10 páginas.
Sin modo asíncrono, grande PDFs puede causar el Make escenario para agotar el tiempo antes OCR Completa. Habilitar ¿Es asíncrono? Para cualquier documento con más de 10 páginas, permitir que el módulo devuelva los resultados de forma asíncrona cuando finalice el procesamiento.
El módulo PDF4me PDF OCR muestra los archivos asignados desde el paso anterior, el nombre del archivo de salida, el tipo de calidad establecido en Experto, OCR solo cuando sea necesario, el código de idioma y los campos Is Async.

Se requieren los siguientes campos: Archivos, Nombre del archivo de salida y Tipo de calidad. OCR Solo cuando sea necesario, Código de idioma y Es asíncrono son opcionales pero se recomiendan para contenido mixto y grande. PDFs.

Parámetros

Requerido: Se deben proporcionar la conexión, los archivos, el nombre del archivo de salida y el tipo de calidad. OCR Solo cuando sea necesario, Código de idioma y Es asíncrono son opcionales.

ParámetroRequeridoLo que haceEjemplo
ConnectionYesPDF4me API connection. Click Add and paste your API key if connecting for the first time.Your PDF4me connection
FilesYesBinary PDF file mapped from a preceding module: scanned, photographed, or image-based PDFs.1. Data
Output File NameYesFilename for the searchable PDF output including the .pdf extension.scanned_searchable.pdf
Quality TypeYesStandard for born-digital PDFs (1 API call per page, faster). Expert for scanned or image-based documents (2 API calls per page, higher accuracy).Expert
OCR Only When NeededNoWhen set to Yes, pages with existing selectable text are skipped: OCR is applied only to image-based pages. Saves API credits for mixed-content PDFs.Yes
Language CodeNoISO language code for the OCR engine. Common values: eng, deu, fra, spa, ita, por. Leave blank for automatic language detection.eng
Is AsyncNoSet to Yes for PDFs with more than 10 pages to prevent Make scenario timeout. Results are returned asynchronously when processing completes.Yes

Configuración rápida

  1. Agregar PDF4mePDF OCR a tu Make escenario.
  2. Seleccionar Conexión (o haga clic Agregar para crear uno con tu API llave).
  3. Mapa Archivos a la salida binaria del módulo de descarga anterior (por ejemplo, Dropbox → Descargar un archivo → Data).
  4. Ingrese un Nombre del archivo de salida: p.ej. scanned_searchable.pdf.
  5. Colocar Tipo de calidad a Expert para documentos escaneados o Standard para productos nacidos en la nube PDFs.
  6. Habilitar opcionalmente OCR Solo cuando sea necesario y ¿Es asíncrono? (para archivos de más de 10 páginas), luego haga clic Ahorrar y ejecutar. La salida Doc Data ¿Es tu búsqueda? PDF.

Ejemplos de flujo de trabajo

Ejemplos de flujo de trabajoCommon Make scenario patterns using PDF OCR.
Factura escaneada OCR y extracción de datos
  1. Gmail El reloj se activa cuando llega un nuevo correo electrónico con un archivo adjunto de factura escaneada.
  2. PDF OCR se ejecuta con el tipo de calidad configurado en Experto y OCR Activado solo cuando sea necesario.
  3. La función Extract Resources extrae el texto que se puede buscar de la salida de Doc Data.
  4. El texto extraído se analiza para extraer los campos de la factura y se registra automáticamente en el sistema contable.
Lote de digitalización de documentos heredados
  1. Dropbox El reloj se activa cuando llega un nuevo escaneo a la carpeta de entrada.
  2. PDF OCR Procesa el archivo con calidad Experto y la opción Is Async está configurada en Sí para lotes grandes.
  3. El buscador PDF se sube al SharePoint carpeta de archivo.
  4. Slack Notifica al equipo cuando cada documento se digitaliza e indexa.
Contrato firmado OCR archivo con Airtable registro
  1. OneDrive El reloj se activa cuando se carga una copia escaneada de un contrato en papel firmado en la carpeta de contratos.
  2. PDF OCR convierte el contrato escaneado en un formato que permite realizar búsquedas. PDF Con calidad profesional.
  3. Google Drive guarda el objeto que se puede buscar PDF a la carpeta de archivo de contratos.
  4. Airtable crea un nuevo registro con el nombre del contrato, la fecha y un enlace a la búsqueda. PDF para el seguimiento del cumplimiento.

Preguntas frecuentes

Which Quality Type should I choose?+
Use Expert for scanned documents, photographed pages, or low-quality images: it applies two processing passes per page for higher accuracy. Use Standard for born-digital PDFs (e.g. generated by software or saved from Word) where OCR is still required, it is faster and uses half as many API credits per page.
What does OCR Only When Needed do?+
When enabled, the module checks each page before processing. Pages that already contain selectable text are skipped: OCR is applied only to image-based pages. This is especially useful for PDFs that mix native digital pages with scanned inserts, since it avoids processing pages that do not need OCR.
Which languages does the OCR engine support?+
Common Language Code values are eng (English), deu (German), fra (French), spa (Spanish), ita (Italian), and por (Portuguese). Leave the Language Code field blank for automatic detection. Providing the correct code when the language is known improves accuracy.
When should I enable Is Async?+
Enable Is Async for any PDF with more than 10 pages. Without async mode, large multi-page documents may cause the Make scenario to time out before OCR processing finishes. With Is Async enabled, the module returns results asynchronously once processing completes regardless of file size.
What is in the Doc Data output?+
Doc Data contains the binary of the OCR-processed searchable PDF. The text layer is embedded inside the PDF: you can pass it to the Extract Resources module to extract the text, save it directly to cloud storage, or forward it to an AI analysis step for further processing.

Módulos relacionados

Obtén ayuda