Saltar al contenido principal

Cómo extraer texto de archivos PDF escaneados en Zapier: Ver → OCR → Extraer (3 pasos)

· 11 min de lectura
SEO and Content Writer

Las facturas escaneadas, los formularios enviados por fax o las capturas de pantalla guardadas como PDF parecen documentos, pero el texto son solo píxeles. No puedes seleccionarlo, copiarlo ni introducirlo en tu Zap. La solución alternativa: ejecuta OCR primero Para que el PDF sea editable, extrae el texto. Aquí tienes un Zap de tres pasos que hace precisamente eso, usando Dropbox y PDF4me.

En una palabra: Arrastra un PDF a Dropbox → Zap activa → OCR lo hace buscable → Extraer texto extrae el contenido Texto completo. Asigna ese campo a Hojas de cálculo, Airtable, correo electrónico o cualquier otra cosa.

Lo que obtendrás al final

Cuando un PDF llega a tu carpeta de Dropbox, Zap ejecuta OCR (si es necesario) y extrae todo el texto en un solo campo, Texto completoPuedes mapear eso en Google Sheets, Airtable, correo electrónico o cualquier otro paso posterior. La salida incluye Identificador de rastreo para depuración y Información del texto de la página para detalles por página.

Extracción de texto de la salida PDF: texto completo con documento PDF de muestra y líneas 1: 10, ID de seguimiento, información del texto de la página.

Salida del Zap: texto extraído, ID de seguimiento e información del texto de la página.


¿Por qué los PDF basados en imágenes necesitan OCR primero?

Los archivos PDF basados en imágenes almacenan el texto como píxeles. Las herramientas de extracción esperan una capa de texto, por lo que no devuelven información útil. Hacer que el PDF sea buscable / OCR agrega esa capa, entonces Extraer texto de un PDF Puede leerlo todo. Omita el paso de OCR solo si sus archivos PDF ya contienen texto seleccionable (intente copiar una palabra en un lector para verificarlo).


¿Qué necesitas?

  • Zapier, Crea una cuenta de Zapier y comienza un nuevo Zap.
  • Clave API de PDF4me, Obtén tu clave APILo conectarás cuando añadas las acciones de PDF4me. ¿Es la primera vez? Ver Conecta PDF4me con Zapier.
  • Dropbox, Nosotros usamos Nuevo archivo en la carpeta como desencadenante. Cualquier aplicación de almacenamiento que se active con archivos nuevos también funciona.

El Zap en 3 pasos

  1. Nuevo archivo en la carpeta (Dropbox): Relojes /pdf4metest/ExtractText cada 2 minutos.
  2. Hacer que el PDF sea buscable / OCR (PDF4me): Convierte archivos PDF basados en imágenes en documentos con capacidad de búsqueda.
  3. Extraer texto de un PDF (PDF4me): Extrae el texto Texto completo, Identificador de rastreo, y Información del texto de la página.
Flujo de trabajo de Zapier: Dropbox Nuevo archivo en carpeta (2 min) → PDF4me Hacer PDF con capacidad de búsqueda / OCR → PDF4me Extraer texto del PDF

Aporte: Un PDF basado en imágenes (por ejemplo, Image To PDF.pdf) con contenido como “Documento PDF de muestra” y líneas numeradas. Producción: Todo el texto en Texto completo, listos para el siguiente paso.

Ejemplo de documento PDF: entrada basada en imágenes con 10 líneas numeradas.

Ejemplo de entrada: PDF basado en imágenes que necesita OCR antes de la extracción.


Paso 1: Nuevo archivo en la carpeta (Activador).

Zap hasta ahora: Solo disparador.

  1. Agregar DropboxNuevo archivo en la carpeta como detonante.
  2. Espacio: Por defecto (o elige tu espacio).
  3. Carpeta *: /pdf4metest/ExtractText (o su carpeta de destino).
  4. ¿Incluir archivos en subcarpetas?: FALSO (o Verdadero para carpetas anidadas).
  5. ¿Incluir el contenido del archivo?: Debe ser Sí para que el contenido del archivo se pase a los siguientes pasos.
  6. ¿Incluir enlace para compartir?: (opcional).
  7. Haga clic Continuar y prueba el gatillo.
Nuevo archivo en la carpeta: Espacio predeterminado, Carpeta /pdf4metest/ExtractText, Incluir contenido del archivo Sí, Incluir enlace para compartir Sí

Importante: Colocar ¿Incluir el contenido del archivo? a Si la respuesta es No, Zapier pasa una referencia en lugar del archivo, y los pasos de OCR y Extracción fallarán.


Paso 2: Hacer que el PDF sea buscable / OCR (Acción).

Zap hasta ahora: Activador → Hacer que el PDF sea buscable / OCR.

  1. Agregar PDF4meHacer que el PDF sea buscable / OCR.
  2. Archivo *Mapa 1. Archivo Desde el activador de Dropbox. Utilice el campo con el contenido real del archivo, no “Archivo: (Existe pero no se muestra)”.
  3. Nombre del archivoMapa 1. Nombre del archivo y 1. Extensión de archivo (p.ej. Image To PDF + .pdf).
  4. Tipo de calidad *: Estándar para la mayoría de los PDF.
  5. Establecer el proceso como asíncrono: FALSO Así que el Zap espera a que termine el OCR.
  6. Haga clic Continuar y prueba.
Hacer que el PDF sea buscable / OCR: Archivo del paso 1, Nombre del archivo Imagen a PDF.pdf, Tipo de calidad Estándar, Establecer proceso como asíncrono Falso

El paso de OCR devuelve un PDF con capacidad de búsqueda. El paso de extracción utiliza ese archivo.


Paso 3: Extraer texto del PDF (Acción).

Zap hasta ahora: Activador → OCR → Extraer texto.

  1. Agregar PDF4meExtraer texto de un PDF.
  2. Archivo *Mapa 2. URL del archivo del paso de OCR (el PDF procesado).
  3. Nombre del archivoMapa 2. Nombre completo del archivo (p.ej. Image To PDF.pdf).
  4. Modo de extracción *: Documento completo para todo el texto en un campo, o Por página para salida por página.
  5. Haga clic Continuar y prueba.
Extraer texto de un PDF: URL del archivo y nombre completo del archivo del paso OCR, modo de extracción: documento completo

Producción: La acción regresa Texto completo (todo el texto extraído), Identificador de rastreo (p.ej. 5e4ba591-94c4-4b6c-ac3f-ca062d483981), y Información del texto de la página. Para un PDF de muestra como el anterior, verá “Documento PDF de muestra” más las líneas 1 a 10 en Texto completo.


Tabla de referencia rápida

PasoConfiguración de teclasNotas
DesencadenarCarpeta: /pdf4metest/ExtractTextIncluir el contenido del archivo:
LOCTipo de calidad: EstándarUtilice Experto para escaneos deficientes (más llamadas a la API).
LOCEstablecer el proceso como asíncrono: FalsoMantiene el Zap sincronizado
ExtractoModo de extracción: Documento completoTodo el texto en un solo campo
ProducciónTexto completoAsigna esto a pasos posteriores

Para obtener detalles completos de los parámetros, consulte Extraer texto de un PDF: Zapier y OCR de PDF, Zapier.


Solución de problemas.

"Archivo: (Existe pero no se muestra)"

Esa opción suele pasar una referencia en lugar del archivo. Seleccione el campo que contiene el contenido real del archivo. Ver Consejos sobre Zapier y Power Automate para el manejo de archivos.

"El archivo está vacío" o no se extrajo ningún texto.

Asegurar ¿Incluir el contenido del archivo? es en el activador, y que usted mapee el paso OCR del URL del archivo (o salida de archivo) en el paso de extracción, no una ruta o metadatos.

Errores 401, 402 u otros errores de API

Solución de problemas de PDF4me Cubre los errores 401 (clave API), 402 (créditos) y más.


Prueba la API tú mismo.

Prueba la API de extracción de texto sin crear un Zap:


Próximos pasos.

Ya está.
  • Arrastra un PDF de prueba a tu carpeta y ejecuta Zap. Comprueba la salida del paso de extracción para Texto completo.
  • Agregue un paso después de Extraer, por ejemplo, Agregar fila a Hojas de cálculo de Google, Enviar correo electrónico o Actualizar Airtable, y mapee. Texto completo dentro de él.
  • Activa Zap para que se ejecute cuando aparezcan nuevos archivos PDF en la carpeta.