Aller au contenu principal

PDF OCR

Effectuer une reconnaissance optique de caractères sur un scanné PDF ou une image, de sorte que le texte qu'elle contient devienne du texte réel et sélectionnable. L'action lit les caractères des images de la page et ajoute une couche de texte en arrière-plan, ce qui vous permet de rechercher dans le document, d'en copier du texte et de permettre aux outils d'indexation d'en lire le contenu. L'entrée est une seule image numérisée. PDF ou un fichier image. La sortie est unique PDF qui a la même apparence mais qui contient désormais du texte consultable.

Utilisez-le lorsqu'il est nécessaire de pouvoir effectuer une recherche par mot-clé dans un dossier de contrats ou de factures numérisés, lorsque vous souhaitez copier des chiffres à partir d'un reçu ou d'un formulaire photographié, ou lorsque des documents papier archivés doivent être lus par un système de recherche en texte intégral ou un système de gestion de documents.


Configuration​

Configurer le PDF OCR étape du générateur de flux de travail :

Configuration de la reconnaissance optique de caractères (OCR) PDF dans les flux de travail PDF4me


Aperçu des actions​

SaisirUn seul scan PDF document ou fichier image
SortirUne seule recherche PDF avec une couche de texte sélectionnable

Propriétés​

Qualité​

  • Taper: Sélectionner
  • Défaut: Brouillon

Définit la qualité de reconnaissance pour le OCR Le mode Brouillon est l'option par défaut et la plus rapide. Le menu déroulant propose des paramètres de qualité supérieure qui améliorent la précision des numérisations floues, déformées ou à basse résolution, au prix d'un temps de traitement plus long. Laissez le mode Brouillon activé pour des pages nettes et en haute résolution, et augmentez la qualité lorsque les numérisations sources sont difficiles à lire.

Faire OCR En cas de besoin​

  • Taper: booléen
  • Défaut: Désactivé

Contrôle si l'action vérifie chaque document avant d'exécuter la reconnaissance. Lorsqu'elle est activée, elle ignore les fichiers contenant déjà une couche de texte et exécute la reconnaissance. OCR uniquement sur les documents qui le nécessitent, ce qui évite un traitement inutile des fichiers déjà indexés. Lorsqu'il est désactivé, il s'exécute OCR sur chaque document qui passe par cette étape. Activez cette option lorsque l'entrée mélange des fichiers numérisés avec PDFs qui sont déjà consultables.


Comment courir PDF OCR utilisation des flux de travail​

Lorsque vous avez des centaines de documents numérisés à traiter, l'automatisation est la seule approche pratique. PDF4me Les flux de travail peuvent s'exécuter OCR sur chaque fichier dès sa réception. Voici un exemple de flux de travail qui reconnaît le texte dans les fichiers numérisés. PDFs et des images et produit un fichier consultable PDF.

Créer un flux de travail​

Ouvrez le Tableau de bord des flux de travail et sélectionnez Créer un flux de travail pour commencer à construire votre automatisation.

Créer un nouveau flux de travail

Ajouter un déclencheur​

Ajoutez et configurez un déclencheur pour lancer le flux de travail. Dès qu'un nouveau fichier arrive dans le dossier configuré, l'automatisation s'exécute. Cet exemple utilise un Google Drive déclenchement. PDF4me Les flux de travail prennent également en charge Dropbox Il existe plusieurs déclencheurs ; choisissez celui qui convient le mieux à votre flux de travail.

Déclencheur Google Drive pour le flux de travail OCR PDF

Ajoutez le PDF OCR action​

Ajouter et configurer le PDF OCR action. Activer Faire OCR en cas de besoin de sorte que OCR S'exécute uniquement sur les documents qui le nécessitent, évitant ainsi les appels de traitement inutiles.

Action OCR PDF pour le flux de travail

Ajouter une action Enregistrer dans le stockage​

Une fois les fichiers traités, enregistrez-les sur votre espace de stockage. Pour ce cas d'utilisation, ajoutez et configurez un Enregistrer dans Google Drive Cliquez sur l'action et indiquez le dossier dans lequel vous souhaitez enregistrer les fichiers traités.

Action « Enregistrer sur Google Drive » pour enregistrer les fichiers de sortie

Publier le flux de travail​

Une fois la configuration terminée, sélectionnez Sauvegarder pour publier le flux de travail. Le flux de travail final ressemble à l'exemple ci-dessous.

Exemple de flux de travail automatisé de reconnaissance optique de caractères (OCR) PDF


Essayez-le dans PDF4me Flux de travail​

Ouvrez le tableau de bord Flux de travail, créez un flux de travail et ajoutez-y les éléments suivants : PDF OCR étape à suivre pour exécuter ceci sur vos propres documents.