Aller au contenu principal

PDF OCR dans Make

Que fait ce module ?

PDF4me, PDF OCR convertit les fichiers numérisés ou basés sur des images PDFs dans des documents textuels entièrement consultables à l'intérieur d'un Make Scénario. Choisissez Standard qualité pour le numérique natif PDFs ou Expert Qualité pour les documents numérisés, photographiés ou basse résolution. Activer OCR uniquement en cas de besoin pour ignorer les pages contenant déjà du texte sélectionnable, et utiliser Est-ce asynchrone ? Pour les fichiers de plus de 10 pages, afin d'éviter les dépassements de délai, le résultat est un fichier consultable. PDF prêt pour l'extraction de texte, l'archivage, l'indexation en texte intégral ou AI traitement.

Articles de blog connexes
Il n'y a pas encore d'article de blog consacré à cette fonctionnalité — à venir prochainement.
En attendant, n'hésitez pas à consulter le blog de PDF4me pour découvrir des tutoriels et des procédures de travail adaptés à toutes les plateformes.
Consultez le blog

Authentification de votre API Demande

Chaque PDF4me module dans Make nécessite un numéro valide ConnexionCréez ou sélectionnez-en un qui contient votre PDF4me API clé permettant au scénario de s'authentifier OCR Traitement sécurisé des demandes.

Informations importantes à ne pas manquer

Qualité experte vs qualité standard
Utiliser Expert Pour les documents numérisés ou photographiés, il effectue deux passages de traitement par page pour une précision accrue. Standard pour les appareils nés numériques PDFsOCR est toujours nécessaire, c'est plus rapide et cela coûte deux fois moins cher. API Crédits par page.
OCR L'option « Uniquement en cas de besoin » permet d'économiser des crédits.
Lorsqu'il est activé, le module vérifie chaque page avant traitement ; les pages contenant déjà du texte sélectionnable sont ignorées et OCR Cela s'applique uniquement aux pages contenant des images. Cela permet d'économiser API crédits lorsque votre contribution PDF mélange des pages originales et des pages numérisées.
Utilisez l'option « Is Async » pour les fichiers de plus de 10 pages.
Sans mode asynchrone, grande taille PDFs peut provoquer Make scénario d'expiration avant OCR termine. Activer Est-ce asynchrone ? pour tout document de plus de 10 pages, afin de permettre au module de renvoyer les résultats de manière asynchrone une fois le traitement terminé.
Module OCR PDF4me : affichage des fichiers mappés à l’étape précédente, du nom du fichier de sortie, du type de qualité défini sur Expert, de l’option OCR uniquement si nécessaire, du code de langue et des champs Asynchrone.

Les champs Fichier, Nom du fichier de sortie et Type de qualité sont obligatoires. OCR Les options « Uniquement en cas de besoin », « Code de langue » et « Asynchrone » sont facultatives, mais recommandées pour les contenus mixtes et les projets volumineux. PDFs.

Paramètres

Requis: Connexion, fichiers, nom du fichier de sortie et type de qualité : tous ces champs doivent être renseignés. OCR Les options « Uniquement en cas de besoin », « Code de langue » et « Asynchrone » sont facultatives.

ParamètreRequisCe que cela faitExemple
ConnectionYesPDF4me API connection. Click Add and paste your API key if connecting for the first time.Your PDF4me connection
FilesYesBinary PDF file mapped from a preceding module: scanned, photographed, or image-based PDFs.1. Data
Output File NameYesFilename for the searchable PDF output including the .pdf extension.scanned_searchable.pdf
Quality TypeYesStandard for born-digital PDFs (1 API call per page, faster). Expert for scanned or image-based documents (2 API calls per page, higher accuracy).Expert
OCR Only When NeededNoWhen set to Yes, pages with existing selectable text are skipped: OCR is applied only to image-based pages. Saves API credits for mixed-content PDFs.Yes
Language CodeNoISO language code for the OCR engine. Common values: eng, deu, fra, spa, ita, por. Leave blank for automatic language detection.eng
Is AsyncNoSet to Yes for PDFs with more than 10 pages to prevent Make scenario timeout. Results are returned asynchronously when processing completes.Yes

Configuration rapide

  1. Ajouter PDF4mePDF OCR à votre Make scénario.
  2. Sélectionner Connexion (ou cliquez Ajouter pour en créer un avec votre API clé).
  3. Carte Fichiers à la sortie binaire du module de téléchargement précédent (par exemple, Dropbox → Télécharger un fichier → Data).
  4. Entrez un Nom du fichier de sortiepar exemple scanned_searchable.pdf.
  5. Ensemble Type de qualité à Expert pour les documents numérisés ou Standard pour les appareils nés numériques PDFs.
  6. activer (optionnel) OCR Uniquement en cas de besoin et Est-ce asynchrone ? (pour les fichiers de plus de 10 pages), cliquez ensuite Sauvegarder et exécuter. Le résultat Doc Data est votre recherche PDF.

Exemples de flux de travail

Exemples de flux de travailCommon Make scenario patterns using PDF OCR.
Facture scannée OCR et extraction de données
  1. Gmail Surveillez les déclencheurs lorsqu'un nouvel e-mail contenant une pièce jointe de facture scannée arrive.
  2. PDF OCR s'exécute avec le type de qualité défini sur Expert et OCR Activé uniquement en cas de besoin.
  3. La fonction Extraire les ressources extrait le texte consultable du fichier de sortie Doc Data.
  4. Le texte extrait est analysé pour en extraire les champs de la facture et automatiquement enregistré dans le système comptable.
Lot de numérisation de documents anciens
  1. Dropbox Surveillez les déclencheurs lorsqu'une nouvelle analyse arrive dans le dossier entrant.
  2. PDF OCR Le fichier est traité avec une qualité experte et l'option « Asynchrone » est activée pour les lots importants.
  3. La recherche PDF est téléchargé sur le SharePoint dossier d'archive.
  4. Slack avertit l'équipe lorsque chaque document est numérisé et indexé.
Contrat signé OCR archive avec Airtable enregistrer
  1. OneDrive La surveillance déclenche le téléchargement d'une copie numérisée d'un contrat papier signé dans le dossier des contrats.
  2. PDF OCR convertit le contrat numérisé en un document consultable PDF Avec une qualité experte.
  3. Google Drive enregistre les données consultables PDF dans le dossier Archives des contrats.
  4. Airtable crée un nouvel enregistrement avec le nom du contrat, la date et un lien vers la fiche consultable. PDF pour le suivi de la conformité.

Foire aux questions

Which Quality Type should I choose?+
Use Expert for scanned documents, photographed pages, or low-quality images: it applies two processing passes per page for higher accuracy. Use Standard for born-digital PDFs (e.g. generated by software or saved from Word) where OCR is still required, it is faster and uses half as many API credits per page.
What does OCR Only When Needed do?+
When enabled, the module checks each page before processing. Pages that already contain selectable text are skipped: OCR is applied only to image-based pages. This is especially useful for PDFs that mix native digital pages with scanned inserts, since it avoids processing pages that do not need OCR.
Which languages does the OCR engine support?+
Common Language Code values are eng (English), deu (German), fra (French), spa (Spanish), ita (Italian), and por (Portuguese). Leave the Language Code field blank for automatic detection. Providing the correct code when the language is known improves accuracy.
When should I enable Is Async?+
Enable Is Async for any PDF with more than 10 pages. Without async mode, large multi-page documents may cause the Make scenario to time out before OCR processing finishes. With Is Async enabled, the module returns results asynchronously once processing completes regardless of file size.
What is in the Doc Data output?+
Doc Data contains the binary of the OCR-processed searchable PDF. The text layer is embedded inside the PDF: you can pass it to the Extract Resources module to extract the text, save it directly to cloud storage, or forward it to an AI analysis step for further processing.

Modules associés

Obtenez de l'aide