Préparer les informations d'analyse pour le document
Ce guide couvre
Préparer les informations d'analyse c'est la configuration du tableau de bord qui transforme un flux brut PDF dans automatisé PDF extraction de donnéesVous définissez des clés de capture, dessinez des zones sur un document d'exemple et attribuez à chaque clé une règle d'extraction en utilisant soit Expression régulière pour des modèles stables ou JavaScript Expression pour la logique conditionnelle. Une fois enregistré, le même modèle s'exécute à partir du REST API, Make, Zapier, Power Automate, et n8n en se référant à son ID du modèle.
Authentification de votre configuration
La création du modèle d'analyse syntaxique a lieu dans le PDF4me Tableau de bord développeur. Connectez-vous avec votre compte, puis créez ou copiez un API clé pour le document d'analyse API appels qui utilisent le modèle que vous créez ici.
Informations importantes à ne pas manquer
ID du modèle pour le modèle. Toujours passer ID du modèle en production API appels. Nom du modèle Cela fonctionne aussi, mais renommer le modèle interrompt toute automatisation qui y fait référence par son nom.Étape 1 : Créer le modèle d’analyse
- Ouvrez le Tableau de bord Analyser les documents.
- Cliquez Ajouter et saisissez un nom de modèle clair (par exemple,
invoiceouvendor-statement). - Cliquez Sauvegarder pour créer le modèle vide.
- Ouvrez le modèle dans Modifier mode pour commencer la configuration des touches de capture.

Étape 2 : Téléchargez un échantillon et configurez les clés de capture
Le tableau de bord affiche un élément téléchargé PDF à droite et montre le Analyse des informations Le formulaire se trouve à gauche. Utilisez des échantillons réels, conformes à la production, et non des fichiers de test synthétiques, afin que les zones de capture correspondent à ce que vous verrez dans le trafic réel.
- Cliquez Télécharger le fichier modèle et choisissez un échantillon représentatif (facture, contrat, formulaire).
- Sous Clés, cliquez + Pour ajouter une clé de capture, donnez-lui un nom en camelCase :
invoiceNumber,customerName,totalAmount. - Choisir Choisissez le type d'expression pour la clé :
Javascript ExpressionouRegex Expression. - Collez le corps de l'expression dans le champ qui apparaît.
- Ensemble Pages à
allpour scanner chaque page, ou jusqu'à un numéro de page spécifique (1,2, etc.) pour limiter la portée. - Basculer Rechercher sur toute la page Activé lorsque la valeur n'est pas à une position fixe. Désactivé, seule la zone de capture dessinée est analysée.

Écran de configuration de l'analyse de document. À gauche : formulaire d'informations d'analyse avec clés et type d'expression. À droite : exemple téléchargé. PDFLes boutons d'action sont disposés de gauche à droite : Télécharger le fichier modèle, Tester l'analyse, Enregistrer les modifications.
Étape 3 : Choisissez le type d’expression pour chaque clé
| Type d'expression | Idéal pour | Utilisation typique | Complexité |
|---|---|---|---|
| Regex Expression | Fixed text patterns | Invoice number, dates, totals, tax IDs, postal codes | Low |
| JavaScript Expression | Conditional and multi-rule extraction | Document classification, fallback logic, rule orchestration | Medium to High |
Modèles d'expressions régulières (bases de l'analyseur PDF avec expressions régulières)
Utiliser Expression régulière lorsque le terrain présente une forme stable et prévisible. La zone capturée est analysée pour la première correspondance.
INV-\d{6,10}
\d{2}/\d{2}/\d{4}
\$?\d{1,3}(?:,\d{3})*(?:\.\d{2})?
Correspondances clés courantes pour une facture :
invoiceNumber→INV-\d{6,10}invoiceDate→\d{2}/\d{2}/\d{4}totalAmount→\$?\d{1,3}(?:,\d{3})*(?:\.\d{2})?
Ces mêmes modèles fonctionnent également pour les mêmes champs dans les relevés de fournisseurs, les bons de commande et les documents d'expédition, car les numéros de facture, les dates et les montants partagent la même forme dans la plupart des documents commerciaux.
JavaScript Expression pour la logique conditionnelle
Utiliser JavaScript Expression lorsque le résultat dépend de la présence ou de la combinaison de plusieurs marqueurs dans le document. PDF4me transmet le texte extrait à votre fonction en tant que variable textVotre fonction évalue le texte et renvoie une chaîne de caractères qui devient la valeur de la clé.
Exemple 1 : classification par marqueurs de contenu
Permet de distinguer un document de conditions générales d'un document de commande en vérifiant quelles expressions clés apparaissent :
function functionFormatTextDate1(text) {
console.log("Hello");
var term = [...text.matchAll(/General Terms and Conditions/gi)];
var order = [...text.matchAll(/your ordernumber/gi)];
if (term.length) {
if (order.length) {
return "Order document";
} else {
return "Terms and Conditions";
}
} else {
return "Not Terms and Conditions";
}
}
return functionFormatTextDate1(text);
Exemple 2 : détection des factures et des commandes
Un classificateur court qui détermine si le document est une facture ou une commande en fonction de la présence des mots invoice et ordernumber:
function functionGetInvoiceOrder(text) {
// You get all PDF text in `text`
var invoice = [...text.matchAll(/invoice/gi)];
var order = [...text.matchAll(/ordernumber/gi)];
if (invoice.length) {
if (order.length) {
return "Order document";
} else {
return "invoice";
}
} else {
return "";
}
}
return functionGetInvoiceOrder(text);
Conseil de mise en œuvre : Enveloppez votre logique dans une fonction nommée et appelez-la avec retourner functionName(text); En bas. Le tableau de bord exécute le corps de l'expression comme une fonction dont la valeur finale renvoyée alimente la clé.
Étape 4 : Tester l’analyse et enregistrer les modifications
Les boutons d'action situés en haut de l'éditeur s'affichent de gauche à droite dans l'ordre où vous les utilisez :
- Télécharger le fichier modèle charge l'échantillon PDF utilisé pour délimiter les zones de capture.
- Analyse de test Analyse toutes les clés par rapport à l'échantillon téléchargé et affiche les valeurs extraites directement dans le texte. Utilisez cette fonction pour valider chaque expression régulière ou JavaScript expression avant l'enregistrement.
- Enregistrer les modifications conserve le modèle et lui attribue une valeur stable TemplateId (GUID). Copiez ce GUID pour l'utiliser dans API plateformes d'appels et d'automatisation.
Itérer sur chaque clé jusqu'à Analyse de test Renvoie la valeur attendue pour chaque champ. Affinez la zone de capture si du texte adjacent est visible, ou réduisez l'expression si les correspondances de modèle sont trop larges.
Utilisez le modèle dans API ou appels d'automatisation
Une fois Enregistrer les modifications attribue un TemplateIdLe même modèle d'analyse syntaxique s'exécute partout par référence. Il n'est pas nécessaire de recréer la configuration sur chaque plateforme.
| Champ | Source | But |
|---|---|---|
TemplateId | L'identifiant unique global (GUID) s'affiche dans le panneau de détails du modèle après l'enregistrement. | Identifiant stable pour l'automatisation de la production. Privilégiez toujours cette solution. TemplateName. |
TemplateName | Le nom que vous avez saisi à l'étape 1 | Solution de remplacement pour la recherche. Renommer le modèle interrompt les appels qui le référencent par son nom. |
ParseId | Un GUID que vous générez côté client (un par appel) | Permet de mettre en corrélation votre requête avec le résultat de l'analyse syntaxique, utile pour la journalisation et les pistes d'audit. |
docName | Source PDF nom de fichier | Utilisé pour le suivi et les messages d'erreur. |
docContent | Source PDF encodé comme Base64 | Le fichier à analyser. |
async | false pour synchrone, true pour les sondages | Contrôle la transmission des réponses. |
Exemple REST Corps de la requête :
{
"docName": "invoice.pdf",
"docContent": "BASE64_ENCODED_PDF_CONTENT",
"TemplateId": "12345678-1234-1234-1234-123456789abc",
"ParseId": "87654321-4321-4321-4321-cba987654321",
"async": false
}
La réponse contient un champ par clé définie dans le modèle. Acheminez-la. JSON vers n'importe quel nœud en aval : Google Sheets, Airtable, une base de données, Excel ou un webhook.
Flux de travail courants
Modèles d'analyse syntaxique typiquesHow a saved parse template moves from dashboard to production.
- Une facture de fournisseur PDF arrive dans un e-mail surveillé ou un dossier cloud.
- Make, Zapier, Power Automate, ou n8n appelle Parse Document avec votre TemplateId.
- La structure JSON La valeur de output (invoiceNumber, totalAmount, invoiceDate) est ajoutée comme ligne dans Google Sheets ou Excel.
- Le service comptable vérifie et approuve directement à partir de la feuille de calcul.
- Un client télécharge un formulaire rempli PDF formulaire via votre portail.
- Votre backend appelle Parse Document avec TemplateId et le Base64 PDF.
- Le analysé JSON est mappé dans une requête INSERT de base de données, avec une colonne par clé de modèle.
- Un courriel de confirmation est renvoyé au client en utilisant son nom et son numéro de référence.
- Un seul dossier surveillé reçoit des documents variés (factures, commandes, contrats).
- UN JavaScript La clé d'expression dans le modèle renvoie le type de document (voir l'exemple 2 ci-dessus).
- Votre flux de travail achemine chaque fichier vers le système en aval approprié en fonction du type renvoyé.
- Les fichiers identifiés comme factures continuent de faire l'objet d'une extraction de champs basée sur les expressions régulières dans le même appel de modèle.
meilleures pratiques de configuration des modèles
- Dessinez des zones de capture légèrement plus grandes que la valeur attendue afin que le décalage de la police ou de la position ne fasse pas sortir la valeur du cadre.
- Veillez à ce que les noms de clés soient cohérents en camelCase dans tous les modèles afin que le mappage en aval dans les feuilles de calcul, les bases de données et les webhooks reste prévisible.
- Testez chaque clé sur au moins trois exemples réels, y compris les cas limites comme les champs optionnels manquants, les factures en deuxième page, et OCR-texte dérivé de scans PDFs.
- Utiliser JavaScript N'utilisez l'expression que lorsque les expressions régulières ne permettent pas d'exprimer la règle. Une logique simple facilite le débogage du modèle.
- Versionnez vos modèles par nom (
invoice-v1,invoice-v2) lors de la mise en œuvre de changements importants, afin que l'automatisation de la production puisse migrer à son propre rythme. - Exécuter l'analyse PDFs à travers OCR premier (le PDF4me OCR point de terminaison) avant l'analyse. Les modèles sont extraits de la couche de texte, qui a été analysée. PDFs n'ont pas jusqu'à OCR est appliqué.