Extraction de texte à partir de Word - Analyseur de contenu API
PDF4me Extraire du texte de Word permet d'extraire le contenu textuel de documents Word avec des options de filtrage par plage de pages et par contenu. API Ce service traite les fichiers Word et extrait le contenu textuel des documents Word avec des options personnalisables. API reçoit le contenu des documents Word via REST API appels, utilisant Base64 Encodage pour une transmission sécurisée. Grâce à la prise en charge de la sélection de plages de pages, de la suppression des commentaires, du filtrage des en-têtes et pieds de page et de l'acceptation des modifications, cette solution est idéale pour les flux de travail de traitement de documents et d'analyse de contenu.
Authentification de votre API Demande
Pour accéder au PDF4me REST APIChaque requête doit inclure des informations d'authentification valides. L'authentification garantit la sécurité des communications et confirme votre identité en tant qu'utilisateur autorisé. REST API.
Caractéristiques principales
- Assistance pour les documents WordExtraire du texte à partir de documents Microsoft Word (.doc, .docx)
- Sélection de plage de pages: Traiter des plages de pages spécifiques ou des documents entiers avec des numéros de page de début et de fin personnalisés
- Filtrage du contenuSupprimer les commentaires, les en-têtes, les pieds de page et le suivi des modifications pour une extraction de texte propre
- Base64 Encodage: Sécuriser la transmission du contenu des fichiers à l'aide de Base64 encodage
- Simple API Intégration: RESTful API conçu pour les flux de travail automatisés de traitement de documents Word
REST API Point de terminaison
Le PDF4me REST API utilise la norme HTTP méthodes d'interaction avec les ressources. Toutes les opérations d'extraction de texte Word sont effectuées via un point de terminaison unique :
- Méthode: POST
- Point final :
/api/v2/ExtractTextFromWord
REST API Paramètres
Liste complète des paramètres pour l'extraction de texte à partir de Word REST APILes paramètres sont organisés par catégorie pour une meilleure compréhension et une mise en œuvre plus aisée.
Important: Les paramètres marqués d'un astérisque (*) sont obligatoires et doivent être fournis pour le API pour fonctionner correctement.
Paramètres requis
| Paramètre | Taper | Description | Exemple |
|---|---|---|---|
| docName* | String | Nom du fichier source Word (sans extension ou avec l'extension .docx/.doc) | output |
| docContent* | Base64 (String) | Le contenu du document Word d'entrée dans Base64 format | JVBERi... |
| StartPageNumber* | Integer | Numéro de la page de départ pour l'extraction de texte | 1 |
| EndPageNumber* | Integer | Numéro de la dernière page pour l'extraction de texte | 3 |
| RemoveComments* | Boolean | Choisissez si vous souhaitez supprimer les commentaires du texte extrait : vrai: Supprimer les commentaires, FAUX: Inclure les commentaires | true |
| RemoveHeaderFooter* | Boolean | Choisissez si vous souhaitez supprimer les en-têtes et les pieds de page : vrai: Supprimer les en-têtes/pieds de page, FAUX: Inclure les en-têtes/pieds de page | true |
| AcceptChanges* | Boolean | Choisissez si vous souhaitez accepter les modifications suivies : vraiAccepter les modifications, FAUX: Refuser les modifications | true |
Paramètres optionnels
| Paramètre | Taper | Description | Exemple |
|---|---|---|---|
| async | Boolean | Activer le traitement asynchrone. Lorsque true, le API retours 202 Accepted avec un Location en-tête pour l'interrogation du résultat | false |
Sortir
Le PDF4me Extraire du texte de Word REST API renvoie des réponses différentes selon le mode de traitement. API renvoie le texte extrait sous forme de JSON réponse ou fichier texte.
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
Traitement synchrone (par défaut)
Quand async est false ou non fourni, le API renvoie immédiatement le texte extrait.
Code d'état : 200 OK
Format de réponse :
{
"extractedText": "Extracted text content from Word document pages 1 to 3...",
"fileName": "output.txt"
}
Ou sous forme de fichier texte :
Extracted text content from Word document pages 1 to 3...
La réponse contient le contenu textuel extrait de la plage de pages spécifiée.
Traitement asynchrone
Quand async est true, le API traite le document de manière asynchrone.
Réponse initiale :
Code d'état : 202 Accepted
En-têtes de réponse :
Location: https://api.pdf4me.com/api/v2/ExtractTextFromWordStatus/{operationId}
Corps de la réponse :
{
"traceId": "operation-trace-id"
}
Sondage pour les résultats :
Utilisez le Location en-tête URL sondage pour vérifier l'achèvement :
const response = await fetch(locationUrl, {
headers: { 'Authorization': 'Basic ' + apiKey }
});
// Continue polling until status code is 200
if (response.status === 200) {
const result = await response.json();
// Process extracted text
}
Réponses d'erreur
| Code d'état | Description | Exemple de réponse |
|---|---|---|
| 400 Bad Request | Paramètres de requête invalides ou champs obligatoires manquants | {"error": "Missing required parameter: docContent"} |
| 401 Unauthorized | Invalide ou manquant API clé | {"error": "Unauthorized"} |
| 408 Délai d'attente dépassé | Délai de traitement de la requête dépassé | {"error": "Request timeout"} |
| 500 Internal Server Error | Erreur serveur lors du traitement | {"error": "Internal server error"} |
Comprendre la réponse
La réponse d'extraction de texte peut se présenter sous deux formats :
- JSON Format: Contient
extractedText(chaîne de caractères) etfileName(chaîne) - Format de texte: Fichier texte brut contenant le contenu extrait
Détails des paramètres :
- StartPageNumber et EndPageNumber: Définir la plage de pages (indexation à partir de 1)
- RemoveComments: Quand
truesupprime tous les commentaires du document Word avant l'extraction - RemoveHeaderFooter: Quand
true, supprime les en-têtes et les pieds de page de chaque page avant l'extraction - AcceptChanges: Quand
trueaccepte toutes les modifications suivies dans le document Word avant l'extraction
Formats Word pris en charge :
.docx(Word 2007 et versions ultérieures).doc(Word 97-2003)
Exemple de requête
En-tête
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
Note:
- Obtenez votre API clé de la PDF4me Tableau de bord
- Le API La clé doit être Base64 encodé et préfixé par « Basic » dans le Authorization en-tête
- Exemple : Si votre API La clé est
abc123, encodez-le en Base64 et utiliserAuthorization: Basic YWJjMTIz
Charge utile
Demande de base :
{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output",
"StartPageNumber": 1,
"EndPageNumber": 3,
"RemoveComments": true,
"RemoveHeaderFooter": true,
"AcceptChanges": true
}
Avec le traitement asynchrone :
{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output",
"StartPageNumber": 1,
"EndPageNumber": 3,
"RemoveComments": true,
"RemoveHeaderFooter": true,
"AcceptChanges": true,
"async": true
}
Exemples de code
Le PDF4me Extraire du texte de Word REST API propose des exemples de code dans plusieurs langages de programmation. Choisissez le langage qui convient le mieux à votre environnement de développement :
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
C# Exemple (CSharp)
Complet C# Implémentation pour l'extraction de texte à partir de documents Word :
Java Échantillon
Java implémentation avec gestion complète des erreurs et traitement des réponses :
JavaScript Échantillon
Node.js et compatible avec les navigateurs JavaScript mise en œuvre:
Python Échantillon
Python implémentation avec la bibliothèque requests et JSON manutention:
Google Apps Script Échantillon
Google Apps Script mise en œuvre pour Google Workspace intégration :
Fonctionnalités d'extraction de texte Word
Traitement des documents
- Prise en charge des formats WordPrise en charge complète des formats de documents Microsoft Word .doc et .docx
- Préservation du format: Préserve la mise en forme et la structure du texte lors de l'extraction
- Documents complexesGère les documents Word complexes contenant des tableaux, des images et du contenu intégré.
- Traitement professionnelExtraction de texte de haute qualité avec préservation précise du contenu
- Entrée flexible: Prise en charge de différentes versions et formats de documents Word
Traitement de la page
- Sélection de plage de pagesExtraire du texte à partir de plages de pages spécifiques, en indiquant les numéros de page de début et de fin.
- Ciblage flexible: Traiter des pages individuelles, des plages de pages ou des documents entiers
- Traitement personnalisé: Prise en charge de toute combinaison de pages avec un contrôle précis
- Traitement par lotsGérer efficacement plusieurs pages en une seule API appels
- Mise en page professionnelleExtraction de texte cohérente sur toutes les pages cibles
Filtrage du contenu
- Suppression des commentaires: Option permettant d'exclure les commentaires et les annotations du texte extrait
- Filtrage de l'en-tête/du pied de pageSupprimer les en-têtes et les pieds de page pour une extraction de contenu propre
- Suivi des modificationsAccepter ou refuser les modifications suivies lors de l'extraction de texte
- Nettoyage de contenuOptions de filtrage avancées pour des besoins spécifiques d'extraction de texte
- Résultats professionnelsSortie de texte propre et formatée avec préservation précise du contenu
Cas d'utilisation et applications industrielles
- Business & Enterprise
- Legal & Professional Services
- Education & Research
- Government & Compliance
- Technology & Development
Cas d'utilisation en entreprise
- Analyse de documentsExtraire le contenu textuel des documents Word pour analyse et traitement
- Gestion de contenuExtraire du texte de documents Word pour les systèmes de gestion de contenu
- Traitement des rapportsExtraire le texte des rapports Word pour un traitement et une analyse automatisés
- Veille stratégiqueExtraire du texte de documents Word professionnels à des fins d'analyse de données
Cas d'utilisation des services juridiques et professionnels
- Traitement des documents juridiquesExtraire du texte de documents juridiques Word pour la gestion des dossiers
- Analyse de contratExtraire du texte des contrats et des documents juridiques
- Gestion de casExtraire du texte de documents juridiques pour les systèmes de gestion de dossiers :
- Recherche juridiqueExtraire du texte de documents juridiques à des fins de recherche et d'analyse
Cas d'utilisation dans le domaine de l'éducation et de la recherche
- Recherche universitaireExtraire du texte de documents Word académiques à des fins de recherche et d'analyse
- Documents de rechercheExtraire du texte à partir d'articles de recherche et de documents académiques
- Contenu éducatifExtraire du texte à partir de documents Word éducatifs
- Analyse académiqueExtraire du texte de documents académiques à des fins d'analyse
Cas d'utilisation gouvernementaux et de conformité
- Surveillance de la conformitéExtraire du texte des documents de conformité Word à des fins de surveillance et d'audit
- Documentation réglementaireExtraire du texte à partir de documents Word réglementaires
- Rapports gouvernementauxExtraire du texte à partir de documents Word gouvernementaux
- Archives publiquesExtraire du texte à partir de documents Word publics.
Cas d'utilisation en matière de technologie et de développement
- Migration de donnéesConvertir le contenu des documents Word vers d'autres formats pour la migration des données
- Traitement du contenuExtraire du texte à partir de documents Word pour l'intégration au système
- API IntégrationExtraire du texte à partir de documents Word pour API traitement
- Extraction de donnéesExtraire du texte de documents Word pour le traitement des données