Aller au contenu principal

Extraction de texte à partir de Word - Analyseur de contenu API

PDF4me Extraire du texte de Word permet d'extraire le contenu textuel de documents Word avec des options de filtrage par plage de pages et par contenu. API Ce service traite les fichiers Word et extrait le contenu textuel des documents Word avec des options personnalisables. API reçoit le contenu des documents Word via REST API appels, utilisant Base64 Encodage pour une transmission sécurisée. Grâce à la prise en charge de la sélection de plages de pages, de la suppression des commentaires, du filtrage des en-têtes et pieds de page et de l'acceptation des modifications, cette solution est idéale pour les flux de travail de traitement de documents et d'analyse de contenu.

Articles de blog connexes
Il n'y a pas encore d'article de blog consacré à cette fonctionnalité — à venir prochainement.
En attendant, n'hésitez pas à consulter le blog de PDF4me pour découvrir des tutoriels et des procédures de travail adaptés à toutes les plateformes.
Consultez le blog

Authentification de votre API Demande

Pour accéder au PDF4me REST APIChaque requête doit inclure des informations d'authentification valides. L'authentification garantit la sécurité des communications et confirme votre identité en tant qu'utilisateur autorisé. REST API.

Caractéristiques principales

  • Assistance pour les documents WordExtraire du texte à partir de documents Microsoft Word (.doc, .docx)
  • Sélection de plage de pages: Traiter des plages de pages spécifiques ou des documents entiers avec des numéros de page de début et de fin personnalisés
  • Filtrage du contenuSupprimer les commentaires, les en-têtes, les pieds de page et le suivi des modifications pour une extraction de texte propre
  • Base64 Encodage: Sécuriser la transmission du contenu des fichiers à l'aide de Base64 encodage
  • Simple API Intégration: RESTful API conçu pour les flux de travail automatisés de traitement de documents Word

REST API Point de terminaison

Le PDF4me REST API utilise la norme HTTP méthodes d'interaction avec les ressources. Toutes les opérations d'extraction de texte Word sont effectuées via un point de terminaison unique :

  • Méthode: POST
  • Point final : /api/v2/ExtractTextFromWord

REST API Paramètres

Liste complète des paramètres pour l'extraction de texte à partir de Word REST APILes paramètres sont organisés par catégorie pour une meilleure compréhension et une mise en œuvre plus aisée.

Important: Les paramètres marqués d'un astérisque (*) sont obligatoires et doivent être fournis pour le API pour fonctionner correctement.

Paramètres requis

ParamètreTaperDescriptionExemple
docName*StringNom du fichier source Word (sans extension ou avec l'extension .docx/.doc)output
docContent*Base64 (String)Le contenu du document Word d'entrée dans Base64 formatJVBERi...
StartPageNumber*IntegerNuméro de la page de départ pour l'extraction de texte1
EndPageNumber*IntegerNuméro de la dernière page pour l'extraction de texte3
RemoveComments*BooleanChoisissez si vous souhaitez supprimer les commentaires du texte extrait : vrai: Supprimer les commentaires, FAUX: Inclure les commentairestrue
RemoveHeaderFooter*BooleanChoisissez si vous souhaitez supprimer les en-têtes et les pieds de page : vrai: Supprimer les en-têtes/pieds de page, FAUX: Inclure les en-têtes/pieds de pagetrue
AcceptChanges*BooleanChoisissez si vous souhaitez accepter les modifications suivies : vraiAccepter les modifications, FAUX: Refuser les modificationstrue

Paramètres optionnels

ParamètreTaperDescriptionExemple
asyncBooleanActiver le traitement asynchrone. Lorsque true, le API retours 202 Accepted avec un Location en-tête pour l'interrogation du résultatfalse

Sortir

Le PDF4me Extraire du texte de Word REST API renvoie des réponses différentes selon le mode de traitement. API renvoie le texte extrait sous forme de JSON réponse ou fichier texte.

Traitement synchrone (par défaut)

Quand async est false ou non fourni, le API renvoie immédiatement le texte extrait.

Code d'état : 200 OK

Format de réponse :

{
"extractedText": "Extracted text content from Word document pages 1 to 3...",
"fileName": "output.txt"
}

Ou sous forme de fichier texte :

Extracted text content from Word document pages 1 to 3...

La réponse contient le contenu textuel extrait de la plage de pages spécifiée.

Exemple de requête

En-tête

Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY

Note:

  • Obtenez votre API clé de la PDF4me Tableau de bord
  • Le API La clé doit être Base64 encodé et préfixé par « Basic » dans le Authorization en-tête
  • Exemple : Si votre API La clé est abc123, encodez-le en Base64 et utiliser Authorization: Basic YWJjMTIz

Charge utile

Demande de base :

{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output",
"StartPageNumber": 1,
"EndPageNumber": 3,
"RemoveComments": true,
"RemoveHeaderFooter": true,
"AcceptChanges": true
}

Avec le traitement asynchrone :

{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output",
"StartPageNumber": 1,
"EndPageNumber": 3,
"RemoveComments": true,
"RemoveHeaderFooter": true,
"AcceptChanges": true,
"async": true
}

Exemples de code

Le PDF4me Extraire du texte de Word REST API propose des exemples de code dans plusieurs langages de programmation. Choisissez le langage qui convient le mieux à votre environnement de développement :

C# Exemple (CSharp)

Complet C# Implémentation pour l'extraction de texte à partir de documents Word :

Fonctionnalités d'extraction de texte Word

Traitement des documents

  • Prise en charge des formats WordPrise en charge complète des formats de documents Microsoft Word .doc et .docx
  • Préservation du format: Préserve la mise en forme et la structure du texte lors de l'extraction
  • Documents complexesGère les documents Word complexes contenant des tableaux, des images et du contenu intégré.
  • Traitement professionnelExtraction de texte de haute qualité avec préservation précise du contenu
  • Entrée flexible: Prise en charge de différentes versions et formats de documents Word

Traitement de la page

  • Sélection de plage de pagesExtraire du texte à partir de plages de pages spécifiques, en indiquant les numéros de page de début et de fin.
  • Ciblage flexible: Traiter des pages individuelles, des plages de pages ou des documents entiers
  • Traitement personnalisé: Prise en charge de toute combinaison de pages avec un contrôle précis
  • Traitement par lotsGérer efficacement plusieurs pages en une seule API appels
  • Mise en page professionnelleExtraction de texte cohérente sur toutes les pages cibles

Filtrage du contenu

  • Suppression des commentaires: Option permettant d'exclure les commentaires et les annotations du texte extrait
  • Filtrage de l'en-tête/du pied de pageSupprimer les en-têtes et les pieds de page pour une extraction de contenu propre
  • Suivi des modificationsAccepter ou refuser les modifications suivies lors de l'extraction de texte
  • Nettoyage de contenuOptions de filtrage avancées pour des besoins spécifiques d'extraction de texte
  • Résultats professionnelsSortie de texte propre et formatée avec préservation précise du contenu

Cas d'utilisation et applications industrielles

Cas d'utilisation en entreprise

  • Analyse de documentsExtraire le contenu textuel des documents Word pour analyse et traitement
  • Gestion de contenuExtraire du texte de documents Word pour les systèmes de gestion de contenu
  • Traitement des rapportsExtraire le texte des rapports Word pour un traitement et une analyse automatisés
  • Veille stratégiqueExtraire du texte de documents Word professionnels à des fins d'analyse de données

Obtenez de l'aide