Estrai testo da Word - Analizzatore di contenuti API
PDF4me Estrai il testo da Word consente di estrarre il contenuto testuale dai documenti Word con opzioni per l'intervallo di pagine e il filtro del contenuto. API Il servizio elabora i file Word ed estrae il contenuto testuale dai documenti Word con opzioni personalizzabili. API riceve il contenuto del documento Word tramite REST API chiamate, utilizzando Base64 Codifica per una trasmissione sicura. Grazie al supporto per la selezione di intervalli di pagine, la rimozione dei commenti, il filtraggio di intestazione/piè di pagina e l'accettazione delle modifiche, questa soluzione è ideale per i flussi di lavoro di elaborazione documenti e analisi dei contenuti.
Autenticazione del tuo API Richiesta
Per accedere al PDF4me REST API, ogni richiesta deve includere credenziali di autenticazione adeguate. L'autenticazione garantisce una comunicazione sicura e convalida la tua identità come utente autorizzato del REST API.
Caratteristiche principali
- Supporto per documenti WordEstrazione del testo da documenti Microsoft Word (.doc, .docx)
- Selezione intervallo di pagineElabora intervalli di pagine specifici o interi documenti con numeri di pagina di inizio e fine personalizzati.
- Filtro dei contenuti: Rimuovi commenti, intestazioni, piè di pagina e tieni traccia delle modifiche per un'estrazione del testo pulita
- Base64 Codifica: Trasmissione sicura del contenuto dei file tramite Base64 codifica
- Semplice API Integrazione: RESTful API progettato per flussi di lavoro automatizzati di elaborazione di documenti Word
REST API Punto finale
IL PDF4me REST API utilizza standard HTTP Metodi per interagire con le risorse. Tutte le operazioni di estrazione del testo Word vengono eseguite tramite un unico endpoint:
- Metodo: POST
- Punto finale:
/api/v2/ExtractTextFromWord
REST API Parametri
Elenco completo dei parametri per l'estrazione del testo da Word REST APII parametri sono organizzati per categoria per una migliore comprensione e implementazione.
Importante: I parametri contrassegnati da un asterisco (*) sono obbligatori e devono essere forniti per il API per funzionare correttamente.
Parametri richiesti
| Parametro | Tipo | Descrizione | Esempio |
|---|---|---|---|
| docName* | String | Nome del file Word di origine (senza estensione o con estensione .docx/.doc) | output |
| docContent* | Base64 String) | Il contenuto del documento Word di input in Base64 formato | JVBERi... |
| StartPageNumber* | Integer | Numero di pagina iniziale per l'estrazione del testo | 1 |
| EndPageNumber* | Integer | Numero di pagina finale per l'estrazione del testo | 3 |
| RemoveComments* | Boolean | Scegli se rimuovere i commenti dal testo estratto: VERO: Rimuovi i commenti, falso: Includi commenti | true |
| RemoveHeaderFooter* | Boolean | Scegli se rimuovere intestazioni e piè di pagina: VERO: Rimuovere intestazioni/piè di pagina, falso: Includi intestazioni/piè di pagina | true |
| AcceptChanges* | Boolean | Scegli se accettare le modifiche rilevate: VERO: Accetta modifiche, falso: Rifiuta le modifiche | true |
Parametri opzionali
| Parametro | Tipo | Descrizione | Esempio |
|---|---|---|---|
| async | Boolean | Abilita l'elaborazione asincrona. Quando true, IL API resi 202 Accepted con un Location intestazione per il sondaggio del risultato | false |
Produzione
IL PDF4me Estrai il testo da Word REST API restituisce risposte diverse a seconda della modalità di elaborazione. API restituisce il testo estratto come un JSON risposta O file di testo.
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
Elaborazione sincrona (impostazione predefinita)
Quando async È false o non fornito, il API restituisce immediatamente il testo estratto.
Codice di stato: 200 OK
Formato di risposta:
{
"extractedText": "Extracted text content from Word document pages 1 to 3...",
"fileName": "output.txt"
}
Oppure come file di testo:
Extracted text content from Word document pages 1 to 3...
La risposta contiene il contenuto testuale estratto dall'intervallo di pagine specificato.
Elaborazione asincrona
Quando async È true, IL API elabora il documento in modo asincrono.
Risposta iniziale:
Codice di stato: 202 Accepted
Intestazioni di risposta:
Location: https://api.pdf4me.com/api/v2/ExtractTextFromWordStatus/{operationId}
Corpo della risposta:
{
"traceId": "operation-trace-id"
}
Sondaggio per i risultati:
Utilizzare il Location intestazione URL per votare il completamento:
const response = await fetch(locationUrl, {
headers: { 'Authorization': 'Basic ' + apiKey }
});
// Continue polling until status code is 200
if (response.status === 200) {
const result = await response.json();
// Process extracted text
}
Risposte di errore
| Codice di stato | Descrizione | Esempio di risposta |
|---|---|---|
| 400 Bad Request | Parametri di richiesta non validi o campi obbligatori mancanti | {"error": "Missing required parameter: docContent"} |
| 401 Unauthorized | Non valido o mancante API chiave | {"error": "Unauthorized"} |
| 408 Timeout della richiesta | Timeout di elaborazione della richiesta | {"error": "Request timeout"} |
| 500 Internal Server Error | Errore del server durante l'elaborazione | {"error": "Internal server error"} |
Comprensione della risposta
La risposta all'estrazione del testo può essere in due formati:
- JSON Guadagno: Contiene
extractedText(stringa) efileName(corda) - Formato del testo: File di testo semplice con il contenuto estratto
Dettagli dei parametri:
- StartPageNumber E EndPageNumber: Definisci l'intervallo di pagine (indicizzazione basata su 1)
- RemoveComments: Quando
true, rimuove tutti i commenti dal documento Word prima dell'estrazione - RemoveHeaderFooter: Quando
true, rimuove intestazioni e piè di pagina da ogni pagina prima dell'estrazione - AcceptChanges: Quando
true, accetta tutte le modifiche rilevate nel documento Word prima dell'estrazione
Formati di parole supportati:
.docx(Word 2007 e versioni successive).doc(Parola 97-2003)
Esempio di richiesta
Intestazione
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
Nota:
- Ottieni il tuo API chiave dalla PDF4me Pannello di controllo
- IL API la chiave deve essere Base64 codificato e prefissato con "Basic" nel Authorization intestazione
- Esempio: se il tuo API la chiave è
abc123, codificalo in Base64 e utilizzareAuthorization: Basic YWJjMTIz
Carico utile
Richiesta di base:
{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output",
"StartPageNumber": 1,
"EndPageNumber": 3,
"RemoveComments": true,
"RemoveHeaderFooter": true,
"AcceptChanges": true
}
Con elaborazione asincrona:
{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output",
"StartPageNumber": 1,
"EndPageNumber": 3,
"RemoveComments": true,
"RemoveHeaderFooter": true,
"AcceptChanges": true,
"async": true
}
Esempi di codice
IL PDF4me Estrai il testo da Word REST API Fornisce esempi di codice in diversi linguaggi di programmazione. Scegli il linguaggio più adatto al tuo ambiente di sviluppo:
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
C# Esempio (CSharp)
Completo C# Implementazione per l'estrazione di testo da documenti Word:
Java Campione
Java implementazione con gestione completa degli errori ed elaborazione delle risposte:
JavaScript Campione
Node.js e compatibile con i browser JavaScript implementazione:
Google Apps Script Campione
Google Apps Script implementazione per Google Workspace integrazione:
Funzionalità di estrazione del testo Word
Elaborazione dei documenti
- Supporto per la formattazione di WordSupporto completo per i formati di documento Microsoft Word .doc e .docx
- Conservazione del formato: Mantiene la formattazione e la struttura del testo durante l'estrazione
- Documenti complessiGestisce documenti Word complessi con tabelle, immagini e contenuti incorporati.
- Elaborazione professionaleEstrazione di testo di alta qualità con accurata conservazione del contenuto.
- Input flessibileSupporto per varie versioni e formati di documenti Word
Elaborazione della pagina
- Selezione intervallo di pagine: Estrai il testo da intervalli di pagine specifici con i numeri di pagina di inizio e fine
- Targeting flessibileElabora singole pagine, intervalli di pagine o interi documenti.
- Elaborazione personalizzataSupporto per qualsiasi combinazione di pagine con controllo preciso
- Elaborazione in batch: Gestisci più pagine in modo efficiente in un'unica API chiamate
- Impaginazione professionaleEstrazione del testo coerente su tutte le pagine di destinazione
Filtro dei contenuti
- Rimozione dei commentiOpzione per escludere commenti e annotazioni dal testo estratto
- Filtro intestazione/piè di pagina: Rimuovere intestazioni e piè di pagina per un'estrazione del contenuto più pulita
- Monitoraggio delle modifiche: Accetta o rifiuta le modifiche rilevate durante l'estrazione del testo
- Pulizia dei contenutiOpzioni di filtraggio avanzate per esigenze specifiche di estrazione del testo
- Risultati professionali: Testo pulito e formattato con conservazione accurata del contenuto
Casi d'uso e applicazioni industriali
- Business & Enterprise
- Legal & Professional Services
- Education & Research
- Government & Compliance
- Technology & Development
Casi d'uso aziendali e per le imprese
- Analisi del documentoEstrazione del contenuto testuale da documenti Word per l'analisi e l'elaborazione
- Gestione dei contenutiEstrazione di testo da documenti Word per sistemi di gestione dei contenuti
- Elaborazione dei reportEstrazione del testo dai report di Word per l'elaborazione e l'analisi automatizzate.
- Business IntelligenceEstrazione di testo da documenti aziendali Word per l'analisi dei dati.
Casi d'uso per servizi legali e professionali
- Elaborazione di documenti legaliEstrazione di testo da documenti Word legali per la gestione dei casi
- Analisi dei contrattiEstrarre testo da contratti e documenti legali
- Gestione dei casiEstrazione di testo da documenti legali per sistemi di gestione dei casi
- Ricerca giuridicaEstrarre testo da documenti legali a scopo di ricerca e analisi.
Casi d'uso in ambito educativo e di ricerca.
- Ricerca accademicaEstrazione di testo da documenti Word accademici a scopo di ricerca e analisi.
- Documenti di ricercaEstrarre testo da articoli di ricerca e documenti accademici
- Contenuti didatticiEstrazione di testo da documenti Word a scopo didattico
- Analisi accademicaEstrarre testo da documenti accademici per l'analisi
Casi d'uso per la pubblica amministrazione e la conformità normativa.
- Monitoraggio della conformitàEstrazione del testo dai documenti di conformità Word per il monitoraggio e la verifica
- Documentazione normativaEstrazione del testo da documenti Word normativi
- Rapporti governativiEstrazione di testo da documenti Word governativi
- Registri pubbliciEstrazione del testo da documenti Word di pubblico dominio
Casi d'uso in ambito tecnologico e di sviluppo
- Migrazione dei dati: Convertire il contenuto dei documenti Word in altri formati per la migrazione dei dati
- Elaborazione dei contenutiEstrazione del testo da documenti Word per l'integrazione nel sistema.
- API Integrazione: Estrai il testo dai documenti Word per API elaborazione
- Estrazione dei datiEstrazione del testo da documenti Word per l'elaborazione dei dati.