Estrazione di testo tramite espressione - Ricerca RegEx API
PDF4me Estrai testo tramite espressione consente di estrarre testo specifico da PDF documenti utilizzando espressioni regolari. Questo API processi di servizio PDF file ed estrae testo corrispondente a modelli/espressioni specifici da PDF documenti. Il API riceve PDF contenuti e modelli di espressioni regolari attraverso REST API chiamate, utilizzando Base64 Codifica per una trasmissione sicura. Grazie al supporto per espressioni regolari complesse e alla flessibilità di targeting delle pagine, questa soluzione è ideale per i flussi di lavoro di elaborazione documenti ed estrazione dati.
Autenticazione del tuo API Richiesta
Per accedere al PDF4me REST API, ogni richiesta deve includere credenziali di autenticazione adeguate. L'autenticazione garantisce una comunicazione sicura e convalida la tua identità come utente autorizzato del REST API.
Caratteristiche principali
- Supporto per le espressioni regolari: Estrai il testo utilizzando modelli regex per una corrispondenza testuale precisa
- Targeting flessibile delle pagine: Elabora pagine specifiche o interi documenti con sequenze di pagine personalizzate
- Corrispondenza di modelliSupporto per espressioni regolari complesse e riconoscimento di pattern
- Base64 Codifica: Trasmissione sicura del contenuto dei file tramite Base64 codifica
- Semplice API Integrazione: RESTful API progettato per flussi di lavoro automatizzati di estrazione del testo
REST API Punto finale
IL PDF4me REST API utilizza standard HTTP metodi per interagire con le risorse. Tutte le operazioni di estrazione del testo tramite espressioni vengono eseguite attraverso un unico endpoint:
- Metodo: POST
- Punto finale:
/api/v2/ExtractTextByExpression
REST API Parametri
Elenco completo dei parametri per l'estrazione del testo tramite espressione REST APII parametri sono organizzati per categoria per una migliore comprensione e implementazione.
Importante: I parametri contrassegnati da un asterisco (*) sono obbligatori e devono essere forniti per il API per funzionare correttamente.
Parametri richiesti
| Parametro | Tipo | Descrizione | Esempio |
|---|---|---|---|
| docContent* | Base64 String) | Il contenuto dell'input PDF file in Base64 formato | JVBERi... |
| docName* | String | Fonte PDF nome del file con estensione corretta | output.pdf |
| expression* | String | Modello di espressione regolare per l'estrazione di testo. Supporta la sintassi standard delle espressioni regolari, inclusi gruppi, quantificatori e ancore. | % O [A-Za-z]+ |
| pageSequence* | String | Specificare quali pagine elaborare. Utilizzare "1-" per tutte le pagine, "1-3" per un intervallo o "1,2,3" per pagine specifiche. | 1-3 |
Parametri opzionali
| Parametro | Tipo | Descrizione | Esempio |
|---|---|---|---|
| async | Boolean | Abilita l'elaborazione asincrona. Quando true, IL API resi 202 Accepted con un Location intestazione per il sondaggio del risultato | true |
Produzione
IL PDF4me Estrai testo tramite espressione REST API restituisce risposte diverse a seconda della modalità di elaborazione. API restituisce le corrispondenze del testo estratto come JSON risposta.
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
Elaborazione sincrona (impostazione predefinita)
Quando async È false o non fornito, il API restituisce immediatamente le corrispondenze del testo estratto.
Codice di stato: 200 OK
Formato di risposta:
{
"textList": ["extracted text 1", "extracted text 2", "extracted text 3"]
}
La risposta contiene un array di stringhe di testo che corrispondono al modello di espressione regolare specificato.
Elaborazione asincrona
Quando async È true, IL API elabora il documento in modo asincrono.
Risposta iniziale:
Codice di stato: 202 Accepted
Intestazioni di risposta:
Location: https://api.pdf4me.com/api/v2/ExtractTextByExpressionStatus/{operationId}
Corpo della risposta:
{
"traceId": "operation-trace-id"
}
Sondaggio per i risultati:
Utilizzare il Location intestazione URL per votare il completamento:
const response = await fetch(locationUrl, {
headers: { 'Authorization': 'Basic ' + apiKey }
});
// Continue polling until status code is 200
if (response.status === 200) {
const result = await response.json();
// Process extracted text matches
}
Risposte di errore
| Codice di stato | Descrizione | Esempio di risposta |
|---|---|---|
| 400 Bad Request | Parametri di richiesta non validi, campi obbligatori mancanti o pattern regex non valido. | {"error": "Missing required parameter: expression"} |
| 401 Unauthorized | Non valido o mancante API chiave | {"error": "Unauthorized"} |
| 408 Timeout della richiesta | Timeout di elaborazione della richiesta | {"error": "Request timeout"} |
| 500 Internal Server Error | Errore del server durante l'elaborazione | {"error": "Internal server error"} |
Comprendere il JSON Risposta
La risposta all'estrazione del testo è una JSON oggetto contenente:
- Elenco di testo: Array di stringhe contenenti tutte le corrispondenze di testo che corrispondono al modello di espressione regolare specificato
Formati di sequenza delle pagine:
"1-": Elabora tutte le pagine dalla pagina 1 alla fine"1-3": Elaborare le pagine 1, 2 e 3"1,2,3": Elaborare le pagine specifiche 1, 2 e 3
Esempi di espressioni:
"%": Corrispondenza dei simboli percentuali"\\d+": Abbina una o più cifre"[a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\\.[a-zA-Z]{2,}": Corrispondenza degli indirizzi email"https?://[^\\s]+": Corrispondenza URL
Esempio di richiesta
Intestazione
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
Nota:
- Ottieni il tuo API chiave dalla PDF4me Pannello di controllo
- IL API la chiave deve essere Base64 codificato e prefissato con "Basic" nel Authorization intestazione
- Esempio: se il tuo API la chiave è
abc123, codificalo in Base64 e utilizzareAuthorization: Basic YWJjMTIz
Carico utile
Richiesta di base:
{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output.pdf",
"expression": "%",
"pageSequence": "1-3"
}
Con elaborazione asincrona:
{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output.pdf",
"expression": "\\d+",
"pageSequence": "1-3",
"async": true
}
Esempi di codice
IL PDF4me Estrai testo tramite espressione REST API Fornisce esempi di codice in diversi linguaggi di programmazione. Scegli il linguaggio più adatto al tuo ambiente di sviluppo:
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
C# Esempio (CSharp)
Completo C# implementazione per l'estrazione del testo tramite espressione da PDF:
Java Campione
Java implementazione con gestione completa degli errori ed elaborazione delle risposte:
JavaScript Campione
Node.js e compatibile con i browser JavaScript implementazione:
Google Apps Script Campione
Google Apps Script implementazione per Google Workspace integrazione:
Funzionalità di estrazione del testo
Elaborazione delle espressioni regolari
- Corrispondenza di modelliSupporto completo per la sintassi e i modelli standard delle espressioni regolari
- Modelli complessiSupporto per funzionalità avanzate delle espressioni regolari, inclusi gruppi, quantificatori e ancore.
- Espressioni personalizzate: Creazione flessibile di modelli per specifiche esigenze di estrazione del testo
- Convalida del modello: Validazione integrata per la sintassi e la compatibilità dei modelli regex.
- Risultati professionaliEstrazione affidabile del testo con corrispondenza precisa dei modelli
Elaborazione della pagina
- Targeting della paginaEstrarre testo da pagine specifiche o da interi documenti
- Sequenze di pagineSupporto per intervalli di pagine personalizzati e selezione di singole pagine
- Elaborazione flessibile: Elabora qualsiasi combinazione di pagine con un controllo preciso
- Elaborazione in batch: Gestisci più pagine in modo efficiente in un'unica API chiamate
- Impaginazione professionaleEstrazione del testo coerente su tutte le pagine di destinazione
Funzionalità avanzate
- Analisi del testoAnalisi e identificazione complete dei modelli di testo
- Filtro personalizzatoOpzioni di filtraggio avanzate per esigenze specifiche di estrazione del testo
- Estrazione professionaleEstrazione di testo di alta qualità con chiara visibilità
- Modelli flessibiliSupporto per qualsiasi modello di espressione regolare e requisiti di corrispondenza del testo
Casi d'uso e applicazioni industriali
- Legal & Professional Services
- Finance & Banking
- Business & Enterprise
- Education & Research
- Government & Compliance
Casi d'uso per servizi legali e professionali
- Analisi del documentoEstrarre modelli di dati specifici da contratti, fatture e documenti legali
- Analisi dei contrattiEstrarre termini chiave e modelli di dati dai contratti legali
- Monitoraggio della conformitàEstrarre informazioni normative e dati di conformità dai documenti
- Estrazione di dati legaliEstrarre modelli di dati specifici da documenti legali
Casi d'uso in ambito finanziario e bancario
- Elaborazione delle fattureEstrazione dei dati della fattura e dei valori dei campi tramite corrispondenza di modelli
- Rapporti finanziari: Estrai metriche e punti dati specifici da PDF rapporti
- Monitoraggio della conformitàEstrarre informazioni normative e dati di conformità dai documenti
- Analisi dei dati finanziariEstrazione di dati strutturati da documenti finanziari
Casi d'uso aziendali e per le imprese
- Data Mining: Identificare ed estrarre dati strutturati da dati non strutturati PDF Documenti
- Elaborazione dei contenutiEstrazione di modelli di testo specifici per la gestione e l'analisi dei contenuti
- Generazione di moduliEstrazione dei dati del modulo e dei valori dei campi tramite corrispondenza di modelli
- Business Intelligence: Estrarre metriche aziendali chiave e indicatori di performance da PDF rapporti
Casi d'uso in ambito educativo e di ricerca.
- Applicazioni di ricercaEstrarre modelli di dati specifici da articoli di ricerca e documenti accademici
- Estrazione di dati accademiciEstrarre dati strutturati da articoli di ricerca
- Dati di ricercaEstrarre metriche specifiche da documenti accademici
- Elaborazione dei contenuti didatticiEstrarre modelli di testo da documenti didattici
Casi d'uso per la pubblica amministrazione e la conformità normativa.
- Monitoraggio della conformitàEstrarre informazioni normative e dati di conformità dai documenti
- Estrazione dei dati normativiEstrarre dati strutturati da documenti normativi
- Rapporti governativiEstrarre metriche specifiche dai rapporti governativi
- Registri pubbliciEstrarre modelli di dati da registri e documenti pubblici