Passa al contenuto principale

Estrazione di testo tramite espressione - Ricerca RegEx API

PDF4me Estrai testo tramite espressione consente di estrarre testo specifico da PDF documenti utilizzando espressioni regolari. Questo API processi di servizio PDF file ed estrae testo corrispondente a modelli/espressioni specifici da PDF documenti. Il API riceve PDF contenuti e modelli di espressioni regolari attraverso REST API chiamate, utilizzando Base64 Codifica per una trasmissione sicura. Grazie al supporto per espressioni regolari complesse e alla flessibilità di targeting delle pagine, questa soluzione è ideale per i flussi di lavoro di elaborazione documenti ed estrazione dati.

Articoli correlati del blog
Non ci sono ancora post sul blog dedicati a questa funzionalità — in arrivo a breve.
Nel frattempo, dai un'occhiata al blog di PDF4me per trovare tutorial e procedure operative su tutte le piattaforme.
Visita il blog

Autenticazione del tuo API Richiesta

Per accedere al PDF4me REST API, ogni richiesta deve includere credenziali di autenticazione adeguate. L'autenticazione garantisce una comunicazione sicura e convalida la tua identità come utente autorizzato del REST API.

Caratteristiche principali

  • Supporto per le espressioni regolari: Estrai il testo utilizzando modelli regex per una corrispondenza testuale precisa
  • Targeting flessibile delle pagine: Elabora pagine specifiche o interi documenti con sequenze di pagine personalizzate
  • Corrispondenza di modelliSupporto per espressioni regolari complesse e riconoscimento di pattern
  • Base64 Codifica: Trasmissione sicura del contenuto dei file tramite Base64 codifica
  • Semplice API Integrazione: RESTful API progettato per flussi di lavoro automatizzati di estrazione del testo

REST API Punto finale

IL PDF4me REST API utilizza standard HTTP metodi per interagire con le risorse. Tutte le operazioni di estrazione del testo tramite espressioni vengono eseguite attraverso un unico endpoint:

  • Metodo: POST
  • Punto finale: /api/v2/ExtractTextByExpression

REST API Parametri

Elenco completo dei parametri per l'estrazione del testo tramite espressione REST APII parametri sono organizzati per categoria per una migliore comprensione e implementazione.

Importante: I parametri contrassegnati da un asterisco (*) sono obbligatori e devono essere forniti per il API per funzionare correttamente.

Parametri richiesti

ParametroTipoDescrizioneEsempio
docContent*Base64 String)Il contenuto dell'input PDF file in Base64 formatoJVBERi...
docName*StringFonte PDF nome del file con estensione correttaoutput.pdf
expression*StringModello di espressione regolare per l'estrazione di testo. Supporta la sintassi standard delle espressioni regolari, inclusi gruppi, quantificatori e ancore.% O [A-Za-z]+
pageSequence*StringSpecificare quali pagine elaborare. Utilizzare "1-" per tutte le pagine, "1-3" per un intervallo o "1,2,3" per pagine specifiche.1-3

Parametri opzionali

ParametroTipoDescrizioneEsempio
asyncBooleanAbilita l'elaborazione asincrona. Quando true, IL API resi 202 Accepted con un Location intestazione per il sondaggio del risultatotrue

Produzione

IL PDF4me Estrai testo tramite espressione REST API restituisce risposte diverse a seconda della modalità di elaborazione. API restituisce le corrispondenze del testo estratto come JSON risposta.

Elaborazione sincrona (impostazione predefinita)

Quando async È false o non fornito, il API restituisce immediatamente le corrispondenze del testo estratto.

Codice di stato: 200 OK

Formato di risposta:

{
"textList": ["extracted text 1", "extracted text 2", "extracted text 3"]
}

La risposta contiene un array di stringhe di testo che corrispondono al modello di espressione regolare specificato.

Esempio di richiesta

Intestazione

Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY

Nota:

  • Ottieni il tuo API chiave dalla PDF4me Pannello di controllo
  • IL API la chiave deve essere Base64 codificato e prefissato con "Basic" nel Authorization intestazione
  • Esempio: se il tuo API la chiave è abc123, codificalo in Base64 e utilizzare Authorization: Basic YWJjMTIz

Carico utile

Richiesta di base:

{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output.pdf",
"expression": "%",
"pageSequence": "1-3"
}

Con elaborazione asincrona:

{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output.pdf",
"expression": "\\d+",
"pageSequence": "1-3",
"async": true
}

Esempi di codice

IL PDF4me Estrai testo tramite espressione REST API Fornisce esempi di codice in diversi linguaggi di programmazione. Scegli il linguaggio più adatto al tuo ambiente di sviluppo:

C# Esempio (CSharp)

Completo C# implementazione per l'estrazione del testo tramite espressione da PDF:

Funzionalità di estrazione del testo

Elaborazione delle espressioni regolari

  • Corrispondenza di modelliSupporto completo per la sintassi e i modelli standard delle espressioni regolari
  • Modelli complessiSupporto per funzionalità avanzate delle espressioni regolari, inclusi gruppi, quantificatori e ancore.
  • Espressioni personalizzate: Creazione flessibile di modelli per specifiche esigenze di estrazione del testo
  • Convalida del modello: Validazione integrata per la sintassi e la compatibilità dei modelli regex.
  • Risultati professionaliEstrazione affidabile del testo con corrispondenza precisa dei modelli

Elaborazione della pagina

  • Targeting della paginaEstrarre testo da pagine specifiche o da interi documenti
  • Sequenze di pagineSupporto per intervalli di pagine personalizzati e selezione di singole pagine
  • Elaborazione flessibile: Elabora qualsiasi combinazione di pagine con un controllo preciso
  • Elaborazione in batch: Gestisci più pagine in modo efficiente in un'unica API chiamate
  • Impaginazione professionaleEstrazione del testo coerente su tutte le pagine di destinazione

Funzionalità avanzate

  • Analisi del testoAnalisi e identificazione complete dei modelli di testo
  • Filtro personalizzatoOpzioni di filtraggio avanzate per esigenze specifiche di estrazione del testo
  • Estrazione professionaleEstrazione di testo di alta qualità con chiara visibilità
  • Modelli flessibiliSupporto per qualsiasi modello di espressione regolare e requisiti di corrispondenza del testo

Casi d'uso e applicazioni industriali

Casi d'uso per servizi legali e professionali

  • Analisi del documentoEstrarre modelli di dati specifici da contratti, fatture e documenti legali
  • Analisi dei contrattiEstrarre termini chiave e modelli di dati dai contratti legali
  • Monitoraggio della conformitàEstrarre informazioni normative e dati di conformità dai documenti
  • Estrazione di dati legaliEstrarre modelli di dati specifici da documenti legali

Richiedi assistenza