Passa al contenuto principale

Estrattore di risorse - Estrattore di testo e immagini API

PDF4me Estrarre risorse consente di estrarre il contenuto testuale e le immagini incorporate da PDF documenti. Questo API processi di servizio PDF file ed estrae risorse di testo e immagini da PDF documenti. Il API riceve PDF contenuto attraverso REST API chiamate, utilizzando Base64 Codifica per una trasmissione sicura. Grazie al supporto per l'estrazione selettiva di testo e immagini, questa soluzione è ideale per flussi di lavoro di elaborazione dei contenuti e piattaforme di estrazione dati.

Articoli correlati del blog
Non ci sono ancora post sul blog dedicati a questa funzionalità — in arrivo a breve.
Nel frattempo, dai un'occhiata al blog di PDF4me per trovare tutorial e procedure operative su tutte le piattaforme.
Visita il blog

Autenticazione del tuo API Richiesta

Per accedere al PDF4me REST API, ogni richiesta deve includere credenziali di autenticazione adeguate. L'autenticazione garantisce una comunicazione sicura e convalida la tua identità come utente autorizzato del REST API.

Caratteristiche principali

  • Estrazione del testo: Estrai tutto il contenuto testuale da PDF Documenti
  • Estrazione dell'immagine: Recupera tutte le immagini e gli elementi visivi da PDF Documenti
  • Estrazione selettiva: Scegli se estrarre solo il testo, solo le immagini o entrambi, in base alle tue esigenze
  • Base64 Codifica: Trasmissione sicura del contenuto dei file tramite Base64 codifica
  • Semplice API Integrazione: RESTful API progettato per flussi di lavoro automatizzati di estrazione dei contenuti

REST API Punto finale

IL PDF4me REST API utilizza standard HTTP metodi per interagire con le risorse. Tutte le operazioni di estrazione delle risorse vengono eseguite tramite un unico endpoint:

  • Metodo: POST
  • Punto finale: /api/v2/ExtractResources

REST API Parametri

Elenco completo dei parametri per l'estrazione delle risorse REST APII parametri sono organizzati per categoria per una migliore comprensione e implementazione.

Importante: I parametri contrassegnati da un asterisco (*) sono obbligatori e devono essere forniti per il API per funzionare correttamente.

Parametri richiesti

ParametroTipoDescrizioneEsempio
docContent*Base64 String)Il contenuto dell'input PDF file codificato in Base64 formato per l'estrazione delle risorse e l'elaborazione dell'analisi dei contenutiJVBERi...
docName*StringFonte PDF Nome del file con estensione .pdf corretta per l'identificazione del documento e l'estrazione delle risorsesample.pdf
extractText*BooleanScegli se estrarre il contenuto testuale dal PDF: VERO: Estrai tutto il contenuto testuale con formattazione, falso: Salta l'estrazione del testo per l'elaborazione delle sole immaginitrue
extractImages*BooleanScegli se estrarre le immagini dal PDF: VERO: Estrarre immagini ed elementi visivi, falsoSalta l'estrazione delle immagini per un'elaborazione più rapida del solo testo.true

Parametri opzionali

ParametroTipoDescrizioneEsempio
asyncBooleanAbilita l'elaborazione asincrona. Quando true, IL API resi 202 Accepted con un Location intestazione per il sondaggio del risultatotrue

Produzione

IL PDF4me Estrarre risorse REST API restituisce risposte diverse a seconda della modalità di elaborazione. API restituisce testo e immagini estratti come un JSON risposta.

Elaborazione sincrona (impostazione predefinita)

Quando async È false o non fornito, il API restituisce immediatamente le risorse estratte.

Codice di stato: 200 OK

Formato di risposta:

{
"textList": ["extracted text content...", "more text..."],
"imageList": [
{
"fileName": "image1.png",
"imageContent": "base64-encoded-image-content..."
},
{
"fileName": "image2.jpg",
"imageContent": "base64-encoded-image-content..."
}
]
}

La risposta contiene il testo estratto come un array di stringhe e le immagini estratte come un array di oggetti con nomi di file e Base64-contenuto codificato.

Esempio di richiesta

Intestazione

Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY

Nota:

  • Ottieni il tuo API chiave dalla PDF4me Pannello di controllo
  • IL API la chiave deve essere Base64 codificato e prefissato con "Basic" nel Authorization intestazione
  • Esempio: se il tuo API la chiave è abc123, codificalo in Base64 e utilizzare Authorization: Basic YWJjMTIz

Carico utile

Richiesta di base:

{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "sample.pdf",
"extractText": true,
"extractImages": true
}

Con elaborazione asincrona:

{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "sample.pdf",
"extractText": true,
"extractImages": true,
"async": true
}

Esempi di codice

IL PDF4me Estrarre risorse REST API Fornisce esempi di codice in diversi linguaggi di programmazione. Scegli il linguaggio più adatto al tuo ambiente di sviluppo:

C# Esempio (CSharp)

Completo C# implementazione per l'estrazione di risorse da PDF:

Funzionalità di estrazione delle immagini

  • Immagini di alta qualità: Estrai le immagini con risoluzione e qualità originali
  • Formati multipli: Supporto per vari formati di immagine (JPG, PNG, GIF, ecc.)
  • Grafica vettoriale: Estrazione di grafica vettoriale e diagrammi scalabili
  • Conservazione dei metadati: Gestire le proprietà e i metadati delle immagini

Elaborazione avanzata

  • Estrazione selettiva: Scegli tra estrazione solo testo, solo immagini o estrazione combinata
  • Elaborazione in batch: Elabora più PDFs e estrarre risorse in modo efficiente
  • Analisi dei contenuti: Analizzare e categorizzare i tipi di contenuto estratti
  • Risultati professionaliEstrazione di alta qualità adatta ad applicazioni aziendali

Casi d'uso e applicazioni industriali

Casi d'uso per la gestione e l'elaborazione dei documenti

  • Digitalizzazione dei contenutiEstrazione di testo e immagini da documenti scansionati per archivi digitali
  • Analisi del documento: Analizzare PDF contenuti per l'estrazione e l'elaborazione delle informazioni
  • Migrazione dei dati: Estrazione del contenuto durante la migrazione dei documenti e gli aggiornamenti di sistema
  • Indicizzazione dei contenuti: Crea indici ricercabili da PDF contenuto testuale e immagini

Richiedi assistenza