Estrattore di risorse - Estrattore di testo e immagini API
PDF4me Estrarre risorse consente di estrarre il contenuto testuale e le immagini incorporate da PDF documenti. Questo API processi di servizio PDF file ed estrae risorse di testo e immagini da PDF documenti. Il API riceve PDF contenuto attraverso REST API chiamate, utilizzando Base64 Codifica per una trasmissione sicura. Grazie al supporto per l'estrazione selettiva di testo e immagini, questa soluzione è ideale per flussi di lavoro di elaborazione dei contenuti e piattaforme di estrazione dati.
Autenticazione del tuo API Richiesta
Per accedere al PDF4me REST API, ogni richiesta deve includere credenziali di autenticazione adeguate. L'autenticazione garantisce una comunicazione sicura e convalida la tua identità come utente autorizzato del REST API.
Caratteristiche principali
- Estrazione del testo: Estrai tutto il contenuto testuale da PDF Documenti
- Estrazione dell'immagine: Recupera tutte le immagini e gli elementi visivi da PDF Documenti
- Estrazione selettiva: Scegli se estrarre solo il testo, solo le immagini o entrambi, in base alle tue esigenze
- Base64 Codifica: Trasmissione sicura del contenuto dei file tramite Base64 codifica
- Semplice API Integrazione: RESTful API progettato per flussi di lavoro automatizzati di estrazione dei contenuti
REST API Punto finale
IL PDF4me REST API utilizza standard HTTP metodi per interagire con le risorse. Tutte le operazioni di estrazione delle risorse vengono eseguite tramite un unico endpoint:
- Metodo: POST
- Punto finale:
/api/v2/ExtractResources
REST API Parametri
Elenco completo dei parametri per l'estrazione delle risorse REST APII parametri sono organizzati per categoria per una migliore comprensione e implementazione.
Importante: I parametri contrassegnati da un asterisco (*) sono obbligatori e devono essere forniti per il API per funzionare correttamente.
Parametri richiesti
| Parametro | Tipo | Descrizione | Esempio |
|---|---|---|---|
| docContent* | Base64 String) | Il contenuto dell'input PDF file codificato in Base64 formato per l'estrazione delle risorse e l'elaborazione dell'analisi dei contenuti | JVBERi... |
| docName* | String | Fonte PDF Nome del file con estensione .pdf corretta per l'identificazione del documento e l'estrazione delle risorse | sample.pdf |
| extractText* | Boolean | Scegli se estrarre il contenuto testuale dal PDF: VERO: Estrai tutto il contenuto testuale con formattazione, falso: Salta l'estrazione del testo per l'elaborazione delle sole immagini | true |
| extractImages* | Boolean | Scegli se estrarre le immagini dal PDF: VERO: Estrarre immagini ed elementi visivi, falsoSalta l'estrazione delle immagini per un'elaborazione più rapida del solo testo. | true |
Parametri opzionali
| Parametro | Tipo | Descrizione | Esempio |
|---|---|---|---|
| async | Boolean | Abilita l'elaborazione asincrona. Quando true, IL API resi 202 Accepted con un Location intestazione per il sondaggio del risultato | true |
Produzione
IL PDF4me Estrarre risorse REST API restituisce risposte diverse a seconda della modalità di elaborazione. API restituisce testo e immagini estratti come un JSON risposta.
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
Elaborazione sincrona (impostazione predefinita)
Quando async È false o non fornito, il API restituisce immediatamente le risorse estratte.
Codice di stato: 200 OK
Formato di risposta:
{
"textList": ["extracted text content...", "more text..."],
"imageList": [
{
"fileName": "image1.png",
"imageContent": "base64-encoded-image-content..."
},
{
"fileName": "image2.jpg",
"imageContent": "base64-encoded-image-content..."
}
]
}
La risposta contiene il testo estratto come un array di stringhe e le immagini estratte come un array di oggetti con nomi di file e Base64-contenuto codificato.
Elaborazione asincrona
Quando async È true, IL API elabora il documento in modo asincrono.
Risposta iniziale:
Codice di stato: 202 Accepted
Intestazioni di risposta:
Location: https://api.pdf4me.com/api/v2/ExtractResourcesStatus/{operationId}
Corpo della risposta:
{
"traceId": "operation-trace-id"
}
Sondaggio per i risultati:
Utilizzare il Location intestazione URL per votare il completamento:
const response = await fetch(locationUrl, {
headers: { 'Authorization': 'Basic ' + apiKey }
});
// Continue polling until status code is 200
if (response.status === 200) {
const result = await response.json();
// Process extracted resources
}
Risposte di errore
| Codice di stato | Descrizione | Esempio di risposta |
|---|---|---|
| 400 Bad Request | Parametri di richiesta non validi o campi obbligatori mancanti | {"error": "Missing required parameter: docContent"} |
| 401 Unauthorized | Non valido o mancante API chiave | {"error": "Unauthorized"} |
| 408 Timeout della richiesta | Timeout di elaborazione della richiesta | {"error": "Request timeout"} |
| 500 Internal Server Error | Errore del server durante l'elaborazione | {"error": "Internal server error"} |
Comprendere il JSON Risposta
La risposta all'estrazione delle risorse è una JSON oggetto contenente:
- Elenco di testo: Array di stringhe contenenti il contenuto testuale estratto (se
extractTextÈtrue) - Elenco immagini: Array di oggetti immagine (se
extractImagesÈtrue) - Nome file: Il nome del file immagine estratto
- Contenuto dell'immagine: Base64-contenuto codificato dell'immagine
Codifica Base64 Contenuto dell'immagine:
Per decodificare e salvare Base64-immagini codificate:
// JavaScript
const decoded = atob(base64String);
const blob = new Blob([decoded], { type: 'image/png' });
const url = URL.createObjectURL(blob);
# Python
import base64
image_data = base64.b64decode(base64_string)
with open('extracted_image.png', 'wb') as f:
f.write(image_data)
Esempio di richiesta
Intestazione
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
Nota:
- Ottieni il tuo API chiave dalla PDF4me Pannello di controllo
- IL API la chiave deve essere Base64 codificato e prefissato con "Basic" nel Authorization intestazione
- Esempio: se il tuo API la chiave è
abc123, codificalo in Base64 e utilizzareAuthorization: Basic YWJjMTIz
Carico utile
Richiesta di base:
{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "sample.pdf",
"extractText": true,
"extractImages": true
}
Con elaborazione asincrona:
{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "sample.pdf",
"extractText": true,
"extractImages": true,
"async": true
}
Esempi di codice
IL PDF4me Estrarre risorse REST API Fornisce esempi di codice in diversi linguaggi di programmazione. Scegli il linguaggio più adatto al tuo ambiente di sviluppo:
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
Java Campione
Java implementazione con gestione completa degli errori ed elaborazione delle risposte:
JavaScript Campione
Node.js e compatibile con i browser JavaScript implementazione:
Google Apps Script Campione
Google Apps Script implementazione per Google Workspace integrazione:
Funzionalità di estrazione delle immagini
- Immagini di alta qualità: Estrai le immagini con risoluzione e qualità originali
- Formati multipli: Supporto per vari formati di immagine (JPG, PNG, GIF, ecc.)
- Grafica vettoriale: Estrazione di grafica vettoriale e diagrammi scalabili
- Conservazione dei metadati: Gestire le proprietà e i metadati delle immagini
Elaborazione avanzata
- Estrazione selettiva: Scegli tra estrazione solo testo, solo immagini o estrazione combinata
- Elaborazione in batch: Elabora più PDFs e estrarre risorse in modo efficiente
- Analisi dei contenuti: Analizzare e categorizzare i tipi di contenuto estratti
- Risultati professionaliEstrazione di alta qualità adatta ad applicazioni aziendali
Casi d'uso e applicazioni industriali
- Document Management & Processing
- Business & Finance
- Legal & Compliance
- Healthcare & Medical
- Education & Research
- Marketing & Content
Casi d'uso per la gestione e l'elaborazione dei documenti
- Digitalizzazione dei contenutiEstrazione di testo e immagini da documenti scansionati per archivi digitali
- Analisi del documento: Analizzare PDF contenuti per l'estrazione e l'elaborazione delle informazioni
- Migrazione dei dati: Estrazione del contenuto durante la migrazione dei documenti e gli aggiornamenti di sistema
- Indicizzazione dei contenuti: Crea indici ricercabili da PDF contenuto testuale e immagini
Casi d'uso in ambito aziendale e finanziario
- Elaborazione delle fattureEstrarre testo e immagini dalle fatture per l'elaborazione automatizzata.
- Analisi del rapportoEstrarre dati e grafici da report e bilanci finanziari
- Gestione dei contrattiEstrarre testo ed elementi visivi da contratti e accordi
- Documentazione di conformità: Elaborare i documenti normativi ed estrarre le informazioni richieste
Casi d'uso legali e di conformità
- Elaborazione di documenti legaliEstrarre testo e prove da documenti legali
- Gestione dei casiEstrarre il contenuto dai fascicoli processuali e dalle memorie legali.
- Conformità normativa: Elaborare i documenti di conformità ed estrarre i dati richiesti
- Raccolta delle proveEstrarre testo e immagini a fini probatori e documentali per scopi legali.
Casi d'uso in ambito sanitario e medico
- Cartelle clinicheEstrarre testo e immagini dalle cartelle cliniche e dai referti medici.
- Dati di ricerca: Elaborare documenti di ricerca ed estrarre dati e grafici
- Studi cliniciEstrarre informazioni dai documenti degli studi clinici
- Diagnostica per immagini: Estrarre immagini mediche e contenuti diagnostici da PDFs
Casi d'uso in ambito educativo e di ricerca.
- Articoli accademiciEstrarre testo e figure da articoli e pubblicazioni di ricerca.
- Contenuti didattici: Elaborazione di libri di testo e materiali didattici
- Dati di ricercaEstrarre dati e grafici da documenti di ricerca
- Digitalizzazione della bibliotecaDigitalizzare le collezioni della biblioteca ed estrarre contenuti ricercabili.
Casi d'uso di marketing e contenuti
- Creazione di contenutiEstrarre testo e immagini per il content marketing e i social media
- Risorse del marchio: Estrai loghi ed elementi di branding da PDF Documenti
- Risorse di progettazione: Estrarre elementi di design e grafica per progetti creativi
- Riutilizzo dei contenutiEstrarre contenuti per riutilizzarli in diversi formati e piattaforme