Kaynakları Çıkarma - Metin ve Görüntü Çıkarıcı API
PDF4me Kaynakları Çıkarın Bu sayede metin içeriğini ve gömülü resimleri ayıklayabilirsiniz. PDF Belgeler. Bu API hizmet süreçleri PDF Dosyalardan metin ve görüntü kaynaklarını çıkarır. PDF Belgeler. API alır PDF içerik aracılığıyla REST API aramalar, kullanarak Base64 Güvenli iletim için kodlama. Metin ve görüntülerin seçici olarak çıkarılmasını destekleyen bu çözüm, içerik işleme iş akışları ve veri çıkarma platformları için idealdir.
Kimliğinizi Doğrulama API Rica etmek
Erişmek için PDF4me REST APIHer istek, geçerli kimlik doğrulama bilgilerini içermelidir. Kimlik doğrulama, güvenli iletişimi sağlar ve yetkili bir kullanıcı olarak kimliğinizi doğrular. REST API.
Başlıca Özellikler
- Metin Çıkarma: Tüm metin içeriğini çıkarın PDF belgeler
- Görüntü Çıkarma: Tüm resimleri ve görsel öğeleri şuradan alın: PDF belgeler
- Seçici Ekstraksiyonİhtiyaçlarınıza bağlı olarak yalnızca metni, yalnızca görüntüleri veya her ikisini birden ayıklamayı seçin.
- Base64 Kodlama: Güvenli dosya içeriği iletimi kullanarak Base64 kodlama
- Basit API Entegrasyon: Huzurlu API Otomatik içerik çıkarma iş akışları için tasarlanmıştır.
REST API Uç nokta
O PDF4me REST API standart kullanır HTTP Kaynaklarla etkileşim kurma yöntemleri. Tüm kaynak çıkarma işlemleri tek bir uç nokta üzerinden gerçekleştirilir:
- Yöntem: POST
- Uç nokta:
/api/v2/ExtractResources
REST API Parametreler
Kaynakları Çıkarma için parametrelerin tam listesi REST APIParametreler, daha iyi anlaşılması ve uygulanması için kategoriye göre düzenlenmiştir.
Önemli: Yıldız (*) ile işaretlenmiş parametreler zorunludur ve mutlaka sağlanmalıdır. API doğru şekilde çalışması için.
Gerekli Parametreler
| Parametre | Tip | Tanım | Örnek |
|---|---|---|---|
| docContent* | Base64 (String) | Girişin içeriği PDF dosya şu şekilde kodlanmıştır: Base64 Kaynak çıkarma ve içerik analizi işlemleri için format | JVBERi... |
| docName* | String | Kaynak PDF Belge tanımlama ve kaynak çıkarma işlemleri için uygun .pdf uzantısına sahip dosya adı. | sample.pdf |
| extractText* | Boolean | Metin içeriğini ayıklamak isteyip istemediğinizi seçin. PDF: doğruBiçimlendirmeyle birlikte tüm metin içeriğini çıkarın. YANLIŞGörüntüye özel işlem için metin çıkarma işlemini atla | true |
| extractImages* | Boolean | Görüntüleri ayıklayıp ayıklamayacağınızı seçin. PDF: doğruGörüntüleri ve görsel öğeleri ayıklayın, YANLIŞDaha hızlı metin işleme için görüntü çıkarma işlemini atlayın. | true |
İsteğe bağlı parametreler
| Parametre | Tip | Tanım | Örnek |
|---|---|---|---|
| async | Boolean | Asenkron işlemeyi etkinleştirin. true, o API iadeler 202 Accepted ile Location Sonucu sorgulamak için başlık | true |
Çıktı
O PDF4me Kaynakları Çıkarın REST API İşleme moduna bağlı olarak farklı yanıtlar döndürür. API Çıkarılan metni ve görüntüleri şu şekilde döndürür: JSON cevap.
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
Senkron İşleme (Varsayılan)
Ne zaman async dır false veya sağlanmadıysa, API Çıkarılan kaynakları anında geri döndürür.
Durum Kodu: 200 OK
Yanıt Formatı:
{
"textList": ["extracted text content...", "more text..."],
"imageList": [
{
"fileName": "image1.png",
"imageContent": "base64-encoded-image-content..."
},
{
"fileName": "image2.jpg",
"imageContent": "base64-encoded-image-content..."
}
]
}
Yanıt, çıkarılan metni bir dize dizisi olarak ve çıkarılan görüntüleri dosya adlarıyla birlikte bir nesne dizisi olarak içerir. Base64-kodlanmış içerik.
Asenkron İşleme
Ne zaman async dır true, o API Belgeyi eşzamansız olarak işler.
İlk Yanıt:
Durum Kodu: 202 Accepted
Yanıt Başlıkları:
Location: https://api.pdf4me.com/api/v2/ExtractResourcesStatus/{operationId}
Yanıt Metni:
{
"traceId": "operation-trace-id"
}
Anket Sonuçları:
Kullanın Location başlık URL Tamamlanma durumunu kontrol etmek için:
const response = await fetch(locationUrl, {
headers: { 'Authorization': 'Basic ' + apiKey }
});
// Continue polling until status code is 200
if (response.status === 200) {
const result = await response.json();
// Process extracted resources
}
Hata Yanıtları
| Durum Kodu | Tanım | Örnek Yanıt |
|---|---|---|
| 400 Bad Request | Geçersiz istek parametreleri veya eksik gerekli alanlar | {"error": "Missing required parameter: docContent"} |
| 401 Unauthorized | Geçersiz veya eksik API anahtar | {"error": "Unauthorized"} |
| 408 İstek Zaman Aşımı | İstek işleme zaman aşımı | {"error": "Request timeout"} |
| 500 Internal Server Error | İşlem sırasında sunucu hatası oluştu. | {"error": "Internal server error"} |
Anlamak JSON Cevap
Kaynak çıkarma tepkisi bir JSON İçinde şu maddeleri içeren nesne:
- metin listesi: Array Çıkarılan metin içeriğini içeren dizelerin (eğer
extractTextdırtrue) - resim listesi: Array görüntü nesnelerinin (eğer
extractImagesdırtrue) - dosya adıÇıkarılan görüntü dosyasının adı
- resim içeriği: Base64-görüntünün kodlanmış içeriği
Kod çözme Base64 Görüntü İçeriği:
Çözmek ve kaydetmek için Base64-kodlanmış görüntüler:
// JavaScript
const decoded = atob(base64String);
const blob = new Blob([decoded], { type: 'image/png' });
const url = URL.createObjectURL(blob);
# Python
import base64
image_data = base64.b64decode(base64_string)
with open('extracted_image.png', 'wb') as f:
f.write(image_data)
Talep Örneği
Başlık
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
Not:
- Alın API anahtardan PDF4me Kontrol Paneli
- O API anahtar olmalı Base64 "Basic" önekiyle kodlanmış ve ön eklenmiş Authorization başlık
- Örnek: Eğer sizin API anahtar şudur
abc123onu kodla Base64 ve kullanınAuthorization: Basic YWJjMTIz
Yük
Temel Talep:
{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "sample.pdf",
"extractText": true,
"extractImages": true
}
Asenkron İşleme ile:
{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "sample.pdf",
"extractText": true,
"extractImages": true,
"async": true
}
Kod Örnekleri
O PDF4me Kaynakları Çıkarın REST API Birden fazla programlama dilinde kod örnekleri sunar. Geliştirme ortamınıza en uygun dili seçin:
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
Google Apps Script Örnek
Google Apps Script uygulama için Google Workspace entegrasyon:
Görüntü Çıkarma Özellikleri
- Yüksek Kaliteli GörüntülerGörüntüleri orijinal çözünürlük ve kalitede çıkarın.
- Çoklu Biçimler: Çeşitli görüntü formatları için destek (JPG, PNG, GIF, vesaire.)
- Vektör GrafikleriÖlçeklenebilir vektör grafikleri ve çizelgeleri çıkarın
- Meta Veri KorumaGörüntü özelliklerini ve meta verilerini koruyun.
Gelişmiş İşleme
- Seçici EkstraksiyonMetin, görüntü veya bunların birlikte çıkarılması seçeneklerinden birini seçin.
- Toplu İşlemeBirden fazla işlemi gerçekleştirin PDFs ve kaynakları verimli bir şekilde çıkarın
- İçerik AnaliziÇıkarılan içerik türlerini analiz edin ve kategorize edin.
- Profesyonel SonuçlarKurumsal uygulamalar için uygun yüksek kaliteli ekstraksiyon
Sektör Kullanım Örnekleri ve Uygulamaları
- Document Management & Processing
- Business & Finance
- Legal & Compliance
- Healthcare & Medical
- Education & Research
- Marketing & Content
Belge Yönetimi ve İşleme Kullanım Örnekleri
- İçerik DijitalleştirmeDijital arşivler için taranmış belgelerden metin ve görselleri ayıklamak.
- Belge Analizi: Analiz et PDF bilgi çıkarımı ve işleme için içerik
- Veri TaşımaBelge geçişi ve sistem güncellemeleri sırasında içerik ayıklama
- İçerik Dizini Oluşturma: Şuradan aranabilir dizinler oluşturun: PDF metin ve görsel içerik
İş ve Finans Kullanım Örnekleri
- Fatura İşlemeFaturalardan metin ve görselleri ayıklayarak otomatik işleme için kullanıma hazır hale getirin.
- Rapor AnaliziFinansal raporlardan ve beyanlardan veri ve grafikler çıkarın.
- Sözleşme YönetimiSözleşme ve anlaşmalardan metin ve görsel öğeleri ayıklama
- Uyumluluk BelgeleriDüzenleyici belgeleri işlemek ve gerekli bilgileri çıkarmak
Hukuk ve Uyumluluk Kullanım Örnekleri
- Hukuki Belge İşlemeHukuki belgelerden metin ve kanıt çıkarmak:
- Vaka YönetimiDava dosyalarından ve hukuki özetlerden içerik çıkarma
- Mevzuat UyumluluğuUyumluluk belgelerini işleyin ve gerekli verileri çıkarın.
- Kanıt ToplamaHukuki delil ve dokümantasyon için metin ve görselleri ayıklamak.
Sağlık ve Tıbbi Kullanım Alanları
- Tıbbi KayıtlarHasta kayıtlarından ve tıbbi raporlardan metin ve görselleri ayıklamak.
- Araştırma VerileriAraştırma belgelerini işlemek ve verileri ve grafikleri çıkarmak:
- Klinik DenemelerKlinik çalışma belgelerinden bilgi çıkarma
- Tıbbi Görüntüleme: Tıbbi görüntüleri ve teşhis içeriklerini şu kaynaklardan çıkarın: PDFs
Eğitim ve Araştırma Kullanım Örnekleri
- Akademik MakalelerAraştırma makalelerinden ve yayınlardan metin ve şekiller çıkarmak.
- Eğitim İçeriğiDers kitapları ve eğitim materyallerinin işlenmesi
- Araştırma VerileriAraştırma belgelerinden veri ve grafikler çıkarın.
- Kütüphane DijitalleştirmeKütüphane koleksiyonlarını dijitalleştirin ve aranabilir içerik çıkarın.
Pazarlama ve İçerik Kullanım Örnekleri
- İçerik Oluşturmaİçerik pazarlaması ve sosyal medya için metin ve görselleri ayıklama
- Marka VarlıklarıLogoları ve marka unsurlarını şu kaynaklardan çıkarın: PDF belgeler
- Tasarım KaynaklarıYaratıcı projeler için tasarım öğeleri ve grafikler çıkarın.
- İçerik Yeniden KullanımıFarklı formatlarda ve platformlarda yeniden kullanılmak üzere içerik ayıklama: