Dönüştürmek PDF Düzenlenebilir PDF Kullanarak OCR
PDF4me Dönüştürmek PDF Düzenlenebilir PDF kullanarak OCR bir REST taranan uç nokta PDFs Aranabilir ve düzenlenebilir. POST A Base64 PDF ile /api/v2/ConvertOcrPdfTaslak veya Yüksek kalite seçeneklerinden birini seçin ve OCR Motor, belgeye gerçek bir metin katmanı yazar. Yanıt olarak tamamlanmış belge döndürülür. PDF gibi Base64 JSONÇözülmeye ve kaydedilmeye hazır.
Görüntü tabanlı veya taranmış bir veri alır. PDF ve tanınan, seçilebilir metni içeren aynı belgeyi geri döndürür. qualityType hızlı tek geçiş arasında geçiş yapar (Taslak1 API dosya başına çağrı) ve sayfa başına tanıma (Yüksek2 API (sayfa başına çağrı sayısı) ocrWhenNeeded atlamalar pages Zaten aranabilir olan. Çıktı şu şekilde gelir: Base64 docContent bir alanda JSON yanıt yoluyla veya bir Location anket URL 202.
Kimliğinizi Doğrulama API Rica etmek
Her PDF4me REST Çağrınızda mutlaka sizin de bulunmanız gerekiyor. API anahtara girin Authorization Başlıkta Temel kimlik doğrulama (Basic auth) belirtilmiştir. Anahtarınızı geliştirici kontrol panelinden alın veya değiştirin.
Uç nokta
/api/v2/ConvertOcrPdfhttps://api.pdf4me.com/api/v2/ConvertOcrPdfKaçırmamanız Gereken Önemli Bilgiler
ocrWhenNeeded Ve outputFormat TELLER "doğru" / "YANLIŞ", sırasında isAsync Ve mergeAllSheets 'dır' JSON Mantıksal değerler. Bu, resmi kod örneklerini yansıtır; bunları karıştırmak 400 hatasının yaygın bir nedenidir.docName artı docContentbitmiş PDF olarak Base64 Dizeyi çöz. docContent Kaydetmeden önce. Yanıt gövdesini olduğu gibi diske yazmayın.ocrWhenNeeded: "doğru" yani zaten aranabilir pages Yeniden işlenmek yerine atlanırlar.HTTP kurmak
Yöntem: POST
URL: https://api.pdf4me.com/api/v2/ConvertOcrPdf
İçerik Türü: uygulama/json
Authorization: Temel <sizin PDF4me API anahtar>
Göndermek isAsync: doğru Vücutta. 200 iadeler JSON ile Base64 docContent. 202 bir döndürür Location anket içeren başlık URL; GET O URL aynı şekilde Authorization başlık 200 değerini döndürene kadar JSON sonuç.
Taranmış bir belgeyi nasıl oluşturursunuz? PDF Aranabilir mi?
Taranmış bir PDF sadece resimlerdir pagesHiçbir şey seçilemiyor ve metin aramasıyla eşleşen hiçbir şey yok. OCR (optik karakter tanıma, bakınız) nasıl OCR işlerBu işlem, her sayfa görüntüsünü okur ve tanınan kelimeleri gerçek bir metin katmanı olarak dosyaya yazar. Dönüştürme işleminden sonra belge, dijital olarak oluşturulmuş bir belge gibi davranır. PDFArama, kopyalama ve ekran okuyucular sorunsuz çalışıyor ve sonraki adımlar için hazır durumda. PDF/A arşivleme veya bul ve değiştir.
| Taslak vs Yüksek | Taslak | Yüksek |
|---|---|---|
| En iyisi | Normal PDFs çoğunlukla metin katmanına sahip olanlar | Taranmış veya görüntü tabanlı belgeler |
| Maliyet | 1 API dosya başına çağrı | 2 API sayfa başına çağrılar |
| Tanıma | Hafif geçiş | Sayfa başına tam OCR |
| Şununla eşleştirin | ocrWhenNeeded: "true" aranabilir olanı atla pages | language metin bozuk bir şekilde geri döndüğünde |
API vücut alanları
| Parametre | Gerekli | Tip | Ne işe yarar? | Örnek |
|---|---|---|---|---|
docContent | Required | string | Base64-encoded bytes of the source PDF. Strip any data:application/pdf;base64, prefix before posting. | JVBERi0xLjcK... |
docName | Required | string | Source filename including the .pdf extension. Used for the output docName. | scanned-contract.pdf |
qualityType | Required | string | Draft for normal PDFs (1 API call per file). High for scanned documents (2 API calls per page). | High |
ocrWhenNeeded | Required | string | The string "true" skips pages that already have a searchable text layer; "false" forces OCR on every page. | "true" |
outputFormat | Required | string | Output format flag, sent as the string "true" in the official samples. | "true" |
language | Conditional | string | Language of the source text (English, Spanish, French, German, and others). Set only when the recognized output is garbled; otherwise let the engine detect it. | English |
mergeAllSheets | Optional | boolean | JSON boolean carried by the official samples; relevant to sheet-based sources. | true |
isAsync | Optional | boolean | true enables the 202 + Location polling pattern, recommended for large scans. | true |
Örnek yükler
Yüksek mod. Taranmış belge ile OCR
{
"docContent": "JVBERi0xLjcKJcfsj6IKNSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZw...",
"docName": "scanned-contract.pdf",
"qualityType": "High",
"ocrWhenNeeded": "true",
"language": "English",
"outputFormat": "true",
"isAsync": true
}
Taslak modu. Karma belge, aranabilir özelliği atla. pages
{
"docContent": "JVBERi0xLjcKJcfsj6IKNSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZw...",
"docName": "mixed-report.pdf",
"qualityType": "Draft",
"ocrWhenNeeded": "true",
"outputFormat": "true",
"isAsync": true
}
Postacı tahsilat ipuçları
curl örneği
curl -X POST https://api.pdf4me.com/api/v2/ConvertOcrPdf \
-H "Content-Type: application/json" \
-H "Authorization: Basic YOUR_API_KEY" \
-d '{
"docContent": "'"$(base64 -w 0 scanned-contract.pdf)"'",
"docName": "scanned-contract.pdf",
"qualityType": "High",
"ocrWhenNeeded": "true",
"outputFormat": "true",
"isAsync": true
}' | python -c "import sys, json, base64; open('searchable.pdf','wb').write(base64.b64decode(json.load(sys.stdin)['docContent']))"
Ne anlama geliyor? API geri dönmek?
JSONHam dosya baytları değil. Kodunu çözün. docContent bitmiş ürünü almak için alan PDF.
| Alan | Tip | İçeriğinde neler var? |
|---|---|---|
| docName (HTTP 200) | String | The output PDF filename, derived from the docName you sent. |
| docContent (HTTP 200) | String (Base64) | The searchable, editable PDF encoded as Base64. Decode to bytes and save with a .pdf extension. |
| Location header (HTTP 202) | String (URL) | Poll URL for an async job that is still running. GET it with the same Authorization header; the official samples poll every 10 seconds, up to 20 retries. |
| Poll response (HTTP 200) | JSON | The same docName + docContent JSON, returned once processing completes. |
Kod örnekleri
Uçtan uca uygulamalar üzerinde çalışılıyor, her birinde taranmış bir örnek bulunuyor. PDF ve bu sayfadaki tam içerik: