pplx-embed-v2-late tabanlı bir PDF arama sisteminin bütçesini çıkarıyorsanız kritik noktayı gözden kaçırmak kolay: Perplexity model ağırlıklarını yayımladı, ancak v2-late için bir API fiyatı açıklamadı ve modeli herkese açık Embeddings API kataloğuna eklemedi. Bugün uygulanabilir seçenek, self-hosted multimodal retrieval; mevcut v1 API fiyatlarıysa yalnızca karşılaştırma için kullanılabilir.
Fiyatlandırma durumu: v2-late herkese açık Embeddings API tarifesinde yok
7 Ekim 2026 itibarıyla resmî Embeddings API hızlı başlangıç sayfasında dört v1 modeli yer alıyor. Listede pplx-embed-v2-late-0.6b ya da pplx-embed-v2-late-9b bulunmadığından, v2-late için savunulabilir bir token başı API maliyet tahmini yapmak henüz mümkün değil.
| API dokümanlarında listelenen Perplexity modeli | 1 milyon token başına fiyat | Hedeflenen girdi |
|---|---|---|
pplx-embed-v1-0.6b | $0.004 | Bağımsız metinler, sorgular, cümleler |
pplx-embed-v1-4b | $0.030 | Bağımsız metinler, sorgular, cümleler |
pplx-embed-context-v1-0.6b | $0.008 | Birbiriyle ilişkili belge parçaları |
pplx-embed-context-v1-4b | $0.050 | Birbiriyle ilişkili belge parçaları |
Bunlar kullandıkça öde API ücretleri; late-interaction ailesinin fiyatları değil. Perplexity'nin duyurusu, late-interaction, dense ve contextual embedding modellerinin API Platformu'na aşamalı olarak geleceğini belirtiyor. Bu ifade, aktif bir v2-late endpoint'i veya fiyat taahhüdü anlamına gelmiyor.
Satın alma kararında bütçeyi iki kaleme ayırın:
- Yönetilen API harcaması: Yukarıdaki v1 modelleri için mevcut; v2-late için açıklanmış bir ücret yok.
- Self-hosting harcaması: v2-late için GPU süresi, sayfa render işlemleri, model depolama, token-vektör indeks depolama ve sorgu sunumu.
Bir v1 fiyatını PDF sayfa sayısıyla çarpıp sonucu v2-late teklifi olarak görmeyin. Modeller farklı gösterimler kullanıyor; v1 API ise dokümante edilen işlenmiş sayfa akışından farklı olarak metin embedding'i sunuyor.
pplx-embed-v2-late paketinde neler var?
Perplexity iki late-interaction checkpoint'i yayımlıyor: pplx-embed-v2-late-0.6b ve pplx-embed-v2-late-9b. 9B model kartına göre küçük model 340M, büyük model ise 7.4B aktif parametreye sahip. İki model de token başına 128 boyutlu vektör üretiyor ve bir sayfayı tek vektöre indirgemek yerine MaxSim kullanıyor.
| Model | Aktif parametre | ViDoRe v3 image nDCG@10 | ViDoRe v3 Markdown nDCG@10 | Pratik kullanım alanı |
|---|---|---|---|---|
pplx-embed-v2-late-0.6b | 340M | 62.3% | 61.2% | Daha hafif sorgu katmanı veya küçük kurulumlar |
pplx-embed-v2-late-9b | 7.4B | 65.2% | 64.7% | Daha yüksek kaliteli indeksleme ve getirme modeli |
Bu benchmark sonuçları bağımsız PDF testleri değil, model kartındaki sonuçlardır: 9B, image retrieval'da 2.9 yüzde puan; Markdown retrieval'da 3.5 puan önde. Buna karşılık yaklaşık 21.8 kat daha fazla aktif parametre kullanıyor. Her iki checkpoint de Hugging Face üzerinde MIT lisansıyla sunuluyor.
Paylaşılan embedding alanı, dağıtım tarafındaki en önemli ayrıntı. Perplexity, 9B ile oluşturulan bir indeksin 0.6B modeliyle sorgulanabildiğini belirtiyor. Dokümanları offline kodlamak için 9B'yi, sorgular içinse 0.6B'yi ancak modeller arası recall değerini doğruladıktan sonra kullanın; bu yaklaşım 9B indeksinin depolama maliyetini ortadan kaldırmaz.
Uygulanabilir bir PDF getirme mimarisi
v2-late akışında her işlenmiş PDF sayfası bir görüntü belgesi olarak ele alınıyor. Böylece metin sorgusu, OCR'ı temel retrieval gösterimi haline getirmeden sayfadaki sözcüklerle, tablo yapısıyla, grafikle veya düzenle eşleşebiliyor. Bu yaklaşım, Sentence Transformers'ın görsel retrieval dokümantasyonunda açıklanan görsel belge modeline karşılık geliyor.
"OCR-free" ifadesi, retrieval sinyalinin OCR olmadığı anlamına gelir; çıkarılmış metin yine de filtreleme, alıntılama, erişilebilirlik ve yedek arama için değerlidir.
1. Sayfaları render edin, metadata'yı saklayın
Her sayfayı sabit çözünürlükte RGB görüntü olarak render edin ve yanına aşağıdaki gibi bir kayıt ekleyin:
| Alan | Örnek |
|---|---|
document_id | contract-2026-04 |
page_number | 17 |
image_path | pages/contract-2026-04/017.png |
source_uri | Dahili PDF nesne URL'si |
text_fallback | İsteğe bağlı çıkarılmış metin |
document_id ve page_number alanlarını yalnızca görüntü dosya adına değil, retrieval kaydına da ekleyin. İlgili sayfa bulunduğunda, tablo, dipnot veya tanım çoğu zaman sayfa sınırını aştığı için aynı belgenin komşu sayfalarını da getirin.
2. Uyumlu encoder'ı kurun
9B model kartı güncel kütüphane sürümlerini gerektiriyor:
pip install "sentence-transformers>=6.0.0" "transformers>=5.4.0" pillow
Resmî örnek MultiVectorEncoder kullanıyor ve model kartı 9B checkpoint'ini yüklerken CUDA'yı seçiyor:
from PIL import Image
from sentence_transformers import MultiVectorEncoder
model = MultiVectorEncoder(
"perplexity-ai/pplx-embed-v2-late-9b",
device="cuda",
)
Büyük checkpoint mevcut sunum donanımına sığmıyorsa 0.6B tanımlayıcısını kullanın. Model kartında resmî bir VRAM alt sınırı, throughput tablosu veya gecikme garantisi yer almıyor; kapasite kararı vermeden önce sayfa çözünürlüğünüzü, batch boyutunuzu ve GPU'nuzu ölçün.
3. Metin sorgularını ve sayfa görsellerini ayrı kodlayın
Model asimetrik çağrılar gerektiriyor. Sorgu metni encode_query, render edilmiş sayfalar ise encode_document üzerinden işleniyor:
query_embeddings = model.encode_query([
"Which clause governs termination after a material breach?"
])
page = Image.open("pages/contract-2026-04/017.png").convert("RGB")
page_embeddings = model.encode_document([page])
scores = model.similarity(query_embeddings, page_embeddings)
print(scores)
Metin ve görüntü belgelerini aynı karma encoding batch'ine koymayın. Model kartı, bu checkpoint'in beklediği ayrı homojen girdileri ve [Q] / [D] işaretçi yapılandırmasını özellikle vurguluyor. model.similarity(), token düzeyindeki gösterimler üzerinde MaxSim uygular.
Gerçek bir koleksiyonda sayfaları offline olarak encode edin, çoklu vektör gösterimini late-interaction indeksinde saklayın ve sayfa metadata'sını ayrı bir depoda tutun. Küçük koleksiyonlarda tam taramalı skorlamadan yararlanabilirsiniz. Daha büyük ölçekte MaxSim destekleyen bir sistem kullanın ya da önce dense bir retriever ile adayları daraltıp kontrollü bir aday kümesinde v2-late reranking uygulayın.
4. Sayfaları getirin, ardından kanıt penceresini genişletin
Sayfa düzeyindeki bir eşleşme normalde şunları döndürmelidir:
- Eşleşen sayfa ve skoru.
- Belge kimliği ve kaynak bağlantısı.
- Aynı belgeden bir veya iki komşu sayfa.
- Alıntılama için sayfa görseli ve varsa çıkarılmış metin.
Bu yaklaşım, tanımın 16. sayfada başlayıp tablonun 17. sayfada devam ettiği senaryolarda görsel olarak doğru bir sayfa eşleşmesinin eksik yanıta dönüşmesini engeller. Çıktıyı denetlenebilir kılar: Kullanıcı, görünmeyen bir OCR dönüşümüne güvenmek yerine eşleşmeyi sağlayan grafiği veya tabloyu görebilir.
API token'larının ötesindeki maliyet modeli
Dört v1 ücretiyle karşılaştırılabilecek yayımlanmış bir v2-late API fiyatı yok. Bu nedenle operasyonel maliyet, model kartında fiyatlandırılmamış dağıtım tercihlerine bağlı.
| Maliyet kalemi | Doğrulanan bilgi | Planlama etkisi |
|---|---|---|
| Model ağırlıkları | 9B deposu, Hugging Face'te yaklaşık 33.6 GB ve F32 tensörler gösteriyor | İndeksleme başlamadan önce bile ağırlık depolama ve yükleme anlamlı bir maliyet kalemi |
| Gösterim | Token başına 128 boyutlu bir vektör; skorlamada MaxSim kullanılıyor | Bir sayfa tek bir dense vektör değil, çok sayıda vektör üretir |
| İndeksleme | 9B, 0.6B ile sorgulanabilen bir indeks oluşturabilir | Sorgu hacmi yüksekse daha yoğun hesaplamayı offline işe taşıyın |
| Retrieval | Late interaction, sorgu token'larını belge token'larıyla karşılaştırır | Desteklenen bir MaxSim indeksi kullanın veya yeniden skorlamadan önce adayları sınırlayın |
| API faturalandırması | v2-late için yayımlanmış ücret yok | Yönetilen API harcamasını henüz tahmin etmeyin |
Hugging Face'in late-interaction rehberi, başka bir model üzerinden yararlı bir ölçek referansı sunuyor: 4,874 passage içeren bir örnek 608,414 token vektörü ve 311.5 MB ham float32 depolama üretirken, sıkıştırılmış PLAID indeksi 92 MB yer kapladı. Bu değerler v2-late tahmini değildir; ancak “128 boyut” ifadesinin “küçük indeks” anlamına gelmediğini gösterir. Asıl çarpan token sayısıdır.
İndeksleme throughput'u da kendi donanımınızda benchmark edilmelidir. Gerçek kullanıcıya ait bir LocalLLaMA raporunda, pplx-embed-v1-4b A100 80GB üzerinde 10,000 vektör başına yaklaşık 45 dakika sürerken Qwen3-Embedding-4B 6 dakika sürdü. Bu rapor v1 ile ilgili, v2-late ile değil; dolayısıyla v2-late performans iddiası değil, Perplexity embedding throughput'unu ölçmeniz gerektiğine dair bir uyarıdır.
“I think it might be because pplx embed uses bidirectional attention rather than standard masked attention.” — u/Velocita84, r/LocalLLaMA
Hangi dağıtım yolunu seçmelisiniz?
| Gereksinim | Bugün için en iyi yol | Neden |
|---|---|---|
| Yönetilen endpoint ile uygun maliyetli, yalnızca metin odaklı RAG | Perplexity v1 API | Açıklanan fiyatlar 1 milyon token başına $0.004 ile $0.05 arasında |
| Grafikler, tablolar, taranmış sayfalar ve düzen önemliyse | Self-host pplx-embed-v2-late | Dokümante edilen akış, render edilmiş sayfalarda doğrudan arama yapıyor |
| Sık sorgulanan büyük corpus | 9B offline indeks + 0.6B sorgu encoder'ı veya dense-first + v2-late reranking | İndeksleme kalitesini sorgu anındaki hesaplama yükünden ayırır |
| Küçük prototip veya donanımı sınırlı test | Temsil niteliği taşıyan sayfa örneğinde 0.6B checkpoint | Daha düşük aktif parametre sayısı; yine de sayfa encoding'i ve depolamayı benchmark edin |
| Yönetilen v2-late endpoint'i zorunluysa | Resmî API model kimliği ve fiyat tarifesini bekleyin | Mevcut herkese açık embedding dokümantasyonunda ikisi de yer almıyor |
Önerim, tam bir indeks oluşturmadan önce 100 ile 500 temsil niteliğindeki sayfada 0.6B ve 9B modellerinin çapraz model yolunu prototiplemeniz. Taranmış sayfaları, tabloları, çok sütunlu düzenleri ve yanıtı sayfa sınırına taşan sayfaları dahil edin. Hedef k değerinizdeki recall'u, sayfa encoding throughput'unu, ham ve sıkıştırılmış indeks boyutunu ve sorgu gecikmesini kaydedin. Bu kanıt, henüz bu API üzerinden satılmayan bir modele v1 token fiyatını taşımaktan çok daha değerlidir.
pplx-embed-v2-late PDF retrieval: SSS
pplx-embed-v2-late için API fiyatı var mı?
Bu rehber için kontrol edilen herkese açık Perplexity Embeddings API dokümantasyonunda yok. Yayımlanan 1 milyon token başına $0.004 ile $0.05 arasındaki fiyatlar, v1 standard ve contextualized modeller için geçerli.
pplx-embed-v2-late resmen yayımlandı mı?
Evet. Perplexity, Hugging Face üzerinde 0.6B ve 9B açık ağırlıklı checkpoint'ler yayımlıyor. Ağırlıkların yayımlanması ile yönetilen API erişimi birbirinden ayrı aşamalardır.
PDF retrieval için OCR gerekli mi?
Görsel retrieval sinyali için hayır. Her sayfayı görüntü olarak render edin ve belge şeklinde encode edin. OCR veya çıkarılmış metin; filtreleme, alıntılama, erişilebilirlik ve yedek arama açısından yine yararlıdır.
0.6B modeli, 9B ile oluşturulmuş bir indeksi sorgulayabilir mi?
Perplexity'nin model kartı, iki modelin ortak embedding alanını paylaştığını ve bu düzeni desteklediğini belirtiyor. Kart, modeller arası retrieval farkı yayımlamadığı için kendi corpus'unuzdaki kaliteyi ölçün.
Metin ve görüntü sayfaları aynı batch'te işlenebilir mi?
Hayır. Model kartı, karma metin ve görüntü girdilerinin aynı encoding batch'inde desteklenmediğini söylüyor. Metin ve görüntü encoding çağrılarını homojen tutun.
Hâlâ reranker kullanmam gerekir mi?
Otomatik olarak gerekmez. MaxSim zaten late-interaction skorlama yöntemi; ancak büyük bir corpus'ta her sayfa-token vektörünü taramak yerine dense ilk aşama retriever'ı ile v2-late reranking'i birleştirmek daha pratik olabilir.
PDF sayfası başına net depolama maliyeti nedir?
Perplexity, v2-late için sayfa düzeyinde depolama hesaplayıcısı yayımlamıyor. Saklanan sayfa token'ı sayısı, vektör hassasiyeti, metadata ve indeks sıkıştırmasına göre tahmin yapın; ardından bunu temsil niteliği taşıyan bir örnekle doğrulayın.
0.6B mi, 9B mi seçmeliyim?
Offline indeksleme kalitesi önceliğinizse ve model ile indeksleme işinin maliyetini karşılayabiliyorsanız 9B'yi kullanın. Daha küçük bir kurulum veya sorgu encoder'ı için, 9B indeksiyle dokümante edilmiş ortak alan düzeni dahil olmak üzere 0.6B'yi tercih edin. Benchmark farkı ölçülebilir, ancak model kartı evrensel bir kalite ya da gecikme kuralı sunmuyor.
Go/no-go kontrolü kısa: Bugün bilinen fiyatlı yönetilen bir Perplexity endpoint'ine ihtiyacınız varsa v2-late bu gereksinim için hazır değil. Self-hosting yapabiliyorsanız ve PDF'leriniz OCR'ın veya metin parçalamanın kaybettiği bilgiler içeriyorsa, ölçeklemeden önce temsil niteliği taşıyan bir sayfa kümesini render edip late-interaction pipeline'ını benchmark edin.