AIREITER

pplx-embed-v2-late API Fiyatlandırması ve PDF Getirme Kurulumu

Son Güncelleme: 2026-10-07 19:16:37

pplx-embed-v2-late tabanlı bir PDF arama sisteminin bütçesini çıkarıyorsanız kritik noktayı gözden kaçırmak kolay: Perplexity model ağırlıklarını yayımladı, ancak v2-late için bir API fiyatı açıklamadı ve modeli herkese açık Embeddings API kataloğuna eklemedi. Bugün uygulanabilir seçenek, self-hosted multimodal retrieval; mevcut v1 API fiyatlarıysa yalnızca karşılaştırma için kullanılabilir.

Fiyatlandırma durumu: v2-late herkese açık Embeddings API tarifesinde yok

7 Ekim 2026 itibarıyla resmî Embeddings API hızlı başlangıç sayfasında dört v1 modeli yer alıyor. Listede pplx-embed-v2-late-0.6b ya da pplx-embed-v2-late-9b bulunmadığından, v2-late için savunulabilir bir token başı API maliyet tahmini yapmak henüz mümkün değil.

API dokümanlarında listelenen Perplexity modeli1 milyon token başına fiyatHedeflenen girdi
pplx-embed-v1-0.6b$0.004Bağımsız metinler, sorgular, cümleler
pplx-embed-v1-4b$0.030Bağımsız metinler, sorgular, cümleler
pplx-embed-context-v1-0.6b$0.008Birbiriyle ilişkili belge parçaları
pplx-embed-context-v1-4b$0.050Birbiriyle ilişkili belge parçaları

Bunlar kullandıkça öde API ücretleri; late-interaction ailesinin fiyatları değil. Perplexity'nin duyurusu, late-interaction, dense ve contextual embedding modellerinin API Platformu'na aşamalı olarak geleceğini belirtiyor. Bu ifade, aktif bir v2-late endpoint'i veya fiyat taahhüdü anlamına gelmiyor.

Satın alma kararında bütçeyi iki kaleme ayırın:

  1. Yönetilen API harcaması: Yukarıdaki v1 modelleri için mevcut; v2-late için açıklanmış bir ücret yok.
  2. Self-hosting harcaması: v2-late için GPU süresi, sayfa render işlemleri, model depolama, token-vektör indeks depolama ve sorgu sunumu.

Bir v1 fiyatını PDF sayfa sayısıyla çarpıp sonucu v2-late teklifi olarak görmeyin. Modeller farklı gösterimler kullanıyor; v1 API ise dokümante edilen işlenmiş sayfa akışından farklı olarak metin embedding'i sunuyor.

pplx-embed-v2-late paketinde neler var?

Perplexity iki late-interaction checkpoint'i yayımlıyor: pplx-embed-v2-late-0.6b ve pplx-embed-v2-late-9b. 9B model kartına göre küçük model 340M, büyük model ise 7.4B aktif parametreye sahip. İki model de token başına 128 boyutlu vektör üretiyor ve bir sayfayı tek vektöre indirgemek yerine MaxSim kullanıyor.

ModelAktif parametreViDoRe v3 image nDCG@10ViDoRe v3 Markdown nDCG@10Pratik kullanım alanı
pplx-embed-v2-late-0.6b340M62.3%61.2%Daha hafif sorgu katmanı veya küçük kurulumlar
pplx-embed-v2-late-9b7.4B65.2%64.7%Daha yüksek kaliteli indeksleme ve getirme modeli

Bu benchmark sonuçları bağımsız PDF testleri değil, model kartındaki sonuçlardır: 9B, image retrieval'da 2.9 yüzde puan; Markdown retrieval'da 3.5 puan önde. Buna karşılık yaklaşık 21.8 kat daha fazla aktif parametre kullanıyor. Her iki checkpoint de Hugging Face üzerinde MIT lisansıyla sunuluyor.

Paylaşılan embedding alanı, dağıtım tarafındaki en önemli ayrıntı. Perplexity, 9B ile oluşturulan bir indeksin 0.6B modeliyle sorgulanabildiğini belirtiyor. Dokümanları offline kodlamak için 9B'yi, sorgular içinse 0.6B'yi ancak modeller arası recall değerini doğruladıktan sonra kullanın; bu yaklaşım 9B indeksinin depolama maliyetini ortadan kaldırmaz.

Uygulanabilir bir PDF getirme mimarisi

v2-late akışında her işlenmiş PDF sayfası bir görüntü belgesi olarak ele alınıyor. Böylece metin sorgusu, OCR'ı temel retrieval gösterimi haline getirmeden sayfadaki sözcüklerle, tablo yapısıyla, grafikle veya düzenle eşleşebiliyor. Bu yaklaşım, Sentence Transformers'ın görsel retrieval dokümantasyonunda açıklanan görsel belge modeline karşılık geliyor.

"OCR-free" ifadesi, retrieval sinyalinin OCR olmadığı anlamına gelir; çıkarılmış metin yine de filtreleme, alıntılama, erişilebilirlik ve yedek arama için değerlidir.

1. Sayfaları render edin, metadata'yı saklayın

Her sayfayı sabit çözünürlükte RGB görüntü olarak render edin ve yanına aşağıdaki gibi bir kayıt ekleyin:

AlanÖrnek
document_idcontract-2026-04
page_number17
image_pathpages/contract-2026-04/017.png
source_uriDahili PDF nesne URL'si
text_fallbackİsteğe bağlı çıkarılmış metin

document_id ve page_number alanlarını yalnızca görüntü dosya adına değil, retrieval kaydına da ekleyin. İlgili sayfa bulunduğunda, tablo, dipnot veya tanım çoğu zaman sayfa sınırını aştığı için aynı belgenin komşu sayfalarını da getirin.

2. Uyumlu encoder'ı kurun

9B model kartı güncel kütüphane sürümlerini gerektiriyor:

pip install "sentence-transformers>=6.0.0" "transformers>=5.4.0" pillow

Resmî örnek MultiVectorEncoder kullanıyor ve model kartı 9B checkpoint'ini yüklerken CUDA'yı seçiyor:

from PIL import Image
from sentence_transformers import MultiVectorEncoder

model = MultiVectorEncoder(
    "perplexity-ai/pplx-embed-v2-late-9b",
    device="cuda",
)

Büyük checkpoint mevcut sunum donanımına sığmıyorsa 0.6B tanımlayıcısını kullanın. Model kartında resmî bir VRAM alt sınırı, throughput tablosu veya gecikme garantisi yer almıyor; kapasite kararı vermeden önce sayfa çözünürlüğünüzü, batch boyutunuzu ve GPU'nuzu ölçün.

3. Metin sorgularını ve sayfa görsellerini ayrı kodlayın

Model asimetrik çağrılar gerektiriyor. Sorgu metni encode_query, render edilmiş sayfalar ise encode_document üzerinden işleniyor:

query_embeddings = model.encode_query([
    "Which clause governs termination after a material breach?"
])

page = Image.open("pages/contract-2026-04/017.png").convert("RGB")
page_embeddings = model.encode_document([page])

scores = model.similarity(query_embeddings, page_embeddings)
print(scores)

Metin ve görüntü belgelerini aynı karma encoding batch'ine koymayın. Model kartı, bu checkpoint'in beklediği ayrı homojen girdileri ve [Q] / [D] işaretçi yapılandırmasını özellikle vurguluyor. model.similarity(), token düzeyindeki gösterimler üzerinde MaxSim uygular.

Gerçek bir koleksiyonda sayfaları offline olarak encode edin, çoklu vektör gösterimini late-interaction indeksinde saklayın ve sayfa metadata'sını ayrı bir depoda tutun. Küçük koleksiyonlarda tam taramalı skorlamadan yararlanabilirsiniz. Daha büyük ölçekte MaxSim destekleyen bir sistem kullanın ya da önce dense bir retriever ile adayları daraltıp kontrollü bir aday kümesinde v2-late reranking uygulayın.

4. Sayfaları getirin, ardından kanıt penceresini genişletin

Sayfa düzeyindeki bir eşleşme normalde şunları döndürmelidir:

  1. Eşleşen sayfa ve skoru.
  2. Belge kimliği ve kaynak bağlantısı.
  3. Aynı belgeden bir veya iki komşu sayfa.
  4. Alıntılama için sayfa görseli ve varsa çıkarılmış metin.

Bu yaklaşım, tanımın 16. sayfada başlayıp tablonun 17. sayfada devam ettiği senaryolarda görsel olarak doğru bir sayfa eşleşmesinin eksik yanıta dönüşmesini engeller. Çıktıyı denetlenebilir kılar: Kullanıcı, görünmeyen bir OCR dönüşümüne güvenmek yerine eşleşmeyi sağlayan grafiği veya tabloyu görebilir.

API token'larının ötesindeki maliyet modeli

Dört v1 ücretiyle karşılaştırılabilecek yayımlanmış bir v2-late API fiyatı yok. Bu nedenle operasyonel maliyet, model kartında fiyatlandırılmamış dağıtım tercihlerine bağlı.

Maliyet kalemiDoğrulanan bilgiPlanlama etkisi
Model ağırlıkları9B deposu, Hugging Face'te yaklaşık 33.6 GB ve F32 tensörler gösteriyorİndeksleme başlamadan önce bile ağırlık depolama ve yükleme anlamlı bir maliyet kalemi
GösterimToken başına 128 boyutlu bir vektör; skorlamada MaxSim kullanılıyorBir sayfa tek bir dense vektör değil, çok sayıda vektör üretir
İndeksleme9B, 0.6B ile sorgulanabilen bir indeks oluşturabilirSorgu hacmi yüksekse daha yoğun hesaplamayı offline işe taşıyın
RetrievalLate interaction, sorgu token'larını belge token'larıyla karşılaştırırDesteklenen bir MaxSim indeksi kullanın veya yeniden skorlamadan önce adayları sınırlayın
API faturalandırmasıv2-late için yayımlanmış ücret yokYönetilen API harcamasını henüz tahmin etmeyin

Hugging Face'in late-interaction rehberi, başka bir model üzerinden yararlı bir ölçek referansı sunuyor: 4,874 passage içeren bir örnek 608,414 token vektörü ve 311.5 MB ham float32 depolama üretirken, sıkıştırılmış PLAID indeksi 92 MB yer kapladı. Bu değerler v2-late tahmini değildir; ancak “128 boyut” ifadesinin “küçük indeks” anlamına gelmediğini gösterir. Asıl çarpan token sayısıdır.

İndeksleme throughput'u da kendi donanımınızda benchmark edilmelidir. Gerçek kullanıcıya ait bir LocalLLaMA raporunda, pplx-embed-v1-4b A100 80GB üzerinde 10,000 vektör başına yaklaşık 45 dakika sürerken Qwen3-Embedding-4B 6 dakika sürdü. Bu rapor v1 ile ilgili, v2-late ile değil; dolayısıyla v2-late performans iddiası değil, Perplexity embedding throughput'unu ölçmeniz gerektiğine dair bir uyarıdır.

“I think it might be because pplx embed uses bidirectional attention rather than standard masked attention.” — u/Velocita84, r/LocalLLaMA

Hangi dağıtım yolunu seçmelisiniz?

GereksinimBugün için en iyi yolNeden
Yönetilen endpoint ile uygun maliyetli, yalnızca metin odaklı RAGPerplexity v1 APIAçıklanan fiyatlar 1 milyon token başına $0.004 ile $0.05 arasında
Grafikler, tablolar, taranmış sayfalar ve düzen önemliyseSelf-host pplx-embed-v2-lateDokümante edilen akış, render edilmiş sayfalarda doğrudan arama yapıyor
Sık sorgulanan büyük corpus9B offline indeks + 0.6B sorgu encoder'ı veya dense-first + v2-late rerankingİndeksleme kalitesini sorgu anındaki hesaplama yükünden ayırır
Küçük prototip veya donanımı sınırlı testTemsil niteliği taşıyan sayfa örneğinde 0.6B checkpointDaha düşük aktif parametre sayısı; yine de sayfa encoding'i ve depolamayı benchmark edin
Yönetilen v2-late endpoint'i zorunluysaResmî API model kimliği ve fiyat tarifesini bekleyinMevcut herkese açık embedding dokümantasyonunda ikisi de yer almıyor

Önerim, tam bir indeks oluşturmadan önce 100 ile 500 temsil niteliğindeki sayfada 0.6B ve 9B modellerinin çapraz model yolunu prototiplemeniz. Taranmış sayfaları, tabloları, çok sütunlu düzenleri ve yanıtı sayfa sınırına taşan sayfaları dahil edin. Hedef k değerinizdeki recall'u, sayfa encoding throughput'unu, ham ve sıkıştırılmış indeks boyutunu ve sorgu gecikmesini kaydedin. Bu kanıt, henüz bu API üzerinden satılmayan bir modele v1 token fiyatını taşımaktan çok daha değerlidir.

pplx-embed-v2-late PDF retrieval: SSS

pplx-embed-v2-late için API fiyatı var mı?

Bu rehber için kontrol edilen herkese açık Perplexity Embeddings API dokümantasyonunda yok. Yayımlanan 1 milyon token başına $0.004 ile $0.05 arasındaki fiyatlar, v1 standard ve contextualized modeller için geçerli.

pplx-embed-v2-late resmen yayımlandı mı?

Evet. Perplexity, Hugging Face üzerinde 0.6B ve 9B açık ağırlıklı checkpoint'ler yayımlıyor. Ağırlıkların yayımlanması ile yönetilen API erişimi birbirinden ayrı aşamalardır.

PDF retrieval için OCR gerekli mi?

Görsel retrieval sinyali için hayır. Her sayfayı görüntü olarak render edin ve belge şeklinde encode edin. OCR veya çıkarılmış metin; filtreleme, alıntılama, erişilebilirlik ve yedek arama açısından yine yararlıdır.

0.6B modeli, 9B ile oluşturulmuş bir indeksi sorgulayabilir mi?

Perplexity'nin model kartı, iki modelin ortak embedding alanını paylaştığını ve bu düzeni desteklediğini belirtiyor. Kart, modeller arası retrieval farkı yayımlamadığı için kendi corpus'unuzdaki kaliteyi ölçün.

Metin ve görüntü sayfaları aynı batch'te işlenebilir mi?

Hayır. Model kartı, karma metin ve görüntü girdilerinin aynı encoding batch'inde desteklenmediğini söylüyor. Metin ve görüntü encoding çağrılarını homojen tutun.

Hâlâ reranker kullanmam gerekir mi?

Otomatik olarak gerekmez. MaxSim zaten late-interaction skorlama yöntemi; ancak büyük bir corpus'ta her sayfa-token vektörünü taramak yerine dense ilk aşama retriever'ı ile v2-late reranking'i birleştirmek daha pratik olabilir.

PDF sayfası başına net depolama maliyeti nedir?

Perplexity, v2-late için sayfa düzeyinde depolama hesaplayıcısı yayımlamıyor. Saklanan sayfa token'ı sayısı, vektör hassasiyeti, metadata ve indeks sıkıştırmasına göre tahmin yapın; ardından bunu temsil niteliği taşıyan bir örnekle doğrulayın.

0.6B mi, 9B mi seçmeliyim?

Offline indeksleme kalitesi önceliğinizse ve model ile indeksleme işinin maliyetini karşılayabiliyorsanız 9B'yi kullanın. Daha küçük bir kurulum veya sorgu encoder'ı için, 9B indeksiyle dokümante edilmiş ortak alan düzeni dahil olmak üzere 0.6B'yi tercih edin. Benchmark farkı ölçülebilir, ancak model kartı evrensel bir kalite ya da gecikme kuralı sunmuyor.

Go/no-go kontrolü kısa: Bugün bilinen fiyatlı yönetilen bir Perplexity endpoint'ine ihtiyacınız varsa v2-late bu gereksinim için hazır değil. Self-hosting yapabiliyorsanız ve PDF'leriniz OCR'ın veya metin parçalamanın kaybettiği bilgiler içeriyorsa, ölçeklemeden önce temsil niteliği taşıyan bir sayfa kümesini render edip late-interaction pipeline'ını benchmark edin.