AIREITER

Çeviri için En İyi LLM: 6 Modeli Test Ettik, 2'si 10 Kat Daha Pahalı

Son Güncelleme: 2026-07-29 12:15:19

17 Temmuz 2026'da altı modeli karşılaştırdık ve sonuç net: üslup ve marka dili için Claude Sonnet 5, yüksek hacimli işler için 1.000 görevde yaklaşık $0.10 maliyetle DeepSeek V4 Flash, hız ve genel denge içinse GPT-5.6 Terra öne çıkıyor.

Her modelin API'sine aynı üç çeviri istemini gönderdik, ardından ham çıktıları karşılaştırdık. Asıl şaşırtan kalite değildi. Altı modelin tamamı teknik Almancayı doğru çevirdi; altı modelden beşi, öznenin sıkça atlandığı Japonca diyalog testini tek hata yapmadan geçti. Sürpriz maliyetteydi: Kâğıt üzerinde "ucuz" görünen iki model, istek başına o kadar fazla akıl yürütme tokenı harcadı ki çeviri başına Claude'dan 8–10 kat daha pahalıya geldi. Böylece karakter bazlı DeepL ücretlerine de epey yaklaştılar.

2026'da çeviri için en iyi LLM'i seçerken mesele artık hangi modelin çeviri yapabildiği değil; hepsi yapabiliyor. Asıl mesele, içerik türünüze ve hacminize uygun modeli, fark ettirmeden bütçeyi şişirmeden bulmak.

Hangi çeviri işi için hangi model?

İş yükünüzTercihNedenÖlçülen 1.000 görev maliyeti
Pazarlama metinleri, marka diliClaude Sonnet 5Çeviri gibi değil, hedef dilde baştan yazılmış gibi okunuyor~$1.06
Yüksek hacim: ürün akışları, dokümanlar, altyazılarDeepSeek V4 FlashÜç testin tamamında doğru sonuç verdi ve açık ara en ucuzuydu~$0.10
Karma iş yükleri, en düşük gecikmeGPT-5.6 Terra3.0–4.3 sn yanıt süresi, en temiz biçimlendirme~$0.88
Sözlük zorunluluğu, CAT aracı iş akışlarıDeepLLLM API'lerinde bulunmayan terim bankaları ve entegrasyonlar sunuyor1M karakter başına $27.50

Maliyetler, üç test görevimizin ortalamasıdır: çıktı tokenları resmi Temmuz 2026 fiyatlarıyla hesaplandı ve 1.000 kısa çeviriye uyarlandı. Ayrıntılı ölçüm tablosu aşağıda. Test dışında kalan bir alan da var: canlı sesli konuşmalar için Google, 1 milyon token başına $3.50/$21 fiyatlı, amaca özel Gemini 3.5 Live Translate varyantı sunuyor. Buna değindik ancak test etmedik.

Testi nasıl yaptık?

17 Temmuz 2026'da, her model için aynı ifadelerle üç istemi birer kez çalıştırdık: İngilizce→Japonca pazarlama metni ile üslubu, İngilizce→Almanca API dokümantasyonu ile terminolojiyi, Japonca→İngilizce gündelik diyalog ile de atlanan özneleri ve bağlamı test ettik. Son test, CJK dil çiftlerinde sık görülen klasik hata türlerinden birini hedefliyordu. CJK; makine çevirisi kalitesiyle ilgili şikâyetlerin yoğunlaştığı Çince, Japonca ve Korece için kullanılan kısaltma.

Testte yer alan modeller şunlardı: GPT-5.6 Terra, Claude Sonnet 5, DeepSeek V4 Flash, DeepSeek V4 Pro, GLM-5.2 ve Kimi K2.6. Tüm çağrıları varsayılan ayarlarla aynı gateway hesabı üzerinden yaptık. Bu nedenle gecikme değerleri modeller arasında karşılaştırılabilir; ancak bölgenize ve sağlayıcı yoğunluğuna göre değişebilir.

Kendiniz de yeniden çalıştırabilmeniz için üç kaynak metni aynen paylaşıyoruz:

EN→JA (pazarlama): "Fikirlerinizi daha hızlı hayata geçirin. Platformumuz angarya işleri üstlenir; ekibiniz de önemli olana odaklanabilir." EN→DE (teknik): "Bir istek hız sınırını aşarsa API, 429 durum kodu döndürür. Üstel geri çekilme ile yeniden deneyin ve Retry-After başlığına uyun. İdempotency anahtarları, yeniden deneme başarılı olduğunda yinelenen ücretlendirmeleri önler." JA→EN (diyalog): 「昨日の件、もう部長に話した?」「いや、まだ。タイミング見て言うつもりだけど、たぶん怒られるだろうな。」「先に根回ししといたほうがいいって。うちの部長、後から聞かされるの一番嫌がるから。」

Model ve görev bazında tüm ölçümler aşağıda. Gecikme, gerçek geçen süreyi saniye cinsinden; token sayısı ise usage nesnesindeki çıktı tokenlarını gösteriyor:

ModelEN→JAEN→DEJA→ENOrtalama görev maliyeti
GPT-5.6 Terra3.0s / 464.3s / 673.2s / 63$0.00088
Claude Sonnet 53.5s / 604.0s / 1463.5s / 111$0.00106
DeepSeek V4 Flash5.2s / 4214.3s / 3714.7s / 323$0.00010
DeepSeek V4 Pro16.5s / 76918.0s / 98919.6s / 946$0.00078
GLM-5.230.8s / 1,90629.0s / 1,59035.2s / 1,985$0.00804
Kimi K2.619.6s / 2,84948.5s / 2,23523.6s / 2,413$0.01000

Görev başı maliyet = çıktı tokenları × sağlayıcının resmi çıktı fiyatı. Girdi tarafı görev başına 60–110 token seviyesinde ve GPT-5.6 Terra fiyatlarıyla bile $0.0003'ün altında ek maliyet yaratıyor. Aşağıdaki milyon karakter başı grafiğe bu tutar da dahil. Tüm fiyatlar, hesabımıza uygulanan indirimli fiyatlar değil, 17 Temmuz 2026 itibarıyla resmi liste fiyatlarıdır.

Üç görevlik hızlı bir kontrol, 100 dil çiftinde model sıralaması yapmaya yetmez; zaten böyle bir iddiamız yok. Ancak küçük örneklemde bile ayakta kalan farkları ortaya çıkarabilir. Buradaki farklar da büyüktü.

Test 1: İngilizce→Japonca pazarlama metni

İstemimiz, şu SaaS açılış sayfası cümlesini doğal ve kibar Japoncayla çevirmeyi istiyordu: "Ship your ideas faster. Our platform handles the busywork so your team can focus on what matters."

Claude Sonnet 5 şu metni yazdı:

アイデアを、もっとスピーディーにカタチへ。面倒な作業はプラットフォームにお任せください。

Bu, Japon bir metin yazarının kullanacağı kayıt. "Şekil" anlamındaki カタチ sözcüğünün stilize katakana yazımı ve virgüllerle kurulan ritim, ders kitabı gramerinden çok açılış sayfası geleneğine ait. GPT-5.6 Terra ve DeepSeek V4 Pro da temiz, kurumsal tonlu çevirilerle hemen arkasından geldi: 「アイデアを、より迅速に形に。」

Altı model arasında en kelimesi kelimesine yaklaşan DeepSeek V4 Flash oldu: 「アイデアをより速く実現しましょう。当社のプラットフォームが雑務を代行するため…」Dilbilgisi açısından sorun yok, ancak çeviri olduğu hissediliyor. Ürün sayfasında insan eliyle son rötuş istersiniz. Destek makaleleri veya kurum içi dokümanlarda ise rahatlıkla kullanılabilir.

Buradaki fark gerçek ama dar: altı modelin tamamı kullanılabilir Japonca üretti. Claude için 1.000 görevde yaklaşık $1 fazladan ödeme, özellikle marka dili çalışmalarında karşılığını veriyor. Testlerimizin başka hiçbir bölümünde bu kadar belirleyici olmadı.

Test 2: İngilizce→Almanca teknik dokümantasyon

API dokümantasyonundan iki cümleyi çevirdik: hız sınırları, HTTP 429, üstel geri çekilme ve idempotency anahtarları. Altı modelin tamamı teknik terimleri doğru kullandı; yine tamamı Almanca teknik dokümanlarda yerleşik kullanımlara uydu: Ratenlimit, Statuscode 429, exponentielles Backoff, Idempotenzschlüssel.

Göze çarpan tek fark, GPT-5.6 Terra'nın Retry-After ifadesini kod biçiminde vermesiydi. Gerçek Almanca API dokümanlarında başlık adları da bu şekilde dizilir. Hoş bir ayrıntı, kalite farkı değil.

Kaynakları güçlü Avrupa dilleri arasındaki standart dokümantasyon metinlerinde örneklemimizde hiçbir model hata üretmedi. Bu nesilde kalite farkları gözlemlenemeyecek kadar küçüktü. İş yükünüzün tamamı buysa seçimi kaliteye göre değil, fiyat ve hıza göre yapın. Bu da milyon token başına $0.14 girdi / $0.28 çıktı fiyatıyla DeepSeek V4 Flash'ı varsayılan tercih haline getiriyor.

Test 3: Atlanan özneler içeren Japonca→İngilizce diyalog

Japoncada cümlenin öznesi rutin olarak atlanır; çevirmenin kimin ne yaptığını bağlamdan çıkarması gerekir. Test diyaloğumuzda ayrıca doğrudan İngilizce karşılığı olmayan, resmi karar öncesinde sessizce fikir birliği oluşturmayı anlatan kültüre bağlı 根回し (nemawashi) ifadesi de vardı.

Altı modelden beşi her şeyi doğru ele aldı. Özneler doğru atandı; nemawashi için "lay the groundwork", "sound him out beforehand" veya "give him a heads-up" gibi savunulabilir karşılıklar kullanıldı. Claude'un sürümü en doğal İngilizce diyalog hissini verdi: "he's probably gonna chew me out".

Toplam 18 çıktıdaki tek gerçek hata DeepSeek V4 Pro'dan geldi. Model, sırada ne yapılması gerektiğine dair tavsiye olan 「先に根回ししといたほうがいい」 ifadesini "You should've laid the groundwork first" diye çevirdi. Yani henüz yapılacak bir şey için öneriyi, kaçırılmış bir fırsata ilişkin geçmiş zaman pişmanlığına dönüştürdü. Küçük sözcükler, zıt anlam. Bir iş arkadaşınız birini söyleyip siz diğerini anlarsanız, farklı hareket edersiniz.

Tek çalıştırmada görülen tek zaman hatası, model hakkında kesin hüküm vermeye yetmez; iki DeepSeek katmanını DeepSeek V4 Flash vs Pro comparison yazımızda daha ayrıntılı karşılaştırıyoruz. Yine de akıcılık ile sadakatin farklı özellikler olduğunu iyi hatırlatıyor: cümle kusursuz görünebilir ama yanlış anlama gelebilir. Sözleşmeler, tıbbi içerikler veya zamanın yanlış yorumlanmasının para kaybettireceği her işte, hangi modeli seçerseniz seçin insan kontrolü için bütçe ayırın.

Token tüketimi tuzağı: Liste fiyatı neden yanıltır?

Satın alma kararını değiştiren bulgu bu. Milyon çıktı tokenı başına GLM-5.2 $4.40, Kimi K2.6 ise $4.00 tutuyor; ikisi de Claude Sonnet 5'in $10 fiyatının yarısından az. Fakat gerçek çeviri başına maliyetleri 8–10 kat daha yüksekti.

1.000 kısa çeviride ölçülen maliyeti gösteren yatay çubuk grafik: Kimi K2.6 $10.00, GLM-5.2 $8.04, Claude Sonnet 5 $1.06, GPT-5.6 Terra $0.88, DeepSeek V4 Pro $0.78, DeepSeek V4 Flash $0.10

Mekanizma basit: her iki model de yanıt vermeden önce görünür bir akıl yürütme zinciri çalıştırıyor ve bu tokenlar çıktı olarak ücretlendiriliyor. Kimi K2.6, tek bir pazarlama cümlesini çevirirken 40–60 tokenlik çeviri için 2,849 çıktı tokenı üretti; GLM-5.2 ise 1,906 token harcadı. Aynı görevde Claude Sonnet 5 60, GPT-5.6 Terra 46 token kullandı.

Gecikme de aynı örüntüyü izledi. GPT-5.6 Terra ve Claude Sonnet 5, üç görevin tamamında 3–4 saniyede yanıt verdi. DeepSeek V4 Flash 4–5 sn sürdü; DeepSeek V4 Pro 16–20 sn, GLM-5.2 ve Kimi K2.6 ise istek başına 20 ila 48 saniye aralığında kaldı.

Buradan iki pratik kural çıkıyor. Birincisi, çeviri gibi kısa ve yüksek hacimli işlerde modelleri liste fiyatıyla değil, ölçülmüş görev başı maliyetle karşılaştırın: 20 istek çalıştırın, usage alanını inceleyin. İkincisi, çeviride akıl yürütmeyi kapatın ya da azaltın. DeepSeek, thinking ve non-thinking uç noktalarını ayırıyor; GLM ve Kimi ise istek gövdesinde thinking parametreleri sunuyor. Üç görevimizde akıl yürütme zinciri çıktı kalitesine ölçülebilir hiçbir katkı sağlamadı.

Hacim arttığında çeviri maliyeti

Ölçülen token tüketimini 1 milyon karakterlik İngilizce kaynak metne, yani yaklaşık 250.000 tokene ölçeklediğinizde fark dramatikleşiyor:

Bir milyon karakteri çevirme maliyetini gösteren yatay çubuk grafik: DeepL API Growth aşım ücreti $27.50, Kimi K2.6 $24.20, GLM-5.2 $19.05, GPT-5.6 Terra $4.38, Claude Sonnet 5 $3.90, DeepSeek V4 Pro $1.98, DeepSeek V4 Flash $0.28

DeepSeek V4 Flash, bir roman hacmindeki metni yaklaşık $0.28 karşılığında çevirebiliyor. Aynı hacim, DeepL API'de Growth planı aşım fiyatıyla $27.50 tutuyor; arada 98 kat fark var. Bu sonuç, daha küçük self-hosted modeller sayesinde daha yüksek bir çarpana ulaşan ve "LLMs are 800x cheaper for translation than DeepL" başlığıyla geniş kitlelere ulaşan r/LocalLLaMA analizinin yönüyle de örtüşüyor.

Grafiğin üst kısmına dikkat edin: ölçülen token tüketiminde, akıl yürütme ağırlıklı açık ağırlıklı modeller DeepL ile aralarındaki farkı neredeyse kapatıyor. Token ölçümü olmadan birim fiyat, maliyet tahmini değildir.

Taahhüt vermeden önce bilmeniz gereken ve 17 Temmuz 2026'da doğruladığımız üç fiyatlandırma ayrıntısı:

  • DeepL'in ücretsiz katmanı değişti. API Developer planı artık eski dokümanlarda ve forum yanıtlarında hâlâ göreceğiniz aylık 500.000 karakter kotası yerine, tek seferlik 1.000.000 karakter kredisi veriyor. Growth planı yıllık faturalandırmayla aylık $26; yıllık 12M karakter dahil, sonrasında ek her milyon karakter $27.50.
Developer ücretsiz katmanını, aylık $26 Growth planını ve özel fiyatlı Enterprise seçeneğini gösteren DeepL API fiyatlandırma sayfası
  • DeepSeek, diğerlerinin çok altında ücret alıyor. V4 Flash için milyon token başına $0.14 girdi / $0.28 çıktı; önbellek isabetli girdide bu fiyat $0.0028'e düşüyor. Eski deepseek-chat model adı 24 Temmuz 2026'da kullanımdan kalkıyor.
V4 Flash ve V4 Pro token fiyatlarını gösteren DeepSeek API fiyatlandırma sayfası
  • Claude Sonnet 5 tanıtım fiyatıyla sunuluyor. 31 Ağustos 2026'ya kadar milyon token başına $2/$10, sonrasında $3/$15. Yeni tokenizer'ı aynı metin için yaklaşık %30 daha fazla token üretiyor; maliyet hesabımıza bunu da dahil ettik. Eylül sonrasını planlıyorsanız her iki durumu da bütçelendirin.
  • Batch API'leri faturayı yarıya indiriyor. OpenAI, Anthropic ve Google, eşzamansız toplu işlemler için yaklaşık %50 indirim veriyor. Çeviri işleri genellikle gecikmeye duyarlı değildir; dolayısıyla bu fiilen bedava tasarruf demek. Batch fiyatıyla GPT-5.6 Terra milyon karakter başına ~$2.19'a, Claude Sonnet 5 ise ~$1.95'e düşüyor.

DeepL veya Google Translate ne zaman daha mantıklı?

Karakter başı maliyette LLM'ler avantajlı, ancak üç ihtiyaç hâlâ geleneksel çözümleri öne çıkarıyor:

  • Zorunlu terminoloji kullanımı. DeepL, bir terimin her seferinde aynı şekilde çevrilmesini garanti eden sözlükler ve terim bankaları sunuyor. LLM'e bunu istem olarak verip doğrulamanız gerekir; bu garanti değil, olasılıksal bir yaklaşımdır.
  • CAT aracı ve iş hattı entegrasyonları. Çeviri belleğiniz bir CAT (computer-assisted translation) aracında yaşıyorsa, DeepL bağlayıcıları doğrudan entegre olur.
  • Ölçekte saniyenin altındaki gecikme. Geleneksel sinirsel makine çevirisi motorları, genel amaçlı LLM'lerden tipik olarak daha hızlı yanıt verir. Satır içi arayüz çevirilerinde bu önemlidir.

Canlı ses için ne klasik NMT ne de sohbet LLM'i doğru araç. Google, dakikalık ses ücretlerine ek olarak milyon token başına $3.50/$21 fiyatlandırdığı özel Gemini 3.5 Live Translate varyantını sunuyor. Bunu Gemini 3.5 Live Translate breakdown yazımızda ele aldık.

Nadir ve düşük kaynaklı dillerde kalite sıralamasından önce kapsam gelir: herhangi bir karşılaştırmaya geçmeden, dil çiftinizin desteklenip desteklenmediğini kontrol edin. DeepL yaklaşık 30 dili destekliyor; büyük LLM'ler yüzün üzerinde dili işliyor, ancak listenin sonlarına doğru kalite düşüyor.

Açık kaynak ve yerel seçenekler

GLM-5.2 ile Kimi'nin K serisi açık ağırlıklar yayımlıyor. Bu nedenle yukarıdaki token tüketimi sorunu self-hosting ile çözülebilir: örnekleme ayarlarını siz kontrol eder, akıl yürütme zincirlerini tamamen kapatırsınız.

Tek GPU'lu yerel çeviri için Qwen3-30B-A3B, özellikle Avrupa dillerinden İngilizceye çeviride yerel çeviri modelleri hakkındaki r/LocalLLaMA başlıklarında sürekli önerilen model. Dil çifti daha sıra dışı hale geldikçe daha büyük modeller tavsiye ediliyor. Bu tercih genellikle kalite yerine gizlilikten, yani sözleşmeler ve henüz duyurulmamış ürünlerden, ya da sıfır marjinal maliyetten kaynaklanıyor. Aynı başlıklarda barındırılan frontier modellerin çeviride hâlâ daha iyi olduğu da belirtiliyor.

Takip etmeye değer bir gelişme: Kimi K3, bu hafta açık ağırlıklarla ve barındırılan kullanımda milyon token başına $3/$15 fiyatla yayınlandı. K3 API erişimi hâlâ kademeli açıldığı için K2.6'yı test ettik. K3, K serisinin token iştahını devralırsa aynı ölçülmüş maliyet uyarısı onun için de geçerli olacak.

Bu karşılaştırmayı kendiniz yapın

Yukarıdaki testin tamamını yaklaşık 20 API çağrısıyla yeniden üretebilirsiniz: kendi içeriğinizden iki cümle seçin, bunları aday modellere gönderin ve gerçek token sayılarını görmek için her yanıttaki usage nesnesini okuyun. 18 istekten oluşan test çalıştırmamızın toplam maliyeti $0.15'in altındaydı.

Zor olan kısım, beş sağlayıcıdan altı API anahtarını yönetmek. Biz altı modelin tamamını, büyük model API erişimini tek Anthropic uyumlu uç noktanın arkasında yeniden satan bir AIReiter hesabı üzerinden çalıştırdık. Yani tek anahtar ve yukarıdaki tüm modeller için aynı wire formatı; Claude ailesi anahtarları da liste fiyatının yaklaşık beşte biri seviyesinde.

Çeviri hacminiz ciddiyse, kendi içeriğinizle bir saatlik hızlı kontrol yapmak, bu sıralama dahil her türlü genel sıralamadan daha değerlidir. Modeller kalite açısından birbirine yeterince yakın; kararı dil çiftiniz, ton gereksinimleriniz ve token ölçümleriniz vermeli.

SSS

Çeviri için ChatGPT mi Gemini mi daha iyi?

Testlerimizde GPT-5.6 Terra, üç görevin tamamında hızlı, doğru ve biçimlendirme açısından temizdi. Gemini'yi karşılıklı test etmedik; gateway'imizde yoktu. Ancak yayımlanmış fiyatları rekabetçi: 3.5 Flash için milyon token başına $1.50/$9. Ayrıca canlı ses çevirisine özel model sunan tek sağlayıcı da Google.

Şu anda en doğru yapay zekâ çevirmeni hangisi?

Kaynakları güçlü dil çiftlerinde frontier modeller arasındaki doğruluk farkları küçük. Test ettiğimiz altı modelin tamamı teknik Almancayı hatasız çevirdi. Farklar daha çok tonda, yani Japonca pazarlama metninde Claude'un öne çıkmasında, ayrıca atlanan özneler ve zamanlar gibi uç durumlarda yoğunlaşıyor. DeepSeek V4 Pro, örneklemimizdeki tek gerçek hatayı bu tür bir durumda yaptı.

Çeviri için en iyi açık kaynak LLM hangisi?

GLM-5.2 ve Kimi K2.6, ağırlıklarını yayımlıyor ve testlerimizde doğru çeviri üretti. Self-hosting, barındırılan API'lerini görev başına pahalı yapan akıl yürütme zincirlerini kapatmanıza izin veriyor. Tüketici donanımı için topluluğun yaygın önerisi Qwen3-30B-A3B.

LLM, insan çevirmenin yerini alabilir mi?

Kurum içi dokümanlar, destek içerikleri ve yüksek hacimli ürün metinleri için büyük ölçüde evet. Modele göre DeepL'in karakter başı maliyetinin %1–16'sında kalabiliyor: DeepSeek V4 Flash ~%1, Claude Sonnet 5 ~%14, GPT-5.6 Terra ~%16. Sözleşmeler, tıbbi metinler ve marka kampanyalarında ise Test 3'teki zaman hatası önemli bir uyarı. Akıcı çıktı yine de anlamı tersine çevirebilir; yanlış okumanın maliyetli olduğu yerlerde insan kontrolünü koruyun.

DeepL 2026'da hâlâ kullanmaya değer mi?

Evet, üç durumda: zorunlu sözlük kullanımı, CAT aracı entegrasyonu ve saniyenin altındaki gecikme. Bunların dışında karakter başı maliyeti savunmak zor. Ayrıca ücretsiz katmanın artık aylık değil, tek seferlik 1M karakter kredisi sunduğunu unutmayın.

İlgili içerikler