Muse Spark 1.2 için kısa karar
Meta, Muse Spark 1.2'yi 5 Ağustos 2026'da daha güçlü kodlama test sonuçları ve bu model için geliştirilmiş yeni terminal ajanı Muse Code ile yayınladı. İlerleme gerçek, ancak Claude Opus 5 karşısındaki tablo değişmiş değil: model üç kodlama karşılaştırmasının tamamında geride kaldı. Meta, kodlama eğitimine ayrılan hesaplama gücünü artırdı ve modeli Muse Code ajanıyla birlikte eğitti; bunun etkisi sonuçlara yansıdı. Yine de sürümler arasındaki sıçramanın bir kısmı yalnızca modelden değil, yeni test koşumundan geliyor. Terminal-Bench, DeepSWE ve Meta'nın kendi dahili kodlama değerlendirmesinde Anthropic'in modeli hâlâ 4 ila 9 puan önde.
Buna rağmen Muse Spark 1.2'yi ilgi çekici kılan fiyatı. Standart ücretlendirme milyon token başına $1.25/$4.25 seviyesinde kaldı; contributor katmanı ise bunu yaklaşık 12 kat daha aşağı çekiyor. Ancak varsayılan seçenekte kodunuz Meta'nın eğitim verisine dahil ediliyor. Ayrıca en yüksek muhakeme düzeyinde ilk token'a ulaşma süresi yaklaşık dokuz kat uzamış durumda. Muse Spark 1.2'yi üretim ortamındaki kodlama işleri için değerlendiriyorsanız, liderlik tablosundaki sıradan çok bu iki ayrıntıya odaklanmalısınız.
1.1'den bu yana neler değişti?
Muse Spark 1.2, Meta'nın ileri seviye muhakeme modelinin kodlamaya odaklanan güncellemesi. 5 Ağustos'ta, şu anda beta aşamasındaki terminal tabanlı kodlama ajanı Muse Code ile birlikte çıktı. Meta bile bunu Muse Spark 1.1 için "orta ölçekli bir iyileştirme" olarak tanımlıyor. Bu temkinli ifade yerinde; güncelleme özellikle kodlama ajanlarının zorlandığı çok dosyalı yeniden düzenlemeler, uzun hata ayıklama oturumları ve tek bir istemin ötesine geçen görevlerde kazanım sağlamayı hedefliyor.
Bu artışın arkasında iki eğitim tercihi var. İlki, Muse Code'un ilk günden itibaren eğitim döngüsünde yer alması. Meta, modeli rejection-sampled harness trajectories ile Muse Code ajanıyla birlikte eğitti; yani model, kendi ajanı içinde en iyi sonucu verecek şekilde ayarlandı. Şirket eğitimde birden fazla koşum kullandığını, dolayısıyla modelin diğer kodlama araçlarına da uyum sağlayabildiğini belirtiyor. İkinci unsur ise öz-iyileştirme döngüsü: Muse Spark 1.1, zorlayıcı kodlama ortamları ve talimat takibi şablonları oluşturdu; aday çözümler bunlara göre değerlendirildi ve 1.2'nin eğitim verisi böyle üretildi. Meta'ya göre bu süreç, 1.2'nin karmaşık talimatları izleme becerisini ölçülebilir biçimde geliştirdi.
Güncelleme, Muse ailesinin zayıf kaldığı noktayı hedefliyor. Muse Spark Nisan 2026'da tanıtıldığında ajan tabanlı kodlamada gerideydi: SWE-Bench Verified'da Claude Opus 4.6'nın 80.8 puanına karşı 77.4 almıştı. Kodlamaya özel bir kontrol noktası ve amaca yönelik bir koşum, bu açığa doğrudan yanıt verirken genel ajan yetenekleri de korunuyor.
Test sonuçlarını doğru okumak
Muse Code üzerinde çalışan Muse Spark 1.2, Terminal-Bench 2.1'de %82.9 aldı. Bu sonuç, Codex içindeki GPT-5.6 Terra'nın %81.8'ini ve Grok Build içindeki Grok 4.5'in %81.6'sını az farkla geçiyor. Ancak Claude Code'da maksimum eforla çalışan Claude Opus 5, %86.7 ile lider. DeepSWE 1.1'de Muse Spark 1.2'nin puanı %59.3; Opus 5'in %65.0'ı ve GPT-5.6 Terra'nın %64.8'inin ardından üçüncü sırada. Üçü içinde en açık sözlü tablo Meta'nın dahili kodlama testinde görülüyor: Muse Spark 1.2'nin %70.6'sı, GPT-5.6 Terra'yı (%65.4) ve Gemini 3.6 Flash'ı (%63.9) geçiyor, fakat Opus 5'in %79.4'ünün yaklaşık dokuz puan altında kalıyor. Claude üç grafiğin de zirvesinde.
Nesil değişimindeki gelişme ise net: Muse Spark 1.2, Terminal-Bench'te 1.1'i 6.7 puan, DeepSWE'de ise 6.3 puan geride bırakıyor. Ancak sürümleri karşılaştırırken grafik etiketlerindeki bir ayrıntıyı unutmamak gerek. 1.1 puanları genel amaçlı mini-swe-agent koşumunda ölçülürken, 1.2 Muse Code içinde çalıştırıldı. Dolayısıyla sıçramanın bir bölümü yeni koşumdan, yalnızca yeni modelden değil. Artificial Analysis'in bileşik Intelligence Index değerlendirmesinde 1.2, sınıf medyanı 32 iken 54 puanla 186 model arasında 14. sırada. Bu, 1.1'in 51 puanına göre daha sınırlı bir yükseliş; kodlama grafiklerinin ima ettiğinden daha sakin bir tablo.
Alıcıların sürekli sorduğu soru Claude ve GPT ile doğrudan karşılaştırma. 1.2 verileri ortaya çıkmadan önce Reddit'te bir geliştirici bunu şöyle özetlemişti:
"Meta'nın MUSE Spark 1.1'ini kullanan oldu mu? Muhakeme, kodlama, hız, doğruluk ve bağlam yönetiminde Claude ve GPT ile nasıl karşılaştırıldığını merak ediyorum."
1.2 testleri, bu soruya verilen ilk ciddi yanıt niteliğinde: Rekabetçi bir model; kodlamada açık biçimde ikinci sırada ve çoğu grafikte GPT-5.6 ile Gemini seçeneklerinin önünde.
Üretim kullanımını belirleyen iki kritik nokta
Muse Spark 1.2'nin gerçek bir iş akışına uyup uymayacağını iki pratik ayrıntı belirliyor. Liderlik tablolarında ikisini de göremezsiniz.
xhigh düzeyindeki gecikme sorunu
Muse Spark bir muhakeme modeli; yanıt vermeden önce düşünüyor ve bu davranışı kapatamıyorsunuz. /effort ayarı minimalden xhigh'a uzanan beş seviye sunuyor; düşünme token'ları da çıktı olarak ücretlendiriliyor. En üst seviyede maliyet iki açıdan yükseliyor. OrcaRouter'ın yayımladığı bağımsız ölçümlerde, xhigh düzeyinde ilk token'a ulaşma süresi 1.1'deki 2.90 saniyeden 26.12 saniyeye çıktı; yani yaklaşık dokuz kat uzadı. Çıktı hızı da saniyede 213.5 token'dan 165.0 token'a düştü. Artificial Analysis Intelligence Index değerlendirmesini 1.2 ile çalıştırmanın maliyeti, modelin daha fazla düşünmesi nedeniyle 1.1'deki $548.07'den %16 artışla $637.85 oldu. Geliştiricinin yanıt beklediği etkileşimli kodlama işlerinde maksimum efor, çoğu zaman doğruluk karşılığında kabul edilemeyecek bir gecikme yaratıyor.
Contributor katmanında indirim karşılığı kodunuz
Meta, Muse Spark 1.2 için iki fiyat katmanı sunuyor ve yeni kullanıcıları yönlendirdiği seçenek belirli bir koşula bağlı. Contributor katmanı, milyon giriş/çıkış token'ı için $0.10/$0.20 talep ediyor; standart katmandaki $1.25/$4.25 ile karşılaştırıldığında girişte yaklaşık 12 kat, çıktıda 21 kat daha ucuz. Önbellekten gelen girişin bedeli ise $0.002 ile neredeyse sıfır. Karşılığında Meta'ya istemlerinizi ve model yanıtlarını gelecekteki modellerini eğitmek için kullanma izni veriyorsunuz. Yukarıdaki karşılaştırmadaki en düşük ücret bu katmanda, ancak farkı verinizle ödüyorsunuz.
Muse Code'un varsayılan başlangıç akışı geliştiricileri bu katmana yerleştiriyor. VentureBeat'in aktardığı testte, tek satırlık kurulum aracı Mac mini üzerinde çalıştı; 97 MB'lık indirme ve oturum açma yeterliydi. Ancak ajan görünür model olmadığını bildirerek herhangi bir işlem çalıştırmadı ve indirimli katmanda bile ödeme yöntemi istedi. Düşük maliyetli olduğu doğru, ücretsiz olduğu değil. İstek sınırı da daha sıkı: standart katmanda dakikada 3,000 istek varken burada 60 istekle sınırlı. Bu da katmanın üretimden çok bireysel kullanım ve prototipleme için tasarlandığını açıkça gösteriyor. Özel kod tabanlarıyla çalışan ekiplerin standart fiyatlandırmaya bilinçli biçimde geçmesi ya da Meta satış ekibi üzerinden sıfır veri saklama talep etmesi gerekiyor.
Fiyat tablosunda Muse Spark'ın yeri
Muse Spark 1.2'nin standart katmanı; milyon giriş token'ı için $1.25, önbelleğe alınmış giriş için $0.15, çıktı için $4.25, 1M token bağlam penceresi ve uzun bağlam ek ücreti olmamasıyla kodlama modeli pazarının alt-orta bölümünde konumlanıyor. Kodlama tarafındaki üst seviye liderlerden belirgin biçimde ucuz: Claude Opus 5'in $5/$25 ve GPT-5.5'in $5/$30 fiyatları, çıktı tarafında yaklaşık 4 ila 7 kat daha yüksek. Z.ai'nin $1.40/$4.40 fiyatlı GLM-5.2 modeliyle neredeyse aynı sınıfta; $2/$6 seviyesindeki Grok 4.5'in ise altında. Pazarın en ucuz bölümünde yer alan DeepSeek V4 Pro, $0.435/$0.87 ile Muse Spark'ı birkaç kat geride bırakıyor; Muse Spark contributor katmanı da aynı şekilde daha düşük maliyetli.
| Model | Giriş $/M | Çıkış $/M | Önbellek $/M | Bağlam |
|---|---|---|---|---|
| Muse Spark 1.2 (standart) | 1.25 | 4.25 | 0.15 | 1M |
| Muse Spark 1.2 (contributor)* | 0.10 | 0.20 | 0.002 | 1M |
| Claude Opus 5 | 5.00 | 25.00 | — | — |
| GPT-5.5 | 5.00 | 30.00 | — | — |
| GLM-5.2 | 1.40 | 4.40 | — | — |
| Grok 4.5 | 2.00 | 6.00 | — | — |
| DeepSeek V4 Pro | 0.435 | 0.87 | — | — |
\*contributor katmanı Meta'ya verinizle eğitim yapma hakkı tanır; sınır dakikada 60 istektir.
Nereden erişilir, bugün ne kullanılabilir?
Muse Spark 1.2'ye üç kanaldan erişilebiliyor: Meta Model API, Muse Code terminal ajanı ve OpenRouter. Henüz tüm toplayıcı platformlarda yer almıyor; 6 Ağustos 2026'da kontrol edilen AIReiter kataloğunda model listelenmiyor. Altyapınız birleşik bir API üzerinde çalışıyorsa ve bugün bir kodlama modeline ihtiyacınız varsa, seçiminiz mevcut yönlendirmelerle sınırlı.
Şu anda erişilebilen en yakın fiyat alternatifi, $1.40/$4.40 seviyesindeki GLM-5.2. 6 Ağustos 2026'da, "bugün erişilebilir" seçeneğinin ne sunduğunu görmek için platformun API'si üzerinden yönlendirilen glm-5.2 ile tek seferlik bir kodlama-muhakeme görevi çalıştırdım: eksi bakiye kontrolü eksik bir Python para çekme fonksiyonu. GLM-5.2, 3.2 saniyede yanıt verdi (85 istem, 128 tamamlama token'ı); eksik bakiye kontrolünü doğru tespit etti, çözümü üretti (if amount > 0 and account_balance >= amount:) ve düzeltmeden önce başarısız olup sonrasında geçen bir test yazdı. Bu tek görev bir benchmark değil; ancak aynı fiyat aralığında, şu an çağrılabilen çalışan bir kodlama modeli olduğunu gösteriyor. DeepSeek V4 Pro, Kimi K3, Claude Sonnet 5 ve GPT-5.6 ailesi de AIReiter kataloğunda bulunan kodlama yetenekli seçenekleri tamamlıyor.
Muse Spark 1.2 kullanılmalı mı?
Karar, hangi önceliğe göre seçim yaptığınıza bağlı olarak üçe ayrılıyor.
Muse Spark 1.2'yi seçin: Fiyat hassasiyetinin yüksek olduğu geniş ölçekli kodlama işleri yapıyorsanız; yani büyük çok dosyalı yeniden düzenlemeler, uzun hata ayıklama oturumları veya uzun soluklu ajan görevleri yürütüyorsanız ve Meta, Muse Code ya da OpenRouter üzerinden doğrudan çalışmaya açıksanız. $1.25/$4.25 fiyatıyla orta seviye maliyet karşılığında üst düzey kodlama yeteneği sunuyor. Bağlam sıkıştırmalı 1M token bağlam penceresi de tek istemi aşan işler için uygun. Göreviniz 26 saniyelik ilk token süresini tolere etmiyorsa muhakeme eforunu xhigh altında tutun.
Claude Opus 5'i seçin: Kodlama testlerinde en üst sonucu istiyorsanız. Muse Spark 1.2'nin yer aldığı üç benchmarkın tamamında lider. Bu doğruluk avantajı için token başına 4 ila 6 kat daha fazla ödeme yaparsınız.
Toplayıcınızda zaten bulunan bir modeli seçin: Bugün ürün çıkarmanız gerekiyorsa ve Muse Spark platformunuzda yoksa. GLM-5.2, beklemeden aynı fiyat katmanını sunuyor; maliyetin her şeyden önemli olduğu yerlerde DeepSeek V4 Pro daha da ucuz.
SSS
Muse Spark 1.2, kodlamada Claude Opus 5'ten daha mı iyi?
Hayır. Claude Opus 5, Meta'nın yayımladığı üç kodlama benchmarkının tamamında — Terminal-Bench 2.1, DeepSWE 1.1 ve Meta'nın dahili kodlama değerlendirmesi — 3.8 ila 9 puan farkla önde. Muse Spark 1.2 net biçimde ikinci sırada; çoğu grafikte GPT-5.6 Terra ve Gemini 3.6 Flash'ın önünde bulunuyor.
Muse Spark 1.2 açık kaynak mı?
Hayır. Meta'nın Llama ailesinin aksine Muse Spark tescilli bir model: yalnızca bulutta sunuluyor, indirilebilir ağırlıkları yok ve kendi altyapınızda barındıramıyorsunuz. Mark Zuckerberg olası açık kaynak yayınları için "paylaşacak daha fazla şeyi" olacağını söyledi, ancak 1.2 herhangi bir ağırlık veya lisansla gelmiyor.