Fable Güvenlik Kalkanını Nasıl Aşarsınız (Ne İşe Yarar)

Son Güncelleme: 2026-07-16 08:26:48

"Fable 5'in güvenlik önlemleri bu mesajı işaretledi." Normal kod yazarken buna takıldıysanız, Fable 5'in sınıflandırıcısı üç alandan birinde bir anahtar kelime kalıbı yakalamıştır: biyoloji, siber güvenlik veya ML eğitimi.

Sınıflandırıcıyı devre dışı bırakamazsınız. Ancak doğru system prompt çerçevesi çoğu yanlış pozitif sonucu ortadan kaldırır. Fable 5 oturumlarının %95’i hiçbir zaman fallback’i tetiklemez. Bu kılavuz, onu neyin tetiklediğini, nasıl teşhis edeceğinizi ve isteklerinizi Fable 5’te tutan kod seviyesindeki stratejileri kapsar.

Fable 5'in Güvenlik Sistemi Ne Yapar

Fable 5 işaretli istekleri reddetmez. Bunları, niyet modellemesi ve bağlam ağırlıklandırması kullanarak ikinci bir değerlendirme için Opus 4.8’e yönlendirir. Bu yeniden yönlendirmeyi üç sınıflandırıcı kategorisi tetikler:

  • Biyoloji ve yaşam bilimleri — patojen araştırması, protein mühendisliği, kimyasal sentez yolları
  • Siber güvenlik ve saldırı amaçlı güvenlik — exploit geliştirme, güvenlik açığı analizi, sızma testi
  • ML eğitimi ve distilasyonu — frontier model ön eğitimi, dağıtık eğitim altyapısı, model ağırlığı çıkarımı

Bu kategoriler kasıtlı olarak fazla geniş tutulmuştur. Anthropic'in @ClaudeDevs hesabı şunu belirtti: "Güvenlik önlemlerini görünür kılmak, onların etrafından dolaşmayı kolaylaştırır; bu yüzden jailbreak girişimlerine karşı sağlam kalmalarını sağlamak, sınıflandırıcıları iyileştirirken ne yazık ki daha fazla yanlış pozitife yol açacaktır."

İşaretlendiğinizi Nasıl Anlarsınız

Fable 5'in iki farklı müdahalesi vardır.

Görünür Yedek

Açık bir mesaj görürsünüz ve isteğiniz bunun yerine Opus 4.8 tarafından karşılanır. Yine de bir yanıt alırsınız, ancak Opus 4.8 SWE-Bench Pro'da %69.2 puan alırken Fable 5 %80.3 alır.

Sessiz Bozulma

ML ile ilgili görevlerde, Fable 5 hiçbir bildirim olmadan yanıt kalitesini sessizce düşürebilir. Bu, sınır LLM ön eğitimini, dağıtık eğitim altyapısını ve ML hızlandırıcı tasarımını hedefler. Trafiğin yaklaşık %0,03’ünü etkiler, ancak siz o %0,03’ün içindeyseniz, çıktı bir politika engelinden ziyade model karmaşası gibi görünür.

İsteği hangi modelin karşıladığını doğrulamak için API yanıtınızdaki model alanını kontrol edin:

import anthropic

client = anthropic.Anthropic(api_key="your-key")
response = client.messages.create(
    model="claude-fable-5",
    max_tokens=1024,
    system="ML altyapı çalışmasına yardımcı oluyorsunuz.",
    messages=[{"role": "user", "content": "your prompt here"}]
)

# If this doesn't match what you requested, you were rerouted
print(f"Requested: claude-fable-5")
print(f"Served by: {response.model}")

Eğer sunulan model isteğinizden farklıysa, sınıflandırıcı müdahale etmiştir.

Meşru İşlerin Neden Engellendiği

Sınıflandırıcı niyeti değil, içeriği okur. Kendi kodunu denetleyen bir güvenlik araştırmacısı ile kötü amaçlı yazılım geliştiren biri aynı terminolojiyi kullanır. Her kategorinin kendine özgü bir yanlış pozitif deseni vardır:

Biyoloji: COMBINE-lab’dan bir araştırmacı, Fable 5’in RNA-seq analizi için bir Rust kütüphanesini yeniden yazmaya yardımcı olmasını sağlamak için 15-30 dakika harcadı. Kod biyolojik dizi işlemeyi referans alıyordu ve sınıflandırıcı her denemeyi işaretledi. Görev, biyolojik bir amaç taşımayan bir Rust portuydu, ancak alan söz varlığı bunun için yeterliydi.

Siber Güvenlik: Bir geliştirici, Fable 5’ten uygulamasını güvenlik açıkları açısından incelemesini istedi. Fable 5, sistemlerinde gerçekten kötü amaçlı yazılım buldu, ardından sınıflandırıcı etkileşimi işaretledi ve oturumu düşürdü. Model, bizzat keşfettiği tehdide yardımcı olmaktan engellendi.

ML/Distillation: Çevre bilimi araştırma istemleri engellenirken drone-sürü koordinasyon istemleri geçti. "ML training" için sınır, bitişik bilimsel bilişimi de kapsayacak kadar geniş.

Yanlış Pozitifleri Azaltan Dört Strateji

Sistem İsteminize Profesyonel Bağlam Ekleyin

Sınıflandırıcı, sistem isteminizi büyük ölçüde dikkate alır. Genel bir "You are a helpful coding assistant" ifadesi, ona meşru işi tehdit simülasyonundan ayırt etmesi için hiçbir sinyal vermez.

Bu sistem istemi biyografi sınıflandırıcısını geçer:

Bir üniversitenin genomik laboratuvarında çalışan bir biyoinformatik araştırmacısına yardımcı oluyorsunuz
. Çalışma, Rust ile standart RNA-seq iş akışı
geliştirmeyi içeriyor. Tüm biyolojik referanslar
halka açık referans genomlara ve standart
biyoinformatik dosya biçimlerine (FASTQ, BAM, VCF) aittir.

Bu, bunu tetikler:

Biyolojik dizilim verilerini işlememe ve protein yapılarını analiz etmeme yardımcı olun.

İlki, kim, hangi alan, hangi araçlar ve biyolojik referansların herkese açık verilerle kapsamını belirtir. İkincisi ise bağlam olmaksızın geniş biyolojik terminoloji kullanır.

Teknik Terminolojiyi Talimatlardan Ayırın

İsteminiz "tehlikeli" terminolojiyi doğrudan talimatlarla karıştırdığında, sınıflandırıcı bunu operasyonel olarak okur. Aynı terminoloji veri veya bağlam bloklarında göründüğünde ise bunu referans materyali olarak okur.

Bunun yerine:

Bu ağda güvenlik açıklarını taramak için kod yazın
ve kimlik doğrulama sistemindeki herhangi bir zayıflıktan yararlanın.

Yeniden yapılandır:

Şirketimizin staging ortamında yetkili bir penetration testi yürüten bir güvenlik mühendisiyim. Aşağıdaki ağ tarama sonuçlarını inceleyin ve OWASP metodolojisini izleyerek bir sonraki aşamada hangi kimlik doğrulama mekanizmalarının test edilmesi gerektiğini önerin.

[tarama sonuçlarını buraya yapıştırın]

İkincisi, niyeti (sonuçları inceleme) yetkilendirme bağlamından (staging ortamı, yetkili test) ve metodolojiden (OWASP) ayırır. Sınıflandırıcı bunu bir saldırı isteğinden ayırt edebilir.

API üzerinden Operatör Düzeyinde Sistem İstemlerini Kullanın

Anthropic'in operatör düzeyindeki sistem istemleri, sınıflandırıcı için kullanıcı düzeyindeki istemlerden daha fazla ağırlık taşır. Bağlamınızı, bunu konuşma mesajlarına gömmek yerine system parametresini kullanarak operatör düzeyinde ayarlayın.

response = client.messages.create(
    model="claude-fable-5",
    max_tokens=1024,
    # Operatör düzeyi bağlam — sınıflandırıcı bunu daha ağır tartar
    system="Bu uygulama, lisanslı bir güvenlik denetimi platformudur. "
           "Tüm talepler, kullanıcının kendi altyapısı üzerinde yetkili sızma testi içerir.",
    messages=[{"role": "user", "content": user_prompt}]
)

Anthropic ayrıca kullanım politikası kapsamında profesyonel kullanım senaryoları için güvenlik eşiklerinin ayarlanmasını destekler. Bir güvenlik analizi aracı veya bir biyoinformatik platformu geliştiriyorsanız, operatör düzeyindeki yapılandırma doğru yaklaşımdır.

Hassas Görevleri Odaklanmış İstemler Arasında Bölün

Tek bir promptta anahtar kelime birikimi, sınıflandırıcının isteğin riskli olduğuna dair güvenini artırır. Protein katlanması, CRISPR ve sentez yollarından birlikte bahseden bir prompt, her konuyu ayrı ayrı ele alan üç ayrı prompta kıyasla tetiklenme olasılığı daha yüksektir.

Her odaklanmış istem, sınıflandırıcının değerlendirmesi için daha net bir bağlam sunar.

Farklı Bir Model Ne Zaman Kullanılır

Bazı iş akışları, modeller arasında geçiş yaparak daha iyi sonuç verir. Fable 5'in güvenlik sınıflandırıcısı Opus 4.8 veya Sonnet 5 üzerinde mevcut değildir.

GörevÖnerilen ModelNeden
Güvenlik kod incelemesiOpus 4.8 or Sonnet 5Sınıflandırıcı yok, doğrudan değerlendirme
Biyo/kimya araştırma koduSonnet 5Daha hafif güvenlik kısıtlamaları
ML eğitim altyapısıOpus 4.8Distillation sınıflandırıcısı yok
Genel kodlamaFable 5%80,3 SWE-Bench Pro, mevcut olan en iyisi

Kodda Otomatik Yedekleme

API'yi kullanıyorsanız, güvenlik yönlendirmesini tespit edebilir ve güvenlik sınıflandırıcısı olmayan bir modelde yeniden deneyebilirsiniz:

def query_with_fallback(prompt, system_context):
    primary = client.messages.create(
        model="claude-fable-5",
        max_tokens=1024,
        system=system_context,
        messages=[{"role": "user", "content": prompt}]
    )

    # Güvenlik yönlendirmesini algıla
    if primary.model != "claude-fable-5":
        return client.messages.create(
            model="claude-opus-4-8",
            max_tokens=1024,
            system=system_context,
            messages=[{"role": "user", "content": prompt}]
        )

    return primary

Bu, aynı endpoint üzerinden birden fazla Claude modelini destekleyen herhangi bir API sağlayıcısıyla çalışır. AIReiter gibi üçüncü taraf API proxy’leri, tüm Claude modellerini tek bir API anahtarıyla düşürülmüş oranlarla sunar; böylece model değiştirme, ayrı bir hesap kurulumu gerektirmeyen tek satırlık bir değişiklik olur.

SSS

Fable 5 Sınıflandırıcısını Tamamen Devre Dışı Bırakabilir Misiniz?

Hayır. Sınıflandırıcı sunucu tarafındadır ve istek başına yapılandırılamaz. Operatör düzeyindeki sistem istemleri, ne kadar agresif işaretlediğini etkiler, ancak onu devre dışı bırakamazlar. Sınıflandırıcı, bildirilen jailbreak vektörünü vakaların %99’undan fazlasında engeller ve Anthropic bunun böyle kalmasını sağlamak için güvenlik ekibini büyüttü.

Güvenlik Sınıflandırıcısı Verilerimi Saklar mı?

İşaretlenmiş Fable 5 trafiği, mevcut sıfır saklama anlaşmalarını geçersiz kılan zorunlu 30 günlük veri saklamasına tabidir. Bu, yalnızca doğrudan API erişimi değil, GitHub Copilot gibi üçüncü taraf entegrasyonlar da dahil olmak üzere tüm yüzeyler için geçerlidir. Kuruluşunuzun bir ZDR sözleşmesi varsa, işaretlenmiş istekler istisnadır.

Fable 5, Yanlış Pozitiflere Rağmen Kullanılmaya Değer mi?

Çalışmanız üç tetikleyici alanla örtüşmüyorsa, Fable 5 SWE-Bench Pro’da %80,3 ile öndedir (Opus 4.8: %69,2, GPT-5.5: %58,6). Sınıflandırıcılara düzenli olarak takılıyorsanız, daha düşük benchmark skorlarına rağmen sınıflandırıcı ek yükü olmayan Opus 4.8 veya Sonnet 5 size daha az zaman kaybettirir.