如何繞過 Fable Safety Guard(有效的方法)

最近更新: 2026-07-16 08:28:23

「Fable 5 的安全措施標記了這則訊息。」如果你在撰寫一般程式碼時遇到這種情況,Fable 5 的分類器偵測到以下三個領域之一中的關鍵字模式:生物學、網路安全或 ML 訓練。

你無法停用分類器。但適當的 system prompt 架構可消除大多數誤判。95% 的 Fable 5 工作階段從不會觸發 fallback。本指南說明會觸發它的原因、如何診斷,以及在程式碼層級上可讓你的請求維持在 Fable 5 的策略。

Fable 5 的安全系統做什麼

Fable 5 不會拒絕被標記的請求。它會將這些請求重新導向至 Opus 4.8,以使用意圖建模和上下文加權進行第二次評估。三個分類器類別會觸發這種重新導向:

  • 生物學與生命科學 — 病原體研究、蛋白質工程、化學合成途徑
  • 網路安全與攻擊性安全 — 漏洞利用開發、漏洞分析、滲透測試
  • ML 訓練與蒸餾 — 前沿模型預訓練、分散式訓練基礎設施、模型權重提取

這些類別是刻意設計得過於寬泛的。Anthropic 的 @ClaudeDevs 表示:「將安全防護措施公開可見,會讓人更容易繞過它們,因此要讓它們對越獄攻擊保持穩健,不幸地意味著在我們改進分類器的同時,會出現更多誤判。」

如何判斷你已被標記

Fable 5 有兩個不同的介入。

可見的備援方案

您會看到一則明確的訊息,而您的請求會改由 Opus 4.8 提供服務。您仍然會收到回應,但 Opus 4.8 在 SWE-Bench Pro 上的得分為 69.2%,而 Fable 5 的得分為 80.3%。

無聲的退化

對於與 ML 相關的任務,Fable 5 可能會在沒有通知的情況下悄悄降低回應品質。這針對前沿 LLM 預訓練、分散式訓練基礎設施,以及 ML 加速器設計。它大約影響 0.03% 的流量,但如果你剛好在那 0.03% 中,輸出看起來會像是模型混淆,而不是政策封鎖。

檢查您 API 回應中的 model 欄位,以確認是哪個模型處理了該請求:

import anthropic

client = anthropic.Anthropic(api_key="your-key")
response = client.messages.create(
    model="claude-fable-5",
    max_tokens=1024,
    system="你正在協助處理 ML 基礎架構工作。",
    messages=[{"role": "user", "content": "your prompt here"}]
)

# 如果這不符合你所要求的內容,你已被重新導向
print(f"Requested: claude-fable-5")
print(f"Served by: {response.model}")

如果實際提供的模型與您的請求不同,則表示分類器已介入。

為什麼合法工作會被阻擋

分類器讀取的是內容,而不是意圖。審核自己程式碼的安全研究員和製作惡意軟體的人會使用相同的術語。每個類別都有不同的誤判模式:

Biology:來自 COMBINE-lab 的一位研究人員花了 15-30 分鐘嘗試讓 Fable 5 幫忙重寫一個用於 RNA-seq 分析的 Rust 函式庫。程式碼提到了生物序列處理,而分類器將每一次嘗試都標記了出來。這項任務是將程式移植到 Rust,並沒有任何生物學意圖,但領域詞彙已經足夠了。

資安:一位開發者請 Fable 5 檢查他們的應用程式是否存在安全漏洞。Fable 5 在他們的系統上發現了實際的惡意軟體,接著分類器標記了這段互動並將該工作階段降級。該模型因此被禁止協助處理它所發現的威脅。

ML/Distillation: 環境科學研究提示已被封鎖,而無人機群協調提示則通過了。「ML training」的界線寬泛到足以涵蓋相鄰的科學計算。

降低誤判的四種策略

在你的系統提示中設定專業情境

分類器會非常重視你的系統提示。像泛用的「你是一位樂於助人的程式編寫助手」這樣的內容,無法提供任何訊號來區分正當工作與威脅模擬。

這個系統提示通過了生物分類器:

你正在協助一位大學基因組學實驗室的生物資訊研究人員。
工作內容涉及以 Rust 開發標準 RNA-seq 流程。
所有生物學參考皆為公開可取得的參考基因組以及標準
生物資訊檔案格式(FASTQ、BAM、VCF)。

這個會觸發它:

幫助我處理生物序列資料並分析
蛋白質結構。

第一個指定了誰、什麼領域、什麼工具,並將生物參考資料的範圍限定於公開資料。第二個則使用了廣泛的生物學術語,沒有上下文。

將技術術語與指示分開

當您的提示將「dangerous」術語混入直接指令時,分類器會將其解讀為操作性內容。當相同的術語出現在資料或上下文區塊中時,則會將其解讀為參考資料。

而不是:

編寫程式碼來掃描此網路中的漏洞
並利用驗證系統中的任何弱點。

重組:

我是資安工程師,正在對我們公司的預備環境進行授權的滲透測試。請檢視以下網路掃描結果,並依照 OWASP 方法建議下一步應測試哪些驗證機制。

[在此貼上掃描結果]

第二個將意圖(審查結果)與授權上下文(staging 環境、已授權測試)以及方法(OWASP)區分開來。分類器可以將這與攻擊請求區分。

透過 API 使用運算子層級的系統提示

Anthropic 的 operator-level 系統提示在分類器中的權重比 user-level 提示更高。請使用 system 參數在 operator-level 設定您的上下文,而不是將其嵌入對話訊息中。

response = client.messages.create(
    model="claude-fable-5",
    max_tokens=1024,
    # Operator-level context — classifier weighs this more heavily
    system="This application is a licensed security audit platform. "
           "All requests involve authorized penetration testing of "
           "the user's own infrastructure.",
    messages=[{"role": "user", "content": user_prompt}]
)

Anthropic 也支援在其使用政策範圍內,為專業使用情境校準安全門檻。如果您正在建立安全分析工具或生物資訊平台,採用操作層級的設定才是正確做法。

將敏感任務拆分到聚焦的提示中

在單一提示中累積關鍵字會提高分類器對該請求具風險的信心。一個同時提到蛋白質摺疊、CRISPR 和合成途徑的提示,比起三個分別獨立處理各個主題的提示,更容易觸發。

每個聚焦的提示都為分類器提供了更清晰的評估上下文。

何時使用不同的模型

有些工作流程更適合切換模型。Fable 5 的安全分類器在 Opus 4.8 或 Sonnet 5 上不存在。

任務建議模型原因
安全程式碼審查Opus 4.8 或 Sonnet 5無分類器,直接評估
生物/化學研究程式碼Sonnet 5較寬鬆的安全限制
ML 訓練基礎架構Opus 4.8無蒸餾分類器
一般程式設計Fable 580.3% SWE-Bench Pro,目前最佳可用

程式碼中的自動回退

如果您使用 API,您可以偵測安全重導並在沒有安全分類器的模型上重試:

def query_with_fallback(prompt, system_context):
    primary = client.messages.create(
        model="claude-fable-5",
        max_tokens=1024,
        system=system_context,
        messages=[{"role": "user", "content": prompt}]
    )

    # Detect safety reroute
    if primary.model != "claude-fable-5":
        return client.messages.create(
            model="claude-opus-4-8",
            max_tokens=1024,
            system=system_context,
            messages=[{"role": "user", "content": prompt}]
        )

    return primary

這適用於任何透過同一端點支援多個 Claude 模型的 API 提供者。像 AIReiter 這類第三方 API 代理,能透過單一 API key 提供所有 Claude 模型,並以 更低費率 供應,讓模型切換只需一行變更,無需另外設定帳號。

常見問題

可以完全停用 Fable 5 分類器嗎?

不。分類器是在伺服器端運作,且無法按每次請求進行設定。營運者層級的系統提示會影響其標記的積極程度,但無法將其關閉。該分類器可攔截所回報的越獄向量,成功率超過 99%,而 Anthropic 也已擴充其安全團隊,以維持這樣的成效。

安全分類器會保留我的資料嗎?

Flagged Fable 5 流量需遵守強制 30 天資料保留規定,並將覆蓋現有的零保留協議。這適用於所有介面,包括像 GitHub Copilot 這類第三方整合,而不僅限於直接 API 存取。若您的企業簽有 ZDR 合約,則被標記的請求屬於例外。

儘管有誤判,Fable 5 值得使用嗎?

如果你的工作不重疊於這三個觸發領域,Fable 5 在 SWE-Bench Pro 上以 80.3% 領先(Opus 4.8:69.2%,GPT-5.5:58.6%)。如果你經常碰到分類器,沒有分類器額外開銷的 Opus 4.8 或 Sonnet 5,儘管基準分數較低,仍會為你節省更多時間。