Fable安全ガードを回避する方法(有効なもの)

最終更新日: 2026-07-16 08:27:49

「Fable 5の安全対策により、このメッセージはフラグが付けられました。」通常のコードを書いていてこれに遭遇した場合、Fable 5の分類器が、biology、cybersecurity、またはML trainingの3つのドメインのいずれかにおけるキーワードパターンを検出したということです。

classifier を無効にすることはできません。ただし、適切な system prompt の設計により、ほとんどの誤検知はなくなります。Fable 5 のセッションの 95% では、fallback は一度も発動しません。このガイドでは、何がそれを引き起こすのか、どう診断するのか、そしてリクエストを Fable 5 に維持するためのコードレベルの戦略を説明します。

Fable 5の安全システムが行うこと

Fable 5 はフラグ付きのリクエストを拒否しません。意図モデリングとコンテキスト重み付けを用いた2回目の評価のために、それらを Opus 4.8 に再ルーティングします。次の3つの分類器カテゴリがこの再ルーティングを引き起こします:

  • 生物学および生命科学 — 病原体研究、タンパク質工学、化学合成経路
  • サイバーセキュリティおよび攻撃的セキュリティ — エクスプロイト開発、脆弱性分析、ペネトレーションテスト
  • ML training and distillation — フロンティアモデルの事前学習、分散トレーニングインフラ、モデル重みの抽出

これらのカテゴリは意図的に広く設定されています。Anthropic の @ClaudeDevs は次のように述べました。「安全策を目に見える形にすると、回避されやすくなるため、ジャイルブレイクに対して堅牢に保つには、分類器を改善している間は残念ながら誤検知が増えることになります。」

フラグが付けられたことを見分ける方法

Fable 5には2つの異なる介入があります。

表示されるフォールバック

明示的なメッセージが表示され、代わりにあなたのリクエストは Opus 4.8 によって処理されます。応答は返ってきますが、Opus 4.8 の SWE-Bench Pro でのスコアは 69.2% で、Fable 5 の 80.3% に対して劣ります。

静かな劣化

ML関連のタスクでは、Fable 5は通知なしに応答品質を静かに低下させることがあります。これは、フロンティアLLMの事前学習、分散学習インフラ、MLアクセラレータ設計を対象としています。影響を受けるのはトラフィックの約0.03%ですが、その0.03%に該当する場合、出力はポリシーブロックというよりモデルの混乱のように見えます。

API レスポンスの model フィールドを確認して、どのモデルがリクエストを処理したかを確かめてください:

import anthropic

client = anthropic.Anthropic(api_key="your-key")
response = client.messages.create(
    model="claude-fable-5",
    max_tokens=1024,
    system="MLインフラ作業を支援しています。",
    messages=[{"role": "user", "content": "your prompt here"}]
)

# If this doesn't match what you requested, you were rerouted
print(f"Requested: claude-fable-5")
print(f"Served by: {response.model}")

提供されたモデルがリクエストと異なる場合、分類器が介入しました。

なぜ正当な作業がブロックされるのか

分類器は意図ではなく、コンテンツを読み取ります。自分のコードを監査しているセキュリティ研究者と、マルウェアを作成している人物は、同じ用語を使います。各カテゴリには、異なる誤検知パターンがあります:

Biology: COMBINE-labの研究者が、RNA-seq解析用のRustライブラリを書き直すのをFable 5に手伝ってもらおうとして15〜30分を費やした。コードは生物学的配列処理に言及しており、分類器はあらゆる試行をフラグ付けした。このタスクは生物学的意図のないRust移植だったが、ドメイン語彙だけで十分だった。

サイバーセキュリティ: ある開発者が、自分のアプリケーションのセキュリティ脆弱性をレビューするようFable 5に依頼しました。Fable 5はそのシステム上で実際のマルウェアを発見し、その後、分類器がそのやり取りをフラグ付けしてセッションを格下げしました。モデルは、自ら発見したまさにその脅威への対処を支援することをブロックされました。

ML/Distillation: 環境科学の研究プロンプトはブロックされた一方で、ドローン群制御のプロンプトは通過しました。「ML training」の境界は、隣接する科学計算まで含めるほど広いです。

偽陽性を減らす4つの戦略

システムプロンプトに専門的なコンテキストを設定する

分類器はあなたのシステムプロンプトを強く重視します。一般的な「You are a helpful coding assistant」では、正当な作業と脅威のシミュレーションを区別するための手がかりが得られません。

このシステムプロンプトはbio分類器を通過します:

あなたは大学のゲノミクス研究室に所属するバイオインフォマティクス研究者を支援しています
。業務には Rust による標準的な RNA-seq パイプライン
開発が含まれます。すべての生物学的参照は
公開されている参照ゲノムと標準的な
バイオインフォマティクスのファイル形式(FASTQ、BAM、VCF)に関するものです。

これはそれを引き起こします:

生物学的配列データの処理と
タンパク質構造の分析を手伝ってください。

最初のものは、誰が、どのドメインが、どのツールを使うかを指定し、生物学的参照を公開データにスコープします。2番目のものは、文脈なしに広範な生物学用語を使用します。

技術用語と指示を分ける

プロンプトが「危険」な用語を直接的な指示の中に混ぜると、分類器はそれを実行指示として読み取ります。同じ用語がデータやコンテキストのブロックに現れる場合、参照資料として読み取ります。

代わりに:

このネットワークをスキャンして脆弱性を見つけ、
認証システムの弱点を悪用するコードを書いてください。

再構成:

私は、当社のステージング環境に対して許可を得てペネトレーション
テストを実施しているセキュリティエンジニアです。次の
ネットワークスキャン結果を確認し、OWASPの方法論に従って、
次にどの
認証メカニズムをテストすべきか提案してください。

[スキャン結果をここに貼り付け]

2つ目は、意図(結果のレビュー)を認可コンテキスト(ステージング環境、許可されたテスト)および手法(OWASP)から分離しています。分類器はこれを攻撃要求と区別できます。

API 経由でオペレーター レベルのシステム プロンプトを使用する

Anthropic のオペレーター レベルのシステムプロンプトは、ユーザーレベルのプロンプトよりも分類器に対して大きな影響を持ちます。会話メッセージに埋め込むのではなく、system パラメータを使用してオペレーター レベルでコンテキストを設定してください。

response = client.messages.create(
    model="claude-fable-5",
    max_tokens=1024,
    # Operator-level context — classifier weighs this more heavily
    system="このアプリケーションは、ライセンスを受けたセキュリティ監査プラットフォームです。 "
           "すべてのリクエストは、ユーザー自身のインフラストラクチャに対する "
           "認可済みの侵入テストを含みます。",
    messages=[{"role": "user", "content": user_prompt}]
)

Anthropic は、利用ポリシー内でプロフェッショナルなユースケース向けの安全しきい値の調整もサポートしています。セキュリティ分析ツールやバイオインフォマティクスプラットフォームを構築している場合は、operator-level の設定が正しい方法です。

フォーカスしたプロンプトに敏感なタスクを分割する

単一のプロンプトにキーワードを蓄積すると、そのリクエストが危険であるという分類器の確信が高まります。タンパク質折りたたみ、CRISPR、合成経路をまとめて言及するプロンプトは、それぞれのトピックを個別に扱う3つの別々のプロンプトよりも、トリガーされやすくなります。

各フォーカスされたプロンプトは、分類器が評価するためのより明確な文脈を提示します。

別のモデルを使用すべき場合

一部のワークフローでは、モデルを切り替えるほうが適しています。Fable 5の安全性分類器は、Opus 4.8やSonnet 5には存在しません。

タスク推奨モデル理由
セキュリティコードレビューOpus 4.8 または Sonnet 5分類器なし、直接評価
バイオ/化学研究コードSonnet 5より軽い安全制約
MLトレーニングインフラOpus 4.8蒸留分類器なし
一般的なコーディングFable 580.3% SWE-Bench Pro、利用可能な中で最良

コード内の自動フォールバック

APIを使用している場合は、安全性リルートを検出し、安全性分類器のないモデルで再試行できます:

def query_with_fallback(prompt, system_context):
    primary = client.messages.create(
        model="claude-fable-5",
        max_tokens=1024,
        system=system_context,
        messages=[{"role": "user", "content": prompt}]
    )

    # 安全リルートを検出
    if primary.model != "claude-fable-5":
        return client.messages.create(
            model="claude-opus-4-8",
            max_tokens=1024,
            system=system_context,
            messages=[{"role": "user", "content": prompt}]
        )

    return primary

これは、同じエンドポイントを通じて複数のClaudeモデルをサポートする任意のAPIプロバイダーで動作します。AIReiterのようなサードパーティのAPIプロキシは、割引料金で単一のAPIキーを使ってすべてのClaudeモデルを提供するため、モデルの切り替えは別アカウントの設定なしで1行変更するだけで済みます。

よくある質問

Fable 5 classifierを完全に無効化できますか?

いいえ。分類器はサーバー側で動作し、リクエストごとに設定することはできません。オペレーターレベルのシステムプロンプトは、どれだけ積極的にフラグを立てるかに影響しますが、無効化することはできません。分類器は報告された jailbreak ベクターを99%以上のケースでブロックしており、Anthropic はその状態を維持するために安全性チームを拡大しています。

セーフティ分類器は私のデータを保持しますか?

Flagged Fable 5 traffic is subject to mandatory 30-day data retention, overriding existing zero-retention agreements. This applies across all surfaces including third-party integrations like GitHub Copilot, not just direct API access. If your enterprise has a ZDR contract, flagged requests are the exception.

誤検知があるにもかかわらず、Fable 5 を使う価値はありますか?

あなたの作業が3つのトリガードメインと重ならない場合、Fable 5はSWE-Bench Proで80.3%とトップです(Opus 4.8: 69.2%、GPT-5.5: 58.6%)。もし分類器に頻繁に引っかかるなら、ベンチマークスコアは低くても、分類器のオーバーヘッドがないOpus 4.8またはSonnet 5のほうが、結果的に時間をあまり取られません。