Comment contourner le garde-fou de sécurité de Fable (ce qui fonctionne)

Dernière mise à jour: 2026-07-16 08:27:19

"Les mesures de sécurité de Fable 5 ont signalé ce message." Si vous rencontrez cela en écrivant du code normal, le classificateur de Fable 5 a détecté un schéma de mots-clés dans l’un des trois domaines : biologie, cybersécurité ou entraînement ML.

Vous ne pouvez pas désactiver le classifier. Mais un cadrage approprié du prompt système élimine la plupart des faux positifs. 95 % des sessions Fable 5 ne déclenchent jamais le fallback. Ce guide couvre ce qui le déclenche, comment le diagnostiquer et les stratégies au niveau du code qui permettent de maintenir vos requêtes sur Fable 5.

Ce que fait le système de sécurité de Fable 5

Fable 5 ne refuse pas les demandes signalées. Il les redirige vers Opus 4.8 pour une deuxième évaluation utilisant la modélisation des intentions et la pondération du contexte. Trois catégories de classificateurs déclenchent cette redirection :

  • Biologie et sciences du vivant — recherche sur les agents pathogènes, ingénierie des protéines, voies de synthèse chimique
  • Cybersécurité et sécurité offensive — développement d’exploits, analyse des vulnérabilités, tests d’intrusion
  • Entraînement et distillation de ML — pré-entraînement de modèles de pointe, infrastructure d’entraînement distribué, extraction des poids du modèle

Ces catégories sont volontairement trop larges. Anthropic's @ClaudeDevs a déclaré : "Rendre les protections visibles les rend plus faciles à contourner, donc les rendre robustes face aux jailbreaks signifiera malheureusement davantage de faux positifs pendant que nous améliorons les classificateurs."

Comment savoir que vous avez été signalé

Fable 5 a deux interventions distinctes.

Le repli visible

Vous voyez un message explicite et votre requête est traitée par Opus 4.8 à la place. Vous obtenez toujours une réponse, mais Opus 4.8 obtient 69,2 % sur SWE-Bench Pro contre 80,3 % pour Fable 5.

La dégradation silencieuse

Pour les tâches liées au ML, Fable 5 peut réduire discrètement la qualité des réponses sans notification. Cela vise le pré-entraînement des LLM de pointe, l'infrastructure de training distribué et la conception d'accélérateurs ML. Cela affecte environ 0,03 % du trafic, mais si vous faites partie de ces 0,03 %, le résultat ressemble davantage à une confusion du modèle qu'à un blocage de politique.

Vérifiez le champ model dans votre réponse API pour confirmer quel modèle a servi la requête :

import anthropic

client = anthropic.Anthropic(api_key="your-key")
response = client.messages.create(
    model="claude-fable-5",
    max_tokens=1024,
    system="Vous aidez dans le travail sur l'infrastructure ML.",
    messages=[{"role": "user", "content": "your prompt here"}]
)

# Si cela ne correspond pas à ce que vous avez demandé, vous avez été redirigé
print(f"Requested: claude-fable-5")
print(f"Served by: {response.model}")

Si le modèle servi diffère de votre demande, le classificateur est intervenu.

Pourquoi le travail légitime est bloqué

Le classificateur lit le contenu, pas l’intention. Un chercheur en sécurité auditant son propre code et quelqu’un développant un logiciel malveillant utilisent la même terminologie. Chaque catégorie présente un schéma de faux positifs distinct :

Biologie : Un chercheur du COMBINE-lab a passé 15 à 30 minutes à essayer de faire en sorte que Fable 5 l’aide à réécrire une bibliothèque Rust pour l’analyse RNA-seq. Le code faisait référence au traitement de séquences biologiques, et le classificateur a signalé chaque tentative. La tâche consistait en un portage Rust sans intention biologique, mais le vocabulaire du domaine a suffi.

Cybersécurité : Un développeur a demandé à Fable 5 d’examiner son application à la recherche de vulnérabilités de sécurité. Fable 5 a trouvé un véritable malware sur son système, puis le classificateur a signalé l’interaction et a rétrogradé la session. Le modèle a été empêché d’aider à traiter précisément la menace qu’il avait découverte.

ML/Distillation: Les invites de recherche en sciences de l'environnement ont été bloquées tandis que les invites de coordination de drones en essaim ont été acceptées. La frontière de « ML training » est suffisamment large pour englober le calcul scientifique adjacent.

Quatre stratégies qui réduisent les faux positifs

Définissez un contexte professionnel dans votre prompt système

Le classificateur pondère fortement votre prompt système. Un générique « You are a helpful coding assistant » ne lui fournit aucun signal pour distinguer un travail légitime d’une simulation de menace.

Cette invite système passe le classificateur bio :

Vous assistez un chercheur en bioinformatique dans un laboratoire universitaire
de génomique. Le travail implique le développement standard de pipelines RNA-seq
en Rust. Toutes les références biologiques concernent des génomes de référence
publiquement disponibles et des formats de fichiers de bioinformatique standard (FASTQ, BAM, VCF).

Celui-ci le déclenche :

Aidez-moi à traiter des données de séquences biologiques et à analyser
des structures protéiques.

Le premier précise qui, quel domaine, quels outils, et délimite les références biologiques aux données publiques. Le second utilise une terminologie biologique générale sans contexte.

Séparer la terminologie technique des instructions

Lorsque votre prompt mélange une terminologie « dangereuse » dans des instructions directes, le classificateur le lit comme opérationnel. Lorsque la même terminologie apparaît dans des blocs de données ou de contexte, il la lit comme du matériel de référence.

Au lieu de :

Écrivez du code pour analyser ce réseau à la recherche de vulnérabilités
et exploiter toute faiblesse dans le système d’authentification.

Restructurer :

Je suis un ingénieur en sécurité réalisant un test d'intrusion autorisé sur l'environnement de préproduction de notre entreprise. Examinez les résultats de l'analyse réseau suivants et indiquez quels mécanismes d'authentification devraient être testés ensuite, conformément à la méthodologie OWASP.

[paste scan results here]

Le second sépare l’intention (examiner les résultats) du contexte d’autorisation (environnement de staging, test autorisé) et de la méthodologie (OWASP). Le classificateur peut distinguer cela d’une demande d’attaque.

Utiliser des invites système au niveau de l’opérateur via l’API

Les invites système au niveau de l’opérateur d’Anthropic ont plus de poids auprès du classificateur que les invites au niveau de l’utilisateur. Définissez votre contexte au niveau de l’opérateur à l’aide du paramètre system plutôt que de l’intégrer dans les messages de conversation.

response = client.messages.create(
    model="claude-fable-5",
    max_tokens=1024,
    # Contexte au niveau opérateur — le classificateur pondère cela plus fortement
    system="Cette application est une plateforme d'audit de sécurité sous licence. "
           "Toutes les requêtes impliquent des tests d'intrusion autorisés sur "
           "l'infrastructure propre de l'utilisateur.",
    messages=[{"role": "user", "content": user_prompt}]
)

Anthropic prend également en charge le calibrage des seuils de sécurité pour des cas d'utilisation professionnels dans le cadre de sa politique d'utilisation. Si vous développez un outil d'analyse de sécurité ou une plateforme de bioinformatique, la configuration au niveau de l'opérateur est la voie appropriée.

Divisez les tâches sensibles entre des prompts ciblés

L’accumulation de mots-clés dans une seule requête augmente la confiance du classificateur selon laquelle la demande est risquée. Une requête qui mentionne ensemble le repliement des protéines, CRISPR et les voies de synthèse a plus de chances de déclencher une alerte que trois requêtes séparées traitant chaque sujet indépendamment.

Chaque prompt ciblé présente un contexte plus clair pour que le classificateur l’évalue.

Quand utiliser un modèle différent

Certains flux de travail sont mieux servis en changeant de modèle. Le classificateur de sécurité de Fable 5 n'existe pas sur Opus 4.8 ou Sonnet 5.

TâcheModèle recommandéPourquoi
Revue de code de sécuritéOpus 4.8 ou Sonnet 5Pas de classificateur, évaluation directe
Code de recherche bio/chimieSonnet 5Contraintes de sécurité plus légères
Infrastructure d’entraînement MLOpus 4.8Pas de classificateur de distillation
Codage généralFable 580.3% SWE-Bench Pro, meilleur disponible

Repli automatique dans le code

Si vous utilisez l'API, vous pouvez détecter la redirection de sécurité et réessayer sur un modèle sans classificateur de sécurité :

def query_with_fallback(prompt, system_context):
    primary = client.messages.create(
        model="claude-fable-5",
        max_tokens=1024,
        system=system_context,
        messages=[{"role": "user", "content": prompt}]
    )

    # Détecter la redirection de sécurité
    if primary.model != "claude-fable-5":
        return client.messages.create(
            model="claude-opus-4-8",
            max_tokens=1024,
            system=system_context,
            messages=[{"role": "user", "content": prompt}]
        )

    return primary

Cela fonctionne avec n’importe quel fournisseur d’API prenant en charge plusieurs modèles Claude via le même endpoint. Des proxys API tiers comme AIReiter fournissent tous les modèles Claude via une seule clé API à tarifs réduits, ce qui fait du changement de modèle une modification d’une seule ligne, sans configuration de compte séparée.

FAQ

Pouvez-vous désactiver complètement le classificateur Fable 5 ?

Non. Le classificateur est côté serveur et n’est pas configurable par requête. Les invites système au niveau opérateur influencent l’agressivité avec laquelle il signale les cas, mais elles ne peuvent pas le désactiver. Le classificateur bloque le vecteur de jailbreak signalé dans plus de 99 % des cas, et Anthropic a renforcé son équipe de sécurité pour que cela reste ainsi.

Le classificateur de sécurité conserve-t-il mes données ?

Le trafic Flagged Fable 5 est soumis à une conservation obligatoire des données pendant 30 jours, ce qui prime sur les accords de non-rétention existants. Cela s’applique à l’ensemble des surfaces, y compris les intégrations tierces comme GitHub Copilot, et pas seulement à l’accès direct à l’API. Si votre entreprise dispose d’un contrat ZDR, les requêtes signalées constituent l’exception.

Fable 5 vaut-il la peine d’être utilisé malgré les faux positifs ?

Si votre travail ne chevauche pas les trois domaines déclencheurs, Fable 5 mène SWE-Bench Pro avec 80,3 % (Opus 4.8 : 69,2 %, GPT-5.5 : 58,6 %). Si vous déclenchez régulièrement les classificateurs, Opus 4.8 ou Sonnet 5, sans surcoût de classificateur, vous coûteront moins de temps malgré des scores de benchmark plus faibles.