"Le misure di sicurezza di Fable 5 hanno segnalato questo messaggio." Se ti capita questo mentre stai scrivendo codice normale, il classificatore di Fable 5 ha rilevato un pattern di parole chiave in uno di tre domini: biologia, cybersecurity o addestramento ML.
Non puoi disattivare il classifier. Ma un corretto framing del system prompt elimina la maggior parte dei falsi positivi. Il 95% delle sessioni di Fable 5 non attiva mai il fallback. Questa guida illustra cosa lo attiva, come diagnosticarlo e le strategie a livello di codice che mantengono le tue richieste su Fable 5.
Cosa fa il sistema di sicurezza di Fable 5
Fable 5 non rifiuta le richieste segnalate. Le reindirizza a Opus 4.8 per una seconda valutazione usando la modellazione dell'intento e la ponderazione del contesto. Tre categorie di classificatore attivano questo reindirizzamento:
- Biologia e scienze della vita — ricerca sui patogeni, ingegneria delle proteine, vie di sintesi chimica
- Cybersecurity e sicurezza offensiva — sviluppo di exploit, analisi delle vulnerabilità, penetration testing
- Addestramento e distillazione ML — pretraining di modelli frontier, infrastruttura di training distribuito, estrazione dei pesi del modello
Queste categorie sono volutamente molto ampie. @ClaudeDevs di Anthropic ha dichiarato: "Rendere le protezioni visibili le rende più facili da aggirare, quindi mantenerle robuste contro i jailbreak significherà purtroppo più falsi positivi mentre miglioriamo i classificatori."
Come capire se sei stato segnalato
Fable 5 ha due interventi distinti.
Il fallback visibile
Vedi un messaggio esplicito e la tua richiesta viene invece servita da Opus 4.8. Ricevi comunque una risposta, ma Opus 4.8 ottiene il 69,2% su SWE-Bench Pro contro l’80,3% di Fable 5.
Il degrado silenzioso
Per attività adiacenti al ML, Fable 5 può ridurre silenziosamente la qualità delle risposte senza alcuna notifica. Questo riguarda il pretraining di frontier LLM, l'infrastruttura di training distribuito e la progettazione di acceleratori ML. Colpisce circa lo 0,03% del traffico, ma se rientri in quello 0,03%, l'output sembra confusione del modello piuttosto che un blocco di policy.
Controlla il campo model nella risposta della tua API per confermare quale modello ha servito la richiesta:
import anthropic
client = anthropic.Anthropic(api_key="your-key")
response = client.messages.create(
model="claude-fable-5",
max_tokens=1024,
system="Stai assistendo con il lavoro sull'infrastruttura ML.",
messages=[{"role": "user", "content": "your prompt here"}]
)
# Se questo non corrisponde a ciò che hai richiesto, sei stato reindirizzato
print(f"Requested: claude-fable-5")
print(f"Served by: {response.model}")
Se il modello servito differisce dalla tua richiesta, il classificatore è intervenuto.
Perché il lavoro legittimo viene bloccato
Il classificatore legge il contenuto, non l’intento. Un ricercatore di sicurezza che esamina il proprio codice e qualcuno che sviluppa malware usano la stessa terminologia. Ogni categoria ha un distinto pattern di falsi positivi:
Biology: Un ricercatore del COMBINE-lab ha trascorso 15-30 minuti cercando di far aiutare Fable 5 a riscrivere una libreria Rust per l'analisi RNA-seq. Il codice faceva riferimento all'elaborazione di sequenze biologiche, e il classificatore ha segnalato ogni tentativo. Il compito era un porting in Rust senza intenti biologici, ma il vocabolario del dominio è stato sufficiente.
Cybersecurity: Uno sviluppatore ha chiesto a Fable 5 di esaminare la propria applicazione per individuare vulnerabilità di sicurezza. Fable 5 ha trovato malware reale sul loro sistema, quindi il classificatore ha segnalato l'interazione e declassato la sessione. Il modello è stato bloccato dall'aiutare proprio con la minaccia che aveva scoperto.
ML/Distillation: i prompt di ricerca in scienze ambientali sono stati bloccati mentre i prompt di coordinamento di uno sciame di droni sono passati. Il confine per "ML training" è sufficientemente ampio da includere il calcolo scientifico adiacente.
Quattro strategie che riducono i falsi positivi
Imposta il contesto professionale nel tuo prompt di sistema
Il classificatore attribuisce un peso elevato al tuo prompt di sistema. Un generico "You are a helpful coding assistant" non gli fornisce alcun segnale per distinguere un lavoro legittimo da una simulazione di minaccia.
Questo prompt di sistema supera il classificatore bio:
Stai assistendo un ricercatore di bioinformatica presso un laboratorio universitario
di genomica. Il lavoro riguarda lo sviluppo standard di pipeline RNA-seq
in Rust. Tutti i riferimenti biologici si riferiscono a
genomi di riferimento disponibili pubblicamente e a formati di file
bioinformatici standard (FASTQ, BAM, VCF).
Questo lo attiva:
Aiutami a elaborare dati di sequenze biologiche e ad analizzare
strutture proteiche.
Il primo specifica chi, quale dominio, quali strumenti e delimita i riferimenti biologici ai dati pubblici. Il secondo usa una terminologia biologica ampia senza contesto.
Separare la terminologia tecnica dalle istruzioni
Quando il tuo prompt mescola terminologia "pericolosa" in istruzioni dirette, il classificatore la interpreta come operativa. Quando la stessa terminologia compare in blocchi di dati o di contesto, la interpreta come materiale di riferimento.
Anziché:
Scrivi codice per analizzare questa rete alla ricerca di vulnerabilità
e sfruttare eventuali debolezze nel sistema di autenticazione.
Ristrutturare:
Sono un ingegnere della sicurezza e sto conducendo un penetration test autorizzato
sull'ambiente di staging della nostra azienda. Esamina i
seguenti risultati della scansione di rete e suggerisci quali
meccanismi di autenticazione dovrebbero essere testati successivamente, seguendo
la metodologia OWASP.
[inserisci qui i risultati della scansione]
Il secondo separa l'intento (revisionare i risultati) dal contesto di autorizzazione (ambiente di staging, test autorizzato) e dalla metodologia (OWASP). Il classificatore può distinguerlo da una richiesta di attacco.
Utilizza i prompt di sistema a livello di operatore tramite l'API
I prompt di sistema a livello operatore di Anthropic hanno un peso maggiore per il classificatore rispetto ai prompt a livello utente. Imposta il tuo contesto a livello operatore usando il parametro system invece di incorporarlo nei messaggi di conversazione.
response = client.messages.create(
model="claude-fable-5",
max_tokens=1024,
# Contesto a livello di operatore — il classificatore assegna a questo un peso maggiore
system="Questa applicazione è una piattaforma autorizzata per audit di sicurezza. "
"Tutte le richieste riguardano test di penetrazione autorizzati "
"dell'infrastruttura dell'utente stesso.",
messages=[{"role": "user", "content": user_prompt}]
)
Anthropic supporta anche la calibrazione delle soglie di sicurezza per casi d'uso professionali all'interno della loro policy di utilizzo. Se stai sviluppando uno strumento di analisi della sicurezza o una piattaforma di bioinformatica, la configurazione a livello di operatore è la strada corretta.
Suddividi le attività sensibili tra prompt mirati
L'accumulo di parole chiave in un singolo prompt aumenta la confidenza del classificatore che la richiesta sia rischiosa. Un prompt che menziona insieme protein folding, CRISPR e synthesis pathways ha maggiori probabilità di attivare il filtro rispetto a tre prompt separati che trattano ciascun argomento in modo indipendente.
Ogni prompt mirato presenta un contesto più chiaro per la classificazione da valutare.
Quando usare un modello diverso
Alcuni flussi di lavoro sono meglio serviti passando da un modello all’altro. Il classificatore di sicurezza di Fable 5 non esiste in Opus 4.8 o Sonnet 5.
| Attività | Modello consigliato | Perché |
|---|---|---|
| Revisione del codice di sicurezza | Opus 4.8 o Sonnet 5 | Nessun classificatore, valutazione diretta |
| Codice di ricerca bio/chimica | Sonnet 5 | Vincoli di sicurezza meno restrittivi |
| Infrastruttura di training ML | Opus 4.8 | Nessun classificatore di distillazione |
| Programmazione generale | Fable 5 | 80.3% SWE-Bench Pro, il migliore disponibile |
Fallback automatico nel codice
Se utilizzi l'API, puoi rilevare il reindirizzamento di sicurezza e riprovare su un modello senza il classificatore di sicurezza:
def query_with_fallback(prompt, system_context):
primary = client.messages.create(
model="claude-fable-5",
max_tokens=1024,
system=system_context,
messages=[{"role": "user", "content": prompt}]
)
# Rileva il rerouting di sicurezza
if primary.model != "claude-fable-5":
return client.messages.create(
model="claude-opus-4-8",
max_tokens=1024,
system=system_context,
messages=[{"role": "user", "content": prompt}]
)
return primary
Questo funziona con qualsiasi provider API che supporti più modelli Claude tramite lo stesso endpoint. Proxy API di terze parti come AIReiter forniscono tutti i modelli Claude tramite una singola API key a tariffe ridotte, rendendo il passaggio tra modelli una modifica di una sola riga senza bisogno di configurare un account separato.
FAQ
Puoi disattivare completamente il classificatore di Fable 5?
No. Il classificatore è lato server e non è configurabile per singola richiesta. I prompt di sistema a livello di operatore influenzano quanto aggressivamente segnala, ma non possono disattivarlo. Il classificatore blocca il vettore di jailbreak segnalato in oltre il 99% dei casi, e Anthropic ha ampliato il proprio team di sicurezza per mantenere invariata questa situazione.
Il classificatore di sicurezza conserva i miei dati?
Il traffico Flagged Fable 5 è soggetto a una conservazione obbligatoria dei dati di 30 giorni, in deroga agli accordi esistenti di conservazione zero. Questo si applica a tutte le superfici, comprese integrazioni di terze parti come GitHub Copilot, non solo all’accesso diretto API. Se la tua azienda ha un contratto ZDR, le richieste contrassegnate sono l’eccezione.
Vale la pena usare Fable 5 nonostante i falsi positivi?
Se il tuo lavoro non si sovrappone ai tre domini trigger, Fable 5 guida SWE-Bench Pro all'80,3% (Opus 4.8: 69,2%, GPT-5.5: 58,6%). Se attivi regolarmente i classifier, Opus 4.8 o Sonnet 5 senza overhead di classifier ti costeranno meno tempo nonostante i punteggi benchmark più bassi.
