Como Contornar o Fable Safety Guard (O que funciona)

Última Atualização: 2026-07-16 08:27:18

"As medidas de segurança do Fable 5 sinalizaram esta mensagem." Se você encontrou isso ao escrever código normal, o classificador do Fable 5 detectou um padrão de palavras-chave em um de três domínios: biologia, cibersegurança ou treinamento de ML.

Você não pode desativar o classificador. Mas um enquadramento adequado do prompt de sistema elimina a maioria dos falsos positivos. 95% das sessões do Fable 5 nunca acionam o fallback. Este guia aborda o que o aciona, como diagnosticá-lo e as estratégias em nível de código que mantêm suas solicitações no Fable 5.

O que o Sistema de Segurança do Fable 5 Faz

O Fable 5 não recusa solicitações sinalizadas. Ele as redireciona para Opus 4.8 para uma segunda avaliação usando modelagem de intenção e ponderação de contexto. Três categorias de classificador acionam esse redirecionamento:

  • Biologia e ciências da vida — pesquisa de patógenos, engenharia de proteínas, vias de síntese química
  • Segurança cibernética e segurança ofensiva — desenvolvimento de exploits, análise de vulnerabilidades, testes de penetração
  • Treinamento e destilação de ML — pré-treinamento de modelos de ponta, infraestrutura de treinamento distribuído, extração de pesos do modelo

Essas categorias são deliberadamente amplas demais. Os @ClaudeDevs da Anthropic afirmaram: "Tornar as proteções visíveis as torna mais fáceis de contornar, então mantê-las robustas contra jailbreaks infelizmente significará mais falsos positivos enquanto melhoramos os classificadores."

Como saber se você foi sinalizado

Fable 5 tem duas intervenções distintas.

O fallback visível

Você vê uma mensagem explícita e, em vez disso, sua solicitação é atendida pelo Opus 4.8. Você ainda recebe uma resposta, mas o Opus 4.8 obtém 69,2% no SWE-Bench Pro em comparação com os 80,3% do Fable 5.

A Degradação Silenciosa

Para tarefas adjacentes a ML, o Fable 5 pode reduzir discretamente a qualidade da resposta sem notificação. Isso tem como alvo o pré-treinamento de LLM de fronteira, a infraestrutura de treinamento distribuído e o design de aceleradores de ML. Afeta aproximadamente 0,03% do tráfego, mas, se você estiver nesses 0,03%, a saída parece confusão do modelo em vez de um bloqueio de política.

Verifique o campo model na sua resposta da API para confirmar qual modelo atendeu à solicitação:

import anthropic

client = anthropic.Anthropic(api_key="your-key")
response = client.messages.create(
    model="claude-fable-5",
    max_tokens=1024,
    system="Você está ajudando com trabalho de infraestrutura de ML.",
    messages=[{"role": "user", "content": "seu prompt aqui"}]
)

# Se isso não corresponder ao que você solicitou, você foi redirecionado
print(f"Requested: claude-fable-5")
print(f"Served by: {response.model}")

Se o modelo disponibilizado for diferente do seu pedido, o classificador interveio.

Por que o trabalho legítimo é bloqueado

O classificador lê o conteúdo, não a intenção. Um pesquisador de segurança auditando o próprio código e alguém criando malware usam a mesma terminologia. Cada categoria tem um padrão distinto de falso positivo:

Biologia: Um pesquisador do COMBINE-lab passou de 15 a 30 minutos tentando fazer o Fable 5 ajudar a reescrever uma biblioteca Rust para análise de RNA-seq. O código fazia referência ao processamento de sequências biológicas, e o classificador sinalizou todas as tentativas. A tarefa era uma porta em Rust sem intenção biológica, mas o vocabulário do domínio foi suficiente.

Cibersegurança: Um desenvolvedor pediu ao Fable 5 para revisar sua aplicação em busca de vulnerabilidades de segurança. O Fable 5 encontrou malware real no sistema deles, então o classificador sinalizou a interação e rebaixou a sessão. O modelo foi bloqueado de ajudar com a própria ameaça que descobriu.

ML/Distillation: Prompts de pesquisa em ciência ambiental foram bloqueados, enquanto prompts de coordenação de enxame de drones foram aprovados. A fronteira para "ML training" é ampla o suficiente para abranger computação científica adjacente.

Quatro Estratégias que Reduzem Falsos Positivos

Defina o contexto profissional no seu prompt do sistema

O classificador dá muito peso ao seu prompt de sistema. Um genérico "Você é um assistente de programação prestativo" não fornece nenhum sinal para distinguir trabalho legítimo de simulação de ameaça.

Este prompt de sistema passa pelo classificador de biografias:

Você está auxiliando um pesquisador de bioinformática em um laboratório universitário de
genômica. O trabalho envolve o desenvolvimento de um pipeline padrão de RNA-seq
em Rust. Todas as referências biológicas são a
genomas de referência publicamente disponíveis e formatos padrão de
arquivos de bioinformática (FASTQ, BAM, VCF).

Este aqui o aciona:

Ajude-me a processar dados de sequência biológica e analisar
estruturas de proteínas.

A primeira especifica quem, qual domínio, quais ferramentas e delimita referências biológicas a dados públicos. A segunda usa terminologia biológica ampla sem contexto.

Separe a Terminologia Técnica das Instruções

Quando seu prompt mistura terminologia "perigosa" em instruções diretas, o classificador a interpreta como operacional. Quando a mesma terminologia aparece em blocos de dados ou contexto, ele a interpreta como material de referência.

Em vez de:

Escreva código para escanear esta rede em busca de vulnerabilidades
e explorar quaisquer pontos fracos no sistema de autenticação.

Reestruturar:

Sou um engenheiro de segurança conduzindo um teste de penetração autorizado
no ambiente de staging da nossa empresa. Revise os
seguintes resultados de varredura de rede e sugira quais
mecanismos de autenticação devem ser testados a seguir, seguindo
a metodologia OWASP.

[paste scan results here]

O segundo separa a intenção (revisar resultados) do contexto de autorização (ambiente de staging, teste autorizado) e da metodologia (OWASP). O classificador pode distinguir isso de uma solicitação de ataque.

Usar Prompts de Sistema em Nível de Operador via a API

Os prompts do sistema no nível do operador da Anthropic têm mais peso com o classificador do que os prompts no nível do usuário. Defina seu contexto no nível do operador usando o parâmetro system em vez de incorporá-lo nas mensagens da conversa.

response = client.messages.create(
    model="claude-fable-5",
    max_tokens=1024,
    # Contexto em nível de operador — o classificador dá mais peso a isso
    system="Este aplicativo é uma plataforma licenciada de auditoria de segurança. "
           "Todas as solicitações envolvem testes de penetração autorizados da "
           "própria infraestrutura do usuário.",
    messages=[{"role": "user", "content": user_prompt}]
)

A Anthropic também oferece suporte à calibração de limites de segurança para casos de uso profissionais dentro de sua política de uso. Se você estiver construindo uma ferramenta de análise de segurança ou uma plataforma de bioinformática, a configuração em nível de operador é o caminho correto.

Divida Tarefas Sensíveis Entre Prompts Focados

O acúmulo de palavras-chave em um único prompt aumenta a confiança do classificador de que a solicitação é arriscada. Um prompt que menciona folding de proteínas, CRISPR e vias de síntese juntos tem mais probabilidade de ser acionado do que três prompts separados tratando cada tópico independentemente.

Cada prompt focado apresenta um contexto mais claro para o classificador avaliar.

Quando Usar um Modelo Diferente

Alguns fluxos de trabalho são melhor atendidos pela troca de modelos. O classificador de segurança do Fable 5 não existe no Opus 4.8 nem no Sonnet 5.

TarefaModelo RecomendadoPor quê
Revisão de código de segurançaOpus 4.8 ou Sonnet 5Sem classificador, avaliação direta
Código de pesquisa bio/químicaSonnet 5Restrições de segurança mais leves
Infraestrutura de treinamento de MLOpus 4.8Sem classificador de destilação
Codificação geralFable 580.3% SWE-Bench Pro, o melhor disponível

Fallback Automático no Código

Se você usar a API, você pode detectar o redirecionamento de segurança e tentar novamente em um modelo sem o classificador de segurança:

def query_with_fallback(prompt, system_context):
    primary = client.messages.create(
        model="claude-fable-5",
        max_tokens=1024,
        system=system_context,
        messages=[{"role": "user", "content": prompt}]
    )

    # Detectar redirecionamento de segurança
    if primary.model != "claude-fable-5":
        return client.messages.create(
            model="claude-opus-4-8",
            max_tokens=1024,
            system=system_context,
            messages=[{"role": "user", "content": prompt}]
        )

    return primary

Isto funciona com qualquer provedor de API que ofereça suporte a vários modelos Claude através do mesmo endpoint. Proxies de API de terceiros, como AIReiter, disponibilizam todos os modelos Claude por meio de uma única chave de API com tarifas reduzidas, tornando a troca de modelo uma alteração de uma linha, sem necessidade de configurar uma conta separada.

Perguntas Frequentes

Você pode desativar completamente o classificador Fable 5?

Não. O classificador fica no servidor e não é configurável por solicitação. Prompts de sistema no nível do operador influenciam o quão agressivamente ele sinaliza, mas não podem desativá-lo. O classificador bloqueia o vetor de jailbreak relatado em mais de 99% dos casos, e a Anthropic ampliou sua equipe de segurança para manter isso assim.

O Classificador de Segurança Mantém Meus Dados?

O tráfego do Flagged Fable 5 está sujeito à retenção obrigatória de dados por 30 dias, substituindo os acordos existentes de retenção zero. Isso se aplica a todas as superfícies, incluindo integrações de terceiros como GitHub Copilot, não apenas ao acesso direto à API. Se sua empresa tiver um contrato de ZDR, as solicitações sinalizadas são a exceção.

Vale a pena usar o Fable 5 apesar dos falsos positivos?

Se o seu trabalho não se sobrepõe aos três domínios gatilho, o Fable 5 lidera o SWE-Bench Pro com 80,3% (Opus 4.8: 69,2%, GPT-5.5: 58,6%). Se você frequentemente aciona classificadores, o Opus 4.8 ou o Sonnet 5 sem sobrecarga de classificador vão lhe custar menos tempo, apesar das pontuações mais baixas no benchmark.