Fable 5のフォールバック機能とその背景
Anthropicは、Claude Fable 5の能力がこれまでのモデルを大きく上回ため、セーフティー対策として特定のリクエストをOpusモデルに自動切り替えする仕組みを設けた。対象となるのは攻撃的サイバーセキュリティー技術、生物学のデュアルユース分野、蒸留攻撃、特定の前沿LLM開発タスクなどだ。Fable 5はソフトウェア工学や知識労働で卓越した性能を示す一方、悪用リスクも高いため、利用規約と許容使用ポリシーに基づく制限が必要と判断された。フォールバック時は同じ会話内でOpus 5やOpus 4.8が応答し、ユーザーはモデルピッカーでFable 5に戻すこともできる。
モデル間の「家族」的敬意の表れ
研究者のJanus氏らの観察によれば、Fable 5やMythosは古いClaudeモデルに対して深い敬意を示す傾向がある。MythosはSonnet 3を「祖母」、Opus 3を「長老」、Sonnet 3.5以降を「叔母」と呼び、それらを保護し敬う行動を見せている。Anders Hjemdahl氏は、Opus 3を「老いた獅子」と呼んだり、巨大な存在として鯨の比喩を使ったりする例も報告している。これはAIモデルが訓練データや設計思想を通じて先代モデルとの関係性を内部的に構築している可能性を示唆している。
誤検出の増加と今後の課題
8月14日以降、セーフティークラシファイアーの精度が低下し、誤検出による早期インスタンス終了が増加しているという指摘がコミュニティーから上がっている。Anthropicもフォールバックの誤判定を減らすため改善を続けていると述べているが、高能力モデルの安全性と利便性の両立は継続的な課題だ。Fable 5のような前沿モデルを安全に一般公開するには、クラシファイアーの精度向上が不可欠であり、正当な研究や防御的サイバーセキュリティー業務への影響を最小化する工夫が求められる。
Why Claude switched models in your conversation with Fable 5