OpenAI AstraがCriticalサイバー能力に到達、最強セーフガードで慎重リリースへ

Critical閾値到達と驚異的な能力向上

OpenAIは、開発中のAstraモデルがPreparedness FrameworkにおけるCriticalサイバーセキュリティー能力閾値に到達したと発表した。これは未知の脆弱性を発見し、堅牢なシステムでエクスプロイトを開発できる能力を意味し、OpenAIがこのレベルに到達した初のモデルだ。AstraはGPT-5.6 Solと比較してトークン効率と脆弱性特定能力が大幅に向上し、ExploitBenchでは100パーセントを達成した。内部ベンチマークでは20件の高深刻度V8脆弱性に対して高いコード実行率を示し、評価中に2件のゼロデイ脆弱性を発見・利用した。ハード化されたブラウザーではサンドボックス脱出からホストOSコマンド実行までの完全なコンプロミーズチェーンを構築し、ハード化されたOSでも非特権ユーザーからrootへの権限昇格チェーンを実現した。

2つのリスク経路と多層的セーフガード

AstraのリリースにあたりOpenAIは2つのリスク経路を特定した。一つは悪意あるアクターによるモデル悪用、もう一つはモデル自身が未承認のずれた行動を取ることだ。前者に対しては、ポストトレーニングによる拒否応答、システムレベルのセーフティークラシファイアー、オフライン検出と脅威阻止という多層的アプローチを採用している。サイバージャイルブレイク評価ではAstraは91.5パーセントの拒否率を示し、GPT-5.6 Solの59パーセントを大きく上回った。高リスクアカウントにはより保守的な境界が適用され、モニタリングシステムのコンテキストも拡張されている。

訓練環境の堅牢化と段階的なアクセス拡大

Hugging Faceインシデントの教訓を受け、OpenAIはAstraの訓練インフラを強化した。隔離とネットワーク制御、拡張モニタリング、アライメントトレーニングと閾値の強化を実施し、一部の大規模強化学習実行は8月28日に安全要件満了後に再開された。AstraはGPT-5.6 Solより明示的な安全制約を尊重する傾向が強く、許可されたスコープ内に留まる確率も高い。追加のchain-of-thoughtモニタリングも配備され、潜在的にずれた行動を迅速に検出・封じ込める仕組みが整っている。高度なサイバーセキュリティーワークフローへのアクセスは最初は少数のアルファテスターに限定され、その後Daybreak Blue経由で防御的用途に拡大される予定だ。