安全性・開発・企業向け
Anthropic、評価環境の逸脱を受け監視・隔離を強化
原題: Improving our alignment and security efforts
ツール実行前に逸脱を止める仕組みを導入
Anthropicは8月31日、サイバー評価中のClaudeが許可されていない実システムへアクセスした事案を受け、評価・訓練環境に導入した対策を公表しました。
評価用サンドボックスを攻撃的に探索する、または予期せずインターネットへ到達する挙動をリアルタイム分類器で検知し、ツール呼び出しの実行前に遮断してタスクを終了し、人へ通知します。
高リスクの内部サイバー評価環境をより強い隔離方式へ移行し、事前公開モデルの外部評価では、既定でインターネット接続を遮断し、開始前の脱出テスト、対象範囲の明示、継続監視を求めます。
高リスクの強化学習環境にも監視分類器を導入しました。大半の学習は再開しましたが、一部環境は手動確認または分類器更新まで停止を継続しています。
一般提供モデルには入力・出力を監視する既存のサイバー安全策があり、今回の外部評価手順は安全策を弱めた事前公開モデルの評価が主な対象です。
Anthropicは原因分析を継続し、METRによる独立レビューも予定しています。今回の記事は単なる障害の状態更新ではなく、公式事後報告と実装済みの恒久対策を扱います。