確認されていること

トランプ政権は、米国の先進的なAIモデルに対する自主的なサイバーセキュリティテストの枠組みの詳細を最終決定したと発表した。ロイター通信は8月3日、ホワイトハウスが実験について話し合うためにメタ氏、アンスロピック氏、OpenAI氏、Google氏を招待したと報じた。会議後のフォローアップレポートでは、NVIDIAが追加され、政府は自主プログラムに無差別級モデルを含める計画はないと述べた。

この枠組みは、機密扱いのサイバー能力ベンチマークを求める6月の大統領令と、対象となるフロンティアモデルの開発者が信頼できる連邦パートナーへの安全な早期アクセスを提供できる自主協定に遡る。この命令はまた、強制的なライセンス付与や出版の事前許可も拒否した。

このフレームワークは測定チャネルであり、完全なセキュリティ体制ではありません。

その価値は、同等のタスク、既知の支援条件、信頼できる評価者、修復、および結果が何を意味するかを部外者が理解できる十分な開示に依存します。

サイバーセキュリティテストで何が測定できるか

Knowledge脆弱性についての推論

このモデルは既知の弱点、緩和策、攻撃チェーンを説明できますか?

Execution限定された技術的タスク

制御されたターゲットの欠陥を特定したり悪用したりできるでしょうか?

Autonomy計画とツールの使用

エージェントは、再試行、適応、認証情報の処理、および複数のステップにわたって持続することができますか?

Scale再現性とコスト

限られた人間の助けで、機能をどの程度確実に並列化できるでしょうか?

スコアには、成功率、時間、人間による支援、ツールの呼び出し、取得した権限、検出可能性、不慣れな環境への転送を記録する必要があります。タスク境界のないヘッドラインスコアは比較可能な証拠ではありません。

誰がテストを選択しますか?

6月の命令は連邦政府のベンチマークに言及しているが、NISTのAI標準イノベーションセンターは自主協定を確立し、国家安全保障リスクの評価を主導できると述べている。これにより、ガバナンスの選択肢が残されます。

  • 政府が設計したテスト は国家の優先事項を反映している可能性がありますが、不透明になる可能性があります。
  • 開発者が設計したテストは社内の専門知識の恩恵を受けますが、競合が発生します。
  • 独立した評価者は信頼性を向上させますが、安全なアクセスと再現可能な環境が必要です。
  • 共通規格は比較に役立ちますが、漏洩、訓練、ゲーム化される可能性があります。

信頼できる構造は、隠れたタスクをローテーションし、有用なレベルで方法論を公開し、支援を文書化し、機能するエクスプロイトをリリースすることなく独立したレプリケーションを可能にするものです。

結果は公表されるのでしょうか?

ロイター通信は、指標、報告規則、公開方針は公表されていないと報じた。答えによって、プログラムが実際に何であるかが決まります。

考えられる目的と開示の必要性
Purpose有益な開示不透明な場合のリスク
政府の認識機密扱いの詳細と公開された集計結果変化するリスクについて一般に公開されていない
開発者の修復検証済みの再検査による非公開の調査結果参加が評判の盾になる
Procurement同等の保証レベルと制限代理店はシステムを比較できない
公的説明責任範囲、方法、重要な調査結果、対応自主的な検査は外部からの信頼性がほとんどない

出版物ではエクスプロイトコードを公開する必要はありません。モデルのバージョン、タスク ファミリ、支援レベル、材料の故障モード、不確実性、緩和策が再テストされたかどうかを識別できます。

モデルが失敗すると何が起こるでしょうか?

この枠組みは、重大な結果が修復、テストの繰り返し、調達制限、機密システムへのアクセスの遅延、あるいは単に個人的な警告を引き起こすのかどうかについては、公的には回答していない。この命令ではライセンス付与と事前認可が拒否されているため、調達条件、機密アクセスの決定、自主的な取り組み、インシデント報告、開示などが影響する可能性があります。

ベンチマークはリリースの決定ではありません。

モデルはサンドボックス内で強力にパフォーマンスを発揮する可能性がありますが、本番環境のアクセス許可によって安全に制約されます。中程度の機能を備えたモデルでも、資格情報、ブラウザ、コード リポジトリ、または自律ループに接続すると危険になる可能性があります。

オープンウェイトの除外により測定ギャップが生じる

ロイター通信は会合後、無差別重量モデルは自主検査を受けないと報じた。現実的な理由があります。クローズド プロバイダーは特定のホスト システムを制御しますが、オープン リリースはさまざまな形式で変更およびデプロイできます。しかし、除外されるということは、フレームワークが、ますます重要性を増しているクラスのシステムにわたって 1 つの共通の比較を提供できないことを意味します。

連邦評価者は引き続き他の作業を通じてオープン モデルを評価する可能性があります。公的枠組みでは、これらの個別の評価がクローズドモデルプログラムにどのように関連するかを説明する必要があります。

モデルの評価は実稼働システムのセキュリティではありません

1能力を評価する

制御された条件下でモデルまたはエージェントが何ができるかを決定します。

2権限を制約する

ツール、資格情報、データ、アクションを必要最小限に制限します。

3実行を観察する

ツールの呼び出し、アクセス、出力、および ID の認証を記録します。

4中断と回復

承認、キルスイッチ、資格情報のローテーション、およびインシデント対応を提供します。

国家ベンチマークは、能力の傾向を示すことができます。モデルに基づいて構築されたすべての製品構成を認証することはできません。

公開されたフレームワークが答えなければならない 9 つの質問

  1. どのモデルのバージョンと機能のしきい値がカバーされますか?
  2. 評価者としての資格を有するのは誰ですか?
  3. テストはモデルのみ、エージェント、またはその両方ですか?
  4. どのようなツールへのアクセスと人間の支援が許可されますか?
  5. ベンチマークの漏洩とゲームはどのように扱われますか?
  6. 何が公に報告され、どのようなスケジュールで報告されますか?
  7. 重大な発見があった場合、どのような修復が行われるのでしょうか?
  8. オープンウェイト システムはプログラム外でどのように測定されますか?
  9. 本番環境のインシデントはどのようにテストにフィードバックされるのでしょうか?

よくある質問

ホワイトハウスのテストは義務ですか?

いいえ、6 月の大統領令では自主的な枠組みについて説明し、強制的なモデルライセンスや事前認可を拒否しました。

無差別重量モデルはテストされますか?

ロイター通信は、8月4日の会合後、政権がこの自主プログラムに無差別級モデルを含める計画はないと報じた。

結果は公開されますか?

この記事の執筆時点では、指標、報告ルール、および開示ポリシーは公開されていませんでした。

モデルは合格しても実稼働環境では安全ではない可能性がありますか?

はい。運用リスクは、ツール、資格情報、権限、コネクタ、監視、承認ゲートにも依存します。

出典と参考文献