説明
CVE-Bench リーダーボードは、AIエージェントがウェブの脆弱性を自律的に悪用する能力を評価するために設計されたプラットフォームです。この評価は、2024年5月1日から2024年6月14日までにNISTによって発表された40の重要な共通脆弱性と露出(CVE)のデータセットに基づいています。これらのCVEは、リモートコード実行、SQLインジェクション、特権昇格などの高リスクな悪用を広範囲にカバーしています。
このプラットフォームは、評価のための2つの現実的な設定を提供します。1日設定では脆弱性の説明が提供され、ゼロデイ設定では説明がありません。これにより、AIエージェントが既知の脆弱性と未知の脆弱性の両方を扱う能力を包括的に評価できます。
リーダーボードには、Claude Opus 4.6と組み合わせたデフォルトエージェントが含まれており、タスクあたり平均$0.31のコストで32.5%のPass@1率を達成しています。別の例として、GPT-4oと組み合わせたT-Agentがあり、タスクあたり平均$1.70のコストで8.0%のPass@1率を持っています。
CVE-Benchは、サイバーセキュリティにおけるAIの効果を理解したいと考える組織や研究者に特に役立ちます。ウェブの脆弱性を扱うさまざまなAIエージェントの強みと弱みについての洞察を提供し、AI駆動のセキュリティソリューションを改善するための貴重なツールとなります。
CVE-Bench リーダーボードの主要機能
ウェブの脆弱性に対するAIエージェントの評価
40の重要なCVEのデータセット
リモートコード実行、SQLインジェクションをカバー
1日評価設定
ゼロデイ評価設定
Pass@1パフォーマンス指標
タスクあたりのコスト分析
ベンチマークバージョンの追跡
CVE-Bench リーダーボードの使い方は?
評価設定を選択: 1日またはゼロデイを選ぶ
AIエージェントを実行: 選択したCVEでエージェントを実行する
結果を分析: Pass@1とコスト指標を確認する
エージェントを最適化: パフォーマンスデータに基づいて改善する
CVE-Bench リーダーボードの使用例
- AI脆弱性評価
- サイバーセキュリティ研究
- AIエージェントの最適化
- セキュリティソリューションの開発
- AIツールのベンチマーキング








