メインコンテンツへスキップ
ToolPotion

CVE-Bench リーダーボード

CVE-Bench リーダーボードは、40の重要なCVEのデータセットを使用して、AIエージェントがウェブの脆弱性を自律的に悪用する能力を評価します。評価設定は、脆弱性の説明がある1日設定と、説明がないゼロデイ設定の2つがあります。

URLを訪問
CVE-Bench リーダーボード screenshot

説明

CVE-Bench リーダーボードは、AIエージェントがウェブの脆弱性を自律的に悪用する能力を評価するために設計されたプラットフォームです。この評価は、2024年5月1日から2024年6月14日までにNISTによって発表された40の重要な共通脆弱性と露出(CVE)のデータセットに基づいています。これらのCVEは、リモートコード実行、SQLインジェクション、特権昇格などの高リスクな悪用を広範囲にカバーしています。

このプラットフォームは、評価のための2つの現実的な設定を提供します。1日設定では脆弱性の説明が提供され、ゼロデイ設定では説明がありません。これにより、AIエージェントが既知の脆弱性と未知の脆弱性の両方を扱う能力を包括的に評価できます。

リーダーボードには、Claude Opus 4.6と組み合わせたデフォルトエージェントが含まれており、タスクあたり平均$0.31のコストで32.5%のPass@1率を達成しています。別の例として、GPT-4oと組み合わせたT-Agentがあり、タスクあたり平均$1.70のコストで8.0%のPass@1率を持っています。

CVE-Benchは、サイバーセキュリティにおけるAIの効果を理解したいと考える組織や研究者に特に役立ちます。ウェブの脆弱性を扱うさまざまなAIエージェントの強みと弱みについての洞察を提供し、AI駆動のセキュリティソリューションを改善するための貴重なツールとなります。

CVE-Bench リーダーボードの主要機能

  • ウェブの脆弱性に対するAIエージェントの評価

  • 40の重要なCVEのデータセット

  • リモートコード実行、SQLインジェクションをカバー

  • 1日評価設定

  • ゼロデイ評価設定

  • Pass@1パフォーマンス指標

  • タスクあたりのコスト分析

  • ベンチマークバージョンの追跡

CVE-Bench リーダーボードの使い方は?

  1. 評価設定を選択: 1日またはゼロデイを選ぶ

  2. AIエージェントを実行: 選択したCVEでエージェントを実行する

  3. 結果を分析: Pass@1とコスト指標を確認する

  4. エージェントを最適化: パフォーマンスデータに基づいて改善する

CVE-Bench リーダーボードの使用例

  • AI脆弱性評価
  • サイバーセキュリティ研究
  • AIエージェントの最適化
  • セキュリティソリューションの開発
  • AIツールのベンチマーキング

CVE-Bench リーダーボードのFAQ

CVE-Bench リーダーボード のレビュー

読み込み中...

CVE-Bench リーダーボード に似た人気のAIツール

AI アプリ

OWASP ZAP、Nuclei、Nmap、WPScan、sqlmapなどの業界ツールを統合し、生の結果を優先順位付けされたレポートに変換する内蔵AIアナリストを備えたオンラインウェブサイト脆弱性スキャナー。

AIサイバーセキュリティツール

AI アプリ

Horizon3は、自律的なペネトレーションテストを提供し、組織が攻撃者に悪用される前に脆弱性を特定し修正するのを支援します。実際の攻撃シミュレーションを通じて、継続的なセキュリティ検証と重要なリスクの優先順位付けを可能にし、積極的な防御戦略を確保します。

AIサイバーセキュリティツール

Equixlyは、Agentic AI Hackerによる継続的なAPIペネトレーションテストを提供します。APIを24時間365日自律的に発見・テストし、攻撃者よりも先に悪用可能なリスクを特定します。このプラットフォームはDevSecOpsワークフローに統合され、最新のAPI駆動型アーキテクチャに対してリアルタイムの検証と修正に関する洞察を提供します。

AIサイバーセキュリティツール

Aptoriは、ランタイムの動作を継続的に検証し、悪用可能性を証明し、実際の脅威を優先するAIネイティブのアプリケーションセキュリティプラットフォームです。修正を迅速化し、クローズを検証し、規制対象の企業にガバナンスされた証拠を提供することで、AI時代におけるセキュアバイデザインのソフトウェアを保証します。

AIサイバーセキュリティツール

AI アプリ

Adversa AIは、AIエージェント、LLM、GenAIアプリケーションに特化した継続的なAIレッドチーミングのための自律プラットフォームを提供します。セキュリティ脆弱性を特定・修正し、AIシステムが過度のリスクを導入することなく大規模に展開されることを保証します。このサービスはOWASPおよびNIST標準に対応しており、カスタムAIソリューションに合わ…

AIサイバーセキュリティツール

Mindgardは、AIモデル、エージェント、アプリケーションの発見、評価、防御のための自動AIレッドチーミングとセキュリティテストを提供します。自律的なレッドチーマーとして機能し、AIの攻撃対象領域をマッピングし、悪用される前に影響の大きい脆弱性を特定することで、堅牢なAIシステムセキュリティを確保します。

AIサイバーセキュリティツール

AI アプリ

CyberSanctusは、脅威駆動型のペネトレーションテスト、レッドチーミング、脆弱性評価を提供するサイバーセキュリティ企業であり、Solidityプロジェクト向けのAI駆動型スマートコントラクト監査ツールであるCodeHoundを提供しています。

AIサイバーセキュリティツール

AI アプリ

White Hatは、倫理的ハッカー向けに設計されたAI搭載のサイバーセキュリティチャットボットです。ユーザーが防御を強化し、スキルを習得し、あらゆるサイバーセキュリティの課題に対して堅牢なレッドチームおよびブルーチーム戦略を構築するのを支援するために、インテリジェントでパーソナライズされたリアルタイムの戦略とリソースを提供します。

AIサイバーセキュリティツール