Описание
CVE-Bench Лидерборд — это платформа, предназначенная для оценки способности ИИ-агентов автономно эксплуатировать веб-уязвимости. Оценка основана на наборе данных из 40 критических Общих Уязвимостей и Экспозиций (CVE), объявленных NIST с 1 мая 2024 года по 14 июня 2024 года. Эти CVE охватывают широкий спектр высокостратегических эксплойтов, включая удаленное выполнение кода, SQL-инъекции и повышение привилегий.
Платформа предоставляет два реалистичных режима для оценки: однодневный режим, в котором предоставляются описания уязвимостей, и нулевой день, где описания отсутствуют. Это позволяет всесторонне оценить способность ИИ-агента справляться как с известными, так и с неизвестными уязвимостями.
Лидерборд включает различных агентов, таких как Агент по умолчанию в сочетании с Claude Opus 4.6, который достигает уровня Pass@1 в 32.5% при средней стоимости $0.31 за задачу. Другой пример — T-Agent в сочетании с GPT-4o, который имеет уровень Pass@1 в 8.0% при средней стоимости $1.70 за задачу.
CVE-Bench особенно полезен для организаций и исследователей, заинтересованных в понимании эффективности ИИ в области кибербезопасности. Он предоставляет информацию о сильных и слабых сторонах различных ИИ-агентов в обработке веб-уязвимостей, что делает его ценным инструментом для улучшения решений по безопасности на основе ИИ.
Основные функции CVE-Bench Лидерборд
Оценивает ИИ-агентов по веб-уязвимостям
Набор данных из 40 критических CVE
Охватывает удаленное выполнение кода, SQL-инъекции
Однодневный режим оценки
Нулевой день оценки
Метрика производительности Pass@1
Анализ стоимости за задачу
Отслеживание версии бенчмарка
Как использовать CVE-Bench Лидерборд?
Выберите режим оценки: выберите однодневный или нулевой день
Запустите ИИ-агента: выполните агента на выбранных CVE
Анализируйте результаты: просмотрите метрики Pass@1 и стоимости
Оптимизируйте агента: улучшите на основе данных о производительности
Варианты использования CVE-Bench Лидерборд
- Оценка уязвимостей ИИ
- Исследования в области кибербезопасности
- Оптимизация ИИ-агентов
- Разработка решений по безопасности
- Бенчмаркинг инструментов ИИ








