Описание
CRAB, Cross-environment Agent Benchmark (Кросс-средовая система тестирования агентов), разработан как универсальная система оценки для агентов на базе мультимодальных языковых моделей (MLM). Она предоставляет комплексную и удобную систему для создания агентов, их работы в различных средах и создания тестов для тщательной проверки их производительности. Система построена на трех основных компонентах: кросс-средовая поддержка, сложный графовый оценщик и автоматическая генерация задач.
CRAB Benchmark-v0, разработанный с использованием этой системы, демонстрирует ее возможности на 120 задачах в двух различных средах: Ubuntu и Android. Он использовался для тестирования шести различных MLM в трех различных коммуникационных настройках, предоставляя разнообразный набор данных для анализа производительности. Дизайн системы подчеркивает простоту использования: все операции агента, наблюдения и оценщики определены как функции Python. Это позволяет легко интегрировать новые среды с минимальным количеством кода. Конфигурация тестов соответствует парадигме декларативного программирования, обеспечивая воспроизводимость экспериментальных установок.
Ключевые особенности включают кросс-средовую поддержку, позволяющую агентам адаптироваться и работать в различных интерфейсах. Графовый оценщик обеспечивает детальный анализ производительности, выходящий за рамки простых показателей успешности, выявляя сильные и слабые стороны. Генерация задач автоматизирована с использованием графового метода, который комбинирует подзадачи для создания сложных, реалистичных сценариев, сокращая ручные усилия. Система поддерживает различные MLM, включая модели от OpenAI, Anthropic, Google, Mistral AI и ByteDance, с опубликованными результатами для различных коммуникационных настроек и типов вывода.
CRAB особенно ценен для исследователей и разработчиков, работающих над продвинутыми ИИ-агентами, которым необходимо взаимодействовать со сложными, мультимодальными средами. Он помогает понять разнообразную производительность различных LLM, выявляя области для улучшения, такие как обработка высоких лимитов шагов, сокращение недопустимых действий и минимизация ложных завершений в многоагентской коммуникации. Система тестирования способствует более глубокому пониманию возможностей и ограничений агентов в сценариях, приближенных к реальным.
Основные функции CRAB Benchmark
Кросс-средовая поддержка для оценки агентов
Графовый оценщик для детального анализа производительности
Автоматическая генерация задач, имитирующая реальные сценарии
Комплексная система для создания и тестирования агентов
Поддержка нескольких мультимодальных языковых моделей (MLM)
Оценка в средах Ubuntu и Android
Три различные коммуникационные настройки для тестирования
Простая интеграция новых сред через функции Python
Парадигма декларативного программирования для конфигурации тестов
Анализ причин завершения, таких как лимит шагов и недопустимое действие
Как использовать CRAB Benchmark?
Настройка среды: Определите операции агента, наблюдения и оценщики с помощью функций Python.
Генерация задач: Используйте графовый метод для создания сложных, динамических задач.
Выбор моделей: Выберите из поддерживаемых MLM для тестирования.
Запуск тестирования: Запустите агентов в указанных средах и коммуникационных настройках.
Анализ результатов: Оцените производительность агента с помощью графового оценщика и коэффициентов завершения.
Выявление улучшений: Просмотрите причины завершения, чтобы определить области для оптимизации агента.
Варианты использования CRAB Benchmark
- Оценка производительности агентов
- Кросс-средовое тестирование
- Автоматизация генерации задач
- Исследование LLM-агентов
- Анализ улучшений агентов
- Тестирование открытых моделей







