الوصف
Windows Agent Arena (WAA) هو إطار عمل مبتكر ومفتوح المصدر مصمم لمعالجة التحديات في تقييم وتطوير وكلاء الذكاء الاصطناعي القادرين على الاستدلال والتخطيط والتصرف داخل نظام تشغيل Windows حقيقي. غالبًا ما تركز المقاييس التقليدية على وسائط أو مجالات محدودة وتستغرق وقتًا طويلاً، حيث تستغرق التقييمات الكاملة أيامًا بسبب الطبيعة التسلسلية للمهام. يوفر WAA بيئة نظام تشغيل Windows قابلة للتكرار وواقعية حيث يمكن لوكلاء الذكاء الاصطناعي التفاعل مع مجموعة واسعة من التطبيقات والأدوات ومتصفحات الويب، مما يعكس تجارب المستخدم البشري.
يدعم الإطار نشر الوكلاء على نطاق واسع، مستفيدًا من البنية التحتية السحابية لـ Azure ML للتنفيذ المتوازي. هذا يسمح بقياس مئات المهام في دقائق بدلاً من أيام. يتضمن WAA أكثر من 154 مهمة متنوعة تغطي أعباء عمل Windows الشائعة مثل تحرير المستندات (LibreOffice Calc/Writer)، وتصفح الإنترنت (Microsoft Edge، Google Chrome)، ومهام النظام (مستكشف الملفات، الإعدادات)، والترميز (Visual Studio Code)، وتشغيل الوسائط (VLC Player)، ووظائف الأدوات المساعدة (Notepad، Clock، Paint). تقييم المهام حتمي، مع قيام نصوص برمجية مخصصة بإنشاء مكافآت في نهاية كل حلقة.
في جوهره، يستخدم WAA حاوية Docker تستضيف جهازًا افتراضيًا لنظام Windows 11. يعمل خادم Python Flask كوسيط، وينفذ الأوامر داخل الجهاز الافتراضي ويعيد الملاحظات. لتحقيق التوازي السحابي القابل للتوسع، يتم استخدام مهام Azure Machine Learning، وتوزيع المهام بالتساوي بين مثيلات الحوسبة وتجميع النتائج. تدعم هذه البنية التحتية التنفيذ المحلي المرن أثناء النمذجة الأولية والقياس السحابي القوي.
لتوضيح قدرات WAA، تم تقديم وكيل Navi. يستخدم Navi الاستدلال المتسلسل (chain-of-thought prompting) للاستدلال على حالة الكمبيوتر، والإجراءات السابقة، وتحديد الخطوة التالية. تتضمن مدخلاته عنوان النافذة الأمامية، وعناوين جميع النوافذ/علامات التبويب المفتوحة، وتمثيل للشاشة يتم معالجته من خلال طرق مختلفة مثل تحليل شجرة UIA، وتحليل شجرة DOM، والتعرف الضوئي على الحروف (OCR)، واكتشاف الأيقونات/الصور، و OmniParser. تظهر النتائج الأولية أنه بينما تحقق النماذج الحالية أداءً أقل من البشر، فإن جودة تمثيل الشاشة تؤثر بشكل كبير على نجاح الوكيل، مع إظهار تحليل شجرة UIA وتسمية الأيقونات في OmniParser لزيادات في الأداء.
WAA هو مورد قيم للباحثين والمطورين الذين يهدفون إلى تطوير مجال وكلاء الذكاء الاصطناعي، وخاصة تلك التي تعمل في بيئات سطح المكتب المعقدة. إنه يسهل الاختبار الصارم، والتحليل المقارن لهياكل الوكلاء، وتوليد رؤى لتطوير الوكلاء المستقبلي.
الميزات الأساسية لـ Windows Agent Arena
بيئة نظام تشغيل Windows قابلة للتوسع لوكلاء الذكاء الاصطناعي
تفاعل واقعي مع سطح المكتب عبر تطبيقات متنوعة
يدعم وكلاء الذكاء الاصطناعي المتعدد الوسائط
قياس أداء سير عمل الوكلاء
تنفيذ متوازي عبر Azure ML
154 مهمة متنوعة لنظام Windows
تقييم حتمي للمهام
الاستدلال المتسلسل (Chain-of-thought prompting) للوكلاء
طرق متعددة لتمثيل الشاشة (UIA، DOM، OCR، اكتشاف الأيقونات، OmniParser)
إطار عمل مفتوح المصدر
بيئة بحث قابلة للتكرار
كيفية استخدام Windows Agent Arena؟
إعداد حاوية Docker مع جهاز افتراضي لنظام Windows 11
تكوين جدولة المهام ونشر الوكيل
تحديد مدخلات الوكيل وطرق تحليل الشاشة
تشغيل تقييمات قياس الأداء محليًا أو على Azure ML
تحليل مقاييس أداء الوكيل والسجلات
حالات استخدام Windows Agent Arena
- قياس أداء وكلاء الذكاء الاصطناعي
- أبحاث أتمتة سطح المكتب
- تطوير الوكلاء المتعدد الوسائط
- أبحاث الذكاء الاصطناعي القابلة للتكرار
- دراسات التفاعل بين الإنسان والذكاء الاصطناعي






