🧠 چارچوب Gym-Anything: تحولی در ارزیابی عاملهای هوش مصنوعی با تبدیل هر نرمافزاری به محیط تستمحققا…
انتشار: 2026/07/05 08:37 UTC
🧠 چارچوب Gym-Anything: تحولی در ارزیابی عاملهای هوش مصنوعی با تبدیل هر نرمافزاری به محیط تستمحققان دانشگاه کارنگی ملون با معرفی Gym-Anything، گامی بلند در مسیر ارزیابی واقعگرایانهی عاملهای هوش مصنوعی برداشتهاند. این چارچوب نوآورانه، هر نرمافزاری را به یک محیط تعاملی برای آموزش و ارزیابی عاملها تبدیل میکند.---🔧 فرآیند خودکار ساخت محیط با دو عامل هوشمندسیستم Gym-Anything از یک فرآیند چندعاملی (Multi-Agent) برای ساخت خودکار محیطها استفاده میکند:🔹 عامل برنامهنویس (Builder Agent): اسکریپتهای نصب و راهاندازی را مینویسد، دادههای واقعی را از منابع معتبر دانلود میکند، نرمافزار را پیکربندی کرده و محیط را برای اجرای وظایف آماده میسازد. این عامل از مدلهای زبانی بزرگ مثل Claude 4.5 Opus برای تولید کدهای setup استفاده میکند.🔹 عامل ممیزی (Validator Agent): کار عامل اول را از طریق اسکرینشاتها، لاگهای سیستم، فایلهای تولیدشده و چکلیستهای تعریفشده بررسی میکند. در صورت مشاهدهی هرگونه نقص، وظیفه را برای اصلاح به عامل برنامهنویس بازمیگرداند. این فرآیند تا زمانی که محیط کاملاً عملیاتی شود، ادامه مییابد.---📊 مجموعه CUA-World: بزرگترین مجموعهی وظایف واقعینتیجهی این رویکرد، مجموعهی CUA-World (Computer Use Agent World) است:✅ بیش از ۱۰,۰۰۰ وظیفه در ۲۰۰ نرمافزار مختلف (شامل نرمافزارهای دسکتاپ، تحتوب و خط فرمان)✅ پوشش همهی ۲۲ گروه شغلی بر اساس دادههای اقتصادی واقعی آمریکا (مشاغل سفید و یقهآبی)✅ حوزههای متنوعی مثل پزشکی، نجوم، مهندسی، امور مالی، حقوق، طراحی، آموزش و سیستمهای سازمانی✅ مجموعه CUA-World-Long: زیرمجموعهای از وظایف با بیش از ۵۰۰ مرحله که برای سنجش عملکرد در سناریوهای طولانیمدت طراحی شده است---📉 نتایج هشداردهنده: شکست عاملهای قوی در کارهای واقعیآزمایشهای گسترده روی CUA-World نشان داده که:🔸 مدل Gemini-3-Flash در حالت پایه، تنها ۱۱.۵٪ موفقیت در وظایف واقعی دارد🔸 با استفاده از همان روش ممیزی در زمان آزمون، عملکرد این مدل به ۱۴٪ بهبود یافته است🔸 در وظایف طولانیمدت (بیش از ۵۰۰ مرحله)، عملکرد عاملها بهشدت کاهش مییابد و حتی بهترین مدلها نیز در حفظ بافت، تعامل با رابط کاربری و بازیابی از خطا با مشکل مواجه میشوند---🎯 مقیاس واقعی در مقایسه با بنچمارکهای پیشینبرای درک بهتر عظمت این دستاورد، کافی است نگاهی به بنچمارکهای قبلی بیندازیم. OSWorld با ۹ نرمافزار و ۳۶۹ وظیفه و WebArena با ۶ وبسایت و ۸۱۲ وظیفه، هر دو بسیار محدودتر از WindowsAgentArena با ۱۱ نرمافزار و ۱۵۴ وظیفه عمل کردهاند. اما Gym-Anything با ۲۰۰ نرمافزار و بیش از ۱۰٬۰۰۰ وظیفه، گامی فراتر از تمامی این پلتفرمها برداشته و نمایندهای واقعی از پیچیدگیهای دنیای واقعی است.---💡 اهمیت این پژوهش برای آیندهسیستم Gym-Anything با حذف گلوگاه دستیسازی محیطها، امکان ساخت محیطهای آزمایش در مقیاس انبوه را فراهم کرده است. این رویکرد به پژوهشگران اجازه میدهد تا عاملهای خود را در شرایطی ارزیابی کنند که بهطرز غیرقابلمقایسهای به دنیای واقعی نزدیکتر است.---🔗 لینکهای مفید📄 مقاله:arxiv.org/abs/2604.06126%F0%9F%8C%90 صفحهی پروژه:cmu-l3.github.io/gym-anything/%F0%9F%92%BB کد و دادهها:github.com/cmu-l3/gym-anything--- #GymAnything #کارنگی_ملون #عامل_های_هوش_مصنوعی #ارزیابی_هوش_مصنوعی #پژوهش_هوش_مصنوعی #CUAWorld🆔 @asrgooyeshpardaz ❤️⭐️