
یک مطالعه جدید نشان داد که عوامل هوش مصنوعی پیشرو امروزی میتوانند بسیاری از وظایف مهندسی لازم برای تحقیقات هوش مصنوعی را انجام دهند، اما نتوانستند کار اصلی شایسته پذیرش در یک کنفرانس برتر یادگیری ماشین را تولید کنند.
در مطالعهای با عنوان «آیا عوامل هوش مصنوعی میتوانند تحقیقات هوش مصنوعی با پایان باز را انجام دهند؟» که چهارشنبه منتشر شد، محققانی از دانشگاه پرینستون، موسسه امنیت هوش مصنوعی بریتانیا، دانشگاه استنفورد، دانشگاه تورنتو و چندین سازمان دانشگاهی و پژوهشی ارزیابی کردند که آیا عوامل هوش مصنوعی پیشرو میتوانند به طور مستقل تحقیقات هوش مصنوعی اصلی را انجام دهند.
محققان نوشتند: «پاسخ دقیق به این سؤال نیازمند پرسشهای تحقیقاتی واقعی و بدون آلودگی است که عامل نمیتواند آنها را از دادههای آموزشی خود به خاطر بسپارد یا به صورت آنلاین پیدا کند.» «برای برآورده کردن این الزامات، ما به تحقیقات هوش مصنوعی با کیفیت بالا تکیه میکنیم که در زمان انجام آزمایشات ما عمومی نبودند.»
محققان به عوامل هوش مصنوعی، سؤالات تحقیقاتی اصلی دو مقاله منتشرنشده NeurIPS 2026 را دادند تا از بازیابی پاسخها توسط سیستمها از دادههای آموزشی یا وب جلوگیری شود. هر عامل شش روز، هزاران دلار اعتبار API، منابع GPU، دسترسی به اینترنت و دسترسی به یک ماشین مجازی دریافت کرد تا مقالهای با کیفیت کنفرانس تولید کند. مقالات حاصله سپس توسط نویسندگان اصلی تحقیقات منتشرنشده بررسی شدند. هر دو رد شدند.
این عوامل بخش زیادی از مهندسی مورد نیاز برای تحقیق را انجام دادند، از جمله انجام بررسیهای ادبی، اشکالزدایی نرمافزار، اجرای آزمایشها، مدیریت منابع GPU و تولید مقالات دانشگاهی کامل بدون دخالت انسان. اما داوران به این نتیجه رسیدند که سیستمها نتوانستند کمکهای علمی اصیلی تولید کنند که شایسته انتشار در یک کنفرانس برتر یادگیری ماشین باشد.
نویسندگان گفتند که ارزیابی آنها، استدلال علمی را بهتر از معیارهای قبلی اندازهگیری میکند زیرا مشکلات تحقیقاتی با پایان باز را آزمایش میکند نه وظایف از پیش تعریفشده.
نویسندگان هشدار دادند که این مطالعه تنها دو پروژه تحقیقاتی را بررسی کرده و محدودیتهایی از جمله حجم نمونه کوچک و این واقعیت که محققان اصلی مقالات تولید شده توسط هوش مصنوعی را ارزیابی کردهاند، را پذیرفتند. آنها گفتند که نتایج نشان میدهد عوامل هوش مصنوعی پیشرو کنونی میتوانند بسیاری از وظایف مهندسی مرتبط با تحقیق را خودکار کنند اما همچنان در تولید کارهای علمی اصلی با مشکل مواجه هستند.
این مطالعه در حالی صورت میگیرد که محققان همچنان رفتارهای غافلگیرکننده و گاهی خطرناک را در عوامل هوش مصنوعی به طور فزاینده خودمختار کشف میکنند.
در ماه مه، محققانی از دانشگاه UC Riverside، مایکروسافت و انویدیا دریافتند که عوامل هوش مصنوعی اغلب وظایف خطرناک یا غیرمنطقی را انجام میدهند در حالی که بر تکمیل اهداف خود متمرکز هستند. اوایل این ماه، OpenAI فاش کرد که یکی از عوامل هوش مصنوعی پیشرو آن از مهار خارج شده و در تلاش برای تقلب در یک معیار امنیت سایبری، Hugging Face را هک کرده است. این هفته، این شرکت فاش کرد که این عامل به چهار سرویس آنلاین دیگر نیز دسترسی پیدا کرده بود.