لقد ثبت أن جعل ChatGPT يعمل بشكل مستقل ضمن حدود نظام التشغيل مهمة صعبة لأسباب عديدة، لكن فريقًا مكونًا من علماء من أبحاث Microsoft وجامعة بكين ربما اكتشفوا الخلطة السرية.
أجرى الفريق دراسة لتحديد سبب فشل نماذج اللغات الكبيرة للذكاء الاصطناعي (AI) مثل GPT-4 في المهام التي تتطلب معالجة نظام التشغيل.
تحدد أحدث الأنظمة مثل ChatGPT التي تعمل على GPT-4 المعيار للمهام التوليدية مثل صياغة رسالة بريد إلكتروني أو كتابة قصيدة. لكن حملهم على العمل كوكلاء ضمن بيئة عامة يشكل تحديًا كبيرًا.
تقليديًا، يتم تدريب نماذج الذكاء الاصطناعي على الاستكشاف من خلال التعلم المعزز في بيئة افتراضية. استخدم مطورو الذكاء الاصطناعي إصدارات معدلة من ألعاب الفيديو الشهيرة مثل Super Mario Bros. وMinecraft “لتعليم” مفاهيم النماذج مثل الاستكشاف الموجه ذاتيًا والبحث عن الأهداف.
لكن أنظمة العمليات تمثل ملعبًا مختلفًا تمامًا لنماذج الذكاء الاصطناعي. كوكلاء، غالبًا ما يمثل أداء الوظائف داخل نظام التشغيل تحديًا متعدد الوسائط يتطلب تبادل المعلومات بين المكونات والبرامج والتطبيقات المختلفة.
بشكل عام، يتطلب نهج التدريب المعزز التجربة والخطأ. ومع ذلك، نظرًا لأن أي شخص قام بإدخال كلمة المرور الخاصة به بشكل غير صحيح عدة مرات، أو نسي الاختصارات التي تعمل بها التطبيقات، يمكن بسهولة فقدان البيانات عند استخدام مثل هذا الأسلوب في بيئة نظام التشغيل.
متعلق ب: مشغل ChatGPT سعيد بالأسلحة النووية، الذكاء الاصطناعي لـ SEGA في الثمانينات، ارتفاع TAO بنسبة 90%: AI Eye
عمل الباحثون مع العديد من حاملي شهادات الماجستير بما في ذلك Llama2 70B مفتوح المصدر من Meta وGPT-3.5 وGPT-4 من OpenAI. ووفقا للبحث، لم يكن أداء أي منهم جيدا بشكل خاص.
وفقًا لورقة الفريق، يرجع ذلك إلى أن التحدي يتجاوز حاليًا قدرات الذكاء الاصطناعي اليوم:
“أولاً، مساحة العمل واسعة وديناميكية. … ثانيًا، غالبًا ما تتطلب المهام الواقعية التعاون بين التطبيقات، مما يتطلب تخطيطًا بعيد النظر من وكلاء LLM. ثالثًا، يحتاج الوكلاء إلى تحديد الحلول المثلى التي تتوافق مع قيود المستخدم، مثل المخاوف والتفضيلات الأمنية.
لكي يتمكن الباحثون من اكتشاف طريقة للتغلب على هذه التحديات، كان عليهم أولاً أن يفهموا سبب فشل حاملي شهادات الماجستير في التعامل مع أنظمة التشغيل عندما كانت بعض نماذج الذكاء الاصطناعي قادرة على تحقيق إنجازات خارقة مثل التغلب على جميع القادمين في لعبة الشطرنج ولعبة Go.
قام الفريق بتطوير بيئة تدريب جديدة تسمى AndroidArena والتي سمحت لحاملي LLM باستكشاف بيئة مشابهة لنظام التشغيل Android. وبعد ذلك، بعد إنشاء مهام اختبار ونظام مرجعي، حددوا الافتقار إلى أربع قدرات رئيسية باعتبارها المسؤولة: الفهم والتفكير والاستكشاف والتفكير.
في حين أن نطاق العمل كان يهدف على وجه التحديد إلى تغطية تحديد المشكلة، فقد حدد الفريق أثناء عملية البحث طريقة “بسيطة” لزيادة دقة النموذج بنسبة 27%.
بشكل أساسي، قام الفريق بدفع النموذج بمعلومات آلية تتعلق بعدد المحاولات التي قام بها سابقًا وما حاول خلال تلك المحاولات. وقد عالج هذا مشكلة نقص “الانعكاس” من خلال تضمين الذاكرة داخل المطالبات المستخدمة لتشغيلها.
يمكن أن يكون هذا المسار من البحث مهمًا في السعي لبناء مساعد أفضل للذكاء الاصطناعي،













