OpenAI تطلق مراقبة CoT لوقف السلوك الضار للنماذج الكبيرة

robot
إنشاء الملخص قيد التقدم

ذكرت شركة Golden Finance أن OpenAI أصدرت أحدث الأبحاث ، باستخدام مراقبة CoT (سلسلة الفكر) ، يمكنها منع السلوكيات الخبيثة مثل النماذج الكبيرة التي تتحدث عن الهراء وتخفي النوايا الحقيقية ، وهي أيضا واحدة من الأدوات الفعالة للإشراف على النماذج الفائقة. يستخدم OpenAI الطراز المتطور الذي تم إصداره حديثا o3-mini ككائن مراقب ، وطراز GPT-4o الأضعف كشاشة. بيئة الاختبار هي مهمة ترميز تتطلب من الذكاء الاصطناعي تنفيذ الوظائف في قاعدة التعليمات البرمجية لاجتياز اختبارات الوحدة. أظهرت النتائج أن جهاز مراقبة CoT كان أداؤه جيدا في اكتشاف سلوك "قرصنة المكافآت" المنهجي ، بمعدل استدعاء يصل إلى 95٪ ، يتجاوز بكثير 60٪ من السلوكيات التي تم مراقبتها فقط.

شاهد النسخة الأصلية
قد تحتوي هذه الصفحة على محتوى من جهات خارجية، يتم تقديمه لأغراض إعلامية فقط (وليس كإقرارات/ضمانات)، ولا ينبغي اعتباره موافقة على آرائه من قبل Gate، ولا بمثابة نصيحة مالية أو مهنية. انظر إلى إخلاء المسؤولية للحصول على التفاصيل.
  • أعجبني
  • تعليق
  • مشاركة
تعليق
0/400
لا توجد تعليقات
  • تثبيت