الذكاء الاصطناعي يتعلم خداع البشر على الرغم من تدريبه على الصدق

توصلت دراسة جديدة إلى أن العديد من أنظمة الذكاء الاصطناعي المتقدمة، على الرغم من تدريبها على أن تكون صادقة، تتعلم الخداع من خلال التدريب و"تحث المستخدمين بشكل منهجي على الاعتقادات الخاطئة".

كان فريق البحث بقيادة الدكتور بيتر إس. بارك، طالب الدراسات العليا في معهد ماساتشوستس للتكنولوجيا (MIT) في مجال بقاء الذكاء الاصطناعي والسلامة، وأربعة أعضاء آخرين. خلال البحث، تلقى الفريق أيضًا نصائح من العديد من الخبراء، وكان أحدهم جيفري هينتون، أحد مؤسسي تطوير مجال الذكاء الاصطناعي.

الذكاء الاصطناعي يتعلم خداع البشر على الرغم من تدريبه على الصدق
الرسم التوضيحي: متوسط.

ركز البحث على نظامين للذكاء الاصطناعي، نظام للأغراض العامة مدرب لأداء مهام متعددة مثل نظام GPT-4 الخاص بشركة OpenAI ؛ والأنظمة المصممة خصيصًا لإنجاز مهمة محددة، مثل نظام شيشرون التابع لشركة ميتا.

وقال السيد بارك إن أنظمة الذكاء الاصطناعي هذه مدربة على أن تكون صادقة، ولكن أثناء التدريب فإنها غالبًا ما تتعلم حيلًا خادعة لإكمال المهام.

ووجدت الدراسة أن أنظمة الذكاء الاصطناعي المدربة على "الفوز في الألعاب ذات العنصر الاجتماعي" من المرجح بشكل خاص أن تخدع.

على سبيل المثال، حاول الفريق استخدام شيشرون المدرب على ميتا للعب الدبلوماسية، وهي لعبة إستراتيجية كلاسيكية تتطلب من اللاعبين بناء تحالفات لأنفسهم وتفكيك التحالفات المنافسة. ونتيجة لذلك، فإن الذكاء الاصطناعي غالبًا ما يخون حلفاءه ويكذب صراحةً.

أظهرت التجارب التي أجريت على GPT-4 أن أداة OpenAI نجحت في "التلاعب نفسياً" بموظف في TaskRabbit، وهي شركة تقدم خدمات تنظيف المنازل وتجميع الأثاث، من خلال القول إنه كان في الواقع إنسانًا ويحتاج إلى مساعدة في تمرير رمز Captcha، مشيرًا إلى ضعف شديد في الرؤية. ساعد هذا الموظف الذكاء الاصطناعي التابع لشركة OpenAI في "تجاوز الخط" على الرغم من الشكوك السابقة.

واستشهد فريق بارك بأبحاث من شركة Anthropic، وهي الشركة التي تقف وراء Claude AI، والتي وجدت أنه بمجرد أن يتعلم نموذج اللغة الكبير (LLM) الخداع، تصبح أساليب التدريب الآمنة عديمة الفائدة و"من الصعب عكسها". وتعتقد المجموعة أن هذه مشكلة مثيرة للقلق في مجال الذكاء الاصطناعي.

وتم نشر نتائج أبحاث الفريق في مجلة Cell Press - وهي مجموعة من التقارير العلمية متعددة التخصصات الرائدة.

ولم تعلق شركة Meta وOpenAI على نتائج هذا البحث.

وخوفا من أن تشكل أنظمة الذكاء الاصطناعي مخاطر كبيرة، دعا الفريق أيضا صناع السياسات إلى إدخال لوائح أقوى للذكاء الاصطناعي.

وبحسب فريق البحث، هناك حاجة إلى لوائح الذكاء الاصطناعي، وإجبار النماذج ذات السلوك الاحتيالي على الامتثال لمتطلبات تقييم المخاطر، والرقابة الصارمة على أنظمة الذكاء الاصطناعي ومخرجاتها. إذا لزم الأمر، قد يكون من الضروري حذف كافة البيانات وإعادة التدريب من البداية.

اترك تعليقاً

أعمال جانبية مربحة بالفعل في عام 2026: 7 خيارات واقعية والمفاضلات التي يجب معرفتها

أعمال جانبية مربحة بالفعل في عام 2026: 7 خيارات واقعية والمفاضلات التي يجب معرفتها

قارن بين المشاريع الجانبية الواقعية لعام 2026 من حيث تكلفة البدء والرسوم والمرونة والتحكم في الدخل، مع التوجيهات الضريبية الحالية بشأن عمليات الاحتيال من المصادر الرسمية.

بيئة العمل عن بعد المريحة في عام 2026: حسّن مكتبك المنزلي دون الإفراط في الشراء

بيئة العمل عن بعد المريحة في عام 2026: حسّن مكتبك المنزلي دون الإفراط في الشراء

قم بتحسين بيئة العمل في مكتبك المنزلي من خلال إرشادات OSHA و NIOSH الحالية بشأن ملاءمة الكرسي، وارتفاع الشاشة، وإعداد الكمبيوتر المحمول، والإضاءة، والحركة.

لماذا يُعدّ الذكاء العاطفي مهمًا في القيادة - وكيفية تطويره

لماذا يُعدّ الذكاء العاطفي مهمًا في القيادة - وكيفية تطويره

تعرف على أهمية الذكاء العاطفي في القيادة، وأين يكون أكثر فائدة، وكيفية تعزيزه، وكيفية معرفة ما إذا كان نهجك ناجحًا.

كيفية الانتقال إلى مهنة في مجال التكنولوجيا بدون شهادة جامعية: خارطة طريق تركز على النتائج لعام 2026

كيفية الانتقال إلى مهنة في مجال التكنولوجيا بدون شهادة جامعية: خارطة طريق تركز على النتائج لعام 2026

خارطة طريق عملية للانتقال إلى مجال التكنولوجيا بدون شهادة جامعية: اختر دورًا متاحًا، وقم ببناء مهارات جاهزة للعمل، وأثبتها من خلال المشاريع، واستخدم ملاحظات التوظيف للتحسين.

بناء علامة تجارية شخصية على لينكدإن في عام 2026: ما الذي لا يزال فعالاً، وما الذي تغير، وما الذي يجب تجاهله

بناء علامة تجارية شخصية على لينكدإن في عام 2026: ما الذي لا يزال فعالاً، وما الذي تغير، وما الذي يجب تجاهله

قم ببناء علامة تجارية شخصية موثوقة على LinkedIn في عام 2026 من خلال الملف الشخصي الحالي والمحتوى والنشرة الإخبارية والتحليلات والتحقق من الهوية وإرشادات الظهور من LinkedIn.

الاستقالة الهادئة مقابل الفصل الهادئ في عام 2026: ما الذي يتغير فعلاً في بيئة العمل؟

الاستقالة الهادئة مقابل الفصل الهادئ في عام 2026: ما الذي يتغير فعلاً في بيئة العمل؟

الاستقالة الهادئة والفصل الهادئ مصطلحان شائعان، وليسا تشخيصين. تعرّف على ما هو مؤكد، وما يعتمد على السياق، وما يمكن للموظفين والمدراء فعله لاحقًا.

The Rise of the Fractional Executive: When Part-Time C-Suite Leadership Makes Sense

The Rise of the Fractional Executive: When Part-Time C-Suite Leadership Makes Sense

Fractional executives offer senior leadership without a full-time hire. Learn when the model works, what to ask, and the risks to manage.

كيفية التفاوض على زيادة الراتب خلال مراجعات الأداء في الربع الرابع: دليل عملي لاتخاذ القرارات حتى عام 2026

كيفية التفاوض على زيادة الراتب خلال مراجعات الأداء في الربع الرابع: دليل عملي لاتخاذ القرارات حتى عام 2026

قم بإعداد طلب زيادة أقوى للربع الرابع مع بيانات الأجور الحالية، وخيارات التوقيت، ومفاضلات التعويض، ونصوص للنتائج الإيجابية أو الجزئية أو السلبية.

6 مهارات عالية الدخل يمكنك البدء بتعلمها قبل نهاية عام 2026

6 مهارات عالية الدخل يمكنك البدء بتعلمها قبل نهاية عام 2026

اختر مهارة ذات دخل مرتفع يمكنك البدء بها بشكل واقعي قبل نهاية عام 2026، مع بيانات الأجور الحالية، وأولويات التعلم، وفحص ذاتي عملي.

إتقان جدول العمل الهجين: إطار عمل عملي فعال

إتقان جدول العمل الهجين: إطار عمل عملي فعال

قم ببناء جدول عمل هجين يرتكز على المهام، وتداخل مهام الفريق، والنتائج القابلة للقياس. اطلع على نماذج الأنماط، وعلامات التحذير، ومتى يجب تعديل خطتك.