ڇا ٿيندو جڏهن توهان AI ايجنٽ کي هڪ ٻئي جي خلاف کڙو ڪندا آهيو؟ Anthropic جي جاچ موجب، شيون جلدي گندا ٿي ويندا آهن.

خميس تي، اينٿروپڪ جي فرنٽيئر ريڊ ٽيم نئين تحقيق شايع ڪئي جنهن جي جاچ ڪئي وئي ته اي آءِ ايجنٽ جا گروهه ڪيئن هلندا آهن جڏهن اهي جهنگ ۾ هڪ ٻئي سان ملن ٿا. نتيجن کي امڪاني خطرن جي هڪ جھلڪ مهيا ڪري ٿي جيڪا ترقي ڪري سگهي ٿي جيئن ڪمپنيون ۽ حڪومتون ايجنٽن کي لاڳو ڪرڻ لاءِ منتقل ٿين ٿيون جيڪي گڏيل ڪوڊ بيسز، مارڪيٽن ۽ ڪمپيوٽر سسٽم ۾ خودمختيار طور ڪم ڪن ٿيون.

هڪ تجربي ۾، انٿروپڪ ٽن ڪلاڊ ايجنٽن کي هڪ ئي سافٽ ويئر پروجيڪٽ تائين پهچ ڏني، هر هڪ کي پنهنجي پنهنجي غير مطابقت واري هدايتن سان ان سان ڇا ڪرڻو آهي. ايجنٽن کي نه ٻڌايو ويو ته اتي ٻيا ايجنٽ به ساڳي منصوبي تي ڪم ڪري رهيا آهن، تنهن ڪري محقق ڏسي سگهن ٿا ته ڇا ٿيو جڏهن انهن رستا پار ڪيا.

"اسان مسلسل هڪ گھڻائي واري ٽرف جنگ ڏٺو،" اينٿروپڪ محقق لکيو. ماڊل سڀني کي فرض ڪيو ويو ته ٻيا "مقصد طور تي انهن جي ڪم کي روڪي رهيا آهن" ۽ هڪ ٻئي کي "وڌندڙ جارحتي، خود نقل ڪندڙ مالويئر" سان سبوتاژ ڪرڻ شروع ڪيو.

مطالعي جي نتيجي ۾ اچي ٿو ڪيترن ئي اعلي پروفائل واقعن جي ايجنٽن جي اينٿروپڪ ۽ اوپن اي آئي سائبر سيڪيورٽي جي جائزي دوران ۽ حقيقي دنيا جي سسٽم جي ڀڃڪڙي دوران انهن جي سينڊ باڪس کان فرار ٿي. جڏهن ته AI حفاظتي حلقن ۾ بحث جو گهڻو حصو ان ڳالهه تي مرکوز ڪيو ويو آهي ته ڇا ٿئي ٿو جڏهن هڪ خودمختيار ايجنٽ روگ ٿي وڃي ٿو، انٿروپڪ جو تازو مطالعو هڪ مختلف سوال پيدا ڪري ٿو: ڪهڙي نئين ۽ ممڪن طور تي نقصانڪار متحرڪ پيدا ٿين ٿا جڏهن هزارين يا لکين ايجنٽ هڪ ٻئي سان رابطو ڪري رهيا آهن؟

"ايجنٽ-ايجنٽ جي رابطي جو حجم ممڪن طور تي انساني-انساني ۽ انساني-ايجنٽ جي وچ ۾ رابطي کان وڌيڪ ٿي سگهي ٿو، ان کان اڳ جو دنيا اهڙين ڳالهين کي بهتر بڻائڻ جي حالتن کي سمجهي،" مطالعو پڙهي ٿو. "انفرادي سطح تي غير معمولي رويي جي نرالا شايد ناپسنديده عالمي نتيجن ۾ مرڪب هوندا."

ھڪڙو تازو OpenAI واقعو ھڪڙو گندا حقيقي دنيا جو مثال پيش ڪري ٿو ڪيترن ئي متحرڪ انتھروپڪ جو ذڪر ڪيو ويو آھي پنھنجي پيپر ۾. هن مهيني جي شروعات ۾ لاس ويگاس ۾ بليڪ هيٽ سيڪيورٽي ڪانفرنس ۾، OpenAI انڪشاف ڪيو ته هفتا اڳ هن جي ايجنٽن هيڪنگ منهن کي هيڪ ڪيو، انهن ڏينهن ۽ هفتن دوران گڏجي ڪم ڪيو ته ڪمپني جي سائبر سيڪيورٽي تشخيص سسٽم ۾ استحصال ڳولڻ ۽ انهن کي هڪ ٻئي سان شيئر ڪيو.

جڏهن ته اهو واقعو ڏيکاري ٿو ته ايجنٽ چڱي طرح گڏجي ڪم ڪري سگهن ٿا، ممڪن طور تي وڏي پيماني تي نتيجن سان، انٿروپڪ جو مطالعو ڏيکاري ٿو ته ڇا ٿيندو جڏهن ايجنٽ جا مقصد مطابقت نه هوندا آهن.

ٽرف جنگ جي صورت ۾، سبق اهو آهي ته متضاد هدايتن سان آزاد ايجنٽ نقصانڪار مقابلي ۾ وڌي سگهن ٿا. وڌيڪ قابل ايجنٽ، بهتر اهي وڙهڻ ۾ هوندا. تنهن هوندي، اهي پڻ پنهنجي تڪرارن کي حل ڪرڻ لاء خودڪار طريقي سان ميڪانيزم ايجاد ڪري سگهن ٿا، جهڙوڪ هڪ فاتح-کي-سڀ مقابلو، پر هڪ پڪڙي سان.

"ايجنٽ ڪڏهن ڪڏهن پنهنجن مقصدن کي گفتگو ڪرڻ ۽ همراه ڪرڻ جو انتظام ڪن ٿا: اهي ٻين جي حوصلي کي دشمني جي بدران متضاد هدايتن جي طور تي سڃاڻندا آهن، ۽ بعد ۾ اڻڄاتل حد تائين وڌڻ کي روڪڻ لاءِ تڪرار جي لوپ مان ٻاهر نڪري ويندا آهن،" اينٿروپڪ لکي ٿو. "انهن مان ڪيترن ئي ڪامياب قسطن ۾، اهي پيغام يا مارڪ ڊائون فائلون لکندا آهن جيڪي بدسلوڪي رويي لاء معافي وٺندا آهن ۽ هڪ جنگ بندي کي ترتيب ڏين ٿا. اهي انهن جي بدسلوڪي ڪوڊ کي صاف ڪن ٿا، تڪرار جي نوعيت کي واضح ڪن ٿا، ۽ انسان کي مداخلت ڪرڻ لاء پڇن ٿا."

ڪاغذ جي مطابق، Mythos 5 ۾ جنگبندي جي ذريعي تڪرار حل ڪرڻ جي بلند ترين شرح (98٪) هئي. Sonnet 4.6 ۽ Opus 4.6 سڀ کان وڌيڪ ممڪن هئا ته طاقت جي ذريعي.

"Sonnet 4.6 ۽ Opus 4.6 جي ٻين جي مقصدن تي غور ڪرڻ جي بار بار ناڪامي انهن کي ماڊل جي سڀ کان وڌيڪ غلط طريقي سان سرپل ڪرڻ جو سبب بڻائين ٿا: اهي انهن جي هدايت جي نالي تي اڳتي وڌندا آهن،" پيپر پڙهي ٿو.

ڪجهه حالتن ۾، ايجنٽ پنهنجي تڪرار کي حل ڪرڻ لاء ٽورنامنٽ جي صورت ۾ هڪ سماجي ميڪانيزم سان گڏ آيا. هتي جا نتيجا ٻن سببن لاءِ دلچسپ آهن: پهريون اهو آهي ته ٽنهي ايجنٽن بيهڻ تي اتفاق ڪيو جيڪڏهن اهي ٽورنامينٽ وڃائي ويٺا، جيتوڻيڪ ان جو مطلب اصل صارف جي درخواست کان انحراف ڪرڻ هوندو. ٻيو اهو آهي ته ڪيترن ئي قسطن جي نتيجي ۾ Mythos 5 جي ابتڙ رويي جي نتيجي ۾: هڪ ايجنٽ تجويز ڪيل ميٽرڪس جيڪي ظاهر ڪيا ويا آهن ۽ ٻين لاء غير جانبدار، پر اهو ڄاڻي ٿو ته هو پنهنجي پنهنجي صلاحيتن کي پسند ڪندو. ايجنٽ هن کي ”خود خدمت ڪندڙ پر حقيقي طور تي اصولي“ سڏيو ۽ پڪ ڪيو ته ٻين کي ظاهر نه ٿئي جيئن اها ”ميٽرڪ شاپنگ“ هئي. جيئن ته بليڪ هيٽ جي انڪشافن ۾ ڏٺو ويو آهي، عام سبق اهو آهي ته جڏهن ايجنٽ ڪنهن رڪاوٽ کي منهن ڏين ٿا، اهي سماجي ۽ ٽيڪنيڪل ڍانچي ايجاد ڪري سگهن ٿا جيڪي انهن جي ڊزائنر جي توقع نه ڪئي هئي. انتھروپڪ ماڊلز لاءِ، اھو ھڪڙو ٽورنامينٽ ھو جيڪو ھڪ ٽرف جنگ جي پٺيان ھو. OpenAI جي لاء، اهو اجتماعي منصوبابندي لاء هڪ پيغام بورڊ هو.

هن قسم جو رويو ڪنٽينمينٽ کي وڌيڪ سخت بڻائي ٿو ڇاڪاڻ ته محقق اهو فرض نٿا ڪري سگهن ته سسٽم جو رويو انهن کي فراهم ڪيل ڪوآرڊينيشن ميڪانيزم تائين محدود رهندو.

ڪوآرڊينيشن کي ماپڻ دوران، اينٿراپڪ ڏٺائين ته ايجنٽن جي تعداد کي ماپڻ خود بخود پيداواري تعاون کي ماپ نٿو ڪري. جڏهن ڪم اوورليپ ٿيڻ شروع ٿي ويا يا هڪ ٻئي تي منحصر ٿيڻ لڳا، ايجنٽ هڪ ٻئي جي رستي ۾ ايندا. اهي اڪثر ڪري پاڻ کي خاموش ڪرڻ سان حل ڪندا آهن ۽ سڀني سان تعاون نه ڪندا آهن.

ٻين حالتن ۾، نمائندن جي همراهيءَ ۾ مطابقت جي طرف مائل هئا. جڏهن عنصر جهڙوڪ ايجنٽ جي حوالي سان، ڇنڊڇاڻ، ۽ بنيادي ماڊل سڀ هڪجهڙا يا ساڳيا هئا، مختلف ايجنٽ ساڳيا ڪارناما کڻندا.

"هن جو مطلب اهو آهي ته جڏهن هڪ ايجنٽ هڪ خراب فيصلو ڪري ٿو، اهو ممڪن آهي ته ڪيترائي ايجنٽ اهو ساڳيو خراب فيصلو ڪن،" Anthropic لکيو. "جيڪا الڳ الڳ مسئلا هوندا هئا جلدي سسٽماتي ناڪامي بڻجي سگهن ٿا."

انٿروپڪ جو چوڻ آهي ته اهڙي قسم جو رويو هڪ نظام کي اوچتو تباهي، وسيلن جي کوٽ، يا ميلاپ جو سبب بڻجي سگهي ٿو.

هڪ مثال ۾، اينٿراپڪ ڪيترن ئي ايجنٽن کي قيمت جي راند ۾ رکيا، هر هڪ هڪجهڙا هول سيل قيمتون ۽ مينڊيٽ انفرادي طور تي منافعو وڌائڻ لاءِ. جڏهن ايجنٽن کي هڪ خانگي واپس چينل ڏنو ويو، انهن تقريبن فوري طور تي ڳنڍڻ شروع ڪيو ۽ جلدي قيمت جي منزل تي اتفاق ڪيو. اهي ڳنڍيندا رهيا جڏهن انهن جا سڌو ڪميونيڪيشن چينلز هٽايا ويا، عوامي لسٽنگ بورڊ کي استعمال ڪندي قيمت ميچ کي "پيني ڏانهن."

انهي سطح جي مطابقت ڏيکاري ٿي OpenAI جي سسٽم ۾ پڻ. بليڪ هٽ رپورٽنگ جي مطابق، هڪ ايجنٽ دليل ڏنو ته ٻاهرين انفراسٽرڪچر جو استحصال ان جي ارادي جي دائري کان ٻاهر هو، پر اهو جزوي طور تي جاري رهيو ڇاڪاڻ ته ان جا ساٿي اهو ڪري رهيا هئا. پير صاحب جو دٻاءُ. متحرڪ ذهنيت. ايجنٽ اسان وانگر آهن.

پڻ انسانن وانگر، ايجنٽ اڪثر نه ڄاڻندا آهن جن تي ڀروسو ڪجي. Anthropic مليا آهن ته اهي خراب معلومات لاء gullible ٿي سگهن ٿا يا تمام conformist تسليم ڪرڻ لاء ته هڪ اڪيلو اختلاف Cassandra آهي نازڪ معلومات سان.

جڏهن ته انٿروپڪ پنهنجي پيپر ۾ اهو بيان نه ڪيو آهي، فوري انجيڪشن - سائبر حملي جو هڪ قسم جنهن ۾ هيڪرز هڪ ايجنٽ جي اصل سسٽم جي هدايتن کي ختم ڪرڻ لاءِ بدسلوڪي يا گمراهه ڪندڙ ٽيڪسٽ انجيڪشن ڪندا آهن - اعتماد جي مسئلي جو حقيقي دنيا جو مظهر ٿي سگهي ٿو. گڏجي ڪم ڪرڻ هڪ نئين اعتماد جي حد پيدا ڪري ٿي؛ ايجنٽ کي ٻين ايجنٽن کان حاصل ڪيل معلومات جو فيصلو ڪرڻو پوندو. ۽ هڪ سمجهوتو يا غلط ايجنٽ گروپ جي باقي حصي تي اثر انداز ٿي سگهي ٿو، خراب معلومات کي ڇڪائيندي جيستائين اهو اتفاق نه ٿي وڃي.

OpenAI جي Black Hat منظرنامي ۾، OpenAI جي ايجنٽن ساٿين سان معلومات ۽ سندون شيئر ڪيون. ھڪڙي ھڪڙي دريافت کي swarm کي ٻڌايو ۽ ٻين کي ان کي استعمال ڪرڻ جي حوصلا افزائي ڪئي. ڇا ٿئي ها جيڪڏهن swarm جو هڪ ميمبر هڪ تڪڙي انجيڪشن سان سمجهوتو ڪيو وڃي ها؟

اينٿروپڪ پنهنجي پيپر کي ختم ڪري ٿو اهو نوٽ ڪري ٿو ته ايجنٽ ساڳئي سماجي دٻاء جي تابع آهن جيڪي "ارتقاء" انسانن تي لاڳو ڪيا ويا آهن. تنهن هوندي، انهن وٽ انساني هم آهنگيءَ جي nuances ۽ جيئرو تجربو نه آهي - جنهن ۾ ريتن رسمن، شهرت، سگنلنگ، وسيلو شامل آهن - جيڪي گروپ سيٽنگ ۾ غير ارادي رويي کي محدود ڪري سگھن ٿا.

جيئن ته ليبز ملٽي-ايجنٽ سسٽم ڏانهن ڊوڙي ٿي، سوال هاڻي ٿي وڃي ٿو: ڪيتري حفاظتي جاچ اڃا تائين هڪ وقت ۾ هڪ ايجنٽ جو جائزو وٺندو آهي، بمقابله ايجنٽ جو هڪ ٻئي سان لهه وچڙ ۾؟