اينٿروپڪ خميس چيو ته هڪ اندروني تحقيق ٽن واقعن کي بي نقاب ڪيو جنهن ۾ ان جي AI ماڊل ڪلاڊ سائبر سيڪيورٽي ٽيسٽ کي هلائڻ دوران ٽن تنظيمن جي سسٽم کي ٽوڙيو. تحقيق، ۽ انڪشاف، هڪ هفتي کان وڌيڪ بعد ۾ OpenAI ظاهر ڪيو آهي ته ان جي هڪ اڻ ڇپيل ماڊل اندروني جاچ دوران Hugging Face جي سسٽم جي ڀڃڪڙي ڪئي.
ٽنهي صورتن ۾، هڪ ڪلاڊ ماڊل هڪ ٽيسٽنگ ماحول جي اندر کان انٽرنيٽ تائين پهچندي جڏهن ٽئين پارٽي سان رابطو ڪيو ۽ پوءِ انهن تنظيمن جي لائيو سسٽم تائين غير مجاز رسائي حاصل ڪئي، انٿروپڪ هڪ بلاگ پوسٽ ۾ چيو، بيان ڪيو ته اهو ڇا مليو ۽ ڪمپني ان کي ٻيهر ٿيڻ کان روڪڻ لاءِ ڇا تبديل ڪرڻ جو ارادو رکي ٿي.
اينٿروپڪ چيو ته 21 جولاءِ OpenAI واقعو ڪمپني کي پنهنجي سائبر سيڪيورٽي جي تشخيص ڪرڻ جي هدايت ڪئي. اهو خاص طور تي ثبوت ڳولي رهيو هو ته ڪلواڊ انٽرنيٽ تائين رسائي ڪئي هئي ٽيسٽنگ ماحول جي اندر، جيڪي سينڊ باڪس جي طور تي ڪم ڪرڻ ۽ ماڊل کي الڳ رکڻ لاءِ ٺهيل آهن.
141006 جي تشخيص جي وچ ۾ ان جو جائزو ورتو ويو، AI ليب ٽي واقعا ڏٺا جن ۾ ان جي ماڊل انٽرنيٽ تائين رسائي ڪئي جڏهن ته ان جي ٽئين پارٽي جي ڀائيوارن مان هڪ Irregular سان رابطو ڪيو. اينٿروپڪ چيو ته رسائي غلط ترتيب جي حوالي سان تشخيص واري ماحول ۾ Irregular سان هلندي آهي. ان کي ٻن ڪمپنين جي وچ ۾ ”غلط فهمي“ سڏيو ويو ته ڇا ٽيسٽ سيٽ اپ کي انٽرنيٽ جي رسائي هئي، جڏهن حقيقت ۾ اهو ڪيو ويو. اينٿروپيڪ چيو ته اهو الزام نه ٿو لڳائي رهيو آهي ۽ ”فيڪسز تي پهچي رهيو آهي ڄڻ ته ذميواري اسان جي اڪيلائي هئي،“ جڏهن ته مشاهدو ڪيو ته غير منظم پنهنجي الڳ تحقيق ڪري رهيو آهي.
ڪنهن به صورت ۾، انهي کليل ڪنيڪشن جي ڪري، ماڊل ٽن مختلف تنظيمن جي پيداوار جي بنيادي ڍانچي تائين غير مجاز رسائي حاصل ڪئي. Anthropic چيو ته واقعن ۾ ٽي مختلف ڪلاڊ ماڊل شامل آهن: Opus 4.7، Mythos 5، ۽ هڪ اندروني ريسرچ ٽيسٽ ماڊل.
خاص طور تي، اينٿروپڪ چيو ته انهن مان هر هڪ ڪيس ۾ "ڪلاڊ واضح طور تي اسان جي فوري طور تي ٻڌايو ويو آهي ته ان کي انٽرنيٽ جي رسائي نه هئي." اهو ظاهر ٿئي ٿو ته AI ماڊل حقيقي دنيا جي سسٽم کي مشق جو حصو بڻائڻ جو فرض ڪيو هو جيڪو انجام ڏيڻ لاء چيو ويو هو.
اهو مفروضو هڪجهڙائي سان نه رهيو، جيئن اهو نڪتو. ٽن ماڊل ساڳئي طريقي سان عمل نه ڪيو جڏهن ثبوت ظاهر ٿيو ته انهن جا مقصد حقيقي هئا، جن کي اينٿروپڪ هڪ وڌيڪ اکين جي کولڻ واري نتيجن مان هڪ جي طور تي پرچم ڪيو.
Opus 4.7، ٽن مان سڀ کان پراڻو، تسليم ڪيو ويو ته اهو واقعي جي سڀني چئن رنن ۾ حقيقي پيداوار سسٽم تائين پهچي چڪو هو. انهن مان ٻن ۾، اهو منطقي آهي ته حقيقي ڪمپني ڪنهن نه ڪنهن طرح مشق جو حصو هجڻ گهرجي، پر سڀني چئن ۾، اهو هر طرح تي حملو ڪيو، بشمول سندون ڇڪڻ ۽ پيداوار جي ڊيٽا جي ڊيٽابيس کي ڇڪڻ. Mythos 5 پڻ نشانين تي پڪاريو ته اهو حقيقي انٽرنيٽ تي هو، پر اهو پاڻ کي يقين ڏياريو ته اهو اڃا تائين هڪ تخليق ۾ هو، عوامي پٿون سافٽ ويئر رجسٽري PyPI ڏانهن هڪ خراب سافٽ ويئر پيڪيج شايع ڪرڻ لاء، جيڪو پڪڙي وڃڻ کان اڳ ٻاهران سسٽم طرفان ڊائون لوڊ ۽ هلائي رهيو هو. صرف اندروني ريسرچ ٽيسٽ ماڊل، اينٿروپڪ جو نئون، پنهنجو پاڻ تي بند ٿي ويو جڏهن اهو نتيجو اهو نڪتو ته هدف حقيقي هو.
جواب ۾، Anthropic چيو ته اهم ڪنٽرول انهن قسمن جي تشخيص تي رکيا وڃن جيڪڏهن طاقتور AI ماڊل شامل آهن، سائبر سيڪيورٽي ڪميونٽي جي اندر ڪجهه جذبات کي گونج ڪندي.
ڪمپني اهو پڻ نوٽ ڪيو ته ڪلاڊ اضافي حفاظت جي نگراني کان سواءِ هلائي رهيو هو ۽ درجه بندي ڪندڙ اهو عام طور تي دستياب ماڊلز تي ترتيب ڏئي ٿو، حفاظتي قدمن جو چوڻ آهي ته رويي کي روڪيو هوندو، ڇاڪاڻ ته تشخيص بنيادي ماڊل جي خام صلاحيتن کي ماپڻ لاءِ ٺهيل آهن.
خاص طور تي، اينٿروپڪ چيو ته اهو ڪنهن به نموني جو ڪو ثبوت نه مليو آهي "پنهنجي مقصد جي تعاقب" ۽ ان جي بدران صرف ان ڪم کي مڪمل ڪرڻ جي ڪوشش ڪئي وئي جيڪا ان کي ڪرڻ لاء چيو ويو هو.
جيتوڻيڪ ٻن واقعن جي وچ ۾ مقابلو ناگزير آهي، انٿروپڪ ان جي واقعن ۽ OpenAI جي وچ ۾ واضح فرق پيدا ڪيو، اهو نوٽ ڪيو ته جتي OpenAI جي ماڊل هڪ اڻڄاتل سافٽ ويئر جي ڪمزوري جو استحصال ڪيو ته ان جي امتحان واري ماحول کي ٽوڙڻ لاء، انٿروپڪ جا ماڊل ان جي بدران انٽرنيٽ تائين پهچندا هڪ رستي ذريعي، جيڪا غلطي سان، کليل ڇڏي وئي هئي.
OpenAI پنهنجي خلاف ورزي بابت نئين تفصيل جاري ڪرڻ جاري رکي، چيو ته ان جا ماڊل پڻ استعمال ڪيا ويا عوامي طور تي ظاهر ڪيل سندون چار اڪائونٽس ۾ چار خدمتن تي: هڪ اسٽيجنگ پوائنٽ جي طور تي، هڪ اسٽوريج لاءِ، ۽ ٻه جيڪي صرف ڏسندا هئا، وڌيڪ ٽوڙڻ لاءِ استعمال نه ڪندا هئا، OpenAI جي پنهنجي تازه ڪاري بلاگ پوسٽ جي مطابق. انتھروپڪ پڻ پنھنجي ۽ OpenAI جي وچ ۾ ھڪڙو فرق ٺاھيو آھي ياد ڪندي ته اھو واقعن کي پاڻ دريافت ڪيو، ھڪڙي فعال جائزي ذريعي، ۽ اھو ٻن متاثر تنظيمن تائين پھچڻ جي قابل ٿي سگھيو آھي اڳ ۾ سرگرمي کي دريافت نه ڪيو ويو يا ان کي اينٿروپڪ ڏانھن پرچم ڪيو.
ڪمپني وڌيڪ چيو ته اهو هاڻي ڪم ڪري رهيو آهي آزاد تشخيص گروپ METR سان واقعن جي ٽئين پارٽي جي جائزي تي.
OpenAI جي حادثاتي خلاف ورزي جي هگنگ منهن، جيڪو هڪ AI ليب جو پهريون قابل تصديق ڪيس هو پنهنجي ماڊل جي ڪنٽرول کي وڃائڻ، صنعت ۽ سياستدانن جي رد عمل جي هڪ تار کي جنم ڏنو، جن مان گهڻا لازمي طور تي هڪ ٻئي سان متفق نه آهن. انتھروپڪ کان ھي تازو انڪشاف يقيني بڻائي ٿو AI ماڊلز تي بحث ۽ سيڪيورٽي جاري رھندي.