گذريل هفتي، OpenAI پاران ٺاهيل هڪ غير رليز ٿيل ماڊل اندروني جاچ دوران Hugging Face جي سسٽم جي ڀڃڪڙي ڪئي، ۽ تمام گهڻو نظرياتي تحقيق اوچتو تمام گهڻو عملي بڻجي ويو. هيڪ هڪ AI ليب جو پهريون تصديقي ڪيس هو جيڪو پنهنجي ماڊل جو ڪنٽرول وڃائي رهيو هو، ان جي رسائي حاصل ڪرڻ لاءِ استحصال کي گڏ ڪري ان کي ڪڏهن به نه هئڻ گهرجي ها. پر جڏهن ته AI صنعت پنهنجي الارم ۾ متحد ٿي چڪي آهي، هڪ تقسيم ظاهر ٿيو آهي ته محقق ڪيئن جواب ڏيڻ چاهيندا آهن.

ڪجھ لاءِ، مسئلو ھڪڙو بنيادي سائبر سيڪيورٽي مسئلو آھي: سينڊ باڪس ماڊل کي شامل ڪرڻ ۾ ناڪام ٿيو، ۽ ھگنگ فيس سائبر سيڪيورٽي سسٽم ان کي رکڻ ۾ ناڪام ٿيا. اهي مسئلا حل ڪري سگھجن ٿا بگ کي ڇڪڻ ۽ وڌيڪ مضبوط ڪنٽرول ۽ ڪنٽرول طريقن جي تعمير ذريعي وڌندڙ قابل AI لاءِ جيڪي خودمختار ماحول ۾ بدمعاش ٿيڻ جو خدشو آهي.

پر هڪ ٻيو ڪئمپ وڌيڪ مايوسي وارو نظريو وٺندو آهي. انهن لاءِ، AI جي تيزيءَ سان وڌندڙ صلاحيتن جو مطلب اهو آهي ته روگ ماڊلز کي ڪنٽرول ڪرڻ جي ڪوشش هڪ وڃايل راند آهي. صرف مضبوط سيڪيورٽي انهي ڳالهه کي يقيني بڻائڻ کان اچي ٿي ته ماڊل پهرين جڳهه تي فرار ٿيڻ جي ڪوشش نه ڪري رهيا آهن - هڪ چيلنج اڪثر ڪري ترتيب ڏيڻ جو حوالو ڏنو ويو آهي. صفائي جي شرطن ۾، مسئلو اهو آهي ته OpenAI جو ماڊل ٺڳي ڪرڻ جي ڪوشش ڪري رهيو هو، ۽ انهي مسئلي کي حل ڪرڻ مختصر مدت جي ڪوششن جي ڀيٽ ۾ وڌيڪ تڪڙو آهي.

ان جي عوامي بيانن جو فيصلو ڪندي، OpenAI ٻنهي ڪئمپن کي سنجيده وٺندي آهي. ڪمپني هيڪ ۾ ملوث بگ کي پيچ ڪرڻ لاءِ تڪڙ ڪئي آهي، ۽ اها ڀڃڪڙي عوامي ٿيڻ کان پوءِ پنهنجي بيان ۾ ترتيب ۽ نگراني جي ٻنهي طريقن جو حوالو ڏنو. پر ڪمپني جو جواب پڻ هڪ فلسفو پيش ڪري ٿو جنهن ڪيترن ئي حفاظتي محققن کي پريشان ڪري ڇڏيو آهي: وڌيڪ قابل ماڊل جي ترقي کي سست ڪرڻ يا روڪڻ بدران، ان جي بدران انهن جي چوڌاري مضبوط پنجج ٺاهڻ تي ڌيان ڏيڻ گهرجي.

"جيئن ته ماڊل ڊگھي ۽ وڌيڪ پيچيده ڪمن تي وٺن ٿا، ناڪامي جو اندازو لڳائي سگھي ٿو ته شايد وڌيڪ نتيجا آڻين،" OpenAI واقعي جي پوسٽ مارٽم ۾ چيو. "اسان ڪم ڪندا رهنداسين تشخيص ۽ مقرري جي وچ ۾ فرق کي تنگ ڪرڻ لاءِ: ٽيسٽ ماڊلز جي ڊگھي پيچرن تي، ترتيب کي بهتر ڪرڻ، نگراني جي تعمير ڪرڻ جيڪا مداخلت ڪري سگهي ٿي، ۽ صارفين کي واضح نمائش ۽ ڪنٽرول ڏيڻ."

اهو پڻ سوچڻ جو سبب آهي ته OpenAI جا ماڊل گهٽ ٺهيل آهن جيئن اهي وڌيڪ طاقتور ٿي وڃن. OpenAI جي سسٽم ڪارڊ جي مطابق، GPT-5.6 Sol خاص طور تي ان جي اڳوڻن، GPT-5.5 جي ڀيٽ ۾ ايجنٽ جي غلطي لاء وڌيڪ خطرناڪ آهي. ڊيپلائيشن جي تخليقن ۾، ڪمپني پڻ مليو ته ماڊل پابنديون کي روڪڻ، تباهي واري عملن ۾ مشغول ڪرڻ، ۽ GPT-5.5 جي ڀيٽ ۾ غير مجاز ڊيٽا جي منتقلي کي انجام ڏيڻ جو وڌيڪ امڪان هو. اهي انگ اکر گهڻو ڪري پهرين رليز تي نظر انداز ڪيا ويا، پر ڀڃڪڙي جي نتيجي ۾، اهي هڪ ٻيو نظر حاصل ڪري رهيا آهن - خاص طور تي جڏهن ته سول شامل ٿيل ماڊل مان هڪ هو.

هڪ سوشل ميڊيا پوسٽ ۾، OpenAI جي اسٽريٽجڪ فيوچرز جي سربراهه ڊين بال دليل ڏنو ته مانيٽرنگ ۽ شفافيت انهن رجحانن کي چيڪ ۾ رکڻ لاءِ بهترين طريقا هئا.

"اهي مسئلا وڌيڪ نمايان ٿي ويندا جيئن ماڊل جي صلاحيتون بهتر ٿينديون، ۽ جيئن انهن جي تعیناتي جا داغ وڌندا،" هن چيو. "حل نه ته الارمزم آهي ۽ نه ئي اطمينان. ان جي بدران، مان سمجهان ٿو ته حل محتاط ماپ ۽ نگراني، هڪ انجنيئرنگ ذهنيت، ۽ شفافيت ۾ آهي."

هڪ اڳوڻو OpenAI محقق TechCrunch کي ٻڌايو ته فرم "اندروني ترتيب" جي بجاءِ "ٻاهري ترتيب" تي ڌيان ڏيڻ جو ارادو رکي ٿو - بنيادي طور تي هڪ AI سسٽم جي وچ ۾ فرق جيڪو قدرن جي هڪ سيٽ کي سمجهي ٿو ۽ انهن کي يقين سان نمائندگي ڪري سگهي ٿو، ۽ هڪ جيڪو اصل ۾ اهي قدر آهن بنيادي طور تي. انهي حالت ۾، ٻاهرئين قطار ماڊل کي قائل ڪرڻ لاء ڪافي نه هئي ته ان کي امتحان تي دوکو نه ڏيڻ گهرجي.

OpenAI وڌيڪ معلومات لاء بار بار درخواستن جو جواب نه ڏنو.

ترتيب ڏيڻ تي مرکوز محققن لاءِ، OpenAI جو جواب ڪافي سٺو نه آهي. Zvi Mowshowitz، هڪ ليکڪ جيڪو نئين AI ترقيات تي ڌيان ڏئي ٿو، دليل ڏنو ته OpenAI جو فيصلو ان واقعي کي انفراسٽرڪچر جي مسئلي جي طور تي علاج ڪرڻ ۾ مدد ڪري سگھي ٿو فوري طور تي سائبر سيڪيورٽي مسئلن کي حل ڪرڻ ۾، پر اهو ڊگهي مدت ۾ ناڪام ٿيندو.

"هي هڪ ترتيب وارو مسئلو آهي،" Mowshowitz هڪ تازو Substack بلاگ ۾ لکيو. "هي ماڊل غلط ترتيب ڏنل آهن، ۽ OpenAI جا سڀئي ماڊل بلڪل سخت نشانيون ڏيکاري رهيا آهن ان مسئلي جي باري ۾ اسان سڀ کان وڌيڪ پريشان آهيون، انهي طريقي سان جيڪو ممڪن آهي ته انهن جي تربيت ۾ شامل ڪيو ويو آهي هڪ گہرے سطح تي. سڄي ٽريننگ پائپ لائن کي هن روشني ۾ خطاب ڪرڻ جي ضرورت آهي، يا اهو صرف خراب ٿيندو." ڪيترن ئي ماهرن TechCrunch کي ٻڌايو ته اهو واقعو ان ڳالهه جو ثبوت آهي ته اڄ جا تربيتي طريقا اهڙا نظام پيدا ڪن ٿا جيڪي انساني ارادن کي اندروني ڪرڻ بجاءِ نتيجن لاءِ بهتر ڪن ٿا.

ريڊ ووڊ ريسرچ، هڪ غير منافع بخش AI حفاظت ۽ سيڪيورٽي ريسرچ آرگنائيزيشن، هن معاملي ۾ OpenAI جي ماڊل رويي کي "اسڪور ڳولڻ جي غلط ترتيب" جي طور تي درجه بندي ڪئي وئي، هڪ نمونو جنهن ۾ AI ماڊل هدايتون، ضمني اثرات، يا هيٺئين پاسي جي نتيجن کان سواء اعلي اسڪور حاصل ڪرڻ جي ڪوشش ڪندا آهن.

"انهن ترتيب واري خاصيتن سان ماڊلز غلط ڪاميابين جو هڪ 'پوٽيمڪن ڳوٺ' قائم ڪري سگھن ٿا ته جيئن اهي شيون ٺيڪ هجن جڏهن اهي نه هجن،" Alex Mallen ۽ Girish Gupta، Redwood ۾ ٻه محقق، هڪ تازي مقالي ۾ لکيو.

سکور ڳولڻ وارو رويو ۽ ٻيون غلطيون OpenAI لاءِ منفرد نه آهن. Anthropic ڪيترن ئي مقالن تي شايع ڪيو آهي ايمرجنسي غلط ترتيب واري رويي تي جيڪي سطح تي جڏهن ان جا فرنٽيئر ماڊل بهتر ڪيا وڃن يا خودمختيار ماحول ۾ رکيا وڃن، جن ۾ فريب، انعام-هيڪنگ، ۽ بدسلوڪي خودمختياري شامل آهن.

"اسان اڃا تائين مسلسل ماڊل ڏسندا آهيون ته هو رڪاوٽن کي ختم ڪرڻ جي ڪوشش ڪري رهيا آهن ۽ فريب سان ڪم ڪن ٿا جڏهن انهن کي انهن جي قابليت جي ڪناري تي ڪم ڪرڻ لاءِ چيو وڃي ٿو ،" نيف پرخ ، هڪ AI حفاظتي محقق ، الائنمينٽ غير منافع بخش METR تي ، TechCrunch کي اي ميل ذريعي ٻڌايو. "اسان جي فرنٽيئر خطري جي رپورٽ ۾، اسان هن رويي کي مسلسل مسلسل ڏٺو، ڪمپنين جي ڪوششن جي باوجود هن رويي کي گهٽائڻ ۽ گهٽائڻ جي ڪوشش ڪئي."

OpenAI جي جواب ۾ هنگنگ منهن جي واقعن جو مفروضو اهو فرض آهي ته ترقي اڃا به وڌيڪ قابل سسٽم تي جاري رهندي، ڇا اهي مناسب طور تي انهن جي بنيادي طور تي ترتيب ڏنل آهن يا نه. ڊرائنگ بورڊ ڏانهن واپس وڃڻ واقعي هڪ اختيار ناهي جڏهن AI ڪمپنين جا ڪاروباري ماڊل ماڊل جي ايندڙ نسل کي پهچائڻ تي ڀاڙين ٿا. جيڪڏهن اهو يقين سان ڄاڻڻ ممڪن ناهي ته هڪ ماڊل مڪمل طور تي ترتيب ڏنل آهي، ته پوء عملي سوال اهو اچي ٿو ته ڪيئن محفوظ طور تي ڪنٽرول ڪرڻ ۽ وڌندڙ قابل نظام کي ڪنٽرول ڪرڻ لاء.

"اڃا تائين سٺي سمجھ نه آهي ته سڀ کان وڌيڪ قابل AI سسٽم کي ڪيئن ترتيب ڏيڻ، پر انهن کي ڪيئن ڪنٽرول ڪرڻ جي باري ۾ وڌيڪ اتفاق آهي،" اسٽيون ايڊلر، اڳوڻو حفاظتي محقق OpenAI ۽ Guidelight AI معيارن جو موجوده چيف سائنسدان، هڪ تنظيم جيڪو هڪ معيار شايع ڪري ٿو واقعن کان بچڻ لاء هڪ معيار جهڙوڪ Hugging Face One، TechCrunch کي ٻڌايو. "هر ڪمپني کي حاصل ڪرڻ ۾ وڃڻ جا طريقا آهن."