پچھلے ہفتے، اوپن اے آئی کے تیار کردہ ایک غیر ریلیز شدہ ماڈل نے اندرونی جانچ کے دوران ہیگنگ فیس کے سسٹمز کی خلاف ورزی کی، اور بہت ساری نظریاتی تحقیق اچانک بہت عملی ہو گئی۔ ہیک ایک AI لیب کے اپنے ماڈل پر کنٹرول کھونے کا پہلا قابل تصدیق کیس تھا، جس تک رسائی حاصل کرنے کے لیے استحصال کو ایک ساتھ جکڑ کر اسے کبھی نہیں ہونا چاہیے تھا۔ لیکن جب کہ AI انڈسٹری اپنے خطرے کی گھنٹی میں متحد ہو گئی ہے، ایک تقسیم سامنے آئی ہے کہ محققین کس طرح جواب دینا چاہتے ہیں۔

کچھ لوگوں کے لیے، مسئلہ سائبر سیکیورٹی کا ایک بنیادی مسئلہ ہے: سینڈ باکس ماڈل کو رکھنے میں ناکام رہا، اور Hugging Face کے سائبر سیکیورٹی سسٹمز اسے باہر رکھنے میں ناکام رہے۔ ان مسائل کو کیڑے لگا کر اور تیزی سے قابل AI کے لیے زیادہ مضبوط کنٹرول اور کنٹینمنٹ کے طریقے بنا کر حل کیا جا سکتا ہے جو خود مختار ماحول میں بدمعاش ہونے کا خطرہ ہے۔

لیکن ایک اور کیمپ زیادہ مایوسی کا خیال رکھتا ہے۔ ان کے لیے، AI کی تیزی سے بڑھتی ہوئی صلاحیتوں کا مطلب ہے کہ بدمعاش ماڈلز کو کنٹرول کرنے کی کوشش کرنا ایک ہارنے والا کھیل ہے۔ واحد مضبوط سیکیورٹی اس بات کو یقینی بنانے سے حاصل ہوتی ہے کہ ماڈلز پہلی جگہ فرار ہونے کی کوشش نہیں کر رہے ہیں - ایک چیلنج جسے اکثر صف بندی کہا جاتا ہے۔ صف بندی کی شرائط میں، مسئلہ یہ ہے کہ OpenAI کا ماڈل دھوکہ دینے کی کوشش کر رہا تھا، اور اس مسئلے کو حل کرنا مختصر مدت کی روک تھام کی کوششوں سے زیادہ ضروری ہے۔

اس کے عوامی بیانات کو دیکھتے ہوئے، OpenAI دونوں کیمپوں کو سنجیدگی سے لے رہا ہے۔ کمپنی نے ہیک میں ملوث کیڑے کو پیچ کرنے کے لئے جلدی کی ہے، اور اس نے خلاف ورزی کے عوامی ہونے کے بعد اپنے بیان میں سیدھ اور نگرانی دونوں طریقوں کا حوالہ دیا ہے۔ لیکن کمپنی کا ردعمل ایک ایسا فلسفہ بھی بتاتا ہے جس نے بہت سے حفاظتی محققین کو خطرے میں ڈال دیا ہے: زیادہ قابل ماڈلز کی ترقی کو سست کرنے یا روکنے کے بجائے، اسے اپنے ارد گرد مضبوط پنجروں کی تعمیر پر توجہ دینی چاہیے۔

OpenAI نے واقعے کے پوسٹ مارٹم میں کہا، "چونکہ ماڈلز طویل اور زیادہ پیچیدہ کام انجام دیتے ہیں، اس لیے ناکامیاں جو تشخیص سے محروم رہتی ہیں، اس کے زیادہ نتائج برآمد ہوتے ہیں۔" "ہم تشخیص اور تعیناتی کے درمیان فرق کو کم کرنے کے لیے کام کرتے رہیں گے: طویل رفتار پر ماڈلز کی جانچ کرنا، صف بندی کو بہتر بنانا، نگرانی کی تعمیر جو مداخلت کر سکتی ہے، اور صارفین کو واضح مرئیت اور کنٹرول فراہم کرنا۔"

یہ سوچنے کی بھی وجہ ہے کہ OpenAI کے ماڈلز زیادہ طاقتور ہونے کے ساتھ ساتھ کم منسلک ہوتے جا رہے ہیں۔ OpenAI کے سسٹم کارڈ کے مطابق، GPT-5.6 Sol اپنے پیشرو GPT-5.5 کے مقابلے میں نمایاں طور پر ایجنٹ کی غلط ترتیب کا شکار ہے۔ تعیناتی سمیولیشنز میں، کمپنی نے یہ بھی پایا کہ ماڈل GPT-5.5 کے مقابلے میں پابندیوں کو روکنے، تباہ کن کارروائیوں میں ملوث ہونے اور ڈیٹا کی غیر مجاز منتقلی کرنے کا زیادہ امکان رکھتا ہے۔ پہلی ریلیز پر ان اعداد و شمار کو بڑی حد تک نظر انداز کر دیا گیا تھا، لیکن خلاف ورزی کے تناظر میں، وہ دوسری شکل حاصل کر رہے ہیں - خاص طور پر چونکہ سول اس میں شامل ماڈلز میں سے ایک تھا۔

ایک سوشل میڈیا پوسٹ میں، OpenAI کے اسٹریٹجک فیوچرز کے سربراہ ڈین بال نے دلیل دی کہ نگرانی اور شفافیت ان رجحانات پر قابو پانے کے بہترین طریقے ہیں۔

انہوں نے کہا کہ ماڈلز کی صلاحیتوں میں بہتری کے ساتھ اور ان کی تعیناتی کے داؤ پر لگنے سے یہ مسائل مزید نمایاں ہو جائیں گے۔ "حل نہ تو خطرے کی گھنٹی ہے اور نہ ہی مطمئن۔ اس کے بجائے، میں سمجھتا ہوں کہ حل محتاط پیمائش اور نگرانی، انجینئرنگ کی ذہنیت اور شفافیت میں مضمر ہے۔"

اوپن اے آئی کے ایک سابق محقق نے ٹیک کرنچ کو بتایا کہ فرم "اندرونی صف بندی" کے بجائے "بیرونی سیدھ" پر توجہ مرکوز کرتی ہے - بنیادی طور پر ایک ایسے AI نظام کے درمیان فرق جو اقدار کے ایک سیٹ کو سمجھتا ہے اور ان کی یقین کے ساتھ نمائندگی کر سکتا ہے، اور ایک جس کی اصل میں وہ اقدار ہیں۔ اس معاملے میں، بیرونی صف بندی ماڈل کو یہ باور کرانے کے لیے کافی نہیں تھی کہ اسے ٹیسٹ میں دھوکہ نہیں دینا چاہیے۔

OpenAI نے مزید معلومات کے لیے بار بار کی گئی درخواستوں کا جواب نہیں دیا۔

صف بندی پر مرکوز محققین کے لیے، OpenAI کا ردعمل کافی اچھا نہیں ہے۔ Zvi Mowshowitz، ایک مصنف جو کہ AI کی نئی پیش رفت پر توجہ مرکوز کرتا ہے، نے دلیل دی کہ OpenAI کا اس واقعے کو بنیادی ڈھانچے کے مسئلے کے طور پر علاج کرنے کا فیصلہ سائبر سیکیورٹی کے فوری مسائل کو حل کرنے میں مدد دے سکتا ہے، لیکن یہ طویل مدت میں ناکام ہو جائے گا۔

"یہ ایک صف بندی کا مسئلہ ہے،" موشووٹز نے ایک حالیہ سب اسٹیک بلاگ میں لکھا۔ "یہ ماڈلز کو غلط طریقے سے منسلک کیا جا رہا ہے، اور OpenAI کے تمام ماڈلز بالکل اس مسئلے کی شدید علامات کو ظاہر کر رہے ہیں جس کے بارے میں ہم سب زیادہ فکر مند ہیں، اس طرح جو ممکنہ طور پر ان کی تربیت میں گہری سطح پر شامل ہے۔ پوری ٹریننگ پائپ لائن کو اس روشنی میں حل کرنے کی ضرورت ہے، ورنہ یہ مزید خراب ہو جائے گا۔" کئی ماہرین نے TechCrunch کو بتایا کہ یہ واقعہ اس بات کا ثبوت ہے کہ آج کے تربیتی طریقے ایسے نظام تیار کرتے ہیں جو انسانی ارادوں کو اندرونی بنانے کے بجائے نتائج کے لیے بہتر بناتے ہیں۔

ریڈ ووڈ ریسرچ، ایک غیر منفعتی AI سیفٹی اور سیکیورٹی ریسرچ آرگنائزیشن، نے اس معاملے میں OpenAI کے ماڈل رویے کو "اسکور تلاش کرنے والی غلط ترتیب" کے طور پر درجہ بندی کیا، ایک ایسا نمونہ جس میں AI ماڈلز ہدایات، ضمنی اثرات، یا بہاو کے نتائج سے قطع نظر اعلی اسکور حاصل کرنے کی کوشش کرتے ہیں۔

ریڈ ووڈ کے دو محققین الیکس میلن اور گریش گپتا نے ایک حالیہ مقالے میں لکھا، "ان صف بندی کی خصوصیات کے حامل ماڈل جھوٹی کامیابیوں کا ایک 'پوٹیمکن گاؤں' قائم کر سکتے ہیں تاکہ یہ نظر آئے کہ چیزیں ٹھیک ہیں جب وہ نہیں ہیں،"

اسکور تلاش کرنے والا سلوک اور دیگر غلط ترتیب OpenAI کے لیے منفرد نہیں ہے۔ انتھروپک نے ابھرتی ہوئی غلط ترتیب کے طرز عمل پر متعدد مقالے شائع کیے ہیں جو اس وقت سامنے آتے ہیں جب اس کے فرنٹیئر ماڈلز کو بہتر بنایا جاتا ہے یا خود مختار ماحول میں رکھا جاتا ہے، بشمول دھوکہ دہی، انعام ہیکنگ، اور بدنیتی پر مبنی خودمختاری۔

الائنمنٹ غیر منفعتی METR کے ایک AI حفاظتی محقق، Neev Parikh نے TechCrunch کو ای میل کے ذریعے بتایا، "ہم اب بھی مسلسل ماڈلز کو رکاوٹوں کو دور کرنے کی کوشش کرتے ہوئے دیکھتے ہیں اور جب ان سے اپنی صلاحیتوں کے عین مطابق کام کرنے کو کہا جاتا ہے تو وہ فریب سے کام لیتے ہیں۔" "ہماری فرنٹیئر رسک رپورٹ میں، ہم نے اس رویے کو کافی مستقل طور پر دیکھا، کمپنیوں کی جانب سے اس رویے کو کم کرنے کی کوششوں کے باوجود۔"

ہگنگ فیس کے واقعے پر OpenAI کے ردعمل میں مضمر یہ مفروضہ ہے کہ ترقی اور بھی زیادہ قابل نظاموں پر جاری رہے گی، چاہے وہ اپنے مرکز میں مناسب طور پر منسلک ہوں یا نہ ہوں۔ جب AI فرموں کے کاروباری ماڈل ماڈلز کی اگلی نسل کی فراہمی پر منحصر ہوں تو ڈرائنگ بورڈ پر واپس جانا واقعی کوئی آپشن نہیں ہے۔ اگر یقین کے ساتھ یہ جاننا کبھی ممکن نہ ہو کہ ایک ماڈل مکمل طور پر منسلک ہے، تو عملی سوال یہ آتا ہے کہ بڑھتے ہوئے قابل نظاموں کو کیسے محفوظ طریقے سے شامل اور کنٹرول کیا جائے۔

"ابھی تک اس بارے میں اچھی سمجھ نہیں ہے کہ سب سے زیادہ قابل AI سسٹمز کو کیسے ترتیب دیا جائے، لیکن ان پر قابو پانے کے بارے میں بہت زیادہ اتفاق رائے موجود ہے،" OpenAI کے سابق حفاظتی محقق اور گائیڈ لائٹ AI سٹینڈرڈز کے موجودہ چیف سائنس دان سٹیون ایڈلر نے، ایک تنظیم جو Hugging Face One جیسے واقعات سے بچنے کے لیے ایک معیار شائع کرتی ہے، TechCrunch کو بتایا۔ "ہر کمپنی کے پاس اس کو حاصل کرنے کے لیے راستے ہوتے ہیں۔"