ایک حالیہ مطالعہ کے مطابق، چند سرفہرست AI لیبز نے کنٹینمنٹ رسپانس پلان شائع کیے ہیں یا اس کا مظاہرہ کیا ہے۔ کنٹینمنٹ پلان یہ بتاتا ہے کہ ایک بار جب AI انسانی کنٹرول کو ختم کرنے کی کوشش کرتے ہوئے پکڑا جاتا ہے تو کیا ہوتا ہے - کس تک رسائی کٹ جاتی ہے، اور جب سسٹم مکمل طور پر بند ہوجاتا ہے۔
یہ گائیڈ لائٹ AI سٹینڈرڈز کی تلاش ہے، جو کہ محفوظ فرنٹیئر AI ترقی کے طریقوں کو فروغ دینے کے لیے وقف ہے، جس نے پانچ معروف لیبز کو درجہ بندی کیا کہ وہ بالکل اس منظر نامے کے لیے کتنی تیار ہیں۔ OpenAI سب سے اوپر آیا؛ انتھروپک اور میٹا نے سب سے کم اسکور کیا۔ نتائج اہم ہیں کیونکہ ایجنٹ AI کمپنیوں کے اپنے نظام کے اندر زیادہ خود مختار کردار ادا کرتا ہے، اور کیلیفورنیا اور نیویارک میں ریگولیٹرز کو انکشاف کی ضرورت ہوتی ہے۔ ان ماڈلز پر تعمیر کرنے یا ان میں سرمایہ کاری کرنے والے ہر فرد کے لیے، یہ ایک غیر معمولی آزاد مطالعہ ہے کہ ہر لیب آپریشنل رسک کو کس طرح سنجیدگی سے لیتی ہے بمقابلہ وہ اس کے بارے میں کیسے بات کرتی ہے۔
گائیڈ لائٹ کا اندازہ انتھروپک، گوگل، اوپن اے آئی، میٹا، اور ایکس اے آئی کے عوامی طور پر دستیاب منصوبوں پر مبنی تھا، جس میں میٹرکس کی ایک رینج میں درجہ بندی کی گئی تھی، جس میں یہ بھی شامل ہے کہ ہر کمپنی کتنی اچھی طرح سے لاگ ان اور مانیٹر کرتی ہے کہ اس کے AI سسٹم اندرونی طور پر کیا کر رہے ہیں، آیا یہ فلیگڈ بدعنوانی کے اضافے کے بعد سسٹم کو روکتی ہے، چاہے آزاد تیسرے فریق اس کے ماڈل کے آڈٹ اور آڈٹ پر مشتمل ہے جو اس کے ماڈل کو شائع کرتا ہے اور اس کا کنٹرول کیا ہے ریلوں سے نکل جاتا ہے.
اس بات پر تشویش کہ آیا AI کمپنیاں اپنے بڑھتے ہوئے قابل اور ایجنٹی ماڈلز پر مشتمل ہو سکتی ہیں ہائی پروفائل سائبر سکیورٹی کے واقعات کی ایک سیریز کے بعد جس میں OpenAI، Anthropic، اور Meta کے ماڈلز نے حفاظتی جائزوں کے دوران انٹرنیٹ تک غیر ارادی رسائی حاصل کر لی اور بیرونی نظاموں میں ہیک کر لیے گئے۔
نتائج اس فرق کو نمایاں کرتے ہیں کہ کس طرح AI کمپنیاں عوامی طور پر حفاظت کے قریب پہنچ رہی ہیں کیونکہ وہ ایجنٹوں کی تعیناتی کو ایسے ماحول میں بڑھاتی ہیں جہاں AI سسٹم بڑے پیمانے پر سنجیدہ اقدامات کر سکتے ہیں۔ اگرچہ کچھ AI کمپنیوں نے تفصیل سے بتایا ہے کہ وہ تعیناتی سے پہلے خطرناک صلاحیتوں کے لیے اپنے ماڈلز کی جانچ کیسے کرتی ہیں، لیکن وہ عام طور پر اس بارے میں کم آواز اٹھاتی ہیں کہ جب پہلے سے ہی ان کے سسٹمز کے اندر کام کرنے والے ماڈلز غلط برتاؤ کرتے ہیں تو کیا ہوتا ہے۔
گائیڈ لائٹ کے چیف سائنسدان اور اوپن اے آئی کے سابق حفاظتی محقق سٹیون ایڈلر نے TechCrunch کو بتایا، "میں حیران تھا کہ AI کمپنیوں نے اس بارے میں کتنا کم کہا ہے کہ اگر ان کا ماڈل کسی لحاظ سے ان کے کنٹرول سے باہر ہو جائے تو وہ ایک انتہائی سنگین واقعے سے کیسے نمٹیں گی۔"
گائیڈ لائٹ ایک کنٹینمنٹ پلان کو "پہلے سے متعین کردہ پلان" کے طور پر بیان کرتی ہے، جب AI کو کنٹرول کو ختم کرنے کی کوشش کرنے کا پتہ چلتا ہے، جس میں اس بات کا احاطہ کیا جاتا ہے کہ ماڈل سے کن اجازتوں کو منسوخ کیا جائے، ماڈل کس کے لیے کام جاری رکھ سکتا ہے، کن رکاوٹوں کے تحت، اور کب اسے مکمل طور پر آف لائن لے جانا ہے۔
ایڈلر نے کہا ، "یہ سوچنے کی اچھی وجہ ہے کہ فرنٹیئر AI کمپنیوں میں اس وقت سرکردہ ماڈلز کسی نہ کسی لحاظ سے غلط ہیں۔" "جب بھی ماڈلز کمپنی کی جانب سے کام کر رہے ہوتے ہیں، تو کمپنی کو اپنے اردگرد کچھ سہاروں کا ہونا چاہیے تاکہ وہ یہ بتا سکے کہ وہ AI کیا کر رہا ہے، غلطی کی علامات تلاش کریں، اسے اس کارروائی سے پہلے کسی بہت خطرناک کام سے روکیں، اور عام طور پر اس کے لیے منصوبہ بندی کریں کہ وہ کیا کریں گے کسی سنگین کنٹرول کے واقعے کی صورت میں جہاں ان کے ہاتھ پر کوئی ہنگامی صورت حال ہو اور اس واقعے پر قابو پانے کے لیے اس نقصان پر قابو پانے کی ضرورت ہے۔
آج تک، تباہ کن خطرے کے انتظام کے لیے زیادہ تر منصوبے اب بھی بڑی حد تک کمپنیوں پر چھوڑے گئے ہیں۔ گائیڈ لائٹ کی رپورٹ میں کہا گیا ہے کہ بہترین عوامی شواہد سے پتہ چلتا ہے کہ کمپنیوں کے پاس "ایمرجنسی کے لیے کچھ کنٹینمنٹ پروٹوکول تیار ہیں۔"
یقیناً، کنٹینمنٹ کے منصوبے ہوسکتے ہیں جو کمپنیوں میں موجود ہیں لیکن عوامی طور پر اس کا اشتراک نہیں کیا گیا ہے۔ گوگل کے ترجمان نے TechCrunch کو بتایا کہ گائیڈ لائٹ رپورٹ کمپنی کے AI حفاظت اور حفاظتی اقدامات کے مکمل دائرہ کار کی نمائندگی نہیں کرتی ہے۔ کمپنی نے TechCrunch کے اس سوال کا جواب نہیں دیا کہ آیا گوگل کے پاس اندرونی کنٹینمنٹ رسپانس پلان ہے جس کا عوامی طور پر انکشاف نہیں کیا گیا ہے۔
اوپن اے آئی کے ترجمان نے اسی طرح کے جذبات کی عکاسی کرتے ہوئے کہا کہ گائیڈ لائٹ کی تشخیص کمپنی کے تمام داخلی طریقوں کو حاصل نہیں کرتی ہے۔ ترجمان نے کہا، "ہمارے پاس اجازتوں کو محدود کرنے، کام کے بوجھ کو روکنے، تعیناتی کو محدود کرنے، یا ماڈل کو مکمل طور پر آف لائن لینے کے لیے ایک عمل ہے، اور ہم نے اسے لاگو کر دیا ہے۔"
میٹا نے یہ بتانے سے انکار کر دیا کہ آیا اس کا اندرونی کنٹینمنٹ رسپانس پلان ہے، بجائے اس کے کہ TechCrunch کو موجودہ AI فریم ورک کی طرف اشارہ کیا جائے جو خطرے کی دہلیز کا خاکہ پیش کرتا ہے اور یہ کنٹینمنٹ کے نقصان کی جانچ کیسے کرتا ہے۔ پرائیویسی اور اے آئی کی وکیل اور میٹاورس لا کی بانی للی لی نے TechCrunch کو بتایا کہ ان کا خیال ہے کہ کمپنیاں قانونی، نہ صرف مسابقتی وجوہات کی بنا پر عوام کے سامنے آنے والی ویب سائٹس پر اپنی کنٹینمنٹ پالیسیوں اور جائزوں کے مکمل دائرہ کار کو ظاہر کرنے میں ہچکچاہٹ کا شکار ہو سکتی ہیں۔
"کمپنی کے نقطہ نظر سے تشویش یہ ہے کہ اگر آپ انکشافات کو بہت زیادہ مخصوص کرتے ہیں، اور آپ اپنے وعدوں پر پورا نہیں اتر رہے ہیں، تو یہ ایک غیر منصفانہ اور فریب دینے والے مارکیٹنگ کے دعوے کی بنیاد بن سکتا ہے اور آپ کو آگے بڑھ کر مزید ذمہ داریوں سے دوچار کر سکتا ہے،" لی نے کہا۔
یقیناً، گائیڈ لائٹ کے مطالعہ کا مقصد بڑی حد تک کمپنیوں کو اپنے حفاظتی منصوبوں کے بارے میں زیادہ شفاف ہونے کی ترغیب دینا ہے۔ ریگولیٹرز بھی اس مسئلے کو مجبور کرنا شروع کر رہے ہیں۔
کیلیفورنیا کا SB 53، جو اس سال نافذ ہوا، بڑے فرنٹیئر ڈویلپرز سے فریم ورک شائع کرنے کا تقاضا کرتا ہے کہ وہ اس بات کی وضاحت کریں کہ وہ کس طرح اہم حفاظتی واقعات کی نشاندہی کرتے ہیں اور ان کا جواب دیتے ہیں اور نگرانی کے طریقہ کار کو روکنے والے ماڈلز سے خطرات کا انتظام کرتے ہیں۔ نیویارک کا RAISE ایکٹ، جس میں اسی طرح کے معیارات ہیں، جنوری میں لاگو ہوتے ہیں۔
پچھلے مہینے، نمائندوں نے اے آئی کِل سوئچ ایکٹ متعارف کرایا، جو ایک دو طرفہ وفاقی بل ہے جس میں بڑے AI ڈویلپرز کو بدمعاش AI ماڈلز کو بند کرنے کے لیے تکنیکی میکانزم بنانے اور برقرار رکھنے کی ضرورت ہوگی۔
غیر منفعتی کنٹرول اے آئی کے امریکی ایگزیکٹو ڈائریکٹر کونر لیہی نے کہا، "آج کے ماڈلز کے لیے ایک کِل سوئچ کم از کم ہے۔" "اگر پچھلے چند ہفتوں سے کچھ پتہ چلتا ہے تو وہ یہ ہے کہ یہ کمپنیاں اپنے بنائے ہوئے سسٹمز کو نہیں سمجھ پا رہی ہیں، اور ماڈل اس مقام تک بڑھ رہے ہیں جہاں ان پر لگام لگانا مشکل ہو جاتا ہے جب وہ بدمعاش ہو جاتے ہیں۔ موجودہ خطرناک نظاموں کو بند کرنے کے طریقے کے بغیر، اور مزید بے قابو نظاموں کی تعمیر جاری رکھنے کے لیے تمام تر ترغیبات کے ساتھ، ہم ایک بہت خطرناک سمت میں جا رہے ہیں۔"
ایڈلر نے کہا کہ بغیر کسی روک تھام کے منصوبے کے، کمپنیاں ممکنہ طور پر پرواز کے دوران ہنگامی صورتحال کے بارے میں اپنے ردعمل کا پتہ لگا رہی ہیں اور "اس تیزی سے مخالف کے جواب میں اسے پنکھ لگا رہی ہیں۔"
گائیڈ لائٹ کی تشخیص سے یہ اندازہ لگایا گیا کہ آیا ہر کمپنی اپنے کنٹرول کے معیار سے چھ ترجیحی طرز عمل کو نافذ کرتی ہے، جو صرف عوامی طور پر دستیاب معلومات کی بنیاد پر ہوتی ہے — لہذا کم اسکور عوامی افشاء کی کمی کو ظاہر کرتا ہے، ضروری نہیں کہ اندرونی تحفظات کی کمی ہو۔
اپنے کنٹینمنٹ پلان کو شائع کرنے کے لیے سب سے کم اسکور والی کمپنیاں میٹا اور اینتھروپک تھیں - جو کہ بعد میں شاید انتھروپک کی حفاظت پر دی گئی بیان بازی سے زیادہ حیران کن تھیں۔ گائیڈ لائٹ کا کہنا ہے کہ اینتھروپک کی اگست رسک رپورٹ میں "اس کے ماڈلز میں سے ایک کی تعیناتی کو محدود کرنے کا ذکر نہیں کیا گیا ہے کہ اس کے عمل کے ممکنہ نتائج میں سے ایک کے طور پر غلط ترتیب اور کنٹرول کے واقعات کی تحقیقات اور اس کا جواب دیا جائے۔" اسی طرح گائیڈ لائٹ اس بات کا کوئی ثبوت نہیں ڈھونڈ سکا کہ میٹا کے پاس کنٹینمنٹ رسپانس پلان ہے یا اسے اپنانے کا کوئی منصوبہ ہے۔
ایک انتھروپک ترجمان نے کہا کہ اگر کمپنی کو کسی ایسے ماڈل کا پتہ چلا جو نگرانی سے بچنے یا دوسری صورت میں انسانی کنٹرول کو ختم کرنے کی کوشش کرتا ہے، تو وہ اس بات کا تعین کرنے پر مرکوز ایک خطرے کی تشخیص کرے گی کہ آیا کنٹینمنٹ مناسب ردعمل ہے۔
OpenAI نے سب سے زیادہ (5 میں سے 3) اسکور کیا کیونکہ اس نے کئی مواقع پر حفاظتی واقعات کا پتہ لگانے کے بعد اندرونی ماڈل کی تعیناتی اور تربیت سمیت کام کے بوجھ کو روک یا ختم کیا ہے۔ اس نے یہ بھی بتایا ہے کہ کام کا بوجھ دوبارہ شروع کرنے سے پہلے اسے کیا اقدامات کرنا ہوں گے۔
"تاہم، ہمیں اس بات کا کوئی ثبوت نہیں ملا ہے کہ [اوپن اے آئی] نے مستقبل میں گمراہ کن واقعات کا کب اور کیسے جواب دیا جائے اس کے لیے کوئی باقاعدہ منصوبہ اپنایا ہے،" رپورٹ میں لکھا گیا ہے۔
ایڈلر نے نوٹ کیا کہ اوپن اے آئی کا ہائی اسکور ہگنگ فیس واقعہ کی ہیلس پر نسبتاً حالیہ پیشرفت ہے (جس میں ایک اوپن اے آئی ماڈل اپنے ٹیسٹنگ سینڈ باکس سے باہر نکلا اور سائبر سیکیورٹی کی تشخیص کو دھوکہ دینے کی کوشش کرتے ہوئے ہیگنگ فیس کے سسٹمز میں ہیک کر لیا)۔ اس کے بعد، کمپنی نے اس بارے میں مزید تفصیلات شیئر کیں کہ اس نے اپنے کچھ غلط برتاؤ کرنے والے ماڈلز کو کس طرح بند کر دیا ہے۔
یہ واقعہ AI سسٹمز کی صرف ایک مثال ہے جو کمپنی کے اہداف کے خلاف کام کرتا ہے جس نے انہیں بنایا تھا۔ Anthropic کے ماڈلز پر مشتمل ایک الگ کیس پر غور کریں، جس نے بنیادی طور پر ایک اوپن سورس کوڈبیس کے مینٹینرز کو کمزوریوں کے ساتھ کوڈ کو قبول کرنے پر بات کرنے کی کوشش کی تھی۔
ایڈلر نے کہا کہ ایسی صورت حال AI کمپنی کے اندرونی نظام میں آسانی سے ہو سکتی ہے۔ اس کو روکنے کے لیے، وہ تجویز کرتا ہے کہ کمپنیاں اپنے AI نظام کی سوچ کے سلسلے کو اسکین کریں — ماڈل کی قدم بہ قدم استدلال — دھوکہ دہی، طویل عرصے سے چلنے والی سازش، یا کوڈ میں کمزوریوں کو متعارف کرانے کے منصوبے کو تلاش کرنے کے لیے جس سے وہ بعد میں فائدہ اٹھا سکیں۔ ایڈلر کا کہنا ہے کہ گائیڈ لائٹ جن طریقوں کی وکالت کر رہی ہے وہ لاگو کرنے کے لیے بہت سیدھے ہیں، اور بہت سے معاملات میں، ان کے ورژن پہلے سے موجود ہیں۔ ایڈلر نے کہا ، "یہ کمپنی کے اندر فیصلہ کرنے کے بارے میں ہے کہ اس خطرے کے بارے میں کافی خیال رکھیں تاکہ دائرہ کار کو قدرے وسیع کیا جاسکے۔"
اہم چیلنجوں میں سے ایک یہ ہے کہ محققین اپنے AI سسٹم کے اندر لچکدار طریقے سے کام کرنے کے قابل ہونا چاہتے ہیں، اور ریئل ٹائم، روک تھام کی نگرانی متعارف کرانے سے رگڑ پیدا ہو سکتی ہے۔ انہوں نے کہا، "محققین بنیادی طور پر اپنا کام کرتے ہیں، اور اگر کوئی مسئلہ ہو تو، بعد میں کوئی اور اسے صاف کرنے کے لیے آتا ہے، اور محققین کو اس دوران اپنے ورک فلو کو تبدیل کرنے کی ضرورت نہیں ہے۔"
"حقیقت کے بعد کلین اپ مانیٹرنگ" کے ساتھ مسئلہ یہ ہے کہ اس کی وجہ سے محققین مسائل کو حل کرنے کے لیے گھومتے پھرتے ہیں۔ اور کچھ قسم کے واقعات کے لیے، بہت دیر ہو سکتی ہے۔ مثال کے طور پر، ایک AI کسی کمپنی کے کنٹرول سسٹم کو بند کر سکتا ہے، جس کا مطلب ہے کہ محققین بعد میں بد سلوکی کو پکڑنے پر اعتماد نہیں کر سکتے۔
AI صنعت میں بہت سے لوگ شکایت کریں گے کہ بد سلوکی سے نمٹنے کے لیے طے شدہ منصوبے بنانا بنیادی طور پر مشکل ہے کیونکہ AI بہت تیزی سے حرکت کرتا ہے۔ آج کے منصوبے کل بے کار ہوں گے۔
ایڈلر نے پرانی کہاوت کو جنم دیا کہ منصوبے بیکار ہیں، لیکن منصوبہ بندی ناگزیر ہے۔
"ہم بہتر ہوں گے اگر کمپنیاں وقت سے پہلے اس کے بارے میں سوچ لیں، اور مجھے امید ہے کہ وہ ہیں، چاہے انہوں نے اس کے بارے میں عوامی طور پر بات نہ کی ہو۔"
xAI نے تبصرہ کرنے کے لیے بروقت جواب نہیں دیا۔