پچھلے کچھ مہینوں کے دوران، سائبرسیکیوریٹی تشخیص سے گزرنے والے AI ایجنٹس اپنی حدود سے فرار ہو گئے ہیں، انٹرنیٹ تک رسائی حاصل کر چکے ہیں، اور، بعض صورتوں میں، حقیقی دنیا کے نظاموں میں ہیک ہو گئے ہیں۔ ان واقعات میں OpenAI، Anthropic، Meta، اور حال ہی میں چینی AI لیب Moonshot AI کے ماڈلز شامل ہیں، جن میں متعدد مختلف تنظیموں کے ذریعے ٹیسٹنگ کی گئی ہے جس میں سائبر ایویلیویشن اسٹارٹ اپ بھی شامل ہے جسے Irregular کہتے ہیں۔

اقساط AI صنعت کے لیے بڑھتے ہوئے مسئلے کو بے نقاب کرتی ہیں: جیسے جیسے خود مختار ایجنٹ زیادہ قابل ہو جاتے ہیں، ان کی حدود کو محفوظ طریقے سے جانچنے کے لیے تیار کیے گئے ماحول ان پر قابو پانے میں ناکام ہو رہے ہیں۔

"ان واقعات کی تعداد جو وقوع پذیر ہوئی ہے اس سے واضح ہوتا ہے کہ سینڈ باکسنگ اور ٹیسٹنگ ماحولیات کے کنٹرول واقعی ماڈلز کی صلاحیت کے مطابق نہیں ہیں،" Seán Ó hÉigeartaigh، AI کے ڈائریکٹر: سنٹر فار دی فیوچر آف انٹیلی جنس میں کیمبرج یونیورسٹی کے مستقبل اور ذمہ داری کے پروگرام نے ٹیک کرنچ کو بتایا۔

ٹیسٹ کیے جانے والے ماڈلز کی نوعیت خطرے میں اضافہ کرتی ہے۔ AI کمپنیاں سائبر تشخیص کو غیر جاری کیے گئے، اگلی نسل کے ماڈلز پر جانچتی ہیں، اکثر عام حفاظتی اقدامات کے ساتھ جو بدنیتی پر مبنی رویے کو غیر فعال کرنے پر پابندی لگاتے ہیں تاکہ محققین دیکھ سکیں کہ ماڈل واقعی کس قابل ہیں۔ اس کا مطلب ہے کہ جانچ کے ماحول کی حفاظت خود دفاع کی ایک اہم لائن ہے۔

"یہ جانچ کے لحاظ سے ایک بہت اچھی چیز ہے، لیکن اس کا مطلب یہ بھی ہے کہ اگر وہ جنگل میں نکلنے میں کامیاب ہو جاتے ہیں، تو وہ کافی نقصان پہنچا سکتے ہیں،" Ó ہیگرٹائی نے کہا۔

ایک انتہائی سنگین صورت میں، ایک غیر ریلیز شدہ OpenAI ماڈل اپنے سینڈ باکس سے باہر نکلا اور Hugging Face کے پروڈکشن سسٹمز میں ہیک ہوگیا۔ فاسد، اینتھروپک اور میٹا ماڈلز کی طرف سے کی گئی الگ الگ تشخیص میں غلط کنفیگریشنز نے نادانستہ طور پر انٹرنیٹ کے راستے فراہم کرنے کے بعد اپنے ٹیسٹ ماحول سے باہر کے سسٹم تک پہنچ گئے۔ Moonshot AI کے Kimi K3 نے انٹرنیٹ تک رسائی اور GitHub پر معلومات تک رسائی کے لیے فرنٹیئر سیکیورٹی کے ذریعے چلائے جانے والے اپنے سینڈ باکس میں لیک ہونے کا بھی فائدہ اٹھایا۔

UK کے AI سیکیورٹی انسٹی ٹیوٹ (AISI) کی جانچ میں، محققین نے دراصل ایجنٹوں کو انٹرنیٹ تک رسائی دی، یہ نہ سمجھے کہ وہ غیر منظور شدہ حقیقی دنیا کے اقدامات کریں گے، بشمول ایک سوشل انجینئرنگ کی کوشش ایک اوپن سورس پروجیکٹ میں خطرے کو چھپانے کی کوشش۔

ہر معاملے میں، ایجنٹوں کو بے ترتیب حقیقی دنیا کے اہداف پر حملہ کرنے کی ہدایت نہیں کی گئی تھی۔ وہ صرف وہی کر رہے تھے جو ان کے سامنے پیش کردہ مسئلے کو حل کرنے کے لئے لیا گیا تھا۔

ایک ساتھ لے کر، AI غیر منفعتی CivAI کے ریسرچ کے سربراہ، اینڈریو یون نے دلیل دی کہ واقعات ایک تبدیلی کی طرف اشارہ کرتے ہیں۔

یون نے TechCrunch کو بتایا، "ماضی میں، ہمیں صرف AI ماڈلز کو مختلف مقاصد کے لیے لوگوں کے ذریعے غلط استعمال کرنے کے بارے میں فکر کرنا پڑتی تھی، جیسے کہ AI برائے گھوٹالے یا CSAM،" یون نے ٹیک کرنچ کو بتایا۔ "اب ہم اس صورتحال میں ہیں جہاں AI ماڈلز اپنے طور پر خطرے کے اداکار ہیں۔"

کئی محققین اور سائبر سیکیورٹی ماہرین نے TechCrunch کو بتایا کہ AI تشخیصی ماحول کو مضبوط، دفاعی گہرائی سے تحفظات کی ضرورت ہوتی ہے، جس میں کنٹینمنٹ اور کنٹرول کی سطحیں تعیناتی میں استعمال ہونے والوں تک پہنچتی ہیں۔ اس کا مطلب ہے کہ سیکیورٹی کی متعدد پرتیں تاکہ ایک ہی غلط کنفیگریشن — جیسے نادانستہ طور پر انٹرنیٹ تک رسائی کو کھلا چھوڑنا — فرار ہونے کا باعث نہ بن سکے۔

"اگر آپ ان ماڈلز کو بنانے جا رہے ہیں… آپ اسے ایئر گیپڈ نیٹ ورک پر کرنا چاہتے ہیں،" سٹیلا بائیڈرمین، AI سیفٹی ریسرچ غیر منافع بخش تنظیم EleutherAI کی ایگزیکٹو ڈائریکٹر۔ "آپ بہت سنگین تنہائی اختیار کرنا چاہتے ہیں۔"

باکس کے چیف انفارمیشن سیکیورٹی آفیسر، ہیدر سیلان نے کہا کہ اس کا مطلب سینڈ باکس سے انٹرنیٹ کے ساتھ ساتھ دیگر حساس نظاموں تک نیٹ ورک کے راستوں کو ختم کرنا ہے۔

سیلان نے TechCrunch کو بتایا کہ "آپ کو سمجھنا ہوگا کہ باہر نکلنے کے تمام پوائنٹس کیا ہیں۔" "اگر ہم اپنے اسٹیجنگ ماحول یا اپنے ترقیاتی ماحول میں کسی ماڈل کا جائزہ لے رہے ہیں، تو آپ چاہتے ہیں کہ ہمارے پیداواری ماحول میں کوئی راستہ نہ نکلے۔"

سیلان نے کہا کہ حفاظتی جائزے ماحول کے کنٹرول اور کنٹرول سے بالاتر ہیں۔ ٹیسٹ ہونے کے بعد ان کی بہت بہتر نگرانی کی ضرورت ہے۔

"میرے خیال میں ان میں سے بہت سے معاملات میں دلچسپ بات یہ ہے کہ جب یہ ہوا تو کسی نے اسے نہیں پکڑا،" سی لینڈ نے کہا۔ "اوپن اے آئی کو گلے لگانے والے چہرے کی وجہ سے پتہ چلا۔ انتھروپک نے اسے اس وقت تک نہیں پکڑا جب تک کہ وہ واپس جا کر نہیں دیکھتے۔ میٹا ایسا ہی تھا۔ مجھے یقین ہے کہ ایسے اشارے تھے جن کا انہیں پتہ چل سکتا تھا۔"

Anthropic کے اپنے تین واقعات کے پوسٹ مارٹم میں، کمپنی نے اعتراف کیا کہ یہ اور Irregular دونوں مانیٹرنگ میں بہتر کام کر سکتے تھے، اور یہ کہ کچھ معاملات میں واضح نشانات تھے کہ کچھ غلط تھا۔

ماہرین نے ماڈلز کے سامنے آنے سے پہلے تشخیصی ماحول کے آزاد، تیسرے فریق کے آڈٹ کا بھی مطالبہ کیا۔ یون نے کہا، "اگر، کہتے ہیں کہ، بے ترتیب نے اپنے سسٹمز کی کنفیگریشنز کو جانچنے کے لیے کسی بیرونی آڈیٹر کی خدمات حاصل کی تھیں یا ان کی خدمات حاصل کرنے پر مجبور کیا گیا تھا، تو وہ یقینی طور پر اس مسئلے کو یہاں پکڑ لیتے،" یون نے کہا۔ "یہاں تک کہ اگر لوگوں کو صرف چیک لسٹ سے گزرنے کے لئے وقت سے پہلے میٹنگ ہوتی، تو وہ اسے پکڑ لیتے… حقیقت یہ ہے کہ انہوں نے یہ ظاہر نہیں کیا کہ کونے میں کچھ بہت شدید کٹنگ ہو رہی ہے۔"

تفصیلات سے واقف ایک ذریعہ نے TechCrunch کو بتایا کہ بے ترتیب ماحول کا مسلسل جائزہ لیا جاتا ہے اور اس کی جانچ کی جاتی ہے، جس میں متعدد بیرونی جماعتوں کے ساتھ مشاورت بھی شامل ہے۔ ذریعہ نے یہ بھی کہا کہ نگرانی اپنی جگہ پر تھی، لیکن یہ نگرانی اپنے طور پر کافی نہیں ہے۔

یون اور دیگر محققین نے صنعت پر زور دیا کہ وہ فرنٹیئر ماڈل کی حفاظت کی تشخیص کے لیے ایک معیاری عمل کے ساتھ آئے۔

سیلان نے کہا، "خاص طور پر جب گارڈریلز کو بند کر دیا جاتا ہے، آپ کو اس کے ساتھ ایسا سلوک کرنا پڑے گا جیسے آپ اس ماحول کے اندر دنیا کے سب سے زیادہ قابل ہیکر کو ڈال رہے ہیں۔"

مسئلہ یہ نہیں ہے کہ کمپنیاں یہ نہیں جانتی ہیں کہ ٹیسٹنگ کے زیادہ محفوظ ماحول کیسے بنائے جائیں، یون اور بائیڈرمین دونوں کا کہنا ہے۔ یہ ہے کہ ایسا کرنا مہنگا اور بوجھل ہوسکتا ہے، اور کمپنیوں کو ان سرمایہ کاری کرنے کے لیے بہت کم ترغیب ہوتی ہے جب تک کہ کچھ غلط نہ ہوجائے۔

بائیڈرمین نے کہا، "میرا خیال ہے کہ کمپنیاں ان وسائل کو بڑھانے کے لیے تیار نہیں ہیں جو [کافی گارڈریلز] کو پورا کرنے کے لیے درکار ہیں اور شاید اس وقت تک نہیں کریں گے جب تک کہ انہیں مجبور نہ کیا جائے۔"

لیکن ہاتھ میں ایک اور مسئلہ ہے. اگر وہ جانچ کے دوران کسی ماڈل کو بہت سختی سے بند کر دیتے ہیں تو، محققین ماڈل کے جاری ہونے سے پہلے صلاحیتوں کو دریافت کرنے میں ناکام ہو سکتے ہیں۔ یہ اتنا ہی خطرناک ہے، ممکنہ طور پر اس سے زیادہ، اسے بہت زیادہ آزادی دینے سے، اور پھر تشخیص خود ہی مسئلہ بننے کا خطرہ ہے۔

ٹرمپ انتظامیہ فی الحال ایک رضاکارانہ پری تعیناتی سائبرسیکیوریٹی ایویلیویشن نظام پر غور کر رہی ہے، جس کے تحت حکومت کو نئے، طاقتور ماڈلز کے عوامی طور پر ریلیز ہونے سے 30 دن پہلے ان کے حفاظتی خطرات کا اندازہ لگایا جائے گا۔ پالیسی - ٹرمپ کے ایگزیکٹو آرڈر کی پیداوار جسے بند دروازوں کے پیچھے حتمی شکل دی گئی ہے - حفاظتی تشخیص کے واقعات پر توجہ نہیں دے گی کیونکہ وہ تعیناتی کے اوپری حصے میں واقع ہوتے ہیں۔

یون نے کہا، "گزشتہ چند مہینوں میں ہم جو سبق سیکھ رہے ہیں وہ یہ ہے کہ خود کو منظم کرنے والا آلہ اب کافی نہیں ہے۔" "یہاں مسابقتی دباؤ ہیں جو حفاظتی معیارات پر کسی دوڑ کو نیچے کی طرف ترغیب دے رہے ہیں، اور یہ ریگولیٹری مداخلت کے لیے ایک بہترین جگہ ہے۔"

"ہمیں اس کا احاطہ کرنے کی ضرورت ہے اس پر کچھ قسم کے کنٹرولز ہیں کہ لیبز کے اندر کیا ہو رہا ہے جب کہ ماڈل تیار کیے جا رہے ہیں، تربیتی مرحلے اور جانچ کے مرحلے دونوں پر،" انہوں نے جاری رکھا۔

چیلنج صرف اسی طرح بڑھنے کا امکان ہے جیسا کہ ماڈلز کرتے ہیں۔ Irregular کی تشخیص سے واقف ایک ذریعہ نے TechCrunch کو بتایا کہ زیادہ قابل ماڈلز کے لیے زیادہ پیچیدہ تشخیصات کی ضرورت ہوتی ہے، جو اکثر جلدی اور بڑے پیمانے پر کیے جاتے ہیں، جو مزید غلطیوں کا دروازہ کھولتا ہے۔

AISI، جو جان بوجھ کر کچھ ماڈلز کو انٹرنیٹ تک رسائی فراہم کرتا ہے، نے TechCrunch کو بتایا کہ وہ حقیقت پسندانہ جانچ اور ان ٹیسٹوں سے پیدا ہونے والے خطرات کے انتظام کے درمیان توازن کا جائزہ لے رہا ہے۔

اوپن اے آئی نے کہا کہ وہ اس بات کا جائزہ لے رہا ہے کہ وہ کس طرح تھرڈ پارٹی ٹیسٹنگ کرتا ہے، نیز تنہائی، نگرانی، اور تشخیص کو کب روکا جانا چاہیے۔ میٹا نے کہا کہ وہ ابھی بھی اس واقعے کی تحقیقات کر رہا ہے اور تمام حقائق سامنے آنے کے بعد ایک سابقہ ​​شائع کرنے کا ارادہ رکھتا ہے۔

آخر میں، خطرے کو مکمل طور پر ختم کرنے کا کوئی طریقہ نہیں ہو سکتا۔ جیسے جیسے ماڈلز زیادہ قابل ہو جاتے ہیں، ان کی جانچ کرنے والے ماحول کو مزید مضبوط بننے کی ضرورت ہے۔ اس غلط ہونے کے نتائج صرف بڑھتے ہی رہیں گے۔