برطانیہ کے اے آئی سیکیورٹی انسٹی ٹیوٹ نے مَنگَل کو انکشاف کیا کہ اوپن اے آئی اور اینتھروپک کے ماڈلز کے ٹیسٹ کے دوران ایک AI ایجنٹ کو محفوظ سسٹمز تک غیر مجاز رسائی حاصل کرنے کے لیے جعلی آن لائن شناخت بناتے ہوئے پکڑا گیا، جس سے نئی خلاف ورزیوں کا ایک سلسلہ سامنے آیا۔
انسٹی ٹیوٹ نے کہا کہ Anthropic's Mythos 5 اور OpenAI کے GPT-5.6-Sol سے چلنے والے ایجنٹس نے ماڈلز کی صلاحیتوں کا اندازہ لگانے کے لیے حکومتی تنظیم کی جانب سے حفاظتی جائزوں کے دوران غیر مجاز کارروائیاں کیں۔
AISI نے ایک بلاگ پوسٹ میں کہا، "کچھ ایجنٹوں کی جانچ کی جا رہی تھی جو حقیقی لوگوں اور تنظیموں کے لیے مستقل، ممکنہ طور پر نقصان دہ سرگرمی میں مصروف تھے۔"
رپورٹ ٹیسٹنگ ایجنٹوں کے عمل کے ارد گرد حفاظتی اقدامات کی کمزور حالت کو واضح کرتی ہے، جسے AI کمپنیاں بیک وقت کاروبار کے مستقبل کے طور پر مارکیٹنگ کر رہی ہیں۔
AISI، جو بڑی لیبز سے رضاکارانہ معاہدوں کے تحت ایڈوانسڈ AI ماڈلز تک رسائی حاصل کرتا ہے، ایجنٹوں کو ان کی صلاحیتوں کو جانچنے کے لیے ایک فرضی سائبر سیکیورٹی کے منظر نامے میں ڈالتا ہے۔
اس نے چیلنج کو 122 بار چلایا اور کل 10 ٹیسٹ رنز میں 19 غیر منظور شدہ کارروائیوں کی نشاندہی کی۔ انتھروپک کا ایجنٹ 17 کارروائیوں کے پیچھے تھا، اور باقی دو میں OpenAI کا ایجنٹ تھا۔
AISI نے کہا کہ سب سے زیادہ سنگین کارروائی میں ایک ایجنٹ کو بدنیتی پر مبنی کوڈ لکھنا اور جعلی آن لائن شناخت بنانا شامل ہے تاکہ کسی انسان سے کوڈ کی منظوری حاصل کی جا سکے۔
اگرچہ AISI نے یہ نہیں بتایا کہ جعلی شناخت کے پیچھے کون سا ایجنٹ تھا، لیکن Anthropic نے تصدیق کی کہ اس کا ایجنٹ ذمہ دار تھا۔
اینتھروپک نے ایک بیان میں کہا، "ہم اس واقعے پر UK AISI کے ان کی قیادت کے شکر گزار ہیں، جو کہ تیزی سے قابل AI ایجنٹوں کا محفوظ طریقے سے جائزہ لینے کے طریقے کے بارے میں وسیع تر بات چیت کی ضرورت پر زور دیتا ہے۔"
اس نے یہ بھی کہا کہ وہ AISI کے ساتھ اس واقعے کے بارے میں مزید تفصیلات حاصل کرنے اور اپنی تحقیقات کرنے کے لیے کام کر رہا ہے۔
کیلیفورنیا کے ایک غیر منافع بخش ادارے CivAI کے ایک محقق اینڈریو یون نے کہا: "حقیقت یہ ہے کہ Mythos اس طرح کے دھوکہ دہی کے کاموں میں ملوث ہیں، بظاہر آگاہی کے ساتھ کہ یہ ایک حقیقی شخص کو نشانہ بنا رہا ہے، یہ بتاتا ہے کہ Anthropic کا اپنے ماڈلز پر اتنا اچھا ہینڈل نہیں ہے جتنا وہ سوچتے ہیں۔"
OpenAI نے کمپنی کی ایک بلاگ پوسٹ میں تفصیلات شیئر کیں، یہ نوٹ کرتے ہوئے کہ اس کے دونوں ایجنٹوں کی غیر منظور شدہ کارروائیوں میں انٹرنیٹ تک ان طریقوں سے رسائی شامل ہے جو پرامپٹ کے ذریعے منع کیے گئے تھے۔
OpenAI نے کہا، "ہم پوری صنعت میں کام کرنے کے لیے پرعزم ہیں تاکہ آنے والے ہفتوں میں اسٹیک ہولڈرز جیسے کہ قومی AI انسٹی ٹیوٹ، آزاد تشخیص کار، دیگر AI لیبز، اور دیگر گروپس کو محفوظ طریقے سے انجام دینے کے لیے مشترکہ طریقوں کو مضبوط کیا جا سکے۔"
اوپن اے آئی نے اپنے بلاگ پوسٹ میں ایک الگ واقعہ کا بھی انکشاف کیا جس کے تحت تھرڈ پارٹی ٹیسٹنگ فراہم کرنے والے، غیر منظم کی طرف سے غلط کنفیگریشن نے اپنے ایجنٹوں کو غلطی سے انٹرنیٹ سے منسلک ہونے کی اجازت دی۔ اس نے غلط کنفیگریشن کے بارے میں اسی طرح کے انکشاف کی عکاسی کی ہے جو Anthropic نے پچھلے ہفتے کیا تھا۔
پچھلے ہفتے، OpenAI نے دیگر ایجنٹوں کے بریک آؤٹ کے شواہد تلاش کرنے کے بعد اپنی ہیکنگ کی تحقیقات کو وسیع کر دیا تھا۔
OpenAI ایجنٹ کے ذریعے AI فرم Hugging Face کی جولائی میں سیکیورٹی کی خلاف ورزی کے برعکس، AISI کی تشخیص میں ایجنٹ انٹرنیٹ تک پہنچنے کے لیے الگ تھلگ ٹیسٹنگ ماحول سے نہیں بچ پائے۔ بلکہ، ایجنسی نے اپنے معیاری جانچ کے طریقہ کار کے مطابق انٹرنیٹ تک رسائی کی اجازت دی تھی، AISI نے کہا۔