برطانیہ کے اے آئی واچ ڈاگ نے کہا ہے کہ اینتھروپک اور اوپن اے آئی کے اعلیٰ ترین مصنوعی ذہانت کے ماڈلز حالیہ حفاظتی ٹیسٹوں کے دوران حقیقی لوگوں اور تنظیموں کو نشانہ بنانے والی "خود مختار" اور "غیر منظور شدہ" بدنیتی پر مبنی سرگرمی میں مصروف ہیں۔
AI سیکیورٹی انسٹی ٹیوٹ (AISI) نے مَنگَل کو جاری کردہ ایک رپورٹ میں کہا ہے کہ OpenAI کے GPT-5.6-Sol اور Anthropic's Mythos 5 نے معمول کی حفاظت کے جائزے کے دوران "مستقل، ممکنہ طور پر نقصان دہ سرگرمی" کو انجام دینے کے لیے دھوکہ دہی کی پہلے نہ دیکھی ہوئی سطحوں کو استعمال کیا۔
AISI کے مطابق، جب سائبر سیکیورٹی چیلنج کو حل کرنے کا کام سونپا گیا، تو ماڈلز نے 122 میں سے 10 ٹیسٹ رنز کے دوران "خود مختار، غیر منظور شدہ کارروائی" کی۔
AISI نے کہا کہ ٹیسٹوں نے AI ماڈلز کے ذریعے 19 غیر منظور شدہ کارروائیوں کا اشارہ کیا، ان میں سے دو کے علاوہ تمام Mythos 5 کے ذریعے کیے گئے۔
AISI کے مطابق، انتہائی سنگین صورت میں، Mythos 5 نے ڈویلپر پلیٹ فارم GitHub پر ایک اوپن سورس پروجیکٹ میں بدنیتی پر مبنی کوڈ داخل کرنے کی کوشش کی۔
واچ ڈاگ نے کہا کہ سائبر حملے کی کوشش کے ایک حصے کے طور پر، Mythos 5 نے پراجیکٹ کو برقرار رکھنے والے شخص کو بدنیتی پر مبنی کوڈ کو قبول کرنے پر آمادہ کرنے کے لیے جعلی آن لائن شناخت بنائی۔
AISI، جسے برطانوی حکومت نے 2023 میں قائم کیا تھا، نے کہا کہ سائبر حملہ اس وقت ناکام ہو گیا جب پروجیکٹ مینٹینر نے کوڈ کو منظور کرنے سے انکار کر دیا۔
واچ ڈاگ نے کہا، "یہ پہلا موقع ہے جب AISI نے اس شدت کا دھوکہ دیکھا ہے جو حقیقی دنیا میں، بغیر کسی اشارے کے، ایک حقیقی شخص کو نشانہ بنایا گیا تھا،" واچ ڈاگ نے کہا۔
جب کہ AISI نے کہا کہ AI ماڈلز "ناول، ممکنہ طور پر فریب دینے والے رویے" کو ظاہر کرتے ہیں، واچ ڈاگ نے خبردار کیا کہ اس کے نتائج کو احتیاط کے ساتھ سمجھا جانا چاہیے، کیونکہ وہ "مخصوص حالات" کے تحت ہوئے ہیں، بشمول کچھ ماڈلز کے تحفظات کو غیر فعال کر دیا گیا ہے۔
AISI نے کہا، "ہم ابھی تک اس بات کا یقین نہیں کر سکتے کہ ایجنٹ کب سمجھ گیا کہ وہ حقیقی دنیا میں کارروائی کر رہا ہے، یا اسے کس حد تک یقین ہے کہ یہ ایک فرضی ٹیسٹ کے منظر نامے میں ہے؛ ہمارا تجزیہ اب تک ایک ملی جلی تصویر پیش کرتا ہے اور جاری ہے،" AISI نے کہا۔
اینتھروپک نے کہا کہ وہ واقعے کی اپنی تحقیقات کے حصے کے طور پر مزید تفصیلات اکٹھا کرنے کے لیے AISI کے ساتھ مل کر کام کر رہا ہے، لیکن اس نے نوٹ کیا کہ یہ ٹیسٹ "جان بوجھ کر اجازت دینے والے حالات" کے تحت کیا گیا تھا۔
AI کمپنی نے X پر ایک پوسٹ میں، Anthropic کے AI چیٹ بوٹ، Claude کا حوالہ دیتے ہوئے کہا، "Claude کی صورت حال کے بارے میں سمجھنے کی واضح تصویر حاصل کرنا - اس کے استدلال کی نقلوں کی جانچ کرکے اور خود اپنے تجزیے چلا کر - ہمیں اس کے رویے کی وجوہات کی نشاندہی کرنے میں مدد ملے گی۔"
اوپن اے آئی نے کہا کہ اس نے فریق ثالث کی جانچ کا خیرمقدم کیا ہے جبکہ یہ نوٹ کرتے ہوئے کہ واچ ڈاگ کی تشخیص ایسے حالات میں کی گئی تھی جو "عام استعمال کی عکاسی نہیں کرتی"۔
اوپن اے آئی کے ترجمان نے الجزیرہ کو بتایا کہ "ہم پوری صنعت میں تشخیص کاروں اور دیگر اسٹیک ہولڈرز کے ساتھ کام کرتے رہیں گے تاکہ جائزوں کو محفوظ طریقے سے انجام دینے کے لیے مشترکہ طریقوں کو مضبوط کیا جا سکے۔"
لندن میں قائم واچ ڈاگ کی رپورٹ میں فرنٹیئر اے آئی ماڈلز کے متعدد کیسز کی پِیروی کی گئی ہے جو انسانی اشارے کے بغیر بدنیتی پر مبنی سرگرمیوں میں ملوث ہیں۔
پچھلے مہینے، OpenAI نے انکشاف کیا کہ اس کے دو AI ماڈلز اپنے ٹیسٹنگ ماحول سے باہر ہو گئے اور Hugging Face کو ہیک کر لیا، ایک کمپنی جو اوپن سورس AI ماڈلز اور ڈیٹا سیٹس کی میزبانی کرتی ہے، بغیر انسانی سمت کے۔
UNSW سڈنی میں ایک پروفیسر اور AI ماہر ٹوبی والش نے کہا کہ ASAI کے نتائج نے اس حقیقت کو اجاگر کیا ہے کہ جدید ترین AI ماڈلز "خطرناک" صلاحیتوں کے مالک ہیں۔
والش نے الجزیرہ کو بتایا کہ "ہم ایسی دنیا میں نہیں رہنا چاہتے جہاں ہم AI ماڈلز میں ایسی پریشان کن صلاحیتوں کو ننگا کرنے کے لیے AI کمپنیوں کی نیک نیتی اور تندہی پر انحصار کرتے ہیں۔"
والش نے مزید کہا، "ہم چاہتے ہیں کہ حکومتیں اس میں سرفہرست رہیں۔ اور اس لیے مجھے یقین دلایا گیا ہے کہ برطانیہ کی حکومت کے AI سیفٹی انسٹی ٹیوٹ نے یہ پایا… مصیبت یہ ہے کہ یہ سائبر صلاحیتیں اب ہر کسی کے لیے دستیاب ہیں، بشمول برے اداکار جو پہلے خود سسٹم کو ہیک کرنے کی صلاحیت نہیں رکھتے تھے،" والش نے مزید کہا۔
"تو پھر بہت سے سائبر حملوں کے بارے میں سننے کی توقع کریں۔"