اینتھروپک نے جُمِرات کو کہا کہ ایک اندرونی تحقیقات نے تین واقعات کا پردہ فاش کیا جس میں اس کے AI ماڈل کلاڈ نے سائبرسیکیوریٹی ٹیسٹ کرواتے ہوئے تین تنظیموں کے نظام کی خلاف ورزی کی۔ تحقیقات، اور انکشاف، OpenAI کے اس انکشاف کے ایک ہفتے سے زیادہ وقت کے بعد سامنے آیا ہے کہ اس کے ایک غیر جاری کردہ ماڈل نے اندرونی جانچ کے دوران Hugging Face کے نظام کی خلاف ورزی کی۔

تینوں صورتوں میں، ایک کلاڈ ماڈل تیسرے فریق کے ساتھ بات چیت کرتے ہوئے آزمائشی ماحول کے اندر سے انٹرنیٹ تک پہنچا اور پھر اس نے ان تنظیموں کے لائیو سسٹمز تک غیر مجاز رسائی حاصل کی، اینتھروپک نے ایک بلاگ پوسٹ میں کہا کہ اس نے کیا پایا اور کمپنی اسے دوبارہ ہونے سے روکنے کے لیے کیا تبدیل کرنے کا ارادہ رکھتی ہے۔

اینتھروپک نے کہا کہ 21 جولائی کے اوپن اے آئی کے واقعے نے کمپنی کو اپنی سائبرسیکیوریٹی تشخیص کرنے پر آمادہ کیا۔ اس نے خاص طور پر اس بات کا ثبوت تلاش کیا کہ کلاڈ نے جانچ کے ماحول سے انٹرنیٹ تک رسائی حاصل کی تھی، جو سینڈ باکس کے طور پر کام کرنے اور ماڈلز کو الگ تھلگ رکھنے کے لیے ڈیزائن کیے گئے ہیں۔

141006 تشخیص میں سے جو اس کا جائزہ لیا گیا، AI لیب کو تین ایسے واقعات ملے جن میں اس کے ماڈل نے اپنے تیسرے فریق کے شراکت داروں میں سے ایک Irregular کے ساتھ بات چیت کرتے ہوئے انٹرنیٹ تک رسائی حاصل کی۔ اینتھروپک نے کہا کہ رسائی کا پتہ لگانا غیر منظم کے ساتھ چلنے والے تشخیصی ماحول میں غلط کنفیگریشن کا نتیجہ ہے۔ اس نے اسے دونوں کمپنیوں کے درمیان "غلط فہمی" قرار دیا کہ آیا ٹیسٹ سیٹ اپ میں انٹرنیٹ تک رسائی تھی، جب حقیقت میں ایسا ہوا تھا۔ اینتھروپک نے کہا کہ وہ الزام نہیں لگا رہا ہے اور "اس طرح سے اصلاحات تک پہنچ رہا ہے جیسے ذمہ داری ہماری اکیلے ہے"، جبکہ یہ مشاہدہ کرتے ہوئے کہ بے ترتیب اپنی الگ تحقیقات کر رہی ہے۔

کسی بھی طرح سے، اس کھلے رابطے کی وجہ سے، ماڈل نے تین مختلف تنظیموں کے پروڈکشن انفراسٹرکچر تک غیر مجاز رسائی حاصل کی۔ اینتھروپک نے کہا کہ واقعات میں تین مختلف کلاڈ ماڈل شامل ہیں: Opus 4.7، Mythos 5، اور ایک اندرونی تحقیقی ٹیسٹ ماڈل۔

خاص طور پر، انتھروپک نے کہا کہ ان میں سے ہر ایک کیس میں "کلاڈ کو ہمارے پرامپٹ کے ذریعے واضح طور پر بتایا گیا تھا کہ اس کے پاس انٹرنیٹ تک رسائی نہیں ہے۔" ایسا لگتا ہے کہ AI ماڈل نے حقیقی دنیا کے نظام کو اس مشق کا حصہ سمجھا جس کو انجام دینے کے لیے کہا گیا تھا۔

یہ مفروضہ یکساں طور پر برقرار نہیں رہا، جیسا کہ یہ نکلا ہے۔ تینوں ماڈلز نے ایک ہی طرح کا برتاؤ نہیں کیا ایک بار جب یہ ثبوت سامنے آیا کہ ان کے اہداف حقیقی تھے، جسے اینتھروپک نے ایک اور آنکھ کھولنے والے نتائج کے طور پر جھنڈا دیا۔

Opus 4.7، تینوں میں سب سے قدیم، نے تسلیم کیا کہ یہ اس واقعے کے چاروں رن میں ایک حقیقی پیداواری نظام تک پہنچ گیا ہے۔ ان میں سے دو میں، اس نے عقلی طور پر کہا کہ حقیقی کمپنی کو کسی نہ کسی طرح مشق کا حصہ ہونا چاہیے، لیکن ان چاروں میں، وہ بہرحال حملہ کرتی رہی، بشمول اسناد کو کھینچنا اور پروڈکشن ڈیٹا کے ڈیٹا بیس کو چھونا۔ Mythos 5 نے یہ نشانیاں بھی حاصل کیں کہ یہ حقیقی انٹرنیٹ پر ہے، لیکن اس نے خود کو یہ یقین دلایا کہ یہ اب بھی ایک نقلی حالت میں ہے، عوامی Python سافٹ ویئر رجسٹری PyPI پر ایک بدنیتی پر مبنی سافٹ ویئر پیکج شائع کرنے جا رہا ہے، جسے پکڑے جانے سے پہلے باہر کے سسٹمز کے ذریعے ڈاؤن لوڈ اور چلایا گیا تھا۔ صرف داخلی تحقیقی ٹیسٹ ماڈل، اینتھروپک کا سب سے نیا، خود ہی رک گیا جب اس نے یہ نتیجہ اخذ کیا کہ ہدف حقیقی تھا۔

جواب میں، Anthropic نے کہا کہ اگر طاقتور AI ماڈلز شامل ہوں، تو سائبر سیکیورٹی کمیونٹی کے اندر کچھ جذبات کی بازگشت کرتے ہوئے اس قسم کی تشخیص پر اہم کنٹرول رکھنا ضروری ہے۔

کمپنی نے یہ بھی نوٹ کیا کہ Claude اضافی حفاظتی نگرانی اور درجہ بندی کے بغیر چل رہا تھا جو وہ عام طور پر دستیاب ماڈلز پر تعینات کرتا ہے، حفاظتی اقدامات اس نے کہا ہے کہ رویے کو روک دیا جائے گا، کیونکہ تشخیص بنیادی ماڈل کی خام صلاحیتوں کی پیمائش کرنے کے لیے بنائے گئے ہیں۔

اہم بات یہ ہے کہ، اینتھروپک نے کہا کہ اسے کسی بھی ماڈل کا کوئی ثبوت نہیں ملا کہ وہ "اپنا مقصد حاصل کر رہا ہے" اور اس کے بجائے صرف اس کام کو مکمل کرنے کی کوشش کی جو اسے کرنے کو کہا گیا تھا۔

اگرچہ دونوں واقعات کے درمیان موازنہ ناگزیر ہے، انتھروپک نے اپنے واقعات اور OpenAI کے درمیان واضح فرق پیدا کیا، یہ نوٹ کرتے ہوئے کہ جہاں OpenAI کے ماڈل نے اپنے ٹیسٹ ماحول سے باہر نکلنے کے لیے ایک نامعلوم سافٹ ویئر کمزوری کا فائدہ اٹھایا، اس کے بجائے Anthropic کے ماڈل انٹرنیٹ تک ایسے راستے سے پہنچے جو غلطی سے کھلا چھوڑ دیا گیا تھا۔

OpenAI نے اپنی خلاف ورزی کے بارے میں نئی ​​تفصیلات جاری کرتے ہوئے کہا ہے کہ اس کے ماڈلز نے چار سروسز پر چار اکاؤنٹس میں عوامی طور پر بے نقاب اسناد کا بھی استعمال کیا ہے: ایک اسٹیجنگ پوائنٹ کے طور پر، ایک اسٹوریج کے لیے، اور دو جنہیں صرف دیکھا گیا تھا، مزید ٹوٹنے کے لیے استعمال نہیں کیا گیا، اس واقعے کے بارے میں OpenAI کی اپنی تازہ کردہ بلاگ پوسٹ کے مطابق۔ اینتھروپک نے اپنے اور اوپن اے آئی کے درمیان ایک فرق یہ نوٹ کرتے ہوئے بھی کھینچا کہ اس نے واقعات کو خود ایک فعال جائزہ کے ذریعے دریافت کیا، اور یہ کہ جن دو متاثرہ تنظیموں تک وہ پہنچ سکا تھا اس نے پہلے اس سرگرمی کا پتہ نہیں لگایا تھا یا اسے اینتھروپک پر جھنڈا نہیں لگایا تھا۔

کمپنی نے مزید کہا کہ اب وہ آزاد تشخیصی گروپ METR کے ساتھ واقعات کے تیسرے فریق کے جائزے پر کام کر رہی ہے۔

OpenAI کی حادثاتی طور پر Hugging Face کی خلاف ورزی، جو کہ AI لیب کے اپنے ماڈل پر کنٹرول کھونے کا پہلا قابل تصدیق کیس تھا، نے صنعت اور سیاست دانوں کی جانب سے ردعمل کا ایک سلسلہ شروع کیا، جن میں سے بہت سے ضروری طور پر ایک دوسرے سے متفق نہیں ہیں۔ Anthropic کی طرف سے یہ تازہ ترین انکشاف AI ماڈلز اور سیکیورٹی پر بحث کو یقینی بناتا ہے۔