جیسا کہ پالیسی ساز اس بات پر بحث کر رہے ہیں کہ OpenAI کے GPT-5.6 Sol اور Anthropic's Mythos جیسے تیزی سے طاقتور AI سسٹمز پر حکومت کیسے کی جائے، ایک چینی اوپن ویٹ ماڈل نے صنعت کے رہنماؤں کے ساتھ خلا کو کم کر دیا ہے۔
AI حفاظتی غیر منفعتی SaferAI کی ایک نئی رپورٹ کے مطابق، GLM-5.2، چین کے Z.ai کا اوپن ویٹ AI ماڈل، سائبر اور بائیو صلاحیتوں پر OpenAI کے GPT-5.5 اور Anthropic کے Claude Opus 4.7 سے صرف چند ماہ پیچھے ہے۔ لیکن سرحدی صلاحیتوں اور حفاظتی طریقوں کے درمیان فرق بڑھ رہا ہے۔
SaferAI کی تشخیص کے مطابق، جو غیر منافع بخش تنظیم Z.ai کے عوامی API کے ذریعے چلائی گئی، GLM-5.2 نے کسی بھی جارحانہ سائبر یا دوہری استعمال کے حیاتیات کے کاموں سے انکار نہیں کیا جو اسے دیا گیا تھا۔ مقابلے کے لحاظ سے، Claude Opus 4.7 نے "اتنی مستقل طور پر انکار کیا کہ SaferAI اس پر CyberGym کو بالکل بھی مکمل نہیں کر سکا۔" (سائبر جیم ایک بینچ مارک ہے جو سائبرسیکیوریٹی کی صلاحیتوں کا جائزہ لیتا ہے۔ OpenAI نے اسے اس تشخیص میں استعمال کیا جو پچھلے مہینے کے Hugging Face کی خلاف ورزی سے پہلے تھا۔)
یہ اس بات کی ایک واضح یاد دہانی ہے جس کی کچھ ناقدین نے برسوں سے تنبیہ کی ہے: کہ کھلے وزن والے AI ماڈل ممکنہ حملہ آوروں کے ہاتھ میں انتہائی قابل AI ڈال سکتے ہیں، پولیس کے پاس کوئی طریقہ نہیں ہے کہ وہ وزن ڈاؤن لوڈ کرنے کے بعد ٹیکنالوجی کا استعمال کیسے کریں۔ کھلے وزن والے ماڈلز تیزی سے دنیا کے سرکردہ AI سسٹمز کی صلاحیتوں کے قریب پہنچ رہے ہیں، یہ بحث اس طرف بڑھ رہی ہے کہ آیا وہ اس بات کا مقابلہ کر سکتے ہیں کہ معاشرہ ان کے جاری ہونے کے بعد خطرات کو کس طرح سنبھالتا ہے۔
SaferAI کے ایگزیکٹو ڈائریکٹر ہنری پاپاڈاٹوس نے TechCrunch کو بتایا، "صلاحیت کی سرحد خطرے کی سرحد نہیں ہے، اور اس لیے ہمیں خطرے کا صحیح اندازہ لگانے کے لیے تخفیف کی حالت کو بھی مدنظر رکھنا ہوگا۔"
اگرچہ Z.ai اپنے میزبان API پر حفاظتی اقدامات کا اطلاق کر سکتا ہے، لیکن جب کوئی اپنے ہارڈ ویئر پر وزن چلاتا ہے تو وہ تحفظات ناقابل نفاذ ہو جاتے ہیں، جہاں وہ کسی بھی حفاظتی تدابیر کو ہٹا یا اس میں ترمیم کر سکتے ہیں، ماڈلز کو ٹھیک کر سکتے ہیں، یا سسٹم پرامپٹس کو تبدیل کر سکتے ہیں۔
فرنٹیئر ڈویلپرز جیسے OpenAI اور Anthropic خطرناک سائبر اور حیاتیاتی امداد کو محدود کرنے کے لیے درجہ بندی کرنے والے، انکار کی تربیت، اور API کی سطح کے کنٹرول جیسے حفاظتی اقدامات پر انحصار کرتے ہیں۔
وہ اقدامات فول پروف نہیں ہیں: جیل بریک معمول کے مطابق تعینات ماڈلز پر تحفظات کو نظرانداز کرتے ہیں۔ Far.ai، ایک AI سیفٹی غیر منفعتی، نے سینکڑوں یونیورسل جیل بریکز پائے — دوبارہ قابل استعمال کلیدوں کے طور پر بیان کیے گئے جو زیادہ تر نقصان دہ درخواستوں پر کامیاب ہوتی ہیں — فرنٹیئر ماڈلز جیسے xAI's Grok 4.5 اور Google DeepMind's Gemini 3.1 Pro۔ رپورٹ کے مطابق، جیل بریک اس وقت کامیاب ہوتے ہیں جب حملہ آور متعدد ہیرا پھیری کی تکنیکوں کو یکجا کرتے ہیں - بشمول رول پلےنگ، اتھارٹی کی نقالی، گفتگو کی جعلی تاریخ، اور فالو اپ پرامپٹس - ماڈل کے دفاع میں کمزور نکات کو بڑھانے کے لیے۔
لیکن بند ماڈلز کے لیے موجود حفاظتی اقدامات کھلے وزن والے ماڈلز پر بالکل کام نہیں کرتے، جو کسی بھی بنیادی ڈھانچے پر حفاظت کے کسی بھی سیٹ کے ساتھ چلانے کے لیے بنائے گئے ہیں — یا اس کی کمی ہے۔
پاپاڈاٹوس نے کہا کہ "مقصد واضح طور پر یہ ہونا چاہئے کہ اچھی صلاحیتیں - محفوظ ہیں - ہر کسی کے لیے قابل رسائی ہیں، اور پھر ہم برے کو ہٹانے کی کوشش کرتے ہیں، یہاں تک کہ اوپن سورس فیشن میں،" پاپاڈاٹس نے کہا۔
Papadatos نے نوٹ کی گئی ایک تکنیک جس میں مدد مل سکتی ہے اسے "پری ٹریننگ ڈیٹا فلٹرنگ" کہا جاتا ہے، یہ تب ہوتا ہے جب کوئی AI کمپنی اپنے تربیتی ڈیٹا سے سائبر سیکیورٹی کی جارحانہ معلومات ہٹاتی ہے اور پھر ماڈل کو کیوریٹڈ ڈیٹاسیٹ پر تربیت دیتی ہے۔
کچھ تحقیق سے پتہ چلتا ہے کہ یہ ماڈل کی مجموعی کارکردگی کو نقصان پہنچائے بغیر مؤثر حیاتیاتی علم کو کم کر سکتا ہے۔ تاہم، سائبرسیکیوریٹی کے لیے، ڈیٹا فلٹرنگ بہت کم عملی ہے۔
ایک عام ماڈل کو تربیت دینا مشکل ہے جو کوڈنگ میں مہارت رکھتا ہو لیکن اچھا ہیکر بھی نہ ہو۔ چونکہ کوڈنگ AI کا سب سے بڑا پیسہ بنانے والا بن گیا ہے، ڈویلپرز کو ان صلاحیتوں کو بہتر بنانے کے لیے دباؤ کا سامنا کرنا پڑتا ہے یہاں تک کہ وہ غلط استعمال کو محدود کرنے کے طریقے تلاش کرتے ہیں۔
اس کی وجہ سے، فرنٹیئر ڈویلپرز نے اس کے بجائے تیزی سے دیگر تخفیف پر انحصار کیا ہے۔ ایک نقطہ نظر منتخب طور پر سائبرسیکیوریٹی امدادی ماڈلز کی اقسام کو محدود کرنا ہے۔ مثال کے طور پر، Anthropic's Opus 5، ماڈل کے سسٹم کارڈ کے مطابق، غیر مرتب شدہ سورس کوڈ میں کمزوریوں کو تلاش کر سکتا ہے، لیکن مرتب کردہ سافٹ ویئر نہیں۔ استدلال یہ ہے کہ یہ جارحانہ مقاصد کے لیے Opus 5 کو استعمال کرنا مشکل بنا دیتا ہے۔
دیگر میں تعیناتی سے پہلے کے حفاظتی جائزے، خطرے کے جائزے شائع کرنا، اور اگر کسی نظام کو بہت خطرناک سمجھا جاتا ہے تو ماڈل کے وزن کو روکنا شامل ہیں۔ Error 500 (Server Error)!!1500.That’s an error.There was an error. Please try again later.That’s all we know.