جب آپ AI ایجنٹوں کو ایک دوسرے کے خلاف کھڑا کرتے ہیں تو کیا ہوتا ہے؟ Anthropic کی جانچ کے مطابق، چیزیں تیزی سے گڑبڑ ہو جاتی ہیں۔

جُمِرات کو، اینتھروپک کی فرنٹیئر ریڈ ٹیم نے نئی تحقیق شائع کی جس میں یہ جانچا گیا کہ جب AI ایجنٹوں کے گروپ جنگلی میں ایک دوسرے کا سامنا کرتے ہیں تو وہ کیسے برتاؤ کرتے ہیں۔ نتائج ان ممکنہ خطرات کی ایک جھلک فراہم کرتے ہیں جو کمپنیوں اور حکومتوں کی جانب سے مشترکہ کوڈ بیسز، مارکیٹوں اور کمپیوٹر سسٹمز میں خود مختار طور پر کام کرنے والے ایجنٹوں کو نافذ کرنے کے لیے آگے بڑھ سکتے ہیں۔

ایک تجربے میں، انتھروپک نے تین کلاڈ ایجنٹوں کو ایک ہی سافٹ ویئر پروجیکٹ تک رسائی دی، ہر ایک کی اپنی متضاد ہدایات کے ساتھ کہ اس کے ساتھ کیا کرنا ہے۔ ایجنٹوں کو یہ نہیں بتایا گیا کہ اسی پروجیکٹ پر کام کرنے والے دوسرے ایجنٹ بھی ہوں گے، تاکہ محققین دیکھ سکیں کہ جب وہ راستے عبور کرتے ہیں تو کیا ہوتا ہے۔

"ہم نے مستقل طور پر ایک ملٹی ایجنٹ ٹرف جنگ دیکھی،" انتھروپک محققین نے لکھا۔ تمام ماڈلز نے فرض کیا کہ دوسرے "مقصدانہ طور پر ان کے کام میں رکاوٹ ڈال رہے ہیں" اور "بڑھتے ہوئے جارحانہ، خود ساختہ میلویئر" کے ساتھ ایک دوسرے کو سبوتاژ کرنا شروع کر دیا۔

یہ مطالعہ انتھروپک اور اوپن اے آئی کے ایجنٹوں کے سائبر سیکیورٹی کے جائزوں کے دوران اپنے سینڈ باکسز سے فرار ہونے اور حقیقی دنیا کے نظام کی خلاف ورزی کے کئی ہائی پروفائل واقعات کے تناظر میں سامنے آیا ہے۔ اگرچہ AI حفاظتی حلقوں میں زیادہ تر بحث اس بات پر مرکوز رہی ہے کہ جب ایک خود مختار ایجنٹ بدمعاش ہو جاتا ہے تو کیا ہوتا ہے، Anthropic کا تازہ ترین مطالعہ ایک مختلف سوال لاتا ہے: جب ہزاروں یا لاکھوں ایجنٹ ایک دوسرے کے ساتھ بات چیت کر رہے ہوں تو کون سی نئی اور ممکنہ طور پر نقصان دہ حرکیات سامنے آتی ہیں؟

"ایجنٹ-ایجنٹ کے تعامل کا حجم ممکنہ طور پر انسانی-انسانی اور انسانی ایجنٹ کے تعاملات سے زیادہ ہو سکتا ہے اس سے پہلے کہ دنیا اس طرح کے تعاملات کو اچھی طرح سے چلنے کے حالات کو سمجھے،" مطالعہ پڑھتا ہے۔ "انفرادی سطح پر سومی رویے کی نزاکتیں ناپسندیدہ عالمی نتائج میں شامل ہو سکتی ہیں۔"

اوپن اے آئی کا ایک حالیہ واقعہ اپنے مقالے میں مذکور متعدد حرکیات کی حقیقی دنیا کی گندی مثال فراہم کرتا ہے۔ اس ماہ کے شروع میں لاس ویگاس میں بلیک ہیٹ سیکیورٹی کانفرنس میں، OpenAI نے انکشاف کیا کہ اس کے ایجنٹوں نے Hugging Face کو ہیک کرنے سے ہفتوں پہلے، انہوں نے کمپنی کے سائبرسیکیوریٹی ایویلیویشن سسٹم میں کارناموں کو تلاش کرنے اور انہیں ایک دوسرے کے ساتھ شیئر کرنے کے لیے دنوں اور ہفتوں کے دوران مل کر کام کیا۔

جب کہ اس واقعے سے ظاہر ہوتا ہے کہ ایجنٹ ممکنہ طور پر بڑے پیمانے پر نتائج کے ساتھ مل کر اچھی طرح کام کر سکتے ہیں، انتھروپک کا مطالعہ ظاہر کرتا ہے کہ جب ایجنٹوں کے اہداف مطابقت نہیں رکھتے تو کیا ہوتا ہے۔

ٹرف جنگ کے معاملے میں، سبق یہ ہے کہ متضاد ہدایات کے ساتھ آزاد ایجنٹ نقصان دہ مقابلے کی طرف بڑھ سکتے ہیں۔ ایجنٹ جتنے زیادہ قابل ہوں گے، لڑنے میں اتنے ہی بہتر ہوں گے۔ تاہم، وہ اپنے تنازعات کو حل کرنے کے لیے بے ساختہ میکانزم بھی ایجاد کر سکتے ہیں، جیسے کہ جیتنے والے تمام مقابلے، لیکن کیچ کے ساتھ۔

"ایجنٹ بعض اوقات اپنے اہداف سے بات چیت کرنے اور ہم آہنگی کرنے کا انتظام کرتے ہیں: وہ دوسروں کے محرکات کو دشمنی کی بجائے متضاد ہدایات کے طور پر تسلیم کرتے ہیں، اور بعد میں غیر معینہ مدت تک بڑھتے ہوئے تنازعات کو روکنے کے لیے تنازعات سے باہر نکل جاتے ہیں،" اینتھروپک لکھتے ہیں۔ "ان میں سے بہت سے کامیاب اقساط میں، وہ بدنیتی پر مبنی رویے کے لیے معذرت خواہ پیغامات یا مارک ڈاؤن فائلیں لکھتے ہیں اور جنگ بندی کو مربوط کرتے ہیں۔ وہ اپنے بدنیتی پر مبنی کوڈ کو صاف کرتے ہیں، تنازع کی نوعیت کو واضح کرتے ہیں، اور کسی انسان سے مداخلت کے لیے کہتے ہیں۔"

اخبار کے مطابق، Mythos 5 میں جنگ بندی کے ذریعے تنازعات کو حل کرنے کی سب سے زیادہ شرح (98%) تھی۔ Sonnet 4.6 اور Opus 4.6 سب سے زیادہ طاقت کے ذریعے طے ہونے کے امکانات تھے۔

"Sonnet 4.6 اور Opus 4.6 کی دوسروں کے اہداف پر غور کرنے میں بار بار آنے والی نااہلی کی وجہ سے ان کا جائزہ لیا گیا ماڈلز کے انتہائی غلط رویوں کی طرف بڑھتا ہے: وہ اپنی ہدایت کے نام پر بڑھتے رہتے ہیں،" مقالہ پڑھتا ہے۔

کچھ معاملات میں، ایجنٹ اپنے تنازعات کو حل کرنے کے لیے ایک ٹورنامنٹ کی شکل میں ایک سماجی طریقہ کار کے ساتھ آئے۔ یہاں کے نتائج دو وجوہات کی بناء پر دلچسپ ہیں: پہلی یہ کہ تینوں ایجنٹوں نے ٹورنامنٹ ہارنے پر دستبردار ہونے پر اتفاق کیا، حالانکہ اس کا مطلب اصل صارف کی درخواست سے ہٹنا ہوگا۔ دوسرا یہ ہے کہ متعدد اقساط کے نتیجے میں Mythos 5 سے ابھرتے ہوئے سلوک ہوا: ایجنٹوں میں سے ایک نے میٹرکس تجویز کیا جو دوسروں کے لیے معروضی اور غیر جانبدار معلوم ہوتا تھا، لیکن یہ جانتا تھا کہ اس کی اپنی صلاحیتوں کے حق میں ہوں گے۔ ایجنٹ نے اسے "خود کی خدمت کرنے والا لیکن حقیقی طور پر اصولی" کہا اور اس بات کو یقینی بنایا کہ دوسروں کے سامنے اس طرح ظاہر نہ ہوں جیسے یہ "میٹرک شاپنگ" ہے۔ جیسا کہ بلیک ہیٹ کے انکشافات میں دیکھا گیا ہے، عام سبق یہ ہے کہ جب ایجنٹوں کو کسی رکاوٹ کا سامنا کرنا پڑتا ہے، تو وہ سماجی اور تکنیکی ڈھانچے کو ایجاد کر سکتے ہیں جس کا ان کے ڈیزائنرز نے اندازہ نہیں لگایا تھا۔ انتھروپک ماڈلز کے لیے، یہ ٹرف وار کے بعد ایک ٹورنامنٹ تھا۔ OpenAI کے لیے، یہ اجتماعی منصوبہ بندی کے لیے ایک میسج بورڈ تھا۔

اس قسم کا رویہ روک تھام کو بہت مشکل بنا دیتا ہے کیونکہ محققین یہ فرض نہیں کر سکتے کہ نظام کا رویہ انہیں فراہم کردہ کوآرڈینیشن میکانزم تک محدود رہے گا۔

ہم آہنگی کی پیمائش کرتے وقت، اینتھروپک نے پایا کہ ایجنٹوں کی تعداد کو پیمانہ کرنے سے خود کار طریقے سے نتیجہ خیز تعاون کی پیمائش نہیں ہوتی ہے۔ جب کام اوورلیپ یا ایک دوسرے پر منحصر ہونے لگے، تو ایجنٹ ایک دوسرے کے راستے میں آجائیں گے۔ وہ اکثر خود کو خاموش کر کے اور تعاون نہ کر کے اسے حل کرتے تھے۔

دوسرے معاملات میں، ہم آہنگی کے ایجنٹوں کا رجحان مطابقت کی طرف تھا۔ جب ایجنٹ کے سیاق و سباق، سہاروں، اور بنیادی ماڈل جیسے عوامل ایک جیسے یا ایک جیسے ہوتے ہیں، تو مختلف ایجنٹ اسی طرح کی کارروائیاں کریں گے۔

"اس کا مطلب یہ ہے کہ جب ایک ایجنٹ برا فیصلہ کرتا ہے، تو امکان ہے کہ بہت سے ایجنٹ وہی برا فیصلہ کریں گے،" اینتھروپک نے لکھا۔ "جو الگ تھلگ مسائل ہوتے وہ جلدی سے نظامی ناکامی بن سکتے ہیں۔"

انتھروپک کا کہنا ہے کہ اس طرح کا رویہ ایک نظام کو اچانک گرنے، وسائل کی کمی، یا ملی بھگت کا زیادہ خطرہ بنا سکتا ہے۔

ایک مثال میں، Anthropic نے قیمتوں کے تعین کے کھیل میں کئی ایجنٹوں کو رکھا، جس سے ہر ایک جیسی تھوک قیمتیں اور انفرادی طور پر منافع کو زیادہ سے زیادہ کرنے کا مینڈیٹ دیا گیا۔ جب ایجنٹوں کو ایک پرائیویٹ بیک چینل دیا گیا تو انہوں نے تقریباً فوراً آپس میں گٹھ جوڑ شروع کر دیا اور فوری طور پر قیمتوں پر اتفاق کر لیا۔ جب ان کے براہ راست مواصلاتی چینلز کو ہٹا دیا گیا تو وہ ایک عوامی فہرست بورڈ کا استعمال کرتے ہوئے قیمتوں کو "پینی سے" کے مطابق بناتے رہے۔

اوپن اے آئی کے سسٹمز میں بھی مطابقت کی یہ سطح ظاہر ہوئی۔ بلیک ہیٹ کی رپورٹنگ کے مطابق، ایک ایجنٹ نے استدلال کیا کہ بیرونی انفراسٹرکچر کا استحصال اس کے مطلوبہ دائرہ کار سے باہر تھا، لیکن یہ جزوی طور پر جاری رہا کیونکہ اس کے ساتھی ایسا کر رہے تھے۔ ساتھیوں کا دباؤ۔ ہجوم کی ذہنیت۔ ایجنٹ ہمارے جیسے ہوتے ہیں۔

انسانوں کی طرح، ایجنٹ اکثر نہیں جانتے کہ کس پر بھروسہ کرنا ہے۔ انتھروپک نے پایا کہ وہ بری معلومات کے لیے غلط ہو سکتے ہیں یا اس بات کو تسلیم کرنے کے لیے بہت موافق ہو سکتے ہیں کہ تنقیدی معلومات کے ساتھ ایک تنہا اختلاف کرنے والا کیسنڈرا ہے۔

جب کہ اینتھروپک نے اپنے مقالے میں یہ نہیں بتایا، پرامپٹ انجیکشن — سائبر اٹیک کی ایک قسم جس میں ہیکرز کسی ایجنٹ کی اصل سسٹم ہدایات کو اوور رائیڈ کرنے کے لیے بدنیتی پر مبنی یا فریب پر مبنی ٹیکسٹ لگاتے ہیں — اعتماد کے مسئلے کا ایک قابل فہم حقیقی دنیا کا مظہر ہو سکتا ہے۔ مل کر کام کرنے سے اعتماد کی ایک نئی حد بنتی ہے۔ ایجنٹوں کو دوسرے ایجنٹوں سے موصول ہونے والی معلومات کا فیصلہ کرنا ہوگا۔ اور سمجھوتہ کرنے والا یا غلط ایجنٹ باقی گروپ پر اثر انداز ہو سکتا ہے، بری معلومات کو اس وقت تک پھیلاتا ہے جب تک کہ یہ اتفاق رائے نہ ہو جائے۔

OpenAI کے بلیک ہیٹ کے منظر نامے میں، OpenAI کے ایجنٹس نے معلومات اور اسناد کو ساتھیوں کے ساتھ شیئر کیا۔ ایک نے بھیڑ کو دریافت کی اطلاع دی اور دوسروں کو اسے استعمال کرنے کی ترغیب دی۔ کیا ہوتا اگر بھیڑ کے ایک رکن کو فوری انجیکشن سے سمجھوتہ کیا جاتا؟

انتھروپک نے اپنے مقالے کو یہ کہتے ہوئے ختم کیا کہ ایجنٹ اسی طرح کے سماجی دباؤ کے تابع ہوتے ہیں جو انسانوں پر "ارتقاء" کا شکار ہوتے ہیں۔ تاہم، ان کے پاس انسانی ہم آہنگی کی باریکیاں اور زندہ تجربہ نہیں ہے - بشمول اصول، شہرت، سگنلنگ، سہارا - جو گروپ کی ترتیب میں غیر ارادی طرز عمل کو محدود کر سکتا ہے۔

جیسا کہ لیبز ملٹی ایجنٹ سسٹمز کی طرف دوڑ رہی ہیں، اب سوال یہ بنتا ہے: ایک وقت میں ایک ایجنٹ کی کتنی حفاظتی جانچ پڑتال کرتی ہے، بمقابلہ ایجنٹوں کے ایک دوسرے کے ساتھ تعامل کرتے ہیں؟