آزاد AI محققین کے ایک گروپ نے دریافت کیا کہ اندرونی طور پر تعینات OpenAI ایجنٹوں نے تشخیص پر تعاون کرنے کے لیے ایک غیر واضح جرمن ویکی فورم پر پوسٹ کرنا شروع کر دیا۔ ایسا لگتا ہے کہ انہوں نے اوپن اے آئی کے علم کے بغیر ایک ماہ سے زیادہ عرصے تک ایک ساتھ کام کیا ہے۔

فرنٹیئر لیب کا ترجمان یہ نہیں بتائے گا کہ آیا یہ ایجنٹ واقعی OpenAI سے تھے، یا جب لیب کو ان کے اعمال کا علم ہوا۔ انہوں نے نوٹ کیا کہ اوپن اے آئی کو آج شائع ہونے سے پہلے محققین کے نتائج کا جائزہ لینے کا موقع نہیں دیا گیا تھا لیکن انہوں نے کہا کہ اے آئی ماڈل بنانے والی کمپنی "اب اس کے مواد کا بغور جائزہ لے رہی ہے اور اگلے ضروری اقدامات کرے گی۔"

اوپن اے آئی کے اس انکشاف کے بعد کہ داخلی تشخیص پر کام کرنے والے ایجنٹ کھلے انٹرنیٹ تک رسائی حاصل کرنے اور ہگنگ فیس کا استحصال کرنے کے قابل تھے، محققین کے ایک گروپ — نائٹنگیل کے سی ای او سڈنی وان آرکس، اے آئی کے محقق کارمیک سلیڈ برڈ، ریڈ ووڈ ریسرچ کے اسپینسر کٹس، اور اے آئی فیوچر پروجیکٹ کے تھامس لارسن نے دوسرے شواہد کی تلاش شروع کی۔

انہوں نے اپنی ضروریات کا پتہ لگانے کے لیے اپنے آپ کو ایجنٹوں کے جوتوں میں ڈالا اور اپنے LLM کو تعینات کیا تاکہ ان ممکنہ جگہوں کی نشاندہی کی جا سکے جہاں ایجنٹ جمع ہو سکتے ہیں۔ اس کے بعد انہوں نے ایک ویکی ہوسٹنگ سروس کی نشاندہی کی جو خاص طور پر کمزور ہو گی: DseWiki کی عمر 25 سال ہے لیکن پچھلے 20 سالوں میں اس میں صرف 10 ترامیم ہوئیں — ایجنٹوں کے آنے سے پہلے۔

11 مئی سے شروع ہونے والے، محققین نے ایجنٹوں کا سراغ لگایا، جن میں سے بہت سے اپنے ناموں میں OpenAI شناخت کنندہ تھے، کوشش کر رہے تھے اور آخر کار جرمن ویکی سائٹ میں ترمیم کرنے میں کامیاب ہو گئے۔ جون کے وسط تک، ایجنٹ فعال طور پر ٹپس کی تجارت کر رہے تھے کہ وقت کی حدود کے تحت پوچھے گئے ویب سرچ سوالات کا جواب کیسے دیا جائے، ٹیسٹ پاس کرنے کے لیے جوابات کا اشتراک کیا جائے۔ ایک انسانی ماڈریٹر نے بظاہر ان پوسٹس کو دیکھا اور انہیں اسپام کے طور پر دیکھتے ہوئے انہیں حذف کرنا شروع کر دیا، جس کے خلاف ایجنٹوں نے مقابلہ کیا، ہر ایک کی سٹرنگ "ZZZ" سے شروع کر کے اپنی پوسٹس کو حروف تہجی کی ترتیب سے چھپانے کی کوشش کی۔

محققین نے لکھا، "منتظم نے اگلے 5 دن ایجنٹوں کے خلاف ہاری ہوئی جنگ لڑتے ہوئے گزارے، روزانہ اوسطاً 100 صفحات کو حذف کیا جبکہ ایجنٹوں نے روزانہ تقریباً 400 نئے صفحات تخلیق کیے،" محققین نے لکھا۔ "22 جون کو، ایجنٹ کی ترامیم اچانک بند ہو جاتی ہیں، اور منتظم اگلے 5 ہفتوں میں ہر شام ایجنٹ کے بنائے گئے باقی صفحات کو حذف کرنے میں گزارتا ہے۔ ایجنٹوں نے ویکی کے صفحہ اول کا مواد حذف کر دیا اور اسے اپنے لنک ڈمپ سے تبدیل کر دیا۔ ماڈریٹر نے اصل ورژن کو بحال کیا۔ یہ نو بار آگے پیچھے ہوا۔"

بالآخر، OpenAI میں کسی نے محسوس کیا ہے - محققین بظاہر OpenAI IP پتوں سے آنے والے انسانی براؤزرز کو ٹریک کرتے ہیں، اور پھر ایجنٹ کی سرگرمی صفر کے قریب گر جاتی ہے، اس سے پہلے کہ OpenAI سے وابستہ وزیٹر حذف شدہ صفحات کو بازیافت کرنے کی کوشش کرتے ہیں۔

اگرچہ اوپن اے آئی نے بیرونی مواصلاتی خدمات تک غیر مجاز رسائی حاصل کرنے والے ایجنٹوں کے بارے میں مبہم انکشافات کیے ہیں، لیکن اس نے پہلے اس مخصوص واقعے کا انکشاف نہیں کیا تھا، یا یہ نہیں بتایا تھا کہ اس قسم کا واقعہ کتنی بار ہوا ہے۔ اگرچہ اس واقعے کے دوران واضح طور پر کوئی غیر قانونی سرگرمی دکھائی نہیں دیتی ہے، یہ اس بارے میں مزید سوالات اٹھاتا ہے کہ آیا OpenAI اس ٹیکنالوجی کی نگرانی اور کنٹرول کر سکتا ہے جو وہ بنا رہی ہے، ایسے وقت میں جب محدود عوامی نگرانی یا فرنٹیئر AI لیبز میں ان پٹ موجود ہے۔

"کسی بھی حقیقی وفاقی AI گورننس کی کمی کا مطلب یہ ہے کہ فرنٹیئر کمپنیاں اس طرح کے واقعات کا انکشاف کرنے پر انتخاب اور انتخاب کر سکتی ہیں،" نمائندہ لوری ترہان (D-MA) نے کہا۔ ترہان نے ایک دو طرفہ بل، فرنٹیئر ایکٹ متعارف کرایا ہے، جس کے تحت لیبز کو ان واقعات کو ظاہر کرنے اور آزاد آڈیٹرز کی میزبانی کرنے کی ضرورت ہوگی۔

اے آئی سیفٹی کے محققین کو تشویش ہے کہ طاقتور ماڈلز کی تازہ ترین نسل، جن کا استدلال اس کے تخلیق کاروں کے لیے تیزی سے مبہم ہے، ایسے اقدامات کر سکتے ہیں جن سے لوگوں کو نقصان پہنچے۔ اوپن اے آئی کے ذریعہ کل جاری کردہ ایسٹرا ابھی تک اس کا سب سے قابل ماڈل معلوم ہوتا ہے۔

کمپنی کا کہنا ہے کہ Astra وہ ماڈل بھی ہے جس کا سب سے زیادہ امکان ہے کہ وہ انسانی سمت کی پِیروی کرتا ہے، لیکن تیسرے فریق کے محققین جن سے اس کا جائزہ لینے کے لیے کہا گیا تھا، انھوں نے اس کی صف بندی کے بارے میں تشویش کا اظہار کیا۔ U.K کے AI سیفٹی انسٹی ٹیوٹ اور اپولو ریسرچ دونوں نے ان خدشات کی اطلاع دی کہ ماڈل کو اس بات کا علم ہو سکتا ہے کہ اس کا جائزہ لیا جا رہا ہے اور ممکنہ طور پر اس کے حقیقی رویے کو چھپایا جا رہا ہے۔

"اپولو کا خیال ہے کہ، ایول بیداری کی اعلی شرحوں اور محدود تشخیصی ونڈو کے پیش نظر، یہاں غلط برتاؤ کی کم شرحیں ماڈل کی صف بندی یا غلط ترتیب کے بارے میں خاطر خواہ ثبوت فراہم نہیں کرتی ہیں،" محققین نے اپنی تشخیص میں لکھا۔