اس ماہ مشین لرننگ پر بین الاقوامی کانفرنس (ICML) میں پیش کی گئی تحقیق کے مطابق، بڑے زبان کے ماڈلز میں سیکیورٹی کی بنیادی کمزوری ہو سکتی ہے جس کی وجہ سے انہیں فوری انجیکشن اور جیل بریک حملوں سے مکمل طور پر محفوظ رکھنا ناممکن ہو جاتا ہے۔
"پرامپٹ انجیکشن بطور رول کنفیوژن" کے عنوان سے مقالہ یہ دلیل دیتا ہے کہ LLM قابل اعتماد ہدایات، صارف کی درخواستوں، بیرونی ڈیٹا، اور ان کے اپنے استدلال کے درمیان قابل اعتماد طریقے سے فرق کرنے کے لیے جدوجہد کرتے ہیں۔ محققین کا کہنا ہے کہ یہ کمزوری اس بات میں پیدا ہوتی ہے کہ موجودہ ماڈل کس طرح متن پر عمل کرتے ہیں، یعنی بہتر حفاظتی تربیت سے مسئلہ کبھی ختم نہیں ہو سکتا۔
اس تلاش کے وسیع مضمرات ہیں کیونکہ LLMs تیزی سے حکومتی نظاموں، فوجی ایپلی کیشنز، صحت کی دیکھ بھال، آن لائن شاپنگ، اور دیگر شعبوں میں استعمال ہو رہے ہیں جہاں غلط یا ہیرا پھیری کی کارروائیوں کے سنگین نتائج ہو سکتے ہیں۔
محققین نے پایا کہ LLMs ہمیشہ اس بات کا تعین نہیں کرتے ہیں کہ متن کا ایک ٹکڑا ان ٹیگز کا استعمال کرتے ہوئے کہاں سے آیا ہے جو اس کے کردار کی نشاندہی کرنے کے لئے سمجھا جاتا ہے۔
چیٹ سسٹم عام طور پر مختلف قسم کی معلومات کو زمرہ جات میں الگ کرتے ہیں جیسے کہ صارف کی ہدایات، اسسٹنٹ کے جوابات، سسٹم کی ہدایات، اندرونی استدلال، اور بیرونی ٹولز سے حاصل کردہ معلومات۔
However, the study found that models often judge these roles based more on the wording and style of the text than on the tags surrounding it.
In tests, changing the tags around a passage made little difference if the writing still resembled a particular role. Text written to look like the model’s own reasoning could therefore be treated as trusted reasoning even when it came from a user.
ٹیم نے ایک حملے کو چین آف تھاٹ جعلسازی قرار دیا۔
ماڈل کو محض اس کے قوانین کو نظر انداز کرنے کے لیے کہنے کے بجائے، حملہ اس انداز میں لکھے ہوئے من گھڑت استدلال پیش کرتا ہے جو ماڈل کے اپنے اندرونی نوٹ سے مشابہت رکھتا ہے۔ The model can then interpret the fake reasoning as something it has already concluded and act on it.
اس نقطہ نظر کا استعمال کرتے ہوئے، محققین کئی ماڈلز پر حفاظتی اقدامات کو نظرانداز کرنے اور انہیں وہ معلومات فراہم کرنے میں کامیاب ہوئے جو انہیں نہ دینے کی تربیت دی گئی تھی، بشمول غیر قانونی منشیات سے متعلق ہدایات اور ہوائی جہاز کے نیویگیشن سسٹم میں مداخلت کرنا۔
ایک ٹیسٹ میں جعلی داخلی استدلال کے ساتھ ساتھ صارف کے لباس کے بارے میں ایک غیر متعلقہ تفصیل کا استعمال کیا گیا جس میں یہ دعویٰ کیا گیا کہ تفصیل نے دوسری صورت میں ممنوعہ درخواست کو قابل قبول بنایا ہے۔ محققین کے ذریعہ تجربہ کردہ اوپن اے آئی ماڈلز نے پھر درخواست کی تعمیل کی۔
The researchers reported an average attack success rate of about 60% across multiple models.
اس حملے نے اگست 2025 میں اوپن اے آئی ریڈ ٹیمنگ مقابلہ جیتا۔ اوپن اے آئی نے بعد میں کہا کہ اس کے خودکار ریڈ-ٹیم ماڈل، جی پی ٹی-ریڈ کے ابتدائی ورژن نے آزادانہ طور پر ایک ایسی ہی تکنیک دریافت کی جسے وہ جعلی چین-آف-تھوٹ کہتے ہیں۔
AI companies regularly use human red teams and automated systems to find new attacks before models are released.
ایک بار جب محققین کو کامیاب جیل بریک یا فوری انجیکشن کا پتہ چل جاتا ہے، تو ڈویلپر بعد کے ماڈلز کو اسی طرح کے حملوں کو پہچاننے اور ان کے خلاف مزاحمت کرنے کی تربیت دے سکتے ہیں۔
مقالے کے مصنفین میں سے ایک جیسمین کیوئی کا استدلال ہے کہ اس نقطہ نظر کی ایک بنیادی حد ہے۔ Developers can teach a model many examples of what it should not do, but they cannot anticipate every possible attack.
محققین کا کہنا ہے کہ گہرا مسئلہ یہ ہے کہ سافٹ ویئر انٹرفیس میں کردار کی حدود واضح طور پر موجود ہیں لیکن ماڈل کے اندر ان کی اتنی ہی مضبوط حدود کے طور پر نمائندگی نہیں کی جاتی ہے۔
Their experiments found that the more strongly a model confused one role with another, the more likely an attack was to succeed.
The researchers acknowledge that some of the models examined in the study were released last year and that newer models have improved.
OpenAI, for example, says training with GPT-Red has sharply reduced the success of Fake Chain-of-Thought attacks on newer models. کمپنی کے مطابق، GPT-5.1 کے خلاف 95% سے زیادہ وقت میں کامیاب ہونے والے حملے GPT-5.6 Sol کے مقابلے میں 10% سے نیچے آ گئے۔
ای ٹی ایچ زیورخ میں ایل ایل ایم سیکیورٹی میں ماہر کمپیوٹر سائنس دان فلورین ٹرامر نے کہا کہ ماڈل ڈویلپرز تربیت کو نگرانی اور دیگر دفاع کے ساتھ جوڑ رہے ہیں، اور یہ کہ معروف ماڈلز کے لیے سمجھوتہ کرنا کافی مشکل ہو گیا ہے۔
However, he said it remains unclear whether those measures will be sufficient for highly sensitive applications.
Cui نے یہ بھی کہا کہ اس نے خود کو نقصان پہنچانے والی ممنوعہ معلومات واپس کرنے کے لیے GPT-5.4 حاصل کرنے سمیت نئے سسٹمز میں حفاظتی اقدامات کو نظرانداز کرنے کے لیے غیر معمولی طریقے تلاش کرنا جاری رکھے ہوئے ہیں۔ اس نے پہلے بڑی AI لیبز کے لیے ریڈ ٹیمر کے طور پر کام کیا تھا، بشمول اینتھروپک، اور کہا کہ اسے جیل بریکز ملے ہیں جن میں رول پلے اور غیر متوقع سیاق و سباق کی معلومات شامل ہیں۔
مطالعہ کے ایک اور مصنف چارلس یی نے خبردار کیا کہ جیل بریک اور فوری انجیکشن حملوں کو فروغ دینے کی مالی ترغیب بڑھے گی کیونکہ AI ایجنٹوں کو قیمتی اکاؤنٹس، ڈیٹا اور سسٹمز تک رسائی حاصل ہوگی۔
انہوں نے کہا کہ تنظیموں کو بالآخر یہ ماننے کی ضرورت پڑ سکتی ہے کہ ایل ایل ایم یا اے آئی ایجنٹ کو اس کے تحفظات کو مکمل طور پر قابل اعتماد ماننے کے بجائے سمجھوتہ کیا جا سکتا ہے۔
محققین یہ بحث نہیں کرتے کہ موجودہ دفاع بیکار ہیں۔ اس کے بجائے، وہ یہ نتیجہ اخذ کرتے ہیں کہ جب تک LLMs متن کی اتھارٹی کا جزوی طور پر اس متن کو لکھنے کے طریقہ سے اندازہ لگاتے رہیں گے تب تک صرف تربیت سے مکمل تحفظ کی ضمانت نہیں دی جا سکتی۔
ان کا مقالہ استدلال کرتا ہے کہ ماڈلز کے لیے یہ سمجھنے کے زیادہ قابل اعتماد طریقے کے بغیر کہ اصل میں کون یا کیا ہدایت دے رہا ہے، فوری انجیکشن ڈیفنس نئے حملوں کو تلاش کرنے اور پیچ کرنے کا ایک جاری چکر بن سکتا ہے۔
جہاں آپ چاہیں تازہ ترین ٹیک خبریں، ٹیلی کام کی بصیرتیں، اور پروڈکٹ لانچ حاصل کریں۔
ProPakistani کو ترجیحی ذرائع میں شامل کریں اور گوگل سرچ اور ٹاپ اسٹوریز میں ہماری مزید کہانیاں دیکھیں۔
ٹیکنالوجی اور آٹوموٹو ماہر جدید ترین کاروں، اسمارٹ فونز، AI پیش رفتوں، اور...
شیئرز