وڏي ٻولي جا ماڊل شايد بنيادي حفاظتي ڪمزوري هوندا آهن جيڪي انهن کي مڪمل طور تي فوري انجيڪشن ۽ جيل بريڪ حملن کان بچائڻ ناممڪن بڻائيندا آهن، هن مهيني انٽرنيشنل ڪانفرنس آن مشين لرننگ (ICML) ۾ پيش ڪيل تحقيق جي مطابق.
مقالو، عنوان "Prompt Injection as Role Confusion،" دليل ڏئي ٿو ته LLMs قابل اعتماد هدايتون، صارف جي درخواستن، خارجي ڊيٽا، ۽ انهن جي پنهنجي دليلن جي وچ ۾ قابل اعتماد طور تي فرق ڪرڻ جي جدوجهد ڪن ٿا. محقق چون ٿا ته هي ڪمزوري ان ۾ ٺهيل آهي ته ڪيئن موجوده ماڊل ٽيڪسٽ تي عمل ڪن ٿا، مطلب ته بهتر حفاظتي تربيت اڪيلو ڪڏهن به مسئلو ختم نه ڪري سگهي ٿي.
تلاش جا وسيع اثر آهن جيئن LLMs وڌي رهيا آهن سرڪاري نظامن، فوجي ايپليڪيشنن، صحت جي سارسنڀال، آن لائين شاپنگ ۽ ٻين علائقن ۾ جتي غلط يا هٿرادو عمل جا سنگين نتيجا ٿي سگهن ٿا.
محقق ڏٺا ته LLMs هميشه اهو طئي نه ڪندا آهن ته متن جو هڪ ٽڪرو ڪٿي استعمال ڪيو ويو آهي ٽيگ استعمال ڪندي جيڪي ان جي ڪردار کي سڃاڻڻ گهرجن.
چيٽ سسٽم عام طور تي مختلف قسمن جي معلومات کي ڀاڱن ۾ الڳ ڪري ٿو جهڙوڪ صارف جي هدايتون، اسسٽنٽ جواب، سسٽم هدايتون، اندروني دليل، ۽ معلومات خارجي اوزارن مان حاصل ڪيل.
بهرحال، مطالعي مان معلوم ٿئي ٿو ته ماڊل اڪثر ڪري انهن ڪردارن جو فيصلو ڪن ٿا متن جي لفظن ۽ انداز جي بنياد تي ان جي چوڌاري ٽيگ جي ڀيٽ ۾.
تجربن ۾، ٽيگ کي تبديل ڪرڻ جي چوڌاري پاسن ۾ ٿورو فرق آيو ته لکڻ اڃا به هڪ خاص ڪردار وانگر آهي. لکت لکجي جيئن ماڊل جي پنهنجي استدلال وانگر نظر اچي، تنهن ڪري قابل اعتماد دليل سمجهي سگهجي ٿو جيتوڻيڪ اهو صارف طرفان آيو آهي.
ٽيم هڪ حملي کي جعلسازي جو سلسلو سڏيو.
صرف ماڊل کي ٻڌائڻ جي بدران ان جي ضابطن کي نظر انداز ڪرڻ لاء، حملو پيش ڪري ٿو ٺاهيل دليلن کي هڪ انداز ۾ لکيو ويو آهي جيڪو ماڊل جي پنهنجي اندروني نوٽس وانگر آهي. ماڊل وري جعلي دليل جي تشريح ڪري سگهي ٿو جيئن اهو اڳ ۾ ئي نتيجو ڪيو آهي ۽ ان تي عمل ڪيو.
هن طريقي کي استعمال ڪندي، محقق ڪيترن ئي ماڊلن تي حفاظتي قدمن کي نظرانداز ڪرڻ جي قابل هئا ۽ انهن کي معلومات مهيا ڪرڻ جي قابل هئا جيڪي انهن کي نه ڏيڻ جي تربيت ڏني وئي هئي، بشمول غير قانوني منشيات سان لاڳاپيل هدايتون ۽ جهاز جي نيويگيشن سسٽم سان مداخلت.
ھڪڙي ٽيسٽ استعمال ڪندڙ جي لباس جي باري ۾ ھڪڙي غير لاڳاپيل تفصيل سان گڏ جعلي اندروني دليلن سان گڏ دعوي ڪئي آھي ته تفصيل ھڪڙي ٻي صورت ۾ ممنوع درخواست قبول ڪئي. اوپن اي آئي ماڊلز تحقيق ڪندڙن پاران آزمائيا ويا ته پوءِ درخواست جي تعميل ڪئي وئي.
محققن ٻڌايو ته سراسري حملي جي ڪاميابي جي شرح اٽڪل 60٪ جي ڪيترن ئي ماڊلن ۾.
حملي آگسٽ 2025 ۾ هڪ OpenAI ريڊ ٽيمنگ مقابلو کٽيو. OpenAI بعد ۾ چيو ته ان جي خودڪار ٿيل ريڊ ٽيم ماڊل جو هڪ ابتدائي نسخو، GPT-ريڊ، آزاديءَ سان هڪ اهڙي ٽيڪنڪ دريافت ڪئي جنهن کي اهو Fake Chain-of-Thought سڏين ٿا.
AI ڪمپنيون باقاعده انساني ريڊ ٽيمون ۽ خودڪار سسٽم استعمال ڪن ٿيون نئين حملن کي ڳولڻ لاءِ ماڊل جاري ٿيڻ کان اڳ.
هڪ دفعو محقق هڪ ڪامياب جيل برڪ يا فوري انجيڪشن کي دريافت ڪيو، ڊولپرز بعد ۾ ماڊل کي تربيت ڪري سگهن ٿا ته جيئن ساڳي حملن کي سڃاڻڻ ۽ مزاحمت ڪن.
Jasmine Cui، ڪاغذ جي ليکڪن مان هڪ، دليل ڏئي ٿو ته هن طريقي سان هڪ بنيادي حد آهي. ڊولپرز هڪ ماڊل کي سيکاري سگهن ٿا ڪيترائي مثال جيڪي ان کي نه ڪرڻ گهرجن، پر اهي هر ممڪن حملي جي اڳڪٿي نٿا ڪري سگهن.
محقق چون ٿا ته تمام وڏو مسئلو اهو آهي ته ڪردار جون حدون واضح طور تي سافٽ ويئر انٽرفيس ۾ موجود آهن پر پاڻ ماڊل جي اندر هڪ جيتري مضبوط حدن جي نمائندگي نٿا ڪن.
انهن جي تجربن مان معلوم ٿيو ته هڪ ماڊل جيتري مضبوطيءَ سان هڪ ڪردار کي ٻئي ڪردار سان ملائي ٿو، اوترو ئي وڌيڪ ممڪن آهي ته حملو ڪامياب ٿئي.
محقق تسليم ڪن ٿا ته مطالعي ۾ جانچيل ڪجهه ماڊل گذريل سال جاري ڪيا ويا ۽ نوان ماڊل بهتر ٿيا آهن.
OpenAI، مثال طور، چوي ٿو GPT-Red سان ٽريننگ نئين ماڊلز تي جعلي چين-آف-ٿٽ حملن جي ڪاميابي کي تيزيء سان گھٽائي ڇڏيو آهي. حملا جيڪي ڪامياب ٿيا 95٪ کان وڌيڪ وقت جي GPT-5.1 جي خلاف 10٪ GPT-5.6 Sol جي خلاف، ڪمپني جي مطابق.
فلورين ٽرامر، هڪ ڪمپيوٽر سائنسدان، جيڪو ETH Zürich ۾ LLM سيڪيورٽي ۾ ماهر آهي، چيو ته ماڊل ڊولپرز تربيت کي گڏ ڪري رهيا آهن مانيٽرنگ ۽ ٻين دفاعن سان، ۽ اهو معروف ماڊل سمجھوتي ڪرڻ لاءِ ڪافي مشڪل ٿي چڪا آهن.
تنهن هوندي ، هن چيو ته اهو واضح ناهي ته ڇا اهي قدم انتهائي حساس ايپليڪيشنن لاءِ ڪافي هوندا.
Cui اهو پڻ چيو ته هن نئين سسٽم ۾ حفاظتي قدمن کي نظرانداز ڪرڻ لاءِ غير معمولي طريقا ڳولڻ جاري رکيا آهن، جن ۾ GPT-5.4 حاصل ڪرڻ شامل آهن ممنوع خود نقصان واري معلومات واپس ڪرڻ لاءِ. هن اڳ ۾ وڏين AI ليبز لاءِ ريڊ ٽيمر طور ڪم ڪيو ، بشمول اينٿروپڪ ، ۽ چيو ته هن کي جيل بريڪ مليا آهن جن ۾ ڪردار ادا ڪرڻ ۽ غير متوقع لاڳاپيل معلومات شامل آهن.
چارلس يو، مطالعي جو هڪ ٻيو ليکڪ، خبردار ڪيو ويو آهي ته جيل برڪس ۽ فوري انجيڪشن حملن کي ترقي ڪرڻ جي مالي ترغيب وڌندي ويندي جيئن AI ايجنٽ قيمتي اڪائونٽس، ڊيٽا ۽ سسٽم تائين رسائي حاصل ڪندا.
هن چيو ته تنظيمن کي آخرڪار اهو سمجهڻ جي ضرورت آهي ته هڪ LLM يا AI ايجنٽ سمجهي سگهجي ٿو بجاءِ ان جي حفاظت کي مڪمل طور تي قابل اعتماد سمجهي.
محقق بحث نٿا ڪن ته موجوده دفاع بيڪار آهن. ان جي بدران، اهي اهو نتيجو ڪن ٿا ته اڪيلي ٽريننگ مڪمل تحفظ جي ضمانت ڏيڻ جي ممڪن ناهي جيستائين LLMs متن جي اختيار کي جزوي طور تي اندازو لڳائي رهيا آهن ته متن ڪيئن لکيو ويو آهي.
انهن جو ڪاغذ دليل ڏئي ٿو ته ماڊلز لاءِ وڌيڪ قابل اعتماد طريقي جي بغير اهو سمجهڻ لاءِ ته ڪير يا اصل ۾ هڪ هدايت ڏئي رهيو آهي ، فوري انجيڪشن دفاع نئين حملن کي ڳولڻ ۽ پيچ ڪرڻ جو هڪ جاري چڪر رهي سگهي ٿو.
تازه ترين ٽيڪني خبرن، ٽيليڪم بصيرت، ۽ پراڊڪٽ لانچ حاصل ڪريو جتي توهان چاهيو ٿا.
ProPakistani کي ترجيحي ذريعن ۾ شامل ڪريو ۽ ڏسو اسان جون وڌيڪ ڪهاڻيون گوگل سرچ ۽ ٽاپ اسٽوريز ۾.
ٽيڪنالاجي ۽ گاڏين جو ماهر جديد ڪارن، اسمارٽ فونز، AI ڪاميابين، ۽ ...
شيئرز