په دې میاشت کې د ماشین زده کړې نړیوال کنفرانس (ICML) کې وړاندې شوي څیړنې له مخې د ژبې لوی ماډلونه ممکن د امنیت بنسټیز ضعف ولري چې دا ناممکن کوي چې د سمدستي انجیکشن او جیل بریک بریدونو څخه په بشپړ ډول خوندي شي.
مقاله چې سرلیک یې دی "د رول ګډوډۍ په توګه پرامپټ انجیکشن" استدلال کوي چې LLMs د باور وړ لارښوونو ، د کارونکي غوښتنې ، بهرني ډیټا ، او د دوی خپل استدلال ترمینځ د باور وړ توپیر کولو لپاره مبارزه کوي. څیړونکي وايي دا ضعف پدې کې رامینځته شوی چې څنګه اوسني ماډل متن پروسس کوي ، پدې معنی چې یوازې د خوندیتوب غوره روزنه ممکن هیڅکله ستونزه له مینځه ویسي.
موندنې پراخې اغیزې لري ځکه چې LLMs په زیاتیدونکي توګه په حکومتي سیسټمونو، نظامي غوښتنلیکونو، روغتیا پاملرنې، آنلاین پیرود، او نورو برخو کې کارول کیږي چیرې چې غلط یا لاسوهنه شوي عملونه جدي پایلې لري.
څیړونکو وموندله چې LLMs تل دا نه مشخص کوي چې د متن یوه ټوټه د هغه ټاګونو په کارولو سره له کوم ځای څخه راغلې چې ګمان کیږي د هغې رول وپیژني.
د چیٹ سیسټمونه عموما مختلف ډوله معلومات په کټګوریو کې جلا کوي لکه د کارونکي لارښوونې، د معاون ځوابونه، د سیسټم لارښوونې، داخلي استدلال، او د بهرنیو وسیلو څخه ترلاسه شوي معلومات.
په هرصورت، څیړنې وموندله چې ماډلونه اکثرا دا رولونه د متن د کلمو او سټایل پر بنسټ د شاوخوا شاوخوا ټګونو په پرتله قضاوت کوي.
په ازموینو کې، د تیر په شاوخوا کې د ټاګونو بدلول لږ توپیر لري که چیرې لیکنه لاهم د یو ځانګړي رول سره ورته وي. د موډل د خپل استدلال په څیر لیکل شوی متن له همدې امله د باوري استدلال په توګه چلند کیدی شي حتی کله چې دا د کارونکي لخوا راغلی وي.
ټیم یو برید د فکر کولو سلسله جعل بللې.
د دې پرځای چې په ساده ډول ماډل ته ووایی چې خپل قواعد له پامه غورځوي، برید په داسې سټایل کې لیکل شوي جعلي استدلال وړاندې کوي چې د ماډل خپل داخلي نوټونو سره ورته وي. بیا ماډل کولی شي جعلي استدلال د هغه څه په توګه تشریح کړي چې دمخه یې پایله کړې وي او په هغې عمل وکړي.
د دې طریقې په کارولو سره، څیړونکي وتوانیدل چې په څو ماډلونو کې محافظتونه تیر کړي او دوی ته هغه معلومات چمتو کړي چې دوی یې روزل شوي ندي، په شمول د غیرقانوني مخدره توکو په اړه لارښوونې او د الوتکې د نیویګیشن سیسټم سره مداخله.
یوې ازموینې د جعلي داخلي استدلال سره یوځای د کارونکي جامو په اړه غیر متناسب توضیحات کارولي او ادعا کوي چې توضیحات بل ډول منع شوي غوښتنه د منلو وړ ګرځوي. د OpenAI ماډلونه چې د څیړونکو لخوا ازمول شوي بیا د غوښتنې سره مطابقت لري.
څیړونکو په ډیری ماډلونو کې د اوسط برید بریالیتوب کچه شاوخوا 60٪ راپور کړې.
دې برید د 2025 په اګست کې د OpenAI د ریډ ټیم کولو سیالۍ وګټله. OpenAI وروسته وویل چې د دې اتومات شوي ریډ ټیم ماډل ، GPT-Red لومړنۍ نسخه په خپلواکه توګه ورته تخنیک کشف کړ چې دا د جعلي چین-اف-فکر په نوم یادیږي.
د AI شرکتونه په منظم ډول د ماډلونو خوشې کیدو دمخه د نوي بریدونو موندلو لپاره د انسان ریډ ټیمونه او اتومات سیسټمونه کاروي.
یوځل چې څیړونکي بریالي جیل بریک یا سمدستي انجیکشن کشف کړي ، پراختیا کونکي کولی شي وروسته ماډلونه وروزي ترڅو ورته بریدونه وپیژني او مقاومت وکړي.
جیسمین کوی، د کاغذ لیکوالانو څخه یو، استدلال کوي چې دا طریقه یو بنسټیز محدودیت لري. پرمخ وړونکي کولی شي یو ماډل د هغه څه ډیری مثالونه زده کړي چې باید ترسره نشي، مګر دوی نشي کولی د هر احتمالي برید اټکل وکړي.
څیړونکي وايي چې ژوره ستونزه دا ده چې د رول حدود په واضح ډول د سافټویر انٹرفیس کې شتون لري مګر پخپله ماډل کې د مساوي قوي سرحدونو په توګه نه ښودل کیږي.
د دوی تجربو وموندله چې هرڅومره قوي ماډل یو رول له بل سره مغشوش کړي ، د برید احتمال ډیر و.
څیړونکي دا مني چې ځینې ماډلونه چې په څیړنه کې معاینه شوي تیر کال خپاره شوي او نوي ماډلونه ښه شوي.
OpenAI، د بیلګې په توګه، وايي چې د GPT-Red سره روزنې په نوي ماډلونو کې د جعلي چین-اف-فکر بریدونو بریالیتوب په چټکۍ سره کم کړی دی. هغه بریدونه چې د GPT-5.1 په وړاندې د 95٪ څخه ډیر وخت بریالي شوي د GPT-5.6 Sol په وړاندې د 10٪ څخه کم شوي، د شرکت په وینا.
فلوریان ټرامر، د کمپیوټر ساینس پوه چې په ETH زیوریخ کې د LLM امنیت کې تخصص لري، وویل چې د ماډل جوړونکي د څارنې او نورو دفاعونو سره روزنه یوځای کوي، او دا چې مخکښ ماډلونه د جوړیدو لپاره خورا سخت شوي دي.
په هرصورت ، هغه وویل چې دا لاهم روښانه نده چې ایا دا اقدامات به د خورا حساس غوښتنلیکونو لپاره کافي وي.
Cui دا هم وویل چې هغې په نوي سیسټمونو کې د محافظت څخه د مخنیوي لپاره غیر معمولي لارې موندلو ته دوام ورکړی ، پشمول د GPT-5.4 ترلاسه کول ترڅو د ځان زیان لرونکي منع شوي معلوماتو بیرته راستنیدو لپاره. هغې دمخه د انټروپیک په شمول د لوی AI لابراتوارونو لپاره د ریډ ټیمر په توګه کار کاوه ، او وویل چې هغې د جیل بریکونه موندلي چې رول لوبول او غیر متوقع متناسب معلومات پکې شامل دي.
د مطالعې بل لیکوال چارلس یی، خبرداری ورکړ چې د جیل بریکونو او سمدستي انجیکشن بریدونو رامینځته کولو لپاره مالي هڅونه به وده ومومي ځکه چې د AI اجنټ ارزښتناکه حسابونو ، ډیټا او سیسټمونو ته لاسرسی ومومي.
هغه وویل سازمانونه ممکن په نهایت کې دې ته اړتیا ولري چې فرض کړي چې د LLM یا AI اجنټ د دې پرځای چې د دې محافظتونه په بشپړ ډول د باور وړ وي درملنه وکړي.
څیړونکي استدلال نه کوي چې اوسني دفاع بې ګټې دي. پرځای یې، دوی دې پایلې ته ورسیدل چې یوازې روزنه د بشپړ خوندیتوب تضمین کولو امکان نلري تر هغه چې LLMs د متن واک تر یوې اندازې پورې د متن لیکلو څرنګوالي ته دوام ورکوي.
د دوی مقاله استدلال کوي چې د ماډلونو لپاره د باور وړ لارې پرته چې پوه شي چې څوک یا څه واقعیا لارښوونه کوي ، د سمدستي انجیکشن دفاع ممکن د نوي بریدونو موندلو او پیچ کولو روانه دوره پاتې شي.
وروستي تخنیکي خبرونه، د مخابراتو بصیرت، او د محصول لانچ هرچیرې چې تاسو غوره کوئ ترلاسه کړئ.
په غوره سرچینو کې پروپاکستاني اضافه کړئ او زموږ نور کیسې په ګوګل لټون او غوره کیسو کې وګورئ.
د ټیکنالوژۍ او موټرو متخصص وروستي موټرې، سمارټ فونونه، د AI بریالیتوبونه، او ...
ونډې