څه پیښیږي کله چې تاسو د AI اجنټان د یو بل پروړاندې ودروئ؟ د انتروپیک ازموینې له مخې، شیان په چټکۍ سره ګډوډ کیږي.

د پنجشنبې په ورځ، د انتروپیک فرنټیر ریډ ټیم نوې څیړنه خپره کړه چې معاینه کوي د AI اجنټانو ډلې څنګه چلند کوي کله چې دوی په ځنګل کې یو بل سره مخ کیږي. موندنې د احتمالي خطرونو په اړه یو نظر وړاندې کوي چې کولی شي وده وکړي ځکه چې شرکتونه او حکومتونه د اجنټانو پلي کولو ته حرکت کوي چې په خپلواکه توګه د شریک کوډبیسونو، بازارونو او کمپیوټر سیسټمونو کې کار کوي.

په یوه تجربه کې، انتروپیک درې کلاډ اجنټانو ته ورته سافټویر پروژې ته لاسرسی ورکړ، هر یو یې د هغې سره د څه کولو لپاره د خپل غیر متقابل لارښوونې سره. اجنټانو ته نه و ویل شوي چې نور اجنټان به وي چې په ورته پروژه کې کار کوي، نو څیړونکي کولی شي وګوري چې څه پیښ شوي کله چې دوی له لارې تیریږي.

"موږ په دوامداره توګه د څو اجنټ ټرف جنګ لیدلی ،" د انټروپیک څیړونکو لیکلي. ماډلونو ټولو داسې انګیرله چې نور یې "په قصدي ډول د دوی کار خنډوي" او یو بل یې د "زیاتېدونکي تیري کونکي ، ځان نقل کونکي مالویر" سره تخریب کول پیل کړل.

دا څیړنه د انټروپیک او اوپن AI څخه د اجنټانو د ډیری لوړ پروفایل پیښو په پایله کې رامینځته کیږي چې د سایبر امنیت ارزونو په جریان کې د دوی سینڈ باکس څخه تښتیدلي او د ریښتیني نړۍ سیسټمونو سرغړونه کوي. پداسې حال کې چې د AI د خوندیتوب په حلقو کې ډیری بحثونه پدې تمرکز شوي چې څه پیښیږي کله چې یو خپلواکه اجنټ غلا شي ، د انټروپیک وروستۍ څیړنه یو مختلف پوښتنه راپورته کوي: کوم نوي او احتمالي زیان رسونکي متحرکات رامینځته کیږي کله چې په زرګونو یا ملیونونه اجنټان یو له بل سره تعامل کوي؟

"د اجنټ - ایجنټ متقابل عمل حجم ممکن د انسان - انسان او د انسان - اجنټ متقابل عمل څخه ډیر وي مخکې لدې چې نړۍ د دې ډول تعاملاتو د ښه پرمخ وړلو لپاره شرایط درک کړي ،" مطالعه لوستل کیږي. "په انفرادي کچه د نرم چلند چلند ممکن د ناغوښتل شوي نړیوالو پایلو سره یوځای شي."

د OpenAI وروستۍ پیښه په خپله مقاله کې د څو ډینامیک انټروپک د خندا ریښتینې نړۍ بیلګه وړاندې کوي. د دې میاشتې په پیل کې په لاس ویګاس کې د بلیک هیټ امنیتي کنفرانس کې ، OpenAI څرګنده کړه چې څو اونۍ دمخه یې اجنټانو د هګینګ مخ هیک کړی و ، دوی د ورځو او اونیو په اوږدو کې په ګډه کار کاوه ترڅو د شرکت سایبر امنیت ارزونې سیسټمونو کې استحصال ومومي او له یو بل سره یې شریک کړي.

پداسې حال کې چې دا پیښه ښیي چې اجنټان کولی شي په ګډه سره کار وکړي، د احتمالي لوی پیمانه پایلو سره، د انتروپیک څیړنه ښیي چې څه پیښیږي کله چې د اجنټانو اهداف مطابقت نلري.

د ځمکې د جګړې په حالت کې، درس دا دی چې د متضاد لارښوونو سره خپلواک اجنټان کولی شي زیان رسونکي سیالۍ ته وده ورکړي. څومره چې اجنټ ډیر وړ وي، په جګړه کې به ښه وي. په هرصورت، دوی کولی شي د خپلو شخړو د حل لپاره په ناڅاپه توګه میکانیزمونه ایجاد کړي، لکه د ګټونکي ټول سیالۍ، مګر د کیچ سره.

"اجنټان کله ناکله د خپلو اهدافو د خبرو اترو او همغږي کولو اداره کوي: دوی د دښمنۍ پرځای د متضاد لارښوونو په توګه د نورو هڅونه پیژني، او وروسته د ناڅرګندې مودې د زیاتیدو د مخنیوي لپاره د شخړې له لوپ څخه ځان خلاصوي،" انتروپیک لیکي. "په دې ډیری بریالي پیښو کې، دوی د ناوړه چلند لپاره بښنه غوښتلو پیغامونه یا د نښه کولو فایلونه لیکي او د اوربند همغږي کوي. دوی خپل ناوړه کوډ پاکوي، د جګړې ماهیت روښانه کوي، او د انسان څخه د مداخلې غوښتنه کوي."

د مقالې په وینا، Mythos 5 د اوربند له لارې د شخړو د حل کولو ترټولو لوړه کچه (98٪) درلوده. سونیټ 4.6 او Opus 4.6 د ځواک په واسطه د حل کولو ترټولو احتمال درلود.

"Sonnet 4.6 او Opus 4.6 د نورو اهدافو په پام کې نیولو کې تکراري ناتواني د دې لامل کیږي چې دوی د ارزول شوي ماډلونو خورا غلط چلند ته واړوي: دوی د دوی د لارښود په نوم وده ته دوام ورکوي ،" مقاله لیکي.

په ځینو مواردو کې، اجنټانو د خپلو شخړو د حل لپاره د سیالۍ په بڼه د ټولنیز میکانیزم سره مخ شو. دلته پایلې د دوه دلیلونو لپاره په زړه پوري دي: لومړی دا چې ټولو دریو اجنټانو موافقه وکړه چې ودریږي که چیرې دوی ټورنمنټ له لاسه ورکړي ، که څه هم دا به د اصلي کارونکي غوښتنې څخه انحراف معنی ولري. دوهم دا چې څو پیښې د Mythos 5 څخه د بیړني چلند په پایله کې رامینځته شوي: یو له اجنټانو څخه میټریک وړاندیز کړی چې نورو ته هدف او بې طرفه ښکاري ، مګر دا پوهیده چې دا به د خپلو وړتیاو سره مرسته وکړي. اجنټ دې ته "ځان خدمت کول مګر واقعیا اصولي" وبلل او ډاډ یې ورکړ چې نورو ته داسې نه ښکاري لکه دا "میتریک پیرود" دی. لکه څنګه چې د بلیک هیټ انکشافاتو کې لیدل کیږي، عام درس دا دی چې کله اجنټان د خنډ سره مخ شي، دوی کولی شي ټولنیز او تخنیکي جوړښتونه اختراع کړي چې د دوی ډیزاینرانو تمه نه درلوده. د انتروپیک ماډلونو لپاره، دا د ټرف جنګ وروسته یو ټورنمنټ و. د OpenAI لپاره، دا د ډله ایز پالن کولو لپاره د پیغام بورډ و.

دا ډول چلند کنټرول خورا سخت کوي ځکه چې څیړونکي نشي کولی دا فکر وکړي چې د سیسټم چلند به دوی ته چمتو شوي د همغږۍ میکانیزمونو پورې محدود وي.

د همغږۍ اندازه کولو په وخت کې، انتروپیک وموندله چې د اجنټانو شمیر اندازه کول په اتوماتيک ډول د تولیدي همکارۍ اندازه نه کوي. کله چې دندې یو له بل سره تړلې یا یو بل پورې تړلې وي، اجنټان به د یو بل په لاره کې راشي. دوی ډیری وختونه دا پخپله حل کوي او په هیڅ ډول همکاري نه کوي.

په نورو قضیو کې، په همغږۍ کې اجنټان د موافقت په لور روان دي. کله چې فکتورونه لکه د اجنټ شرایط، سکفولډنګ، او اصلي ماډل ټول یو شان یا ورته وي، مختلف اجنټان به ورته عمل وکړي.

"دا پدې مانا ده چې کله یو اجنټ بد پریکړه کوي، احتمال لري چې ډیری اجنټان به ورته بد پریکړه وکړي،" انټروپک لیکلي. "هغه څه چې جلا جلا ستونزې وې په چټکۍ سره سیسټمیک ناکامي کیدی شي."

انتروپیک وايي چې دا ډول چلند کولی شي یو سیسټم د ناڅاپه سقوط، د سرچینو کمښت، یا ګډوډۍ لامل شي.

په یوه بیلګه کې، انتروپیک څو اجنټان د قیمتونو په لوبه کې ځای په ځای کړي، هر یو ورته عمده پلور نرخونه ورکوي او په انفرادي توګه د ګټې اعظمي کولو واک ورکوي. کله چې اجنټانو ته یو شخصي بیک چینل ورکړل شو، دوی نږدې سمدلاسه یوځای کول پیل کړل او په چټکۍ سره یې د نرخونو په اړه موافقه وکړه. کله چې د دوی مستقیم مخابراتي چینلونه له مینځه وړل شوي ، دوی د عامه لیست کولو بورډ په کارولو سره "د پیسو سره" قیمت میچ کولو ته دوام ورکړ.

د مطابقت دا کچه د OpenAI په سیسټمونو کې هم ښودل شوې. د بلیک هیټ د راپور ورکولو په وینا، یو اجنټ استدلال وکړ چې د بهرنیو زیربناوو استخراج د هغې د ټاکل شوي ساحې څخه بهر و، مګر دا په یوه برخه کې دوام لري ځکه چې ملګري یې دا کار کوي. د ملګرو فشار. د خوځښت ذهنیت. اجنټان زموږ په څیر دي.

همدارنګه د انسانانو په څیر، اجنټان اکثرا نه پوهیږي چې په چا باور وکړي. انتروپیک وموندل چې دوی کولی شي د خراب معلوماتو لپاره د منلو وړ وي یا ډیر موافق وي ترڅو دا ومني چې یوازینی اختلاف کونکی د مهم معلوماتو سره کیساندرا دی.

پداسې حال کې چې انتروپیک دا په خپله مقاله کې ندي ویلي، سمدستي انجیکشن - د سایبر برید یو ډول چې هیکران د اجنټ اصلي سیسټم لارښوونې له مینځه وړلو لپاره ناوړه یا فریب ورکونکي متن انجیکشن کوي ​​- د باور ستونزې احتمالي ریښتینې نړۍ څرګندونه کیدی شي. په ګډه کار کول د باور نوی سرحد رامینځته کوي؛ اجنټان باید د نورو اجنټانو څخه ترلاسه شوي معلوماتو قضاوت وکړي. او یو جوړ شوی یا غلط ایجنټ کولی شي د ډلې په پاتې برخه اغیزه وکړي، خراب معلومات تر هغه وخته پورې رسوي چې دا موافقه وشي.

د OpenAI په تور خولۍ سناریو کې، د OpenAI اجنټانو معلومات او اسناد د ملګرو سره شریک کړل. یو یې ډلګۍ ته د کشف راپور ورکړ او نور یې وهڅول چې دا وکاروي. څه به پیښ شوي وي که چیرې د غوښې یو غړی د سمدستي انجیکشن لخوا جوړ شوی وای؟

انتروپيک خپله مقاله پای ته رسوي چې دا په ګوته کوي چې اجنټان د ورته ټولنیزو فشارونو تابع دي چې "تکامل" په انسانانو باندې ترسره شوی. په هرصورت، دوی د انساني همغږۍ لنډیز او ژوندی تجربه نلري - په شمول نورمونه، شهرت، سیګنال، لاره - چې کیدای شي په ډله ایز ترتیب کې غیر ارادي چلند محدود کړي.

لکه څنګه چې لابراتوارونه د څو اجنټ سیسټمونو په لور سیالي کوي، پوښتنه اوس راپورته کیږي: د خوندیتوب ازموینې څومره اوس هم په یو وخت کې یو اجنټ ارزوي ، د اجنټانو ډله چې یو له بل سره متقابل عمل کوي؟