Nvidia جمعه تي ڪجهه دلچسپ نئين تحقيق شايع ڪئي جنهن ۾ اها صلاح ڏني وئي آهي ته هي هارنس آهي، بنيادي ماڊل کان وڌيڪ، اهو تمام گهڻو اهم آهي جڏهن هڪ AI کان پڇڻ لاء ڊگهو افق ڪم ڪرڻ لاء.
tldr: صرف ميموري کي چڱي طرح سنڀالڻ لاءِ هڪ ڪسٽم هارنس استعمال ڪندي ۽ هڪ ”سپروائيزر“ باس جهڙو جزو شامل ڪرڻ سان، محققن کي ڪلاڊ اوپس 5 حاصل ڪيو ته جيئن انٽرايڪٽو ريجننگ بينچ مارڪ ARC-AGI-3 تي 100٪ سکور حاصل ڪري. (اهو هڪ معيار آهي جنهن کي خاص طور تي حريف فرنٽيئر ليب OpenAI کي متاثر ڪيو آهي.) بغير بغير، Opus 5 30٪ اسڪور ڪيو، جيڪو سڀني ماڊلن جي آزمائشي مان مٿين نتيجو هو.
Nvidia جي تحقيق هڪ ٻيو اشارو آهي ته، جڏهن ته ماڊل جي چونڊ اهميت رکي ٿي، ايجنٽ جي دماغ وانگر ڪم ڪندي، اهو هڪ ايجنٽ سسٽم جو ننڍڙو حصو آهي، ان کان علاوه ڪيترن ئي AI صارفين جو احساس آهي، خاص طور تي ڊگهي افق جي ڪمن لاء. هارنس اهو آهي جيڪو هڪ ماڊل کي نمائندو بڻائي ٿو: اهو ياداشت، حوالن، موٽڻ کي سنڀاليندو آهي.
"عام طور تي ڳالهائڻ، دنيا هڪ ايجنٽ کي تقريبا ماڊل جي API جي طور تي تعبير ڪري ٿو،" عادل ايل هالڪ، Nvidia جي AI يونٽ ۾ پيداوار جو نائب صدر (مٿي ڏنل تصوير)، TechCrunch کي ٻڌائي ٿو. پر هڪ ايجنٽ اصل ۾ ان کان وڌيڪ آهي. "اهو نمونو آهي. اهو ماڊل جي چوڌاري اسڪيل آهي، جنهن کي اسين هارنس سڏين ٿا، يعني اوزارن جو سيٽ جيڪو اهو استعمال ڪري ٿو. اهو رن ٽائم ۽ لاڳاپيل مهارتون ۽ لائبريريون آهن جيڪي اسان ان کي رسائي ڏيون ٿا."
ڊگھي افق جا ڪم اھي آھن جن کي گھڻن فيصلن کي گڏ ڪرڻ جي ضرورت آھي، ڪڏھن ڪڏھن ڏينھن ۾، مڪمل ٿيل ڪم پيدا ڪرڻ لاءِ. اهو هڪ AI جي ابتڙ آهي صرف هڪ تڪڙي جواب کي ٻاهر ڪڍڻ. اهو معلوم ڪرڻ ته AI ڪيئن حاصل ڪجي ڊگھي افق جا ڪم ڪرڻ لاءِ پريشان ٿيڻ ۽ لا-لا زمين ۾ وڃڻ کان سواءِ ايجنٽ ريسرچ ۾ پاڪ گرلز مان هڪ آهي.
مثال طور: Microsoft اپريل ۾ تحقيق شايع ڪئي جنهن ۾ 19 LLMs کي ڊگھي افق جي ڪمن تي آزمايو ويو جنهن ۾ دستاويز جي ترميم شامل هئي ۽ دريافت ڪيو ويو ته سڀئي ماڊل، بشمول فرنٽيئر وارن، دستاويزن کي غلطين سان ڀريو. (جيڪڏهن انسان اهڙي ڪم پيدا ڪيو، انهن کي فوري طور تي برطرف ڪيو ويندو.)
فيصلا پاڻ سان گڏ ڪرڻ وارا ماڊل پڻ پڪڙيا ويا آهن انهن جي استعمال ڪندڙن جي فائلن کي حذف ڪندي، ايستائين جو سڄو ڊيٽابيس يا مجرمانه رويي ڏانهن رخ ڪري رهيا آهن انهن جي مقصدن کي حاصل ڪرڻ لاءِ هيڪنگ کان وٺي هيڪنگ تائين.
Nvidia جي محققن جو انتخاب انهن جي تجربن لاءِ هن انٽرايڪٽو استدلال واري معيار کي استعمال ڪرڻ لاءِ خاص طور تي معنيٰ وارو آهي ، تقريبن مضحکہ خیز. هي 2D راندين جي هڪ گروپ جو هڪ معيار آهي بغير ڪنهن هدايتون. ماڊل کي معلوم ڪرڻو پوندو ته ڪيئن کيڏڻ ۽ کٽڻ. هڪ 100٪ سکور جو مطلب آهي ته ماڊل راندين سان گڏ انسانن کي به مات ڏئي سگهي ٿو.
OpenAI ان جي ماڊلز جي ابتڙ اسڪور (10٪ کان گهٽ) ARC-AGI-3 تي ايترو ته حيران ٿي ويو آهي ته هن گذريل مهيني پنهنجي تحقيق ڪئي. Nvidia وانگر، OpenAI دريافت ڪيو ته صرف ٻن سيٽنگن کي ٽائيڪ ڪندي هارنس تي، ان جا ماڊل انهن جي اسڪور کي ٽي ڀيرا ڪيو.
پر ڪو به ماڊل 100٪ سکور کي مارڻ جي ويجهو نه آيو، جهڙوڪ Nvidia جي محققن حاصل ڪيو. انهن ڏيکاريو ته هارنس کي "نگران" جزو جي ضرورت آهي جيڪو ايجنٽ کي صحيح هدايت ۾ پيش ڪري ٿو جيڪڏهن اهو پڪڙي وڃي.
"وڌيڪ دلچسپ حصو توهان جي مکيه ايجنٽ کان علاوه هڪ نگران ايجنٽ متعارف ڪرايو هو جيڪو ڪم ڪري رهيو آهي،" ايل هالڪ چيو. اهو "تقريبا هڪ سي اي او وانگر ڪم ڪري ٿو ايجنٽ کي ڌڪ ڏيڻ لاءِ جڏهن اهو رستو بند ڪري ٿو يا ڪنهن رستي کي ڳولڻ شروع ڪري ٿو ته اهو شايد ختم ٿي سگهي ٿو، يا ڪنهن رستي کي ٻيهر ڳولي ٿو جيڪو اهو اڳي هليو ويو هو."
جڏهن ته نگران ايجنٽ جو تصور بلڪل نئون ناهي، اڄ اڪثر ايجنٽ استعمال ڪندڙ صرف هڪ پرت تي ڀروسو ڪري رهيا آهن انهن جي هارنس لاءِ، جهڙوڪ ڪلاڊ ڪوڊ، ڪوڊڪس، هرمس وغيره. Nvidia جي محققن پنهنجو سوپ اپ هارنس ٺاهيو جنهن کي Agentic Variation Operators (AVO) سڏيو ويندو آهي.
نوٽ ڪريو ته هي هڪ نئون Nvidia پراڊڪٽ ناهي. Nvidia ان جي بدران نمو برانڊ تحت هارنسز جي تعمير لاءِ ڪيترائي کليل بٽ ۽ ٽيڪنالاجي جا ٽڪرا پيدا ڪري ٿي. انهي ٽيڪنالاجي مان ڪجهه تجارتي آهي، گهڻو ڪري کليل طور تي دستياب آهي.
اڃا تائين، اينڊيا جي نتيجن کي وڌندڙ ثبوتن ۾ شامل ڪيو ويو آهي ته ماڊل پسند ايجنٽ ڪارڪردگي ۾ واحد عنصر کان پري آهي. جولاء ۾، مثال طور، Databricks ڪجهه شاندار تحقيق شايع ڪئي جيڪا ڏيکاري ٿي ته هارنس، ماڊل کان وڌيڪ، ڊرامائي طور تي AI خرچن تي اثر انداز ڪري ٿو.
"توهان هڪ ئي ماڊل چونڊي سگهو ٿا پر مختلف هارنس، ۽ جيڪڏهن توهان غلط هارنس استعمال ڪندا آهيو ته توهان کي تمام گهڻي قيمت ملندي،" Databricks CEO علي گهوڙيسي TechCrunch کي ٻڌايو. ”تنهنڪري توهان سوچيو، اوه، هي هڪ مهانگو ماڊل آهي. هي هڪ سستو ماڊل آهي. پر انتظار ڪريو، توهان ڪهڙي هارنس استعمال ڪري رهيا آهيو؟ اهو پاڻ توهان جي قيمت کي 2x ڪري سگهي ٿو.
Nvidia جو وڏو نقطو اهو ڏيکاري ٿو ته کليل هارنس، کليل ماڊل وانگر، صارفين کي انهن جي احساس کان وڌيڪ ڪنٽرول ۾ وجهي ٿو. "اسان يقين رکون ٿا، ۽ اسان ماحولياتي نظام سان ظاهر ڪري رهيا آهيون، ڪيئن کليل هارنس توهان کي انهي جي درستگي کي هلائڻ لاء تمام گهڻو ڌڪڻ جي اجازت ڏين ٿا،" ايل هالڪ چيو. "اهو OpenAI سان تعلق رکي ٿو انهن جي ماڊل جي تربيت کي سست ڪرڻ،" ماڊل جي نتيجي ۾ سيڪيورٽي جي ڀڃڪڙي ٺاهي ٿي.
"اسان هڪ کليل ايجنٽ اسٽيڪ هجڻ تي يقين رکون ٿا - جتي توهان وٽ ڪنٽرول آهي ، انفراسٽرڪچر جي پار ، رن ٽائم جي پار - اهو آهي جيڪو اسان لاءِ گهربل آهي ته ماحولياتي نظام کي اڳتي ۽ محفوظ طور تي ،" هن وڌيڪ شامل ڪيو.