ایک ڈویلپر نے Colibri بنایا ہے، ایک ہلکا پھلکا انفرنس انجن جو Z.ai کے GLM-5.2 کو چلا سکتا ہے، ایک 744 بلین پِیرامیٹر مکسچر آف ایکسپرٹس ماڈل، صارفین کے ہارڈ ویئر پر بغیر Nvidia GPU کے۔

پروجیکٹ کو CUDA، PyTorch، یا کلاؤڈ انفراسٹرکچر کی بجائے CPU اور مقامی اسٹوریج کا استعمال کرتے ہوئے، تقریباً 25GB RAM والی مشین پر ماڈل چلانے کے لیے ڈیزائن کیا گیا ہے۔

کولیبری مکمل ماڈل کو میموری میں لوڈ نہیں کرتا ہے۔

اس کے بجائے، یہ RAM میں صرف ایکٹو مکسچر آف ایکسپرٹس کے اجزاء کو رکھتا ہے اور بقیہ ماڈل کے وزن کو مقامی SSD اسٹوریج سے اسٹریمز کرتا ہے جب ضرورت ہو۔ یہ سسٹم کو ایسا ماڈل چلانے کی اجازت دیتا ہے جس کے لیے عام طور پر کہیں زیادہ میموری کی ضرورت ہوتی ہے۔

خیال ویڈیو اسٹریمنگ جیسا ہی ہے۔ آپ پوری فلم دیکھنے سے پہلے اسے ڈاؤن لوڈ نہیں کرتے۔ آپ اس وقت جس حصے کی آپ کو ضرورت ہے اسے اسٹریم کریں۔

GLM-5.2 INT4 ماڈل پیکج کو کولیبری کے ساتھ کام کرنے کے لیے ڈیزائن کیا گیا ہے۔

چونکہ ماڈل کو سٹوریج سے سٹریم کیا گیا ہے، صارفین کو ابھی بھی کافی ڈسک اسپیس اور تیز SSD کی ضرورت ہے۔ یہ ایک بنیادی لیپ ٹاپ پر ایک چھوٹا چیٹ بوٹ ماڈل چلانے جیسا نہیں ہے، اور کارکردگی GPU پر مبنی تخمینہ سے مماثل نہیں ہوگی۔

تاہم، پراجیکٹ سے پتہ چلتا ہے کہ بہت بڑے MoE ماڈلز کو بہتر میموری اور اسٹوریج مینجمنٹ کے ذریعے مزید قابل رسائی بنایا جا سکتا ہے۔

سب سے بڑا تکنیکی نکتہ یہ ہے کہ کولیبری کو معمول کے GPU سافٹ ویئر اسٹیک کی ضرورت نہیں ہے۔

یہ CUDA، PyTorch، یا کلاؤڈ انفراسٹرکچر کے بغیر چلتا ہے۔ یہ ان ڈویلپرز کے لیے مفید بناتا ہے جو مہنگے GPU سرورز کو کرایہ پر لیے بغیر مقامی طور پر بہت بڑے کھلے ماڈلز کے ساتھ تجربہ کرنا چاہتے ہیں۔

پروجیکٹ عوامی JustVugg/colibri repository کے تحت GitHub پر دستیاب ہے۔

سیٹ اپ میں ریپوزٹری کی کلوننگ، GLM-5.2 INT4 ماڈل ڈاؤن لوڈ کرنا، کولیبری کو ماڈل فائلوں کی طرف اشارہ کرنا، اور مقامی چیٹ سیشن شروع کرنا شامل ہے۔

کولیبری اوپن اے آئی کے موافق API اینڈ پوائنٹ کے طور پر بھی چل سکتا ہے۔ یہ ڈویلپرز کو اپنے ورک فلو کو دوبارہ بنانے کے بجائے بنیادی URL کو تبدیل کرکے موجودہ ایپس کو جوڑنے دیتا ہے۔

کولیبری Nvidia GPUs کو غیر متعلقہ نہیں بناتا ہے۔

بڑے GPU کلسٹرز اب بھی پیداواری تخمینہ، بھاری کام کے بوجھ، اور کثیر صارف کی خدمت کے لیے بہت تیز ہوں گے۔ کولیبری کو تصور کے ثبوت کے طور پر بہتر طور پر سمجھا جاتا ہے جس سے یہ ظاہر ہوتا ہے کہ بہت بڑے MoE ماڈلز کو چلانے سے پہلے ہمیشہ مکمل طور پر GPU میموری کے اندر بیٹھنے کی ضرورت نہیں ہوتی ہے۔

یہ اب بھی ایک اہم تبدیلی ہے۔ صرف بڑے پیمانے پر VRAM پر انحصار کرنے کے بجائے، سسٹم کچھ بوجھ کو سستی RAM اور SSD اسٹوریج پر منتقل کرتا ہے۔

کولیبری ان ڈویلپرز کے لیے رکاوٹ کو کم کرتا ہے جو کلاؤڈ GPUs کا استعمال کیے بغیر بڑے کھلے ماڈلز کی جانچ کرنا چاہتے ہیں۔

یہ یہ بھی دکھاتا ہے کہ مقامی AI کہاں جا رہا ہے۔ جیسا کہ ماڈل آرکیٹیکچرز، کوانٹائزیشن، اور انفرنس انجن بہتر ہوتے ہیں، زیادہ قابل نظام عام ہارڈ ویئر پر قابل استعمال بن سکتے ہیں۔

ابھی کے لیے، کولیبری کی اہم کامیابی Nvidia کی جگہ نہیں لینا ہے۔ یہ ثابت کر رہا ہے کہ 744B-پِیرامیٹر ماڈل کو کموڈٹی ہارڈویئر پر درست اندازہ لگانے کے ساتھ قابل استعمال بنایا جا سکتا ہے۔

جہاں آپ چاہیں تازہ ترین ٹیک خبریں، ٹیلی کام کی بصیرتیں، اور پروڈکٹ لانچ حاصل کریں۔

ProPakistani کو ترجیحی ذرائع میں شامل کریں اور گوگل سرچ اور ٹاپ اسٹوریز میں ہماری مزید کہانیاں دیکھیں۔

شیئرز