ڈیپ سیک نے اپنا تازہ ترین ہلکا پھلکا ماڈل V4 فلیش جاری کیا ہے اور اسے اوپن سورس کیا ہے، جو قیمت کے ایک حصے پر GLM 5.2 جیسے ٹاپ ماڈلز کو مات دیتا ہے۔ یہ کئی بینچ مارک ٹیسٹوں میں Claude Opus 4.8 کے بالکل قریب ہے۔

اس کی قیمت Claude Fable 5 سے 100 گنا کم ہے۔

ماہرین کے بنیادی مرکب کے ماڈل میں 284 بلین پِیرامیٹرز ہیں، جن میں 13 بلین فی ٹوکن ایکٹیویٹ ہوتے ہیں، اور ایک ملین ٹوکن سیاق و سباق کی ونڈو کو سپورٹ کرتا ہے۔ Hugging Face 304 بلین پِیرامیٹرز پر مکمل ذخیرہ کی فہرست دیتا ہے کیونکہ چوکی میں DSpark قیاس آرائی پر مبنی ڈی کوڈنگ ماڈیول بھی شامل ہے۔

ڈیپ سیک نے ایم آئی ٹی لائسنس کے تحت رسائی کی پابندیوں کے بغیر وزن جاری کیا، جس سے تجارتی اور آن پریمیس تعیناتی کی اجازت دی گئی۔

DeepSeek نے اطلاع دی کہ V4-Flash-0731 نے V4-Flash پیش نظارہ اور V4-Pro پیش نظارہ کو ہر شائع شدہ ایجنٹ کے بینچ مارک میں ہرا دیا۔ اس نے تمام نو ٹیسٹوں میں GLM-5.2 سے زیادہ اسکور بھی کیا۔

V4-Flash ٹرمینل بنچ 2.1، DeepSWE، ایجنٹوں کا آخری امتحان، آٹومیشن بینچ پبلک اور DSBench-FullStack پر Claude Opus 4.8 کے قریب آیا۔ کلاڈ نے NL2Repo، Cybergym، Toolathlon-Verified اور DSBench-Hard پر بڑی برتری برقرار رکھی۔

تاہم، تمام نتائج وینڈر کے ذریعہ رپورٹ کیے گئے ہیں۔ ڈیپ سیک نے اپنے غیر جاری کردہ ڈیپ سیک ہارنس فریم ورک کے کم سے کم موڈ کے ساتھ عوامی کوڈ ایجنٹ کے ٹیسٹ چلائے، زیادہ سے زیادہ استدلال، درجہ حرارت 1.0، اور 0.95 کی ٹاپ-پی ویلیو کا استعمال کرتے ہوئے۔ DSBench-FullStack اور DSBench-Hard اندرونی DeepSeek ڈیٹا سیٹس ہیں، لہذا آزاد نتائج مختلف ہو سکتے ہیں۔

DeepSeek $0.14 فی ملین غیر کیشڈ ان پٹ ٹوکنز، $0.0028 فی ملین کیشڈ ان پٹ ٹوکنز، اور $0.28 فی ملین آؤٹ پٹ ٹوکنز وصول کرتا ہے۔

V4-Pro کی لاگت $0.435 فی ملین غیر کیچڈ ان پٹ ٹوکنز اور $0.87 فی ملین آؤٹ پٹ ٹوکن ہے، جس سے V4-Flash آؤٹ پٹ تقریباً ایک تہائی مہنگا ہے۔

V4-Flash API فی اکاؤنٹ 2500 سمورتی درخواستوں کو سپورٹ کرتا ہے، جبکہ V4-Pro کے لیے 500 کے مقابلے۔ یہ سوچنے اور نہ سوچنے کے طریقوں، ایک ملین ٹوکن سیاق و سباق کی ونڈو، ow اور 384000 ٹوکنز تک کے آؤٹ پٹ کو بھی سپورٹ کرتا ہے۔

API اب مقامی طور پر Responses API فارمیٹ کی حمایت کرتا ہے اور اسے Codex کے لیے ڈھال لیا گیا ہے۔ 31 جولائی کی اپ ڈیٹ صرف V4-Flash پر لاگو ہوئی۔ DeepSeek نے V4-Pro API یا اس کے ویب اور موبائل ایپلی کیشنز میں استعمال ہونے والے ماڈلز کو اپ ڈیٹ نہیں کیا۔

ڈیپ سیک نے تصدیق کی ہے کہ سرکاری V4-Pro ماڈل تیار ہو رہا ہے لیکن اس نے ریلیز کی تاریخ کا اعلان نہیں کیا۔

V4-Flash میں 43 ٹرانسفارمر پرتیں ہیں اور ہر بلاک میں ماہرین کا مرکب نظام استعمال کرتی ہے۔ ہر MoE پرت میں ایک مشترکہ ماہر اور 2048 کے درمیانی جہت کے ساتھ 256 روٹڈ ماہرین ہوتے ہیں۔ چھ روٹڈ ماہرین فی ٹوکن ایکٹیویٹ کرتے ہیں، جبکہ پہلی تین MoE پرتیں ہیش روٹنگ کا استعمال کرتی ہیں۔ اس کی کثیر ٹوکن پیشن گوئی کی گہرائی ایک ہے۔

ماڈل کمپریسڈ اسپارس توجہ اور بھاری کمپریسڈ توجہ کو یکجا کرتا ہے۔ یہ چار اور 20 Sinkhorn-Knopp تکرار کے توسیعی عنصر کا استعمال کرتے ہوئے معیاری بقایا کنکشنز کو Manifold-Constrained Hyper-Connections کے ساتھ بدل دیتا ہے۔

ڈیپ سیک نے ماڈل کو 32 ٹریلین سے زیادہ ٹوکنز پر تربیت دی۔ اس نے زیادہ تر پِیرامیٹرز کے لیے Muon آپٹیمائزر اور ایڈم ڈبلیو کو سرایت کرنے، پیشین گوئی کے سروں، اور RMSNorm وزن کے لیے استعمال کیا۔

ایک ملین ٹوکن سیاق و سباق میں، DeepSeek کا کہنا ہے کہ V4-Flash سنگل ٹوکن انفرنس کمپیوٹنگ آپریشنز کا 10 فیصد اور DeepSeek-V3.2 کو درکار KV کیش کا 7 فیصد استعمال کرتا ہے۔ 27 فیصد کمپیوٹنگ آپریشنز اور KV کیش کے 10 فیصد کے الگ الگ اعداد و شمار V4-Pro پر لاگو ہوتے ہیں، V4-Flash پر نہیں۔

چیک پوائنٹ میں DSpark قیاس آرائی پر مبنی ضابطہ کشائی شامل ہے، جو کہ مرکزی ماڈل کی طرف سے ان کی تصدیق کرنے سے پہلے کئی ٹوکنوں کی پیشن گوئی کرنے کے لیے ایک مسودہ کا حصہ استعمال کرتا ہے۔

ڈیپ سیک لالچی ڈرافٹ سیمپلنگ کے ساتھ سات قیاس آرائی پر مبنی ٹوکن تجویز کرتا ہے۔ اس کا DSpark پیپر اسی مجموعی تھرو پٹ پر اپنے پچھلے MTP-1 سسٹم کے مقابلے 60 سے 85 فیصد تیز فی صارف نسل کی رپورٹ کرتا ہے۔

میزبان API کا استعمال کرنے کے لیے سرشار AI ہارڈویئر کی ضرورت نہیں ہے۔ خود میزبانی زیادہ ضروری ہے کیونکہ تمام ماڈل ماہرین کو یادداشت میں رہنا چاہیے، حالانکہ ہر ٹوکن کے لیے صرف 13 بلین پِیرامیٹرز فعال ہوتے ہیں۔

DeepSeek کی vLLM مثال چار Nvidia GB300 GPUs کے ساتھ ایک نوڈ پر مکمل ماڈل چلاتی ہے۔ Unsloth 162GB پر 8-bit GGUF ورژن اور 103GB پر 3-بٹ ورژن کی فہرست دیتا ہے۔ چھوٹے ورژن کو رن ٹائم اوور ہیڈ کے بعد 103GB سے زیادہ مشترکہ سسٹم میموری اور گرافکس میموری کی ضرورت ہوتی ہے۔

مکمل سیلف ہوسٹنگ اس لیے ملٹی جی پی یو سرورز، انفرنس کلسٹرز یا ہائی میموری ورک سٹیشن والی تنظیموں کے لیے زیادہ موزوں ہے۔

ماڈل ایک معیاری جنجا چیٹ ٹیمپلیٹ استعمال نہیں کرتا ہے۔ اس کے بجائے ڈیپ سیک ایک انکوڈنگ فولڈر فراہم کرتا ہے جس میں اوپن اے آئی کے موافق پیغامات کو تبدیل کرنے اور مکمل آؤٹ پٹ کو پارس کرنے کے لیے ٹولز موجود ہیں۔ V4-Flash کم، زیادہ اور زیادہ سے زیادہ استدلال کی ترتیبات پیش کرتا ہے۔ DeepSeek ایجنٹ کے کاموں کے لیے 0.95 اور دوسرے کام کے بوجھ کے لیے 1.0 کے ساتھ، 1.0 درجہ حرارت تجویز کرتا ہے۔ اعلی اور زیادہ سے زیادہ استدلال کے طریقے 384000 ٹوکن تک کے آؤٹ پٹ کو سپورٹ کرتے ہیں۔

DeepSeek-V4-Flash-0731 بنیادی فن تعمیر کو تبدیل کیے بغیر پیش نظارہ میں بڑی بہتری فراہم کرتا ہے۔ یہ ڈیپ سیک کے ذریعہ شائع کردہ ہر ایجنٹ بینچ مارک پر V4-Pro کے پیش نظارہ کو مات دیتا ہے جبکہ V4-Pro کی آؤٹ پٹ قیمت کا تقریباً ایک تہائی چارج کرتا ہے۔

تاہم، ڈویلپرز کو اپنے کام کے بوجھ پر ماڈل کی جانچ کرنی چاہیے کیونکہ نتائج وینڈر کے ذریعے رپورٹ کیے جاتے ہیں۔ کچھ ٹیسٹوں نے ایک غیر جاری شدہ تشخیصی فریم ورک کا استعمال کیا، اور دو بینچ مارک اندرونی ہیں۔

جہاں آپ چاہیں تازہ ترین ٹیک خبریں، ٹیلی کام کی بصیرتیں، اور پروڈکٹ لانچ حاصل کریں۔

ProPakistani کو ترجیحی ذرائع میں شامل کریں اور گوگل سرچ اور ٹاپ اسٹوریز میں ہماری مزید کہانیاں دیکھیں۔

ٹیکنالوجی اور آٹوموٹو ماہر جدید ترین کاروں، اسمارٹ فونز، AI پیش رفتوں، اور...

شیئرز