أعلنت DeepSeek عن إطلاق الإصدار DeepSeek‑V4.1‑Flash، تحديث معماري ضخم لنماذج الـMoE يقدّم بنية جديدة أطلقت عليها الشركة اسم Causal Encoder–Decoder (CED) مع تكامل بصري مدمج وهدف واضح لتقليل تكاليف الاستدلال وتحسين أداء الأحمال الوكيلة (agentic workloads).
بنية جديدة فعّالة: تفعيل غير متماثل للمعاملات
تتبنى V4.1‑Flash تصميم شبكة مكوّن من 40 طبقة مقسَّمة إلى نصفين: 20 طبقة تعمل كـ”Causal Encoder” تليها 20 طبقة تعمل كـ”Decoder”. وفقاً لوثائق الإصدار، يسمح هذا التقسيم بتنشيط ميزانية معاملات غير متماثلة أثناء مراحل الإدخال والإخراج: ما يقارب 8 مليارات معاملات نشطة لكل توكن أثناء مرحلة الملء (prefill) مقابل 16 مليار معاملات نشطة أثناء مرحلة التوليد (decode). النتيجة المزعومة هي خفض كبير في تكلفة الاستدلال خصوصاً في حالات الإدخال الكبير والمحادثات المعتمدة على الأدوات.
نموذج متعدد الخبرات مع ذاكرة شرطية ومجال سياق فائق الطول
تعتمد V4.1‑Flash على هيكل MoE (Mixture-of-Experts) ضخم يتضمن وحدات ذاكرة شرطية تُدعى Engram بحسب الوثائق، وإعدادات تُشير إلى دعم سياق يمتد إلى مئات الآلاف أو حتى مليون رمز متعدد الوسائط. DeepSeek تؤكد أن التكوين العام للنموذج يصل إلى مئات المليارات من المعاملات (تُذكر أرقام متباينة في تقارير ومشاركات المجتمع، لكن الشركة تحدد ملف النموذج وتفاصيل التنشيط كما ورد أعلاه).
دمج الرؤية واللغة من البداية
يضم الإصدار محول رؤية مُدرَّباً من الصفر (DeepSeek‑ViT) يستخدم تقنيات مثل 2D‑RoPE وعمليات downsampling خاصة (3×3 pixel‑unshuffle) لتحويل الصور إلى متجهات مرئية تُدخَل بدءاً من تدريب نموذج اللغة، بدلاً من ربط تمثيلات بمرحلة لاحقة. هذا الدمج يسمح للنموذج بالتعامل مع مهام متعددة الوسائط ضمن نفس دورة التدريب والاستدلال.
أداء وتكلفة وطرح تجريبي
نشرت DeepSeek نتائج معيارية داخلية تُظهر تفوّق V4.1‑Flash في عدة اختبارات agentic وcoding وbenchmarks ذات صلة بالأتمتة مقارنة بإصدارات سابقة. كما أُعلن عن تغييرات في التوجيهات السعرية وخطة توجيه طلبات نسخة Pro إلى نسخة Flash لفترة انتقالية، ما يوحي بأن الشركة تُطلق هذا الإصدار كتحديث متاح حالياً للاختبار على واجهاتها وخدماتها.
ملاحظات على المصادر والتباينات
توجد مناقشات وملاحظات مجتمعية تشير إلى اختلافات في الإبلاغ عن الحجم الكلي للمعاملات (أرقام متباينة تُعرض في منشورات المستخدمين على المنتديات ومخازن النماذج). المعلومات الموثوقة الأساسية هنا هي بيان DeepSeek الرسمي وملف النموذج على مستودعات مثل Hugging Face التي تشرح البنية وطريقة تفعيل المعاملات ووحدات الذاكرة.