كرت رسوميات واحد. نموذج بحجم 27 مليار معامل. ومهمة برمجية واحدة يخرج منها منتصراً على نماذج تُشغَّل على عناقيد خوادم بكلفة ملايين الدولارات. هذه ليست مزحة تقنية، بل ادعاء تحقّق منه مستخدم واحد ونشره علناً، ليضع الجميع أمام سؤال مزعج: هل انتهى عصر «الأكبر أفضل»؟
قبل أن تفرح، اعلم أن القصة تحمل تحفظات كثيرة سنفككها سطراً بسطر. لكن حتى مع التحفظات، ثمة شيء تغيّر في معادلة سباق الذكاء الاصطناعي.
ما الذي حدث بالضبط؟
مستخدم واحد — لا مختبر ضخم ولا شركة بمليارات — قارن بين نموذج محلي بحجم 27B بعد تكميمه (quantization) ونموذج frontier متقدم، في مهمة واحدة مستخرجة من اختبار برمجي معياري. النتيجة: النموذج الصغير فاز.
التكميم هنا يعني ضغط أوزان النموذج من دقة عالية (مثل FP16) إلى دقة أقل (مثل 4-bit). النتيجة: حجم أصغر، ذاكرة أقل، سرعة أعلى، وخسارة طفيفة في الدقة — غالباً. لكن في هذه المهمة تحديداً، لم تكن الخسارة كافية لإسقاط النموذج.
الادعاء يبدو «أكثر قابلية للتصديق» من ادعاءات مشابهة، لأن المهمة واحدة، والمقارنة مباشرة، والظروف موثقة. لكن مهمة واحدة ليست اختباراً شاملاً، بل نقطة بيانات.
لماذا «مهمة واحدة» ليست انتصاراً كاملاً؟
اختبارات البرمجة المعيارية مثل HumanEval وMBPP وSWE-bench لا تقيس شيئاً واحداً. تقيس القدرة على فهم المتطلبات، توليد كود صحيح، إصلاح أخطاء، والتعامل مع سياق طويل. الفوز في مهمة واحدة قد يعني أن نوع المشكلة كان مألوفاً للنموذج الصغير.
الأخطر: الاختبارات المعيارية عرضة للتلوث (contamination). إذا كان النموذج قد رأى المهمة أو ما يشبهها في بيانات التدريب، فالنتيجة لا تعكس قدرة حقيقية بل حفظاً.
كذلك، Frontier Models تُقاس عادة على مئات المهام، بمتوسطات وأخطاء معيارية. انتقاء مهمة واحدة يشبه اختيار أغنية واحدة لتقييم مغنٍّ كامل.
المعنى الحقيقي: الكفاءة تغيّرت
حتى لو تجاهلنا الادعاء الكبير، ثمة حقيقة أصغر لكنها أهم: نموذج 27B مكمّم يعمل على RTX 4090 — كرت يملكه ملايين المطورين — ويؤدي مهمة برمجية بجودة تنافسية.
هذا يعني أن عتبة «الجودة المفيدة» انخفضت. لم تعد بحاجة إلى عنقود GPU لتشغيل مساعد برمجي ذكي. هذا تحوّل اقتصادي قبل أن يكون تقنياً.
نماذج مثل هذه تفتح الباب أمام أدوات محلية، بلا إنترنت، بلا اشتراكات، وبخصوصية كاملة. للمطور العربي الذي يعمل على بيانات حساسة، هذا ليس ترفاً بل ضرورة.
لماذا التكميم هو البطل الخفي؟
التكميم إلى 4-bit يقلّص الذاكرة المطلوبة بنسبة تصل إلى 75% مقارنة بـ FP16. النموذج 27B بدقة كاملة يحتاج نحو 54 جيجابايت، بينما نسخة 4-bit قد تحتاج 14-16 جيجابايت فقط — أي داخل نطاق كرت واحد.
لكن التكميم ليس سحراً. تقنيات مثل GGUF وGPTQ وAWQ تختلف في جودة الحفاظ على الدقة. بعضها يخسر 5% في المهام المعقدة، وبعضها أقل. النتيجة تعتمد على المهمة والقالب والمطالبة (prompt).
ماذا يعني هذا للسوق العربي والخليجي؟
في الخليج، تتصاعد الاستثمارات في البنية التحتية للذكاء الاصطناعي، لكن الاعتماد على النماذج السحابية الأجنبية يطرح أسئلة سيادة بيانات وكلفة تشغيلية متكررة. النماذج المكمّمة المحلية تقدّم طريقاً ثالثاً.
شركات ناشئة عربية في مجال البرمجة والأتمتة يمكنها الآن بناء منتجات على نماذج 27B تعمل على خوادم صغيرة أو حتى حواسيب مطورين. الكلفة تنخفض من آلاف الدولارات شهرياً إلى مئات، أو صفر في حالة التشغيل المحلي.
في المقابل، ثمة خطر: الانبهار بالادعاءات الفردية قد يدفع فرقاً تقنية لتبنّي نماذج غير مثبتة في بيئات إنتاجية. الحل: اختبار داخلي صارم على مهامك الفعلية، لا على مهام الآخرين.
الفرصة الأكبر: التخصيص
النماذج الصغيرة أسهل في الضبط الدقيق (fine-tuning) على بيانات متخصصة. نموذج 27B مضبوط على كود عربي، أو على أنظمة ERP خليجية، قد يتفوق على frontier عام في تلك المهمة تحديداً.
هذا هو الدرس الحقيقي: التخصص يتفوق على العمومية في المهام الضيقة. والادعاء المذكور ليس استثناءً بل مثالاً على قاعدة تتشكل.
الخلاصة: انتصار صغير بدلالة كبيرة
لا تصدّق أن نموذجاً بحجم 27B «هزم» نماذج frontier بشكل عام. لم يحدث ذلك، ولن يحدث قريباً في المهام المفتوحة المعقدة. لكن صدّق أن الفجوة تضيق، وأن الكفاءة أصبحت سلاحاً موازياً للحجم.
الرأي التحريري هنا جريء: خلال 18 شهراً، ستصبح النماذج المحلية المكمّمة الخيار الافتراضي لمعظم المطورين الأفراد والشركات الصغيرة، وستصبح النماذج السحابية الضخمة حلاً للمهام الاستثنائية فقط.
السؤال للنقاش: لو كان لديك كرت RTX 4090 ونموذج 27B مفتوح، هل تجرؤ على بناء منتجك القادم عليه بدلاً من الاعتماد على واجهات برمجية سحابية؟ وما الذي يمنعك؟

