لنكن دقيقين في معنى "مجاني"، لأن الكلمة تحمل أكثر مما يبدو. لا نتحدث عن تجربة مجانية ولا عن طبقة سخية داخل منتج مدفوع. هذه نماذج مفتوحة الأوزان. الأوزان منشورة برخص مفتوحة على Hugging Face، لذلك تستطيع تنزيلها وتشغيلها على عتادك مقابل تكلفة الحوسبة فقط. وكل جهة توفر أيضاً دردشة مستضافة مجانية، فتستطيع استخدام النموذج مباشرة. هذا مختلف عن مساعد IDE مدفوع يغلف النموذج بأدوات ويفرض رسوماً شهرية. لذلك النوع من المقارنة، راجع مواجهة مساعدات البرمجة.
ثلاث عائلات تتصدر فئة نماذج البرمجة مفتوحة الأوزان الآن: DeepSeek من الصين، وQwen من Alibaba، وKimi من Moonshot AI. إليك ترتيبها حسب النتائج التي ينشرها المصنعون أنفسهم.
| النموذج | المعاملات (الإجمالي / النشط) | الرخصة | السياق | SWE-bench Verified |
|---|---|---|---|---|
| DeepSeek-V4-Pro | 1.6T / 49B | MIT | 1M | 80.6 |
| Kimi K2.6 | 1T / 32B | Modified MIT | 256K | 80.2 |
| DeepSeek-V4-Flash (أوزان فقط؛ توقفت واجهته المستضافة في 10 سبتمبر 2026) | 284B / 13B | MIT | 1M | 79.0 |
| Qwen3.6-27B | 27B كثيف | Apache 2.0 | 262K | 77.2 |
| Qwen3.6-35B-A3B | 35B / 3B | Apache 2.0 | 262K | 73.4% |
| Qwen3-Coder-Next | 80B / 3B | Apache 2.0 | 256K | ~71% |
| Kimi K3 | 2.8T / 104B | Kimi K3 License | 1M | غير منشور |
DeepSeek-V4-Pro: متصدر النتائج
وفق أقوى رقم منشور رسمياً، يتصدّر DeepSeek-V4-Pro هذا الجدول الآن. تعلن DeepSeek في بطاقة النموذج أنه يسجّل 80.6 في SWE-bench Verified، وهو البنشمارك الذي يقيس حلّ مشكلات GitHub حقيقية، و87.9 في Terminal-Bench 2.1. النموذج من نوع Mixture-of-Experts بإجمالي 1.6T معامل، منها 49B نشطة لكل توكن، وأصدرته DeepSeek في أبريل 2026 برخصة MIT وبسعة سياق تبلغ مليون توكن. لم تطبع هذه الصفحة رقماً لـ V4 حين نُشرت في مايو؛ أما الآن فيحمل سجلّ benchr الرقم الذي نشرته DeepSeek، وعليه يقوم الترتيب هنا.
تغيّر الجانب المستضاف في 10 سبتمبر 2026: أوقفت DeepSeek نموذج V4-Flash في واجهتها البرمجية واستبدلت به DeepSeek-V4.1-Flash، ويُحوَّل المعرّف القديم deepseek-v4-flash مؤقتاً إلى النموذج الجديد. بقيت أوزان V4-Flash المرخّصة MIT متاحة للتنزيل، لذلك ما زالت نتيجته 79.0 في SWE-bench Verified تصف نموذجاً تستطيع استضافته بنفسك. تقول DeepSeek إن V4.1-Flash يتفوق على V4-Pro في بنشماركاتها، لكن benchr لم يسجّل له رقماً ولا رخصة بعد، فبقي خارج الجدول. أما V4-Pro فمستمر في الواجهة: أعلنت DeepSeek لفترة قصيرة أنها ستحوّله إلى V4.1-Flash ابتداءً من 14 سبتمبر، ثم تراجعت وأكدت استمراره بطريقة الفوترة نفسها.
ما زالت دردشة DeepSeek المجانية على chat.deepseek.com أسهل طريقة لتجربة العائلة قبل تنزيل أي شيء، لكن benchr لم يُعِد فحص النموذج الذي تخدمه بعد تغيير 10 سبتمبر. موقع DeepSeek أمام بقية النماذج القابلة للتنزيل مغطى في طبقة النماذج مفتوحة الأوزان الآن.
Kimi K2.6، ولماذا لا يدخل K3 الترتيب
يأتي Kimi K2.6 من Moonshot AI بعده بفارق 0.4 نقطة، عند 80.2 في SWE-bench Verified وفق بطاقة Moonshot، إضافة إلى 58.6 في SWE-bench Pro الأصعب و76.7 في النسخة متعددة اللغات. وفي SWE-bench Pro يتقدم على DeepSeek-V4-Pro الذي تعلن له DeepSeek 55.4، فالصدارة بين الاثنين تتبدّل بحسب البنشمارك الذي تعتمده.
داخلياً هو نموذج Mixture-of-Experts بتريليون معامل، منها 32 ملياراً نشطة لكل توكن، وصدر في أواخر أبريل 2026 تحت رخصة Modified MIT. تركيز Moonshot واضح على العمل الوكيلي طويل الأفق: يستطيع K2.6 تنسيق ما يصل إلى 300 وكيل فرعي عبر ما يصل إلى 4,000 خطوة في تشغيل واحد، مع جلسات ذاتية موثقة تصل إلى 12 ساعة.
المشكلة هي الحجم. نموذج بتريليون معامل ليس شيئاً تشغله على لابتوب، لذلك تعني "مجاني" لمعظم الناس هنا الدردشة المستضافة أو GPUs مستأجرة، لا التشغيل المحلي. مراجعة Kimi K2.6 الكاملة تتعمق أكثر في Agent Swarm وتكلفة الاستضافة الذاتية.
أطلقت Moonshot نموذجها الأحدث Kimi K3 في 16 يوليو 2026، بسعة سياق 1M توكن وسعر $3 / $15 لكل مليون توكن إدخال/إخراج لـ Kimi K3 في الواجهة البرمجية. تنشر Moonshot له 88.3 في Terminal-Bench 2.1، أعلى قليلاً من 87.9 لـ DeepSeek-V4-Pro، و67.5 في DeepSWE و93.5 في GPQA Diamond، لكنها لا تنشر رقماً في SWE-bench Verified، فلا يوجد رقم مماثل يضعه أمام K2.6 أو DeepSeek في هذا الجدول. وتصدر أوزانه برخصة Kimi K3 License لا برخصة Modified MIT التي تغطي K2.6، فاقرأ شروطها قبل أن تبني عليه.
Qwen: النموذج الذي تستطيع تشغيله بنفسك
حجة Qwen هي الكفاءة، وهذا سبب أنه قد يكون الجواب الصحيح رغم أنه لا يتصدر الجدول. يقدّم جيل Qwen3.6 الصادر في أبريل 2026 خيارين: Qwen3.6-27B الكثيف يسجّل 77.2 في SWE-bench Verified، وQwen3.6-35B-A3B يسجّل 73.4% بينما يفعّل 3B معامل فقط لكل توكن من إجمالي 35B. وتطرح Alibaba أيضاً نموذج برمجة متخصصاً، Qwen3-Coder-Next، وهو نموذج 80B بالبصمة النشطة نفسها 3B ويصل إلى أكثر قليلاً من 70% حسب الإطار. الثلاثة برخصة Apache 2.0، وهي أكثر رخصة تساهلاً هنا، بلا قيود على الاستخدام التجاري. توجد على Hugging Face نسخة أحدث هي Qwen3.8-27B، لكنها لم تدخل سجلّ benchr بعد، لذلك لا ترد في الترتيب.
صِغر البصمة هو العنوان الأهم. نموذج كثيف بـ27B أو نموذج MoE بـ3B نشطة يعمل على عتاد لا يستطيع نموذج بتريليون معامل الاقتراب منه، وهذا يضع نموذج برمجة قوياً في متناول GPU جيد واحد. إذا كان "مجاني" يجب أن يعني "مجاني على جهازي"، فعائلة Qwen هي نقطة البداية، ومقال النماذج اللغوية الصغيرة يشرح لماذا تنجح حيلة المعاملات النشطة.
إذن أيها تختار؟
اختر DeepSeek-V4-Pro إذا أردت أعلى رقم منشور من المزوّد في SWE-bench Verified بأوزان مفتوحة (80.6، MIT) وتستطيع استضافته أو استخدام واجهة DeepSeek أو دردشتها. يقترب Kimi K2.6 كثيراً عند 80.2 ويتقدم في SWE-bench Pro، لذلك قد يحسم Agent Swarm أو اختبارك على مستودعك الخيار بينهما. تعامل مع Kimi K3 كمرشح للتجربة لا كخيار مرتّب إلى أن تنشر Moonshot رقماً في SWE-bench Verified. واختر Qwen إذا احتجت تشغيل النموذج بنفسك على عتاد معقول: Qwen3.6-27B للنتيجة الأعلى، وQwen3.6-35B-A3B حين تريد 3B معامل نشطة فقط لكل توكن. وإن استضفت DeepSeek-V4-Flash (79.0) بنفسك فتذكّر أن واجهته المستضافة توقفت، وأن DeepSeek تخدم الآن V4.1-Flash في فئة Flash.
تنبيه واقعي قبل الالتزام: النموذجان المتصدران من فئة تريليون معامل، لذلك "مجاني للتنزيل" و"مجاني للتشغيل" ليستا الجملة نفسها. إذا كان هدفك الاستضافة الذاتية، فاقرأ أولاً تشغيل النماذج على جهازك، ثم اضبط طموحك حسب قدرات GPUs لديك.