أدلة موثقة
Kimi K3 تفوّق على Fable 5 بالكلفة لا بالجهد
شغّلت Fireworks اختبار قياس بألف مهمة وكيلية يقارن نموذجًا مفتوحًا بآخر مغلق. نتيجة التوجيه أهمّ من فوز أي نموذج بمفرده.
ما حدث
شغّلت Fireworks نموذج Kimi K3 المفتوح مقابل Fable 5 المغلق على نحو ألف مهمة وكيلية. الرقم الأبرز هو الكلفة: التوجيه بين النموذجين كان أوفر بخمسين ضعفًا من تشغيل Fable وحده على المهام الوكيلية الطويلة.
بلغ إجمالي مهام الاختبار نحو ١٬٠٣٠ مهمة عبر خمس فئات، نُفّذت داخل حلقات وكيلية حقيقية لا بمطالبة واحدة. فئتان توضّحان الصورة أكثر: مجموعة بأسلوب SWE-bench لإصلاح أخطاء برمجية حقيقية (٤٦٠ مهمة)، واختبار وكيل قانوني بمهام يقيّمها محامون (١٢٠ مهمة).
إشارة التوجيه
اختار التوجيه المثالي K3 لنسبة ٧٢ إلى ٩٦ بالمئة من المهام، بحسب الفئة. هذا لا يعني فوز K3 بكل شيء، بل يعني أنه الخيار الأنسب لمعظم العمل في أغلب الأحيان، حين يُتّخذ قرار التوجيه لكل مهمة على حدة لا مسبقًا.
من بين ٨٩ مهمة طرفية، حقق K3 ١١ فوزًا منفردًا مقابل ٧ لـFable. وعمل K3 بجهد أكبر ليصل إلى ذلك: في مهام أسلوب SWE استغرق نحو ٥٥ دورة و١٫٣ مليون رمز للمهمة الواحدة، مقابل ٢١ دورة و١٣٠ ألف رمز لـFable. أما في المهام الطرفية الطويلة فكان Fable هو من انزلق، بما يصل إلى ٦٤ دورة و١٫٥ مليون رمز، وأحيانًا حتى انتهاء المهلة مباشرة. النمط ينقلب بحسب شكل المهمة: K3 يواصل بثبات على العمل المحدود، وFable قد ينزلق على العمل الطويل المفتوح.
كيف تستخدمها
سمِّ فئات مهامك الخاصة كما فعل هذا الاختبار: عملًا محدودًا بشكل برمجي، وعملًا أطول ومفتوحًا. شغّل النموذجين على عدد قليل من الأمثلة الحقيقية من كل فئة قبل أي قرار دائم.
تابع أمرين فقط لكل مهمة: عدد الدورات حتى الانتهاء، وهل انتهت أصلًا. هذان الرقمان هما ما ميّز في هذا الاختبار النموذج الذي يواصل العمل عن النموذج الذي ينزلق.
وجّه العمل المحدود بشكل برمجي إلى أيّ نموذج أنهى بدورات أقل دون انزلاق. ووجّه أي عمل طويل مفتوح عبر الاختبار نفسه قبل أن تثق به بلا إشراف.
أين يفيد أكثر
اختبار كهذا خريطة لمكان ظهور عيب كل نموذج، لا حكم نهائي على الأفضل. عيب K3 هو الكلفة والجهد في مهام لا يناسبها. وعيب Fable، في هذا الاختبار، كان الانزلاق في العمل الطويل المفتوح. معرفة أي عيب يعرّض له عملك أهمّ من معرفة أي نموذج سجّل نتيجة أعلى إجمالًا.