الإجابة السريعة: لا توجد نتائج معايير رسمية لنموذج Ox Alpha. صفحة النموذج stealth/ox-alpha على OpenRouter لا تذكر أي معايير للذكاء أو البرمجة أو العمل الوكيلي، كما أن منصة التتبّع المستقلة Artificial Analysis لا تُدرج النموذج (تم التحقق في 22 أغسطس 2026). أما الأرقام المتداولة — نحو 80% على مجموعة فرعية من DeepSWE مكوّنة من 10 مهام، و87.5% على «Kingbench» — فمصدرها المجتمع، وتعتمد على عيّنات صغيرة جدًا، وغير موثّقة بشكل مستقل. إذا كنت تقيّم Ox Alpha، فهذا المقال يشرح ما تعنيه تلك النتائج فعليًا، وما الإشارات التي يجدر النظر إليها بدلًا منها.
إذا كنت تبحث عن معايير Ox Alpha فغالبًا اصطدمت بالجدار نفسه: نموذج جديد ظهر في 20 أغسطس 2026، والناس يتحدثون عنه على منصة X وفي إعلان OpenCode، لكن ما إن تبحث عن أرقام صلبة حتى تصمت الصفحات الرسمية وتتناقض منشورات المجتمع في المنهجية. ومع نموذج «خفي» يبقى مزوّده مجهولًا خلال فترة المعاينة، يسهل تفسير هذا الصمت على أنه ضعف، أو تغطيته بلقطات من لوحات الترتيب. يستند هذا الدليل إلى بيانات النموذج على OpenRouter وبيانات واجهة البرمجة العامة والإعلانات العلنية، بتحديث 22 أغسطس 2026. لم نُجرِ معايير رسمية بأنفسنا؛ الهدف هو إطار لقراءة الادعاءات التي ستصادفها في أماكن أخرى، إضافة إلى البيانات الرسمية المتوفرة فعلًا.
لوحة النتائج الرسمية فارغة — عن قصد
أُطلق Ox Alpha على OpenRouter في 20 أغسطس 2026. البيانات الرسمية مفصّلة حيث يهم الأمر للتكامل: نافذة سياق بحجم 1,048,576 رمزًا (1M)، ومخرجات تصل إلى 131,072 رمزًا، ومدخلات نصية وصورية وفيديو مع مخرجات نصية، وسعر معاينة قدره 0 دولار لكل مليون رمز في الاتجاهين، واستدلال إلزامي مضبوط افتراضيًا على أقصى جهد، ودعم للأدوات وtool choice والمخرجات المهيكلة. أما التموضع فمذكور صراحةً: «نموذج استدلال مصمَّم للبرمجة والعمل الوكيلي المستمر وأحمال الإنتاج»، ومناسب لـ«هندسة البرمجيات طويلة المدى والاستدلال المعقّد وسير العمل الذي يجمع النص مع السياق البصري».
ما لا تتضمنه تلك البيانات هو نتائج المعايير. لا مؤشر ذكاء، ولا رقم في لوحة ترتيب البرمجة، ولا نتيجة للعمل الوكيلي في قسم الأداء. ومنصة Artificial Analysis — وهي جهة التتبّع المستقلة التي يقصدها معظم الناس أولًا — لا تتابع هذا النموذج (تم التحقق في 22 أغسطس 2026). كما أن التفاصيل التي يحتاجها المرء عادةً لوضع النتائج في سياقها — هوية المزوّد والبنية وعدد المعاملات والتسعير بعد المعاينة — غير معلنة خلال هذه الفترة.
يجدر قول ذلك بوضوح: غياب النتائج الرسمية حقيقة تخصّ صفحة النموذج، وليس دليلًا على قدراته. فالنماذج الخفية كثيرًا ما تتخطى المعايير، جزئيًا لتجنّب تثبيت تقييمها قبل الإطلاق الكامل. السؤال الصحيح ليس «لماذا لا توجد نتائج؟» بل «ما الإشارة التي يمكنني الوثوق بها بدلًا من ذلك؟» — وهذا ما تجيب عنه بقية المقال.
ما الذي يبلّغ عنه المجتمع
هناك رقمان متداولان:
1. نحو 80% على مجموعة فرعية من DeepSWE مكوّنة من 10 مهام. يفيد اختبار مجتمعي بأن Ox Alpha حقّق نحو 80% على مجموعة فرعية من DeepSWE من 10 مهام (بلاغ مجتمعي، غير موثّق بشكل مستقل). والمقارنة نفسها ذات العيّنة الصغيرة تضع Fable عند 65% وGPT-5.6 Sol عند 52%. انتبه للمنهجية: هذه مجموعة فرعية من المعيار — عشر مهام لا الحزمة الكاملة — لذا فإن الفارق بين 80% و65% هو حرفيًا بضع مهام في أي من الاتجاهين.
2. نسبة 87.5% على Kingbench. يذكر مقال مجتمعي أن Ox Alpha حقّق 87.5% على Kingbench، في المرتبة الثانية خلف GLM-5.3 عند 91.25% (بلاغ مجتمعي، غير موثّق بشكل مستقل). وKingbench ليس معيارًا قياسيًا: لا منهجية منشورة أو قابلة للتدقيق، ولا مختبر مستقل يُجريه. تعامل مع الرقم بوصفه مؤشرًا اتجاهيًا في أحسن الأحوال.
كما توجد تكهّنات، استنادًا إلى مقارنات البصمة والمُرمِّز ومشفّر الفيديو، بأن Ox Alpha قد يكون نسخة متعددة الوسائط مخفية من نماذج سلسلة GLM (غير مؤكد، مجرد تكهّن). نحن لا نتبنّى هذا التخمين ولا ينبغي أن يؤثّر في قرارك — لكنه يفسّر لماذا تتعامل بعض النقاشات مع النموذج بوصفه «يُتوقع أن يكون جيدًا في البرمجة» بدل «ثبت أنه جيد في البرمجة».
كيف تقرأ معايير المجتمع: إطار عملي
معظم المقالات تكتفي بتكرار الأرقام. وإليك ما تغفله عادةً — أربعة أسئلة قبل أن تستحق أي نتيجة مجتمعية ثقتك.
السؤال 1: ما حجم العيّنة؟ نتيجة مبنية على 10 مهام تتحرك بنحو 10 نقاط لكل مهمة. تشغيل واحد محظوظ أو تعِس يقلب العنوان بأكمله. القاعدة العملية: تعامل مع أي نتيجة مبنية على أقل من 50 مهمة بوصفها إشارة لا استنتاجًا. هي تخبرك أن النموذج يستحق الاختبار، لا أين يقع في الترتيب.
السؤال 2: ماذا يقيس المعيار فعلًا؟ DeepSWE معيار لهندسة البرمجيات طويلة المدى — على النموذج أن يعمل داخل مستودع حقيقي عبر أدوار كثيرة لحل مشكلة. وهذا يشبه العمل الوكيلي في الإنتاج. أما منهجية Kingbench فغير واضحة (غير قياسية)، فلا يمكنك حتى تحديد ما يقيسه. ونتيجة سؤال وجواب من دور واحد لن تخبرك شيئًا تقريبًا عن نموذج برمجة وكيلي، والعكس صحيح. طابِق حِمل عمل المعيار مع حِمل عملك قبل أن تزن الرقم.
السؤال 3: من أجراه، وهل جرى التحقق منه بشكل مستقل؟ اختبارات المجتمع ليست مراجعة أقران. وإذا كان لمن أجرى الاختبار مصلحة في النتيجة — مزوّد أو شريك تسويقي أو حساب ترويجي — فاخصم من قيمتها. اختبار الاختبار هو قابلية إعادة الإنتاج: هل ترى مجموعة المهام بالضبط، وبيئة التشغيل، وإعدادات النموذج؟ إن لم يكن، فالرقم ادعاء لا قياس.
السؤال 4: هل المقارنات متكافئة؟ هل استُخدمت مجموعة المهام الفرعية نفسها لكل نموذج؟ الحرارة نفسها، والأدوات نفسها، وعدد المحاولات نفسه؟ تبدو مقارنة الـ80% على DeepSWE متسقة داخليًا، لكنها تبقى مجموعة فرعية اختارها طرف واحد وشغّلها بنفسه. وإذا شُغِّل أي نموذج في الجدول بظروف مختلفة، بطل الجدول كله.
الخلاصة في سطر: نتائج المجتمع مفيدة لشيء واحد بالضبط — بناء قائمة مختصرة. وهي غير مفيدة لترتيب Ox Alpha مقابل النماذج الأخرى، وضعيفة على نحو خاص مع نموذج خفي لم يتمكن أحد من تدقيقه.
إشارات أفضل: ماذا يقول الاستخدام الحقيقي
هنا الجزء من البيانات الرسمية الذي تتخطاه معظم المقالات الباحثة عن المعايير. تُظهر واجهة Apps/Activity في OpenRouter حركة إنتاج حقيقية، وخلال نحو يومين بعد الإطلاق استهلك Ox Alpha قرابة 657 مليار رمز إدخال و7.95 مليار رمز إخراج. والتطبيقات الخمسة الأكثر توليدًا للحركة كلها أدوات برمجة وكيلية: Hermes Agent (120 مليار رمز)، وClaude Code (108 مليارات)، وOh-My-Pi (93.5 مليارًا)، وDeepSeek Harness بجسره متعدد الوسائط (84.8 مليارًا)، وZCode (51.5 مليارًا).
لماذا يتفوّق هذا على لقطة شاشة غير موثّقة من 10 مهام؟ لأنه مُجمَّع عبر آلاف المستخدمين الذين يشغّلون أحمال عمل حقيقية وطويلة المدى بصورة متواصلة. الأدوات الوكيلية هي أقسى اختبار إجهاد موجود: تحتفظ بالسياق عبر أدوار كثيرة، وتستدعي الأدوات، وتتعافى من الأخطاء، وتواصل العمل. وحين توجّه فِرق العمل 657 مليار رمز إدخال عبر نموذج خلال يومين، فهذا دليل على الفائدة تحت حِمل واقعي — ليس إثباتًا لموقع في لوحة ترتيب، لكنه إشارة أقوى بكثير من ادعاء مبني على 10 مهام.
وعلى الصعيد التشغيلي، تفيد المراقبة الرسمية (وسيط P50 على مدى ثلاثة أيام تقريبًا) بمعدل إنتاجية 24 رمزًا في الثانية، وزمن استجابة 5.81 ثانية، ووقت تشغيل 99.99%، وتوافر 99.14%. ويؤكد تبنّي المنظومة هذا الاتجاه: Ox Alpha («Ox Alpha Free») مُدرَج على OpenCode Go بنافذة مجانية محدودة للأسبوع المقبل، واستخدام شبه غير محدود لا يُحتسب من حصة Go، وعدم احتفاظ بالبيانات، وسياق 1M نفسه. هذا التزام علني من مزوّد أدوات، لا إشاعة.
إذا كان عملك برمجة طويلة المدى ومهام وكيلية — وهو بالضبط النمط الذي تُظهره بيانات الاستخدام — يمكنك تجربة Ox Alpha مجانًا على glm5.app الآن.
كيف تختبر Ox Alpha بنفسك
بالنظر إلى حالة البيانات العامة، فإن أوثق معيار لحالة استخدامك هو الذي تُجريه أنت. وعمليًا:
- اختر من 3 إلى 5 مهام من عملك الحقيقي. إعادة هيكلة في مستودع تعرفه، أو جلسة تصحيح أخطاء متعددة الخطوات، أو تشغيل وكيلي طويل مع استدعاء أدوات، أو مهمة تمزج لقطة شاشة أو مستندًا مع التعليمات — فالنموذج يقبل مدخلات الصور والفيديو.
- مرّر المُوجَّه نفسه عبر Ox Alpha ونموذجك الحالي. التعليمات نفسها، والأدوات نفسها، ودرجة الحرارة نفسها. لا تغيّر الإعداد بين التشغيلين.
- قيّم الإنجاز والجودة، لا الانطباع. هل أنهى المهمة؟ هل كانت المخرجات صحيحة من المحاولة الأولى؟ كم احتاج من توجيه؟
- اضغط على المدى الطويل. بنافذة سياق 1M رمز واستدلال مضبوط افتراضيًا على أقصى جهد، صُمِّم Ox Alpha للعمل المستمر. سؤال من دور واحد لن يكشف قدراته؛ أما تشغيل وكيلي من 20 دورًا فسيكشفها.
- اضبط الإعدادات بإنصاف. تدعم الواجهة جهد الاستدلال (max/high/low)، والأدوات وtool choice، والمخرجات المهيكلة، ودرجة الحرارة وtop_p/top_k — فتستطيع المقارنة في ظروف متطابقة وقابلة لإعادة الإنتاج.
بعض التحفّظات لضبط التوقعات: المزوّد مجهول خلال هذه المعاينة، ونافذة السعر المجاني على OpenRouter وأسبوع OpenCode المجاني قابلان للتغيّر، ولا شيء في هذا المقال يغني عن الصفحات الرسمية. ما تختبره هو النموذج كما هو اليوم — وهذه الطريقة النزيهة لتقييم إصدار خفي.
وإذا كنت تفضّل ألا تُعِدّ مفتاح واجهة برمجة للبدء، تحدّث مع Ox Alpha في متصفحك على glm5.app — نقطة الدخول المجانية عبر الويب — ونفّذ مهمتك الأولى خلال الدقائق الخمس القادمة.
الأسئلة الشائعة
هل لدى Ox Alpha معايير رسمية؟ لا. تتضمن بيانات OpenRouter المواصفات والتسعير ومراقبة الأداء، لكن من دون أي نتائج معايير للذكاء أو البرمجة أو العمل الوكيلي. كما أن Artificial Analysis لا تُدرج النموذج (تم التحقق في 22 أغسطس 2026).
ما نتيجة Ox Alpha على DeepSWE وKingbench؟ وفق اختبارات المجتمع: نحو 80% على مجموعة فرعية من DeepSWE من 10 مهام (مع Fable عند 65% وGPT-5.6 Sol عند 52% في التشغيل نفسه ذي العيّنة الصغيرة)، و87.5% على Kingbench خلف GLM-5.3 عند 91.25%. وكلتا النتيجتين بلاغ مجتمعي غير موثّق بشكل مستقل، وKingbench ليس معيارًا قياسيًا.
هل يمكنني الوثوق بنتائج المجتمع؟ كإشارات نعم، وكاستنتاجات لا. فهي تأتي من عيّنات صغيرة جدًا دون تحقّق مستقل. مرّرها عبر إطار الأسئلة الأربعة أعلاه — حجم العيّنة، وما يُقاس، ومن أجرى الاختبار، وتكافؤ المنهجية — قبل أن تزن أي رقم.
هل Ox Alpha سريع؟ تفيد مراقبة OpenRouter (وسيط P50 على نحو ثلاثة أيام) بإنتاجية 24 رمزًا في الثانية وزمن استجابة 5.81 ثانية، مع وقت تشغيل 99.99% وتوافر 99.14%. لاحظ أن الاستدلال إلزامي ومضبوط افتراضيًا على أقصى جهد، فتوقّع وقت تفكير في المهام الصعبة.
كيف أختبر Ox Alpha بنفسي؟ شغّل مهامك الحقيقية وجهًا لوجه مع نموذجك الحالي — المُوجَّهات نفسها، والأدوات نفسها، والإعدادات نفسها. وأسرع طريقة للبدء هي المحادثة المجانية عبر الويب على glm5.app؛ أما الواجهة عبر OpenRouter (مجانية خلال المعاينة) فتتيح الاختبار برمجيًا مع الأدوات والمخرجات المهيكلة.
Sources
- OpenRouter: Ox Alpha model page
- OpenRouter API: models endpoint
- OpenRouter: Stealth Model Terms
- OpenRouter Docs
- OpenCode Docs: models
آخر تحديث: 22 أغسطس 2026


