Ox Alpha Benchmark: Topluluk Skorları Nasıl Okunur
Aug 22, 2026

Ox Alpha Benchmark: Topluluk Skorları Nasıl Okunur

Ox Alpha benchmark sonuçları: resmi skor yok. Topluluğun DeepSWE ve Kingbench verileri doğrulanmadı — nasıl okunacağını öğrenin ve modeli kendiniz test edin.

Kısa cevap: Ox Alpha'nın resmi benchmark skoru yok. stealth/ox-alpha için OpenRouter model sayfasında zekâ, kodlama veya agentic benchmark'ı listelenmiyor ve bağımsız takip sitesi Artificial Analysis bu modeli listelemiyor (22 Ağustos 2026'da kontrol edildi). Dolaşan sayılar — 10 görevlik bir DeepSWE alt kümesinde yaklaşık %80 ve "Kingbench"te %87,5 — topluluk kaynaklı, küçük örneklemli ve bağımsız olarak doğrulanmamış. Ox Alpha'yı değerlendiriyorsanız bu yazı, o skorların gerçekte ne anlama geldiğini ve bunun yerine hangi sinyallere bakmanız gerektiğini anlatıyor.

Ox Alpha benchmark sonuçlarını arıyorsanız muhtemelen aynı duvara tosladınız: 20 Ağustos 2026'da yeni bir model çıktı, X'te ve OpenCode duyurusunda konuşuluyor, ama somut sayılara bakmaya kalktığınızda resmi sayfalar susuyor ve topluluk paylaşımları metodolojide birbiriyle çelişiyor. Sağlayıcısı önizleme boyunca anonim kalan bir stealth modelde bu sessizliği zayıflık sanmak ya da liderlik tablosu ekran görüntüleriyle üstünü örtmek çok kolay. Bu rehber, OpenRouter model kaydına, herkese açık API verilerine ve kamuya açık duyurulara dayanıyor; 22 Ağustos 2026 itibarıyla güncel. Kendimiz resmi bir benchmark çalıştırmadık; amaç, başka yerlerde göreceğiniz iddiaları okumak için bir çerçeve sunmak ve gerçekten var olan resmi verileri aktarmak.

Resmi Skor Tablosu Boş — Hem de Bilerek

Ox Alpha, 20 Ağustos 2026'da OpenRouter'da yayınlandı. Resmi kayıt, entegrasyon açısından önemli olan yerlerde ayrıntılı: 1.048.576 token (1M) bağlam penceresi, 131.072 token'a kadar çıktı, metin/görsel/video girişi ve metin çıktısı, her iki yönde de milyon token başına 0 $ önizleme fiyatı, zorunlu ve varsayılan olarak maksimum çabaya ayarlı reasoning, ayrıca araç, tool choice ve yapılandırılmış çıktı desteği. Konumlandırma açıkça yazıyor: "kodlama, sürekli agentic çalışma ve üretim yükleri için tasarlanmış bir akıl yürütme modeli"; "uzun soluklu yazılım mühendisliği, karmaşık akıl yürütme ve metni görsel bağlamla birleştiren iş akışları" için uygun.

Kayıtta olmayan şey ise benchmark skorları. Performans bölümünde ne zekâ endeksi, ne kodlama liderlik tablosu değeri, ne de agentic skor var. Çoğu kişinin ilk baktığı bağımsız takip sitesi Artificial Analysis bu modeli takip etmiyor (22 Ağustos 2026'da kontrol edildi). Skorları bağlama oturtmak için genellikle gereken ayrıntılar — sağlayıcı kimliği, mimari, parametre sayısı ve önizleme sonrası fiyatlandırma — bu önizleme süresince açıklanmıyor.

Bunu açıkça söylemek gerek: resmi skorların yokluğu, kayıtla ilgili bir olgudur; yetenek hakkında bir kanıt değildir. Stealth modeller sıklıkla benchmark yayınlamaz; kısmen tam sürümden önce bir yere sabitlenmemek için. Doğru soru "neden skor yok?" değil, "peki bunun yerine hangi sinyale güvenebilirim?" — yazının geri kalanı da tam olarak bunu yanıtlıyor.

Topluluk Ne Bildiriyor

İki sayı dolaşımda:

1. 10 görevlik DeepSWE alt kümesinde yaklaşık %80. Bir topluluk testi, Ox Alpha'yı DeepSWE'nin 10 görevlik bir alt kümesinde yaklaşık %80'de gösteriyor (topluluk bildirimi, bağımsız doğrulanmamış). Aynı küçük örneklemli karşılaştırma Fable'ı %65, GPT-5.6 Sol'u %52'de konumlandırıyor. Metodolojiye dikkat: bu, benchmark'ın bir alt kümesi — on görev, tüm set değil — yani %80 ile %65 arasındaki fark kelimenin tam anlamıyla iki yönde de birkaç görev demek.

2. Kingbench'te %87,5. Bir topluluk yazısı Ox Alpha'yı Kingbench'te %87,5 ile, %91,25'lik GLM-5.3'ün ardından ikinci sırada gösteriyor (topluluk bildirimi, bağımsız doğrulanmamış). Kingbench standart bir benchmark değil: yayımlanmış, denetlenebilir bir metodolojisi yok ve hiçbir bağımsız laboratuvar onu çalıştırmıyor. Bu sayıyı en fazla yön gösterici olarak değerlendirin.

Ayrıca parmak izi, tokenizer ve video kodlayıcı karşılaştırmalarına dayanan bir spekülasyon var: Ox Alpha, GLM serisi bir modelin gizli çok modlu bir varyantı olabilir (doğrulanmamış, tamamen spekülasyon). Bu tahmini desteklemiyoruz ve kararınızı etkilememeli — ama bazı tartışmaların modeli "kodlamada iyi olduğu kanıtlanmış" yerine "kodlamada iyi olması beklenen" diye ele almasını açıklıyor.

Topluluk Benchmark'ları Nasıl Okunur: Pratik Bir Çerçeve

Çoğu yazı sadece sayıları tekrarlıyor. Genelde atladıkları şey şu — bir topluluk skoru güveninizi hak etmeden önce sorulacak dört soru.

Soru 1: Örneklem ne kadar büyük? 10 görevlik bir sonuç, görev başına yaklaşık 10 puan oynar. Tek bir şanslı ya da şanssız çalıştırma tüm başlığı değiştirir. Kural: 50 görevden az bir örnekleme dayanan her skoru sinyal olarak görün, sonuç olarak değil. Size bir modelin test edilmeye değer olduğunu söyler; nerede sıralandığını söylemez.

Soru 2: Benchmark gerçekte neyi ölçüyor? DeepSWE uzun soluklu bir yazılım mühendisliği benchmark'ı — model, bir sorunu çözmek için gerçek bir depoda birçok tur boyunca çalışmak zorunda. Bu, üretimdeki agentic işe benziyor. Kingbench'in metodolojisi belirsiz (standart dışı), dolayısıyla neyi ölçtüğünü bile söyleyemezsiniz. Tek turluk bir soru-cevap skoru, agentic bir kodlama modeli hakkında neredeyse hiçbir şey söylemez; tersi de geçerli. Sayıyı tartmadan önce benchmark'ın iş yükünü kendi iş yükünüzle eşleştirin.

Soru 3: Kim çalıştırdı ve bağımsız olarak doğrulandı mı? Topluluk testleri hakem değerlendirmesi değildir. Testi yapan kişinin sonuçta çıkarı varsa — satıcı, iş ortağı, hype hesabı — bunu iskonto edin. Bir testin testi tekrarlanabilirliktir: tam görev setini, harness'ı ve model yapılandırmasını görebiliyor musunuz? Göremiyorsanız o sayı bir ölçüm değil, bir iddiadır.

Soru 4: Karşılaştırmalar denk mi? Her model için aynı görev alt kümesi mi kullanıldı? Aynı sıcaklık, aynı araç seti, aynı deneme sayısı mı? %80'lik DeepSWE karşılaştırması kendi içinde tutarlı görünüyor, ama yine de tek bir tarafın çalıştırdığı, kendi seçtiği bir alt küme. Tablodaki herhangi bir model farklı koşullarda çalıştırıldıysa tablonun tamamı geçersizdir.

Tek cümlelik özet: topluluk skorları tam olarak tek bir işe yarar — kısa liste oluşturmaya. Ox Alpha'yı diğer modellere karşı sıralamak için işe yaramazlar ve kimsenin denetleyemediği bir stealth model söz konusu olduğunda özellikle zayıftırlar.

Daha İyi Sinyaller: Gerçek Kullanım Ne Diyor

İşte benchmark peşindeki yazıların çoğunun atladığı resmi veri kısmı. OpenRouter'ın Apps/Activity görünümü gerçek üretim trafiğini gösteriyor ve lansmandan sonraki yaklaşık iki günde Ox Alpha yaklaşık 657 milyar prompt token'ı ve 7,95 milyar completion token'ı tüketti. En çok trafiği getiren beş uygulamanın tamamı agentic kodlama aracı: Hermes Agent (120 milyar token), Claude Code (108 milyar), Oh-My-Pi (93,5 milyar), çok modlu köprüsüyle DeepSeek Harness (84,8 milyar) ve ZCode (51,5 milyar).

Bu neden doğrulanmamış 10 görevlik bir ekran görüntüsünü geçer? Çünkü gerçek, uzun soluklu iş yüklerini sürekli çalıştıran binlerce kullanıcı üzerinden toplanmış. Agentic araçlar var olan en zorlu stres testidir: bağlamı birçok tur boyunca tutar, araç çağırır, hatalardan toparlanır ve devam eder. Ekipler iki günde bir modelden 657 milyar prompt token geçiriyorsa, bu gerçekçi yük altında fayda kanıtıdır — liderlik tablosu sıralamasının kanıtı değil, ama 10 görevlik bir iddiadan çok daha güçlü bir sinyal.

Operasyonel tarafta resmi izleme (yaklaşık üç günlük P50) saniyede 24 token verim, 5,81 saniye gecikme, %99,99 çalışma süresi ve %99,14 erişilebilirlik bildiriyor. Ekosistem benimsemesi eğilimi doğruluyor: Ox Alpha ("Ox Alpha Free") OpenCode Go'da önümüzdeki bir hafta için sınırlı ücretsiz pencereyle, Go kotasına sayılmayan neredeyse sınırsız kullanımla, sıfır veri saklamayla ve aynı 1M bağlamla listeleniyor. Bu bir söylenti değil, bir araç sağlayıcısının kamuya açık taahhüdü.

İşiniz uzun soluklu kodlama ve agentic görevlerse — kullanım verilerinin gösterdiği tam profil — hemen şimdi Ox Alpha'yı glm5.app'te ücretsiz deneyebilirsiniz.

Ox Alpha'yı Kendiniz Nasıl Test Edersiniz

Kamuya açık verilerin durumu göz önüne alındığında, kendi kullanım senaryonuz için en güvenilir benchmark sizin çalıştırdığınızdır. Somut olarak:

  1. Gerçek işinizden 3–5 görev seçin. Bildiğiniz bir depoda refactor, çok adımlı bir hata ayıklama oturumu, araç çağrılı uzun bir agentic çalıştırma ya da bir ekran görüntüsünü veya belgeyi talimatlarla birleştiren bir görev — model görsel ve video girişini kabul ediyor.
  2. Aynı prompt'u hem Ox Alpha'dan hem de mevcut modelinizden geçirin. Aynı talimatlar, aynı araçlar, aynı sıcaklık. Çalıştırmalar arasında kurulumu değiştirmeyin.
  3. His değil, tamamlanma ve kaliteyi puanlayın. Görevi bitirdi mi? Çıktı ilk denemede doğru muydu? Ne kadar yönlendirme gerekti?
  4. Uzun soluğu zorlayın. 1M token bağlam penceresi ve varsayılan maksimum çabaya ayarlı reasoning ile Ox Alpha sürekli çalışma için tasarlanmış. Tek turluk bir soru ne yapabildiğini göstermez; 20 turluk bir agentic çalıştırma gösterir.
  5. Adil ayarlayın. API; reasoning effort (max/high/low), araçlar ve tool choice, yapılandırılmış çıktı, temperature ve top_p/top_k destekliyor — böylece aynı, tekrarlanabilir koşullarda karşılaştırabilirsiniz.

Beklentileri ayarlamak için birkaç uyarı: sağlayıcı bu önizleme boyunca anonim, OpenRouter'daki ücretsiz fiyat penceresi ve OpenCode'un ücretsiz haftası değişebilir ve bu yazıdaki hiçbir şey resmi sayfaların yerini tutmaz. Test ettiğiniz şey modelin bugünkü hâli — bir stealth sürümü değerlendirmenin dürüst yolu da budur.

Başlamak için API anahtarı bağlamak istemiyorsanız, glm5.app üzerinde Ox Alpha ile tarayıcınızda sohbet edin — ücretsiz web giriş noktası — ve ilk görevinizi önümüzdeki beş dakikada çalıştırın.

SSS

Ox Alpha'nın resmi benchmark'ları var mı? Hayır. OpenRouter kaydında teknik özellikler, fiyatlandırma ve performans izleme var; ancak zekâ, kodlama veya agentic benchmark skoru yok. Artificial Analysis modeli listelemiyor (22 Ağustos 2026'da kontrol edildi).

Ox Alpha DeepSWE ve Kingbench'te ne aldı? Topluluk testlerine göre: 10 görevlik DeepSWE alt kümesinde yaklaşık %80 (aynı küçük örneklemli çalıştırmada Fable %65, GPT-5.6 Sol %52) ve Kingbench'te %87,5 ile %91,25'lik GLM-5.3'ün ardında. Her iki sonuç da topluluk bildirimi olup bağımsız doğrulanmamıştır; Kingbench standart bir benchmark değildir.

Topluluk skorlarına güvenebilir miyim? Sinyal olarak evet, sonuç olarak hayır. Bağımsız doğrulaması olmayan çok küçük örneklemlerden geliyorlar. Herhangi bir sayıyı tartmadan önce yukarıdaki dört soruluk çerçeveden geçirin: örneklem büyüklüğü, ne ölçüldüğü, kimin çalıştırdığı, metodolojinin karşılaştırılabilirliği.

Ox Alpha hızlı mı? OpenRouter'ın izlemesi (P50, yaklaşık üç gün) saniyede 24 token verim ve 5,81 saniye gecikme bildiriyor; çalışma süresi %99,99, erişilebilirlik %99,14. Reasoning'in zorunlu olduğunu ve varsayılan olarak maksimum çabaya ayarlandığını unutmayın — zor görevlerde düşünme süresi bekleyin.

Ox Alpha'yı kendim nasıl test ederim? Kendi gerçek görevlerinizi mevcut modelinizle karşı karşıya çalıştırın — aynı prompt'lar, aynı araçlar, aynı ayarlar. Başlamanın en hızlı yolu glm5.app'teki ücretsiz web sohbeti; OpenRouter üzerinden API (önizleme boyunca ücretsiz) araçlar ve yapılandırılmış çıktıyla programatik test yapmanızı sağlar.

Sources

Son güncelleme: 22 Ağustos 2026

GLM 5'i Bugün Kullanmaya Başlayın

GLM 5'i ücretsiz deneyin — akıl yürütme, kodlama, ajanlar ve görsel oluşturma tek platformda.

Ox Alpha Benchmark: Topluluk Skorları Nasıl Okunur - GLM 5