Ox Alpha 벤치마크: 커뮤니티 점수 제대로 읽기
Aug 22, 2026

Ox Alpha 벤치마크: 커뮤니티 점수 제대로 읽기

Ox Alpha 벤치마크에 공식 점수는 없습니다. 커뮤니티의 DeepSWE·Kingbench 결과는 미검증 — 읽는 법과 직접 테스트하는 방법.

빠른 답변: Ox Alpha에는 공식 벤치마크 점수가 없습니다. stealth/ox-alpha의 OpenRouter 모델 페이지에는 지능·코딩·에이전틱 벤치마크가 전혀 없고, 독립 추적 사이트인 Artificial Analysis도 이 모델을 등재하지 않았습니다(2026년 8월 22일 확인). 돌아다니는 수치 — DeepSWE 10개 과제 부분집합에서 약 80%, "Kingbench"에서 87.5% — 는 커뮤니티가 보고한 것이고, 표본이 매우 작으며, 독립적으로 검증되지 않았습니다. Ox Alpha를 검토 중이라면, 이 글은 그 점수들이 실제로 무엇을 뜻하는지, 그리고 대신 어떤 신호를 봐야 하는지 설명합니다.

Ox Alpha 벤치마크를 찾아다녔다면 아마 같은 벽에 부딪혔을 겁니다. 2026년 8월 20일에 새 모델이 등장했고 X와 OpenCode 공지에서 화제인데, 막상 확실한 수치를 찾으면 공식 페이지는 침묵하고 커뮤니티 글은 방법론이 서로 어긋납니다. 프리뷰 기간 동안 제공자가 익명으로 남는 스텔스 모델에서는 그 침묵을 약점으로 오해하거나 리더보드 스크린샷으로 덮기 쉽습니다. 이 가이드는 OpenRouter 모델 등재 정보, 공개 API 데이터, 공개 공지를 근거로 하며 2026년 8월 22일 기준입니다. 저희가 직접 정식 벤치마크를 돌리지는 않았습니다. 목표는 다른 곳에서 보게 될 주장을 읽는 틀과, 실제로 존재하는 공식 데이터를 함께 제시하는 것입니다.

공식 점수판이 비어 있는 건 의도된 것

Ox Alpha는 2026년 8월 20일 OpenRouter에 공개됐습니다. 공식 등재 정보는 연동에 필요한 부분에서는 상세합니다. 1,048,576토큰(1M) 컨텍스트 윈도, 최대 131,072토큰 출력, 텍스트·이미지·비디오 입력과 텍스트 출력, 양방향 모두 100만 토큰당 0달러인 프리뷰 가격, 필수이면서 기본값이 최대 강도인 추론, 그리고 도구·tool choice·구조화 출력 지원까지. 포지셔닝도 명시적입니다. "코딩, 지속적인 에이전틱 작업, 프로덕션 워크로드를 위해 설계된 추론 모델"이며 "장기 소프트웨어 엔지니어링, 복잡한 추론, 텍스트와 시각적 맥락을 결합하는 워크플로"에 적합하다고 되어 있습니다.

등재 정보에 없는 것이 바로 벤치마크 점수입니다. 성능 섹션에 지능 지수도, 코딩 리더보드 수치도, 에이전틱 점수도 없습니다. 대부분이 가장 먼저 확인하는 독립 추적 사이트 Artificial Analysis는 이 모델을 추적하지 않습니다(2026년 8월 22일 확인). 그리고 점수를 맥락에 놓기 위해 보통 필요한 정보 — 제공자 신원, 아키텍처, 파라미터 수, 프리뷰 이후 가격 — 은 이번 프리뷰 기간에 공개되지 않습니다.

이건 분명히 짚어야 합니다. 공식 점수가 없다는 것은 등재 정보에 관한 사실이지, 성능에 관한 증거가 아닙니다. 스텔스 모델은 정식 출시 전에 규정되지 않으려는 이유 등으로 벤치마크를 건너뛰는 경우가 많습니다. 올바른 질문은 "왜 점수가 없나?"가 아니라 "그럼 대신 어떤 신호를 믿을 수 있나?"이고, 이 글의 나머지가 바로 그 답입니다.

커뮤니티가 보고하는 내용

두 수치가 돌고 있습니다.

1. DeepSWE 10개 과제 부분집합에서 약 80%. 한 커뮤니티 테스트가 Ox Alpha를 DeepSWE 10개 과제 부분집합에서 약 80%로 보고했습니다(커뮤니티 보고, 독립 검증 안 됨). 같은 소표본 비교에서 Fable은 65%, GPT-5.6 Sol은 52%입니다. 방법론에 주목하세요. 이건 벤치마크의 부분집합 — 전체 스위트가 아니라 열 개 과제 — 이므로 80%와 65%의 격차는 말 그대로 어느 쪽으로든 과제 몇 개 차이입니다.

2. Kingbench에서 87.5%. 한 커뮤니티 글은 Ox Alpha를 Kingbench에서 87.5%로, 91.25%인 GLM-5.3에 이어 2위로 보고했습니다(커뮤니티 보고, 독립 검증 안 됨). Kingbench는 표준 벤치마크가 아닙니다. 공개되고 감사 가능한 방법론이 없으며, 어떤 독립 연구소도 실행하지 않습니다. 잘해야 방향성 참고 정도로 받아들이세요.

또한 핑거프린트, 토크나이저, 비디오 인코더 비교를 근거로 Ox Alpha가 GLM 계열 모델의 숨겨진 멀티모달 변형일 수 있다는 추측도 있습니다(미확인, 순수 추측). 저희는 이 추측을 지지하지 않으며 여러분의 판단에 영향을 주어서도 안 됩니다. 다만 일부 스레드가 이 모델을 "코딩을 잘한다고 입증된"이 아니라 "코딩을 잘할 것으로 기대되는"으로 다루는 이유는 설명해 줍니다.

커뮤니티 벤치마크 읽는 법: 실전 프레임워크

대부분의 글은 수치를 되풀이할 뿐입니다. 보통 빠뜨리는 부분은 이것 — 커뮤니티 점수가 신뢰를 얻기 전에 던져야 할 네 가지 질문입니다.

질문 1: 표본이 얼마나 큰가? 10개 과제 결과는 과제당 약 10포인트씩 움직입니다. 운이 좋거나 나쁜 실행 한 번이 헤드라인 전체를 뒤집습니다. 경험칙: 50개 미만 과제에 기반한 점수는 결론이 아니라 신호로 취급하세요. 그 모델을 테스트해 볼 가치가 있다는 것은 알려주지만, 순위가 어디인지는 알려주지 않습니다.

질문 2: 그 벤치마크는 실제로 무엇을 측정하나? DeepSWE는 장기 소프트웨어 엔지니어링 벤치마크로, 모델이 이슈를 해결하기 위해 실제 저장소에서 여러 턴에 걸쳐 작업해야 합니다. 프로덕션의 에이전틱 작업과 닮았습니다. Kingbench는 방법론이 불분명(비표준)해서 무엇을 측정하는지조차 말할 수 없습니다. 단일 턴 QA 점수는 에이전틱 코딩 모델에 대해 거의 아무것도 알려주지 못하고, 그 반대도 마찬가지입니다. 수치를 가늠하기 전에 벤치마크의 작업 부하를 여러분의 작업과 맞춰 보세요.

질문 3: 누가 실행했고, 독립적으로 검증됐나? 커뮤니티 테스트는 동료 심사가 아닙니다. 테스트를 실행한 쪽이 결과에 이해관계가 있다면 — 벤더, 제휴사, 화제몰이 계정 — 그만큼 할인해서 보세요. 테스트의 시험대는 재현 가능성입니다. 정확한 과제 세트, 하네스, 모델 설정을 볼 수 있나요? 볼 수 없다면 그 수치는 측정이 아니라 주장입니다.

질문 4: 비교 조건이 동일한가? 모든 모델에 같은 과제 부분집합을 썼나요? 같은 temperature, 같은 툴링, 같은 시도 횟수인가요? DeepSWE 80% 비교는 내부적으로는 일관돼 보이지만, 여전히 한 당사자가 스스로 고른 부분집합을 실행한 결과입니다. 표의 어느 한 모델이라도 다른 조건에서 실행됐다면 표 전체가 무효입니다.

한 줄 요약: 커뮤니티 점수는 딱 한 가지, 후보군을 추리는 데 유용합니다. Ox Alpha를 다른 모델과 서열화하는 데는 쓸모가 없고, 아무도 감사하지 못한 스텔스 모델에서는 특히 약합니다.

더 나은 신호: 실제 사용량이 말해 주는 것

여기가 벤치마크를 좇는 글 대부분이 건너뛰는 공식 데이터입니다. OpenRouter의 Apps/Activity 화면은 실제 프로덕션 트래픽을 보여주는데, 출시 후 약 이틀 동안 Ox Alpha는 대략 6,570억 프롬프트 토큰과 79억 5천만 컴플리션 토큰을 소비했습니다. 트래픽 상위 다섯 개 애플리케이션은 전부 에이전틱 코딩 도구입니다. Hermes Agent(1,200억 토큰), Claude Code(1,080억), Oh-My-Pi(935억), 멀티모달 브리지를 갖춘 DeepSeek Harness(848억), ZCode(515억).

이게 왜 미검증 10개 과제 스크린샷보다 나을까요? 수천 명의 사용자가 실제의 장기 워크로드를 지속적으로 돌린 결과를 집계한 것이기 때문입니다. 에이전틱 도구는 존재하는 가장 혹독한 스트레스 테스트입니다. 여러 턴에 걸쳐 맥락을 유지하고, 도구를 호출하고, 실수에서 복구하며 계속 진행합니다. 팀들이 이틀 만에 6,570억 프롬프트 토큰을 한 모델로 흘려보내고 있다면, 그건 현실적인 부하에서의 유용성에 대한 증거입니다. 리더보드 순위의 증명은 아니지만, 10개 과제 주장보다는 훨씬 강한 신호입니다.

운영 측면에서 공식 모니터링(약 3일간 P50)은 초당 24토큰의 처리량, 5.81초의 지연, 99.99%의 가동률, 99.14%의 가용성을 보고합니다. 생태계 채택도 추세를 뒷받침합니다. Ox Alpha("Ox Alpha Free")는 OpenCode Go에 다음 한 주간 제한적 무료 기간으로 등재돼 있고, Go 사용량에 차감되지 않는 사실상 무제한 사용, 데이터 무보존, 동일한 1M 컨텍스트를 제공합니다. 이건 소문이 아니라 툴 벤더의 공개 약속입니다.

여러분의 작업이 장기 코딩과 에이전틱 과제라면 — 사용 데이터가 보여주는 바로 그 프로필입니다 — 지금 바로 glm5.app에서 Ox Alpha를 무료로 사용해 볼 수 있습니다.

Ox Alpha를 직접 벤치마크하는 방법

공개 데이터의 상태를 감안하면, 여러분의 용도에 가장 신뢰할 수 있는 벤치마크는 여러분이 직접 돌리는 것입니다. 구체적으로:

  1. 실제 업무에서 과제 3~5개를 고르세요. 잘 아는 저장소의 리팩터링, 여러 단계의 디버깅 세션, 도구 호출이 포함된 긴 에이전틱 실행, 또는 스크린샷이나 문서를 지시문과 함께 넣는 과제 — 이 모델은 이미지와 비디오 입력을 받습니다.
  2. 같은 프롬프트를 Ox Alpha와 현재 쓰는 모델에 각각 넣으세요. 같은 지시, 같은 도구, 같은 temperature. 실행 사이에 설정을 바꾸지 마세요.
  3. 느낌이 아니라 완수 여부와 품질을 채점하세요. 과제를 끝냈나요? 첫 시도에 결과가 정확했나요? 얼마나 손이 갔나요?
  4. 긴 호흡을 압박하세요. 1M 토큰 컨텍스트 윈도와 기본값이 최대 강도인 추론으로 Ox Alpha는 지속 작업을 위해 만들어졌습니다. 단일 턴 질문으로는 실력을 알 수 없습니다. 20턴짜리 에이전틱 실행이라면 알 수 있습니다.
  5. 공정하게 설정하세요. API는 reasoning effort(max/high/low), 도구와 tool choice, 구조화 출력, temperature, top_p/top_k를 지원하므로 동일하고 재현 가능한 조건에서 비교할 수 있습니다.

기대치를 맞추기 위한 몇 가지 주의사항: 이번 프리뷰 동안 제공자는 익명이고, OpenRouter의 무료 가격 기간과 OpenCode의 무료 주간은 바뀔 수 있으며, 이 글의 어떤 내용도 공식 페이지를 대신하지 않습니다. 여러분이 테스트하는 것은 오늘 존재하는 그대로의 모델이며, 그것이 스텔스 릴리스를 평가하는 정직한 방식입니다.

시작하려고 API 키까지 연결하고 싶지 않다면, glm5.app에서 브라우저로 Ox Alpha와 대화해 보세요. 무료 웹 진입점이며, 앞으로 5분 안에 첫 과제를 돌려볼 수 있습니다.

자주 묻는 질문

Ox Alpha에 공식 벤치마크가 있나요? 없습니다. OpenRouter 등재 정보에는 사양, 가격, 성능 모니터링은 있지만 지능·코딩·에이전틱 벤치마크 점수는 없습니다. Artificial Analysis도 이 모델을 등재하지 않았습니다(2026년 8월 22일 확인).

Ox Alpha는 DeepSWE와 Kingbench에서 몇 점을 받았나요? 커뮤니티 테스트 기준으로 DeepSWE 10개 과제 부분집합에서 약 80%(같은 소표본 실행에서 Fable 65%, GPT-5.6 Sol 52%), Kingbench에서 87.5%로 91.25%인 GLM-5.3에 이어 2위입니다. 두 결과 모두 커뮤니티 보고이며 독립 검증되지 않았고, Kingbench는 표준 벤치마크가 아닙니다.

커뮤니티 점수를 믿어도 되나요? 신호로는 예, 결론으로는 아니오. 독립 검증 없이 아주 작은 표본에서 나온 값입니다. 어떤 수치든 가늠하기 전에 위의 네 가지 질문 프레임워크 — 표본 크기, 무엇을 측정하는지, 누가 실행했는지, 방법론이 비교 가능한지 — 를 거치세요.

Ox Alpha는 빠른가요? OpenRouter 모니터링(P50, 약 3일)은 초당 24토큰 처리량과 5.81초 지연, 99.99% 가동률과 99.14% 가용성을 보고합니다. 추론이 필수이고 기본값이 최대 강도이므로 어려운 과제에서는 생각하는 시간이 든다는 점을 감안하세요.

Ox Alpha를 직접 벤치마크하려면? 현재 쓰는 모델과 실제 과제로 직접 맞붙여 보세요 — 같은 프롬프트, 같은 도구, 같은 설정으로. 가장 빠른 시작은 glm5.app의 무료 웹 채팅이고, OpenRouter를 통한 API(프리뷰 기간 무료)로는 도구와 구조화 출력을 써서 프로그램적으로 테스트할 수 있습니다.

Sources

마지막 업데이트: 2026년 8월 22일

지금 GLM 5를 시작하세요

GLM 5를 무료로 체험하세요 — 추론, 코딩, 에이전트, 이미지 생성을 하나의 플랫폼에서.

Ox Alpha 벤치마크: 커뮤니티 점수 제대로 읽기 - GLM 5