GLM 5.3 자체 벤치마크 점수입니다.
| 벤치마크 카테고리 / 이름 | GLM-5.3 | GLM-5.2 | Kimi K3 | DeepSeek-V4 Pro-0813 | Qwen3.8-Max | Claude Opus 4.8 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|---|---|---|
| Terminal Bench 2.1 | 88.2 | 81.0 | 88.3 | 87.9 | 86.6 | 85.0 | 88.0 | 88.8 |
| Terminal Bench 3.0 | 28.3 | 4.6 | 17.4 | - | 21.1 | 33.7 | 34.6 | - |
| DeepSWE v1.1 | 66.9 | 46.2 | 67.5 | 62.7 | 56.6 | 58.0 | 69.7 | 72.7 |
| NL2Repo | 58.0 | 48.9 | 58.0 | 61.1 | 55.9 | 69.7 | - | - |
| ProgramBench (Almost Solved) | 19.0 | 9.5 | 17.5 | - | 10.5 | 15.5 | 33.0 | 23.0 |
| FrontierSWE | 78.1 | 67.5 | - | - | - | 66.5 | 88.2 | - |
| SWE-Marathon v1.1 | 42.5 | 19.4 | 48.1 | - | 48.8 | 33.1 | 42.5 | - |
| PostTrainBench | 39.8 | 31.7 | 32.0 | - | - | 32.9 | 41.8 | 36.2 |
| CyberGym | 84.5 | 77.2 | 80.0 | 83.3 | 78.5 | 78.1 | 83.8 | 83.6 |
| ExploitGym (2h / 6h) | 105 / 130 | 29 / 39 | 36 / 70 | - | 14 / 26 | 80 / 120 | 181 / 247 | 216 / 293 |
| ExploitBench | 54.4 | 24.4 | 32.2 | - | 28.8 | 40.0 | 78.0 | 76.5 |
| Agentic Toolathlon Verified | 73.0 | 59.9 | 76.5 | 74.1 | 72.5 | 76.2 | 74.7 | 74.9 |
| AutomationBench v1.0.6 | 48.2 | 26.2 | 46.7 | 43.2 | 39.8 | 41.0 | 46.2 | 45.8 |
| Agents' Last Exam (ALE-CLI) | 28.5 | 23.8 | 27.6 | 25.7 | 27.0 | 25.7 | 23.8 | 28.6 |
| HLE w/ Tools | 62.5 | 54.7 | 59.8 | 60.0 | 56.2 | 57.9 | 63.9 | 64.5 |
| GDPval-AA v2 | 1769 | 1508 | 1682 | 1590 | 1739 | 1588 | 1743 | 1730 |
2주뒤 가중치 발표 예정입니다.
벤치마킹 점수 기준으로 CyberGym 기준, 사이버 보안 능력이 전 세계 1위라고 합니다.
참고로 허깅페이스 해킹 사태 때 OpenAI ChatGPT에 대응했던게 GLM 5.2 이었죠?
아무튼 놀랍습니다.
딥시크 가격 인상 관련해서 구체적인 정보가 나왔군요.
뭔가 할인도 하고 가격도 인상되고 짬뽕이라 정리하기는 조금 어렵지만 공식 문서 기준입니다.
피크 기준 v4 flash out 4.71배 상승. v4 pro 4.55배 상승. 피크 대비 오프 피크 시간대는 50% 정도 상승이구요.
우리나라 기준 피크 시간은 10~13시, 15~19시 입니다.