
중국 모델들은
마치 GPT 와 클로드 처럼...
각각 다른 특성을 갖고 있습니다.
서로 인력도 빼가고 기술도 베끼는 것이 일반적인 생각의 틀 밖에 있고,
또 그걸 자연스럽게 받아들이는 문화여서...
어찌 보면 베끼기고, 또 어찌 보면 서로 기술 주고 받기나 다름 없는 식이라고 할 수 있습니다.
여튼, Qwen3.8 Max의 벤치 성능은 테스트 영역에 따라 갈리며,
대략 클로드4.6 수준과 페이블 5 수준이 나오는...복합성을 갖습니다.
그런데 눈여겨 볼 지점이 있습니다.
클로드와 GPT 중 GPT는 토큰 절약의 명수인 오픈AI의 모델 답게
최적화 끝판왕이라고 할 수 있습니다.
게다가 순수 지능도 가장 높습니다.
지능 높고 최적화 잘 되고... 그럼 압도적인 가성비가 될 수 있습니다.
GPT5.6 Sol은 그러니까 중국 모델이 당분간 넘보긴 어려운 영역에 있기도 하거니와
또 쫒아 가려고 하면 더 달아나 있을 그런 성격으로 보입니다.
https://hehee9.github.io/2026-CSAT/
그런데 위 수능 테스트와 공개 된 벤치 항목들을
종합해서 보자면,
GPT가 클로드를 능가 하는 가성비가 가능했던...
토큰 사용량 최적화에서 Qwen에서 돌파구를 찾은 것 같습니다.
즉, 벤치로는 가성비가 있어 보이는데,
실제로는 같은 작업의 완료 테스트 항목 같은
실제 상황과 맞물리는 해석이 가능한 케이스에서
중국 모델은 꽤 많이 쳐져서,
동 작업 대비 GPT에 비해 눈꼽만큼...
API 비용은 상당한 차이로 싸지만 실제 가업 완료 기준으로는 아주 조금의 차이라는 것은,
그 만큼 실질적 지능의 효율이 부족하다는 것이었는데,
Qwen3.8에선 이런 점에서 개선 기술의 개발이 이뤄진 것으로 보입니다.
요즘 가장 많이 보는 소프트웨어 관련 벤치들과 위의 수능 테스트는...
대개 목적이 이렇습니다.
그래서...AI.. 알겠는데 그래서...
결과를 그냥 내는 것이 아니라.. 제대로 만들어 낼 줄 아느냐...그리고 얼마나 걸리느냐...
구현 목적의 복잡성으로 인한 포기는 없느냐와 같은...
아주 딮한 단계로 진입해 있고,
여기에서 중국 모델이 약했었다는 것입니다.
그런데 이게 나아지네요.
프런티어 모델과의 격차가 .. 단순 수치로는 거의 따라 온 것 같아도,
사실은 보는 이상으로 큰 차이가 있었다는 것이....
엊그제까지의 일이라면,
Qwen3.8 Max가 돌파구를 열어
실질적 격차도 제법 줄었다고 볼 수 있을 것 같습니다.
지능킹에 가성비가 못지 않은...GPT로 인해 ...
굳이? 였던 중국 사용자들은 자국 신 모델 중 둘이 치고 나오고 있으니...
프로젝트를 맡을 때 이제는
과장 광고 같은 점수 과적합 이슈가 있었던 것에서 탈피하여
Qwen3.8을 대충 끼워 넣어도 별 문제가 아니게 될 정도가 된 것 같습니다.
기존에도 만족하셨던 분들이라면... 더욱 그러할 것이고요.
아쉽게도 검열은... 중국 모델 특유의 종특이... 좀 있는 편이라고 합니다.
GPT의 해자가 없다는 말은 아닙니다.
중국 모델의 지능은 GPT에 미칠 정도는 아니고,
앞으로도 잘 하던 이가 잘 할 것이라는 기준에서 보면,
GPTX의 해자는 여전히 그리고 앞으로도 유지 된다고 보는 것이 타당할 것입니다.
다만, 약점의 극복과 가성비... 그로 인한 실용성 측면에서
의미가 있어 보입니다.
Qwen 3.8 max 는 소넷 5 max 급으로 보이네요.
단, 확실한것은 소넷5보더 훨씬 경제적입니다.
해당 지표는 ... 남들에게 보여주기 식으로는 저도 인용을 하는데,
외려 그 안에 보면 오늘 말하고자 하는 내용인
작업 대비 토큰 비용 같은.. 그런 것들을 주로 봅니다.
실제로 유용한지 판별하는 쪽으로요.
예를 들면 현재 지능이 가장 높고 유용한 것은 Sol이라고 생각하는데,
오푸스5가 앞에 있고... 뭐... 여러가지 그런 것들이 있습니다.
여론조사에서.. 추이를 본다는 식으로.. 참고만 하는 정도...
수능을 가져온 것은 이게 더 신뢰가 높다는 것이 아니라
음... 이런 거죠.
말씀하신 그 벤치 종합이 아니라,
수능을 .. 그 많은 벤치 중 하나의 항목 정도로 보고,
그 항목을 보면서... 문제 해결 능력...
즉 보고 싶은 것을 보고, 그 보고 싶은 해결 능력이
괜찮은가를 디테일하게 뜯어 보기 위한...
그래서 작업 당 토큰 소모 같은 것을 상세히 보기 위한...
장치 정도로 보시면 좋겠습니다.
프런트엔드를 볼 때
펠리컨 테스트 하는 것처럼요.