파벨 후린이라는 AI 뉴스레터 사장이 본인이 만든 버그 벤치마크를 통해
11개 프런티어 모델을 동일 조건하에서,
105개 숨어 있는 버그를 찾는 명령을 내렸고 결과는 이미지와 같이 나왔습니다.
GPT 5.6 Sol(max) 70달러, 163분, 42개 수정.
GPT 5.6 루나(max) 1.8달러, 85분, 33개 수정.
Fable 5(max) 105달러, 57분, 29개 수정.
Opus 5(max) 51달러, 60분, 27개 수정.
Kimi K3(high) 25달러, 108분, 21개 수정.
Qwen3.8-Max(high) 31달러, 148분, 19개 수정
Grok 4.5 8달러, 25분, 19개
Qwen은 다른 열 개 모델에서 찾지 못한 버그를 수정했으나,
실행만 하는데 5번 시도를 했고 한 코딩 에이전트가 30분만에 5시간 쿼터를 사용해버렸다고 합니다.
수작업으로 표를 해석하고 글을 쓰다가
AI 한테 저 이미지를 돌려보면 바로 분석 결과를 알려줄텐데 참... 바보 같습니다.
AI 이미지 분석 결과는 아래와 같아요.
🏆 시간/비용 종합 효율 TOP 5 모델
1위: GPT-5.6 Luna (effort MAX) — 압도적인 종합 1위
-
해결한 버그: 64개 (3위)
-
비용/시간: $1.80 / 85분 44초
-
평가: 버그를 64개나 찾아내는 최상위권 성능을 보여주면서도, 비용은 단 $1.80밖에 들지 않았습니다. 버그 1개를 찾는 데 약 $0.028, 약 1.34분이 소요되어 성능과 비용의 밸런스가 가장 완벽한 모델입니다.
2위: GPT-5.6 Luna (high) — 극강의 저비용 모델
-
해결한 버그: 35개
-
비용/시간: $0.57 / 64분 5초
-
평가: 전체 15개 테스트 중 비용이 가장 저렴($0.57)합니다. 버그 1개를 찾는 데 약 $0.016밖에 들지 않아, 가벼운 작업에서 비용을 아끼고 싶을 때 최고의 선택입니다.
3위: Grok 4.5 (high) — 최고의 속도(시성비) 모델
-
해결한 버그: 23개
-
비용/시간: $8.40 / 24분 52초
-
평가: 테스트된 모델 중 가장 빠른 시간(약 24분) 안에 벤치마크를 끝냈습니다. 버그 1개당 소요 시간이 약 1분 8초 수준으로 가장 짧으며 비용도 합리적이라 빠른 결과가 필요할 때 탁월합니다.
4위: GPT-5.6 Sol (high - re-run) — 고성능 모델 중 최고의 효율
-
해결한 버그: 62개 (2위)
-
비용/시간: $33.92 / 66분 40초
-
평가: 최고 성능 모델인 Sol (MAX) 버전이 비용 $69.61에 163분이 걸린 반면, 이 옵션은 버그 해결 수는 62개로 비슷하게 유지하면서 시간과 비용을 절반 수준으로 획기적으로 줄였습니다.
5위: DeepSeek V4-Flash — 준수한 초저가 모델
-
해결한 버그: 14개
-
비용/시간: $1.52 / 48분 28초
-
평가: 찾아낸 버그의 절대적인 개수는 적지만, 비용이 $1.52로 두 번째로 저렴합니다.
⚠️ 추천하지 않는 비효율적인 모델 (워스트 2)
-
가장 비싼 모델 (비용 비효율 1위): Fable 5 (effort MAX)
-
버그를 34개 찾았으나, 비용이 $104.49로 전체 모델 중 압도적으로 가장 비쌉니다. (비슷한 성능인 GPT-5.6 Luna(high)의 비용이 $0.57인 것과 대조적입니다.)
-
-
가장 느린 모델 (시간 비효율 1위): Qwen3.8-Max
-
버그 25개를 찾는 데 무려 148분 7초가 걸렸습니다. 비용($31.10) 대비 너무 많은 시간이 소모됩니다.
-
📊 전체 모델 1버그당 효율 순위표
(기준: 1버그당 소요된 비용이 저렴한 순서)
| 순위 | 모델명 (옵션) | 1버그당 비용 | 1버그당 시간 | 총 해결 / 총 비용 / 총 시간 |
| 1 | GPT-5.6 Luna (high) | $0.016 | 1.83분 | 35개 / $0.57 / 64m 5s |
| 2 | GPT-5.6 Luna (effort MAX) | $0.028 | 1.34분 | 64개 / $1.80 / 85m 44s |
| 3 | DeepSeek V4-Flash | $0.108 | 3.46분 | 14개 / $1.52 / 48m 28s |
| 4 | Grok 4.5 (high) | $0.365 | 1.08분 (최단) | 23개 / $8.40 / 24m 52s |
| 5 | DeepSeek V4-Pro | $0.503 | 2.51분 | 11개 / $5.54 / 27m 37s |
| 6 | GPT-5.6 Sol (high - re-run) | $0.547 | 1.08분 | 62개 / $33.92 / 66m 40s |
| 7 | GPT-5.6 Sol (effort MAX) | $0.848 | 2.00분 | 82개 (최다) / $69.61 / 163m 48s |
| 8 | Kimi K3 (high) | $0.935 | 3.99분 | 27개 / $25.27 / 107m 48s |
| 9 | Sonnet 5 (high) | $1.163 | 2.53분 | 13개 / $15.12 / 32m 53s |
| 10 | Qwen3.8-Max | $1.244 | 5.92분 (최장) | 25개 / $31.10 / 148m 7s |
| 11 | Opus 5 (high) | $1.435 | 1.38분 | 27개 / $38.77 / 37m 20s |
| 12 | Opus 5 (effort MAX) | $1.770 | 2.07분 | 29개 / $51.33 / 59m 58s |
| 13 | Opus 4.8 (high) | $1.935 | 3.49분 | 10개 / $19.35 / 34m 52s |
| 14 | Fable 5 (high) | $2.521 | 1.16분 | 27개 / $68.08 / 31m 20s |
| 15 | Fable 5 (effort MAX) | $3.073 | 1.68분 | 34개 / $104.49 (최고가) / 57m 15s |