3일 전부터 집중적으로 테스트 중입니다만, 4.8 보다도 환각이 더 심하다고 느껴집니다.
가장 큰 문제점이 팩트체크를 안 하고 답변하는 부분으로, 코딩시에도 필수 사항을 확인하지 않고 대충 설계, 배선하는 부분인데 4.8보다 더 빈도가 높이져서 살짝 짜증스럽네요.
여전히 codex에게 감사 역할을 부여하거나 울트라코드 모드+goal문서 준수 형태로 돌려야 할 것 같습니다.
--------
조사를 해보니....
Anthropic 공식 수치도 환각 증가를 보여줍니다
시스템 카드의 AA-Omniscience 폐쇄형 지식 평가에서:
| 모델 | 정답 | 오답·환각 | 답변 거부 |
|---|---|---|---|
| Opus 4.8 | 약 60% | 약 17% | 약 23% |
| Opus 5 | 약 71% | 약 22% | 약 7% |
즉 Opus 5는 정답률이 약 11%p 올라갔지만, 환각도 약 5~6%p 증가했습니다. Anthropic도 이를 “전체적으로는 더 정확하지만 사실 주장을 약간 더 환각한다”고 직접 표현했습니다. 핵심은 Opus 5가 4.8보다 훨씬 덜 기권한다는 점입니다. 예전에는 “모르겠다”고 했을 질문에도 답을 시도하므로, 정답과 오답이 동시에 늘어난 구조입니다.