

3.8 속도가 장점이라고 올린 게시물에 고전 조롱밈이 달리네요
벤치마크가 아무리 좋다고 한들 실사용이랑은 확실히 좀 괴리가 있는 것 같아요
3.7 때도 벤치마크는 엄청 좋다고 했지만..
특히 일반인 기준에선 판단력은 떨어지지만 속도가 빠르고 가성비가 좋은 대형 api처리보다는
추론도 길게 하고 일관성도 있고 통찰이 높은모델이 더 중요하니까요...


3.8 속도가 장점이라고 올린 게시물에 고전 조롱밈이 달리네요
벤치마크가 아무리 좋다고 한들 실사용이랑은 확실히 좀 괴리가 있는 것 같아요
3.7 때도 벤치마크는 엄청 좋다고 했지만..
특히 일반인 기준에선 판단력은 떨어지지만 속도가 빠르고 가성비가 좋은 대형 api처리보다는
추론도 길게 하고 일관성도 있고 통찰이 높은모델이 더 중요하니까요...
"어떤 자리에서나 극단적인 편견에 치우친 말일수록 목청이 높다. 극단적인 편견이란 남의 말을 받아들일 생각이 전혀 없는 생각이기 때문에 그걸 나타내는 목소리까지도 우선 배타적이다. 남의 목소리를 철저하게 배제하려면 제 목청을 높일 수 밖에 없다. 남의 생각을 조금이라도 받아들일 태세가 돼 있으면 그건 이미 극단적인 편견이 아니다. 극단적인 편견이 때로는 옳은 생각일 수도 있지만, 그게 혐오감을 주는 이유는 바로 그 폐쇄성 때문에 그 이상의 발전을 기대할 수 없기 때문이다." - 박완서, '특혜보다는 당연한 권리를'
신모델 나오면 항상 '이번엔 다른 거 같다' '이정도면 쓸만한 것 같다' 라고 하는 사람들이 있지만
며칠, 몇 주만 지나도 결국 프론티어 모델로 돌아가는 거 같습니다.
저도 써봤는데 chatpgt나 클로드에서 넘어갈 이유가 하등 보이질 않네요
luna만도 못해요
벤치마크에서만 1등하는거 정말 쓸모없는 일인데..프로모델이 나오지 않는 이상은 답 없는 것 같습니다.
답변은 그럴싸하게 대답하고 아니잖아? 하면 맞아요 아니에여 식의 답변만 사라져도 쓸 것 같은데.. 3.8은 과연..
아니면 구글의 한계일까요?
TPU의 한계가 곧 구글의 한계 아닐까요..ㅎㅎ
gpt가 codex 5.3 spark를 삐르게 하기 위해서 어떤 짓(?)을 했는지 보고 반성 (gemini가 반성)해야한다고 봅니다..