https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF
아주 간단하게 소개하면,
Qwen3.8 의 성능이 현재 작은 모델 중 넘사벽이다 보니
이것을 베이스로 온갖 실험이 진행되고 있고,
그런 결과물 중 하나입니다.
이러한 실험 모델이 나올 때 마다 그 내용을 보긴 하는데,
요즘은 테스트도 시들해져서... 봐도 기억도 잘 안나고
테스트도 해보진 않았습니다.
요점은...
양자화 기술로 용량을 많이 줄였는데도,
오리지널 성능에 거의 근접하게 나온다는 것으로,
이 모델이 의미가 있는 이유는
16GB VRAM에 13GB 이상 올리게 되면,
KV캐시가 너무 작아져서 실제 활용에는 불편함이 있었는데,
위의 내용처럼 되게 하면,
Q3 양자화 모델로도 원본 모델 비슷한 성능이 나올 수 있으니,
10GB 정도의 용량의 모델로 KV캐시 확보도 되는...
그런 의미로 보면 되겠습니다.
12gb인 제 3080은 참 애매하네요. ㅎㅎ
반응 속도도 빠르고..