유튜버 소울시커 올라온 내용보고, 바로 설치 사용했는데
Qwen3.8-Flash-Next 모델을 16G(8G 가능) GPU + 64GB 주메모리면 동작 시킬 수 있습니다. (IQ3_XXS )
기술적으로는 모델을 통으로 GPU 올리는 것이 아닌 메모리에 올려 두고 실제 동작하는 모델만 GPU로 빠르게 전송하여 연산하는 방식 입니다 (최대한 간단히 설명)
즉 주메모리를 중간 cache 개념으로 두고 추가의 최적화 기법을 두어 GPU 메모리 한계를 해결하는 방법입니다.
즉 5090 32G x2 대는 있어야 하는 상황에서 12G GPU에서도 Qwen3.8-Flash-Next 를 동작하게 합니다.
제 PC 기준으로,
5070 ti (16G) + 64G DDR5 + NVMe (5.0) 4TB 에서 매우 매우 쾌적하고 빠르게 동작 합니다.
직전에 QWEN 3.8 27B 사용을 위해서 4bit 짜리로 5070 ti + 2070 super 합쳐서 억지 24G (실제는 모두 사용 불가)로 사용 때 겨우 20 token out 인데 Strata 에 5070 ti 만으로 날아 갑니다! 엄청난 속도! 100 token 도 쉽게 나옵니다 (IQ3_XXS)
다만 코딩용 모델(Coder )은 쓰레기 급이고(한글 입력 O 출력 X), IQ2_XS 도 쉽게 무한루프 돕니다.
64G 메인 메모리에 다른 앱 응용으로는 IQ3_XXS 로 잘 됩니다. (Android studio + cline)
메모리만 더 있으면(96G 필요) IQ4_XS 사용하여 최고의 품질을 기대할 수 있지 않을 까 합니다.
상세 내용은 아래를 방문하고 검색 해 보시면 정보를 더 얻어실 수 있습니다.
https://github.com/Niko1221/Strata
필요사양만 요약-
| Graphics card | NVIDIA GeForce RTX 20, 30, 40 or 50 series, or AMD Radeon RX 7900 XT / XTX, RX 7800 XT / 7700 XT, RX 9060 XT, RX 9070 / 9070 XT, Radeon AI PRO R9700 or RX 6800 / 6900 series. It needs 12 GB of VRAM or more. |
| RAM | 32 GB or more. Your RAM decides which model fits. 64 GB runs every size. |
| Disk | About 80 GB free. Use an SSD if you can: the first start is much faster. |
| System | Windows 10 / 11 or Linux, and a current graphics driver from NVIDIA or AMD. |