보통 로컬 LLM 돌리는데 글카 vram이 모자르면 꽝인데...
Strata?라는게 있나봐요. LLM엔진?
메인 메모리와 GPU를 나눠 쓰는 Strata로 125B MoE를 돌릴수 있고 expert를 RAM에 두고 CPU가 전부 계산하면 18 tok/s 전후인 경우가 많은데, Strata는 attention만 VRAM에 고정하고 자주 쓰는 expert만 캐시한 뒤 vram에 올리나봅니다.
뭘 압축해서 가지고 있다가 후다닥 VRAM 에 풀어서 쓰는 거라 그냥 양자화와는 다르다...? 뭐 그래 들립니다.
NVIDIA만의 얘기가 아니고 AMD도 되고 디코드 50–70 tok/s, 워밍 후 80 tok/s대, 같은 가중치 기준 2배 이상이라는 측정도 있나 봅니다.
근데... 모델이 Qwen3.8-Flash-Next 계열만 되고 대충 메모리는 32기가는 넘어야 되나봐요.
대화형 코딩에는 쓸 만하고, 범용 엔진이나 자율 루프의 대체는 아니라는 모양이네요.
AMD? 는 글카하나가 무난한 모양인데 7900xtx랑 주 메모리64기가 컴이라 난가!? 하면서 관심이 가는군요. 🤔
뭐 사실 걍 구독이 갑이네 하다가도 간간히 뭐 나왔대! 하면 그으래?? 하면서 관심가네요...
긍까요 ...
뭔가 필요한것만 빡빡 압축해서 갖고있다가 vram에 딱 필요한것만 샥 풀고해서... 잘...?
되는 조건은 까다롭긴한거 같은데... 뭐 뭐든 하나만이라도 짱짱하게 돌면 그거라도 어딘가 싶은데 말입죠...