그동안 Asus GX10(DGX SPARK), HP Z2 Mini G1a (Strix Halo 128GB)를 사용해왔습니다.
HP는 64GB는 서버로서 시스템램에 할당, VRAM에 할당된 64GB는 QWEN Embedding Q8, QWEN Reranker Q8로 오픈클로의 메모리와 Ragflow의 RAG 시스템 담당, OCR로 PaddleOCR, ASR용 이런저런 잡모델을 올려 쓰고 있었습니다.
다만 GX10은 대용량 메모리 대비 속도가 너무 느려 MoE 모델을 쓸 수 밖에 없었고 QWEN3 CODER NEXT, QWEN3.6 35B A3B 여러 모델들을 올려 썼는데 좀.. 아쉽더군요.. 차라리 이 돈으로 구독료를 내자 싶은 생각이 들자마자 팔아버렸는데 배치용으로 주기적으로 AI를 돌려야 할 일이 생겨서... 다시 맞췄습니다.
- 델 7910 워크스테이션 (중고) : 오직 LLM 추론용이다보니 사양은 최대한 낮게...
- 엔비디아 GV100×2 (개봉중고) : 최신 기술은 못쓰고 구형 HBM이라 요즘 LPDDR보다 많이 느리지만 일단은 HBM이고 GX10보다는 빨라서... VRAM 합산 64GB 확보...
※ 알리에서 V100 PCIe 버전을 훨씬 싸게 구할 수 있지만 얼마나 혹사당하다가 나온 친구인지 몰라서...
500 언더로 구성했는데 QWEN3.6 27B DENSE 모델 Q8 (KV캐시는 FP16)으로, 2슬롯에 각각 컨텍스트 200K씩 할당,
단일 추론에 40tok/s, 2슬롯 합산에 50tok/s 정도 나와줍니다.
다음주쯤 QWEN3.8 27B 소식이 있는데 이 모델은 또 얼마나 발전했을지.. 기대대봅니다.
여전히 이 돈으로 토큰값을 내는게 이득인 상황이긴 합니다만... BEP가 언제 찾아올지도 모르겠고 로컬 돌리는게 남자의 로망 아닌가요. (아닌가..)
(그나저나 별 하는일도 없는데 GPT 5.6 SOL은 Pro 20x 사용량 쭉쯕 빨아들이네요.. 덕분에 이번달은 Kimi K3 덕 좀 보고 있습니다. 수시로 장애가 생겨 메인모델로는 못쓰겠습니다만..)
어차피 qwen 3.7로 코딩은 못하고...
agent loop 사용 > 큰모델 필요 > opus/sol/fable등 적어도 100$
그나저나 Luna가 무료라는 말씀은 찾아보셔야 할 것 같네요.. 제 상황에서 무료로 쓸 수 있는지.