CLIEN

본문 바로가기 메뉴 바로가기 보기설정 테마설정
톺아보기 공감글
커뮤니티 커뮤니티전체 C 모두의광장 F 모두의공원 I 사진게시판 Q 아무거나질문 D 정보와자료 N 새로운소식 T 유용한사이트 P 자료실 E 강좌/사용기 L 팁과강좌 U 사용기 · 체험단사용기 W 사고팔고 J 알뜰구매 S 회원중고장터 B 직접홍보 · 보험상담실 H 클리앙홈
소모임 소모임전체 ·굴러간당 ·아이포니앙 ·주식한당 ·방탄소년당 ·일본산당 ·MaClien ·자전거당 ·개발한당 ·안드로메당 ·야구당 ·클다방 ·가상화폐당 ·나스당 ·퐁당퐁당 ·달린당 ·키보드당 ·이륜차당 ·소시당 ·창업한당 ·디아블로당 ·땀흘린당 ·소셜게임한당 ·덕질한당 ·걸그룹당 ·AI그림당 ·AI당 ·바다건너당 ·육아당 ·3D메이킹 ·X세대당 ·ADHD당 ·날아간당 ·사과시계당 ·배드민턴당 ·농구당 ·블랙베리당 ·곰돌이당 ·비어있당 ·FM당구당 ·블록체인당 ·보드게임당 ·활자중독당 ·볼링친당 ·캠핑간당 ·냐옹이당 ·문명하셨당 ·클래시앙 ·콘솔한당 ·요리한당 ·쿠키런당 ·대구당 ·DANGER당 ·뚝딱뚝당 ·개판이당 ·동숲한당 ·날아올랑 ·전기자전거당 ·e북본당 ·갖고다닌당 ·이브한당 ·패셔니앙 ·물고기당 ·도시어부당 ·FM한당 ·맛있겠당 ·포뮬러당 ·젬워한당 ·안경쓴당 ·골프당 ·차턴당 ·총쏜당 ·하스스톤한당 ·히어로즈한당 ·인스타한당 ·IoT당 ·KARA당 ·꼬들한당 ·어학당 ·가죽당 ·레고당 ·리눅서당 ·LOLien ·Mabinogien ·임시소모임 ·미드당 ·밀리터리당 ·땅판당 ·헌팅한당 ·오른당 ·영화본당 ·MTG한당 ·소리당 ·노키앙 ·적는당 ·방송한당 ·PC튜닝한당 ·찰칵찍당 ·그림그린당 ·소풍간당 ·심는당 ·패스오브엑자일당 ·라즈베리파이당 ·품앱이당 ·리듬탄당 ·노젓는당 ·Sea마당 ·SimSim하당 ·심야식당 ·윈태블릿당 ·미끄러진당 ·축구당 ·나혼자산당 ·스타한당 ·스팀한당 ·파도탄당 ·테니스친당 ·테스트당 ·빨콩이당 ·공대시계당 ·여행을떠난당 ·터치패드당 ·트윗당 ·VR당 ·시계찬당 ·WebOs당 ·위스키당 ·와인마신당 ·WOW당 ·윈폰이당
임시소모임
고객지원
  • 게시물 삭제 요청
  • 불법촬영물등 신고
  • 쪽지 신고
  • 닉네임 신고
  • 제보 및 기타 제안
© CLIEN.NET
공지[점검] 잠시후 서비스 점검을 위해 약 30분간 접속이 차단됩니다. (금일 18:15 ~ 18:45)

모두의공원

대충 개인용 로컬 LLM 장비에 안착을 한 듯 합니다. 15

1
2026-08-08 00:36:11 수정일 : 2026-08-08 00:40:19 187.♡.99.59
겜광사랑

b0873f45-cd4b-45a3-add0-68594bd21319-1_all_5.jpg

그동안 Asus GX10(DGX SPARK), HP Z2 Mini G1a (Strix Halo 128GB)를 사용해왔습니다.

HP는 64GB는 서버로서 시스템램에 할당, VRAM에 할당된 64GB는 QWEN Embedding Q8, QWEN Reranker Q8로 오픈클로의 메모리와 Ragflow의 RAG 시스템 담당, OCR로 PaddleOCR, ASR용 이런저런 잡모델을 올려 쓰고 있었습니다.

다만 GX10은 대용량 메모리 대비 속도가 너무 느려 MoE 모델을 쓸 수 밖에 없었고 QWEN3 CODER NEXT, QWEN3.6 35B A3B 여러 모델들을 올려 썼는데 좀.. 아쉽더군요.. 차라리 이 돈으로 구독료를 내자 싶은 생각이 들자마자 팔아버렸는데 배치용으로 주기적으로 AI를 돌려야 할 일이 생겨서... 다시 맞췄습니다.


- 델 7910 워크스테이션 (중고) : 오직 LLM 추론용이다보니 사양은 최대한 낮게...

- 엔비디아 GV100×2 (개봉중고) : 최신 기술은 못쓰고 구형 HBM이라 요즘 LPDDR보다 많이 느리지만 일단은 HBM이고 GX10보다는 빨라서... VRAM 합산 64GB 확보... 

  ※ 알리에서 V100 PCIe 버전을 훨씬 싸게 구할 수 있지만 얼마나 혹사당하다가 나온 친구인지 몰라서...


500 언더로 구성했는데 QWEN3.6 27B DENSE 모델 Q8 (KV캐시는 FP16)으로, 2슬롯에 각각 컨텍스트 200K씩 할당, 

단일 추론에 40tok/s, 2슬롯 합산에 50tok/s 정도 나와줍니다.


다음주쯤 QWEN3.8 27B 소식이 있는데 이 모델은 또 얼마나 발전했을지.. 기대대봅니다.

여전히 이 돈으로 토큰값을 내는게 이득인 상황이긴 합니다만... BEP가 언제 찾아올지도 모르겠고 로컬 돌리는게 남자의 로망 아닌가요. (아닌가..)


(그나저나 별 하는일도 없는데 GPT 5.6 SOL은 Pro 20x 사용량 쭉쯕 빨아들이네요.. 덕분에 이번달은 Kimi K3 덕 좀 보고 있습니다. 수시로 장애가 생겨 메인모델로는 못쓰겠습니다만..)

겜광사랑 님의 게시글 댓글
  • 주소복사
  • Facebook
  • X(Twitter)
댓글 • [15]
Watanka
IP 144.♡.138.132
00:41 2026-08-08 00:41:28
·
그런데 로컬에서 무슨 작업을 하시길래 50tok/s 속도가 필요한건가요?
어차피 qwen 3.7로 코딩은 못하고...
겜광사랑
IP 187.♡.99.59
05:57 2026-08-08 05:57:09 / 수정일: 2026-08-08 06:11:35
·
@Watanka님 그렇죠. 메인코더로 로컬을 쓰겠다는 점 자체가 스트레스와 비극의 시작이죠.. 전 지금은 회사를 쉬고 있어서 개인 이메일 카테고리에 따른 분류와 캘린더/할일 등록 및 LLM Wiki에 사용 중입니다. 로컬에는 큰 일 주면 안되죠..
SIMCGA
IP 124.♡.137.209
01:03 2026-08-08 01:03:35
·
저는 rtx a5000 두장 nvlink로 연결해서 gemma 4 27b awq 4비트 양자화 모델을 돌리는데 140 tok/s 정도 나오던데 gv100은 nvlink가 없나요? 연결하면 상당히 괜찮던데. 물론 저두 rtx a5000 6장 정리하고 a6000으로 바꾸고 싶긴한데 ㅠㅠ
겜광사랑
IP 187.♡.99.59
05:59 2026-08-08 05:59:10 / 수정일: 2026-08-08 06:13:52
·
@SIMCGA님 NVLink가 지금 이베이에서 날아는 오고 있습니다만... 제가(GPT가) 알아본 바고는 그렇게 속도개선 효과는 없다고 합니다. GV100는 워낙에 정보가 없어서 V100 케이스를 조사해봤는데 llama.cpp에서는 오히려 속도가 떨어지는 케이스도 발생했다고... 그나저나 최신 아키텍처... 부럽습니다.. 메모리 대역폭이 오히려 a5000 약간 낮은데도 속도가 3배가 나오는데...
SHERLOCK
IP 211.♡.249.94
01:12 2026-08-08 01:12:18 / 수정일: 2026-08-08 01:12:45
·
5.6 솔 쓰는데 코덱스 주간한도 처음으로 다 썼습니다 ㄷㄷㄷ (오픈클로,헤르메스 연동)
겜광사랑
IP 187.♡.99.59
06:01 2026-08-08 06:01:55
·
@SHERLOCK님 전 대체 뭘하는지 모르겠는데 5.5때는 진짜 펑펑 쓰고도 주간한도 넘기는게 극히 어려웠는데 Sol 5.6 High에서는 한 4일만에 다 날아가는 패턴인 것 같습니다. 오픈클로 경량화도 많이 했는데도 답이 없는걸로 봐서 그냥 제가 시키는 일들이 토큰 많이 소진시키는 작업들인가봅니다.
ProNAS
IP 122.♡.246.28
01:27 2026-08-08 01:27:03
·
팬을 더 달아줘야 되요..
겜광사랑
IP 187.♡.99.59
06:15 2026-08-08 06:15:45
·
@ProNAS님 딱봐도 극한테스트 느낌인데 아직까지는 그래픽카드 2장만 풀부하로 도는 상태라... 온도가 생각보다 높지 않아서(?) 버텨보고 있습니다....만 저도 저게 맞나 싶습니다..
Avaritia
IP 223.♡.217.139
02:02 2026-08-08 02:02:04 / 수정일: 2026-08-08 02:02:10
·
구독보다 로컬에서 돌리는게 가성비가 더 좋나요? 요즘 장비값도 만만찮을거 같은데 궁금하네요
동그리a
IP 14.♡.185.233
03:06 2026-08-08 03:06:36
·
Avaritia님// 절대 아닙니다 luna에서 만족 >이제 무료로 풀림
agent loop 사용 > 큰모델 필요 > opus/sol/fable등 적어도 100$
오히려종아
IP 14.♡.208.186
03:14 2026-08-08 03:14:25
·
@Avaritia님 자기만족같습니다 구돌료가 비싸다고는 해도 프론티어 모델을 쓰는거고 간단배치작업은 저사양모델쓰면 api 비용이 엄청 싸거든요. 다만 그걸 뚜어넘는 막대한 분량의 작업을 로컬로 24시간 돌린다면 ….. 아 속도 때문에 비용잇점이 있을지 미지수네요. 그나저나 전가요금은 ???
Avaritia
IP 223.♡.217.139
03:20 2026-08-08 03:20:31 / 수정일: 2026-08-08 03:21:19
·
@오히려종아님 아... 제가 집에서 홈서버나 스토리지 서버 돌리는 느낌을 수십배쯤 크게 하고 계신거군요. 바로 이해했습니다
겜광사랑
IP 187.♡.99.59
06:03 2026-08-08 06:03:51 / 수정일: 2026-08-08 06:17:36
·
@Avaritia님 동그리a님, 오히려 좋아님께서 정확히 말씀해주셨습니다. 지구상에서 제일 싼 ai 요금제를 찾아서도 이거보단 덜 나오고 더 나은 결과가 나올겁니다. 가성비 측면에선 꽝이고, 자기 만족입니다. 데이터 주권? 전 그만큼 중요한 데이터를 다루지 않습니다.
오르테가
IP 221.♡.184.184
05:51 2026-08-08 05:51:19
·
DGS Spark 이 것보다 훨씻 낫지요?
겜광사랑
IP 187.♡.99.59
06:07 2026-08-08 06:07:39 / 수정일: 2026-08-08 06:19:13
·
@오르테가님 DGX Spark가 대형모델 적재와 최신 가속기술 등 적용이 필요하다면 이보다 낫습니다. 다만 본문에 말씀드렸이듯이 제게 만족스러운 모델은 느리고, 전 딱 QWEN이 27B 모델을 계속 내준다는 전제로 이 시스템을 설계했습니다. GV100의 메모리 대역폭이 DGX Spark보다 약 3배 정도 높습니다. (HBM인데 많이 느리죠.. 10년묵은 구형이라..)
새로운 댓글이 없습니다.
이미지 최대 업로드 용량 15 MB / 업로드 가능 확장자 jpg,gif,png,jpeg,webp
지나치게 큰 이미지의 크기는 조정될 수 있습니다.
목록으로
글쓰기
글쓰기
목록으로 댓글보기 이전글 다음글
아이디  ·  비밀번호 찾기 회원가입
이용규칙 운영알림판 운영소통 재검토요청 도움말 버그신고
개인정보처리방침 이용약관 책임의 한계와 법적고지 청소년 보호정책
©   •  CLIEN.NET
보안 강화를 위한 이메일 인증
안전한 서비스 이용을 위해 이메일 인증을 완료해 주세요. 현재 회원님은 이메일 인증이 완료되지 않은 상태입니다.
최근 급증하는 해킹 및 도용 시도로부터 계정을 보호하기 위해 인증 절차가 강화되었습니다.

  • 이메일 미인증 시 글쓰기, 댓글 작성 등 게시판 활동이 제한됩니다.
  • 이후 새로운 기기에서 로그인할 때마다 반드시 이메일 인증을 거쳐야 합니다.
  • 2단계 인증 사용 회원도 최초 1회는 반드시 인증하여야 합니다.
  • 개인정보에서도 이메일 인증을 할 수 있습니다.
지금 이메일 인증하기
등록된 이메일 주소를 확인하고 인증번호를 입력하여
인증을 완료해 주세요.