로컬 AI들 이렇게 저렇게 돌려보는데, 30b 정도 급만 가도 묘하게 느린 느낌이 있는게.., 이럴거면 맥스로 살걸 그랬나 하는 현타가 아주 세게 오고 있습니다 ㄷㄷㄷ...
가격 인상 없이 산건 잘 한거 같은데 묘하게 계속 워크플로우가 끊기는 느낌인게, LM Studio에서 대강 돌리면 30b급 모델이 4bit 양자화로 해도 초당 13토큰을 넘지를 못하네요 ㅠㅠ
맥스는 이거 두배라고 들은거 같은데 그렇게 생각하면 또 뭔가 되게 손해보는 것 같기도 하고..요..
가격 인상 막 발표되었을때 맥스칩 버전은 64램은 없고 48만 있길래 '그래 맥스를 사는데 48은 아니지, 48을 살거면 그냥 프로를 사지' 했는데 그게 실수였습니다 ㄷㄷ...
사실상 개인이 LLM돌릴때 구하기 쉬운 머신중 최고인듯해요.
드디어 일반 컨슈머용 제품에서 메모리 대역폭이 1T를 넘는 시대가 됐네요
이제는 가격 때문에 "진짜 컨슈머용 제품"이 맞나 싶긴 하지만요,,,
m4 맥스가 차라리 낫더라고요. m5 맥스와도 큰 차이 안나구요.
모델이 출력하는 언어가 영어면 그나마 토크나이징이 효율적으로 되어있어서 모델이 문장을 출력하는 실시간에 동시에 제 눈으로 텍스트를 읽을때의 속도가 느리다는 느낌이 비교적 크게 들지 않는 편이었는데, 한글같은 경우 토크나이징이 비효율적인 축에 속하는 편이어서 출력하는 속도가 빠른 편은 아닌 것 같이 느껴졌어요! 또한 속도 챙기려고 또 양자화를 4비트 이하로 내려버리면 답변 품질면에서 아쉬워지구요... 해결하기 어려운 트레이드 오프같아요!
제가 예전에 측정하였던 초당 토큰생성속도 참고하시면 좋을 것 같아서 아래에 기재해봅니다!
Gemma 3 27B(Dense) 4bit : 27.76tok/s
Gemma 4 31B(Dense) 8bit : 14.55tok/s
EXAONE 4.0.1 32B(Dense) 8bit : 15.48tok/s
얼추 제가 사용할때 나오는 속도의 거의 딱 두배네요!
젬마 4 31B를 4비트 양자화로 돌리면 13토큰 퍼세컨드 정도 나오는데, 딱 그 두배면 측정 하신 4비트 젬마3와 비슷한 속도니까요.
4비트 양자화가 요즘은 예전보다 많이 좋아진건지, 실생활에 크게 지장이 없는 수준까지 올라와준건 너무 좋은데, Gemma의 활성 파라미터 적은 모델들로 테스트 해서 30-40토큰 정도 나오는걸 보니까 그 정도 속도면 너무 좋겠다~ 싶었던 거예요,
더군다나 저는 거의 영어로 출력을 사용해도 문제가 없어서 더욱 그렇게 와닿더라구요, 초당 13토큰에서는 읽는 속도보다 나오는 속도가 느린데, 저는 제가 읽는 속도보다만 빠르면 되서..요 ㅠㅠ
가진걸로 열심히 벌어서 다음 세대에서는 더욱 업그레이드 기원하며 사용해야겠어요 ^^...ㅠㅠ
저도 첨에 48기가로 이것저것 돌리다가
GPU 로 돌리는게 합리적이다 라고 결론이...
nvidia 그래픽카드로 돌리면 30b 가 150토큰 이상 나오니깐요
결국 그냥 매달 3만원씩 내고 claude로 openclaw를 구동시키기는게 정신건강, 시간대비 비용 절감 효과가 있을 것 같아서 로컬 LLM은 포기했습니다.
저야 어차피 openclaw용 llm이니 그렇게 때운다지만,
답변의 퀄리티는 낮아도 되고 답변 시간도 오래 걸려도 무료로 그냥 한없이 기다려도 좋은 작업이라면 로컬에서 돌리는 것을 허용할텐데.
원글 작성자는 속도체감도 중요한 것으로 보아서는 로컬은 그냥 장난감으로 보셔야 하지 않나 이렇게 생각합니다.
속도체감이 중요하긴 합니다만, 사실 제가 생각하는 속도 라는게, 출력된 텍스트가 제 읽기 속도보다만 빠르면 되어서 조금 답답하더라구요, 더군다나 다른 가벼운 모델들로 테스트 해볼때 초당 50토큰 이상은 전혀 체감이 안되는 한계효용의 느낌이어서, 왠지 더 아쉬움이 크게 와닿는 느낌 같습니다. 애시당초 구독용 서비스들도 일부 사용하고 있고, API로도 섞어서 사용하고 있는데, 그 아쉬운 약간의 부분을 로컬로 채워주고 싶었던거여서요~!!
맥당 보면 다들 로컬 LLM 돌리시하시던데 이걸 어떻게 활용하시는걸까요?
저는 기껏해봐야 chatgpt, gemini 활용해서 업무를 하는 정도인데
로컬LLM의 목적이 어떤것일까요?
- 보안
- 토큰 비용 없음
- 오프라인
- 커스텀 가능
사용하시는 GPT, Gemini 에게 한번 질문해보세요. 장/단점을 금방 이해하실 수 있을 겁니다.
즐거운 하루 보내세요~
저희는 35b 12개
122b 4개 켜놓고
앞단에 게이트웨이 하나 만들어둬서 분산 대기 같은 기능들 넣어놓구
회사 파일 자료 테그 달기
이미지분석 같은
사용량 많고,반복작업,작업이 길어지지 않는 답변이 수천토큰에서 끝나는 작업에
해당하는곳에 사용하고 있습니다
https://omlx.ai/ 에 보시면 추론엔진 사용자들이 올린 벤치마크 결과가 있으니 참고해보세요
돈이 많으면 클로드가 좋기는 한데 너무 비싸서
게다가 제가 원래 사용하던 윈도우 데스크톱도 당시에 구매할때 500이상 들였던 물건이라서, 그렇게 생각하면 또 맥이 너무 비싼 것 같지는 않네요... ㅜㅜ 별 워크플로우 없는 것 같아도 성능이 조금 내려가면 역체감이 심하게 느껴져요~!
M5 Max 460 ~ 614 GB/s 풀칩 기준 M5 Pro의 2배 수준
M5 Ultra 약 1.2 TB/s (1,228 GB/s) Max 다이 2개를 결합해 Max의 2배 대역폭 구현