HW: 맥미니 M4 32GB (레어템이죠...)
올라마 챗에선 20B 이하들도 잘 굴러가는데 오픈클로에 물리는 순간 대답하는 것조차도 버거운 경우가 대부분입니다.
대화도 어려운데 뭔가 일을 시킨다? 거의 포기하고 살았죠. 문제는 오픈 AI 정책상 막히는 작업들이 있다는 겁니다.
그래서 올라마에서 젬마4-31B-클라우드 모델을 써봤고 오픈 AI가 막은 거 기가막히게 잘 하더군요. (GPT 5.x시절에 만든 자동화 작업 수정을 6부턴 정책상 안 된다고 막아버렸고 이걸 로컬 LLM으로 우회...)
문젠 올라마 클라우드도 유료모델이라 무료 한도 다 차면 한도 초기화될때까지 기다리던가 돈 내야 합니다 ㄷㄷㄷ
그래서 젬마 31B를 LLM으로 올려봤지만..... 클라우드에서 1분도 안 걸리는 거 30분 넘게 진행중이어서 포기. qwen3.6:35b도 포기.. 그런데 젬마4-26b를 쓰니 느리긴 느려도 (5~6분 걸림) 되긴 되네요 ㄷㄷㄷ (예전엔 올라마 굴리면 CPU만 디립따 썼던걸로 기억하는데 간만에 쓰니 MLX를 지원해서인지 지금은 GPU만 죽어라 갈구네요. 덕택에 LLM 돌리면서 컴터 쓰긴 한결 편해지네요)
로그 찍으보면 로컬 LLM에서 가장 큰 문제가 HW성능이나 RAM이 아니라 컨텍스트인거 같더군요. 앞서 31B 모델들 30분 넘게 작업중 뜨는것ㅎ도 컨텍스트 오바되던게 문제고.. 26B는 어째 어째 32K 안에 압축 몇 번 해서 들어가는 거 같더군요. 시간은 걸리지만 오픈 AI 정책 우회용으로 추가비용 없이 가능하다는 점에 감사하고 있습니다 ㄷㄷㄷ
결론: 풀로 돌리는 건 무리지만 이런 우회용으로써 드디어 로컬 LLM을 써먹기시작합니다 ㄷㄷㄷ
덧: 근데 오픈클로들도 메모리 임베딩으로 4B짜리 로컬 LLM을 알아서 쓰기도 하고 그러더군요.
이리저리 로컬LLM을 있는 하드웨어로 하다가 한계를 느끼고 DGX Spark 2대를 질렀는데요. 개발 작업은 이걸로 하고 있지만 헤르메스는 외부 API (딥시크 또는 GPT Luna) 유료로 연결해 쓰고 있습니다. Gemma는 글은 잘 만들어내는데 하네스의 Tool 사용이나 코딩에 서툴러서 실패 비용을 크게 덤태기 쓰게 되더군요.
가성비로는 무엇을 골라도 딥시크 플래시를 따라올 자가 없어요.
개인정보 보호해가며 시켜야 할 작업이 있다면 불가피하게 로컬 LLM을 써야겠지만 한계는 어쩔수 없는거 같습니다.
맥이 사용할 메모리: 8GB 빼고..
24GB 이니.
원할한 운영을 위해서는 18B 이하의 모델을 찾으세요.. 모델들이 너무 크네요.
요즘 유료 모델들 지능 올라가는 눈높이에 맞추려면 개인이 32gb 수준에서 쓸수 있는건, 다 만들어 놓은 스크립트를 실행하게 하는 tool 분류기 수준 밖에 못 쓰겠더군요.
128gb 시스템이 일을 맡길 수 있는 유의미한 지능의 마지노선이라고 느낍니다.
https://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-mlx-2bit
근데 프리필이 참혹할거라...