AI FOMO 증후군을 극복하고자 주말에 틈틈히 이것저것 만들어보고 있습니다.
특히 요즘 관심을 가졌던 분야가 온라인 교육 도구였는데요,
아들 녀석 온라인 아두이노/코딩 교육 할 때의 카오스적 상황이 생각나서입니다.
적게는 너댓명, 많게는 7-8명이 수업을 듣다보니 곳곳에서 아이들의 질문이 터져나오고,
선생님의 손이 모자라니 부모님까지 합세해서 도와주느라 장날 같은 혼잡함이 이어지더라구요.
2시간을 씨름한 선생님의 지친 모습을 보자니, AI 가 여기 꼭 필요하겠구나 싶었습니다.
그래서 AI 채팅창을 함께 제공하는 학습 프로그램을 만들어서 Hermes 와 LLM API 를 연동해서 돌려보았습니다.
요즘 상용 LLM 들의 성능이야 두 말할 필요가 없을 정도이니, 대부분의 질문에 답변도 매우 만족스러웠구요.
그런데 가만 생각해보니... Ollama/LM Studio 를 사용해서 로컬 LLM 을 돌려도 쓸만할까? 라는 의문이 들었습니다.
그래서 앞서 만든 학습 프로그램에 LM Studio + 8GB 안팎의 LLM 몇 개를 다운로드 받아 돌려봤습니다.
## 실행환경
CPU: Ryzen 7 - 7700 (8 core, 3.8GHz)
Memory: 32GB
Graphic: GeForce RTX 4070 SUPER (12GB)
OS: Windows 11
LLM 구동 프로그램: LM Studio
LLM: Gemma 4 12B QAT (7.2GB) / GLM 4.6V by Z.ai (8.0GB) / Qwen3.5-9b (6.9GB) / DeepSeek R1 14b / Mistral nemo instruct 2407
## 테스트 강좌
아두이노, 라즈베리파이 같은 기초 강좌는 난이도가 낮아 답변이 잘 나올 것 같아서 제외.
난이도가 제법 있는 강좌들을 가지고 테스트 했습니다.
1. ESP32 기초 (중급)
: TTGO(ESP32) 보드로 센서 컨트롤, 카메라 웹서버를 띄우는 코드 실습. 소스코드 안내 중심.

2. 신경망과 LLM 개론 (중급)
: 3Blue1Brown의 시각적인 설명 영상을 바탕으로, 인공 신경망의 기본 원리부터 트랜스포머 기반의 대규모 언어 모델(LLM) 핵심 메커니즘을 설명

## 테스트 방법
각 강좌의 특정 페이지에서 LLM 에게 질문
- System 메시지, 강좌의 목차, 특정 페이지의 내용과 사용자의 질문 history 가 프롬프트에 첨부됨
- 질문을 이어갈수록 질문의 내용이 심화되고 프롬프트 사이즈가 커짐
- 프롬프트 크기에 16K 제한을 두고 사용
이상의 조건에서 답변의 품질, 속도, 동작 안정성을 평가
## 테스트 결과
제가 가진 그래픽카드가 12GB 메모리를 가지고 있어서 8GB 안팎의 LLM 들을 받았습니다.
그 중 제 PC에서 동작이 불안정한 (시스템 오류, 답변 출력 오류 등) LLM 들을 제외하니 Gemma 4 12B / Qwen3.5-9b 만 남았습니다.
다른 LLM 들은 첫 1회 정도의 답변만이 가능할 뿐 지속적으로 사용이 어려웠습니다.
1. ESP32 기초 강좌로 테스트
: 아래 질문은 ESP32 기본 사용법 중 하나이긴 하지만, 임베디드 영역의 특정 디바이스용 코드라서 답변 난이도가 조금 있다고 판단됩니다.
Q1: 적외선 신호를 받으면 이 값을 wifi 로도 확인할 수 있도록 ESP32 웹 서버 기능도 넣고 싶다. 이 기능을 추가한 코드를 보여줘.
Q2: 현재와 같은 HTML 페이지 대신 WebSocket 을 이용해서 적외신 신호 데이터만 실시간으로 받아갈 수 있도록 만들고 싶다. 변경되어야 할 코드를 알려줘.
Q3: 답변에 따라 추가 질문
1-1. Gemma 4 12B QAT 테스트 결과
- Q1 질문에 적절한 샘플 코드를 생성.
- Q2 질문의 핵심은 websocket 을 구현하고 여기에 필요한 protocol 을 정의해서 사용하는 것. 하지만 프로토콜을 만들지 못하고 이전과 같은 HTML 형식을 사용.
- Q3 에서 명시적으로 JSON 형식을 강요. Protocol 을 정의하고 코드 답변까지 완료.
-> 답변의 품질이 괜찮다고 느껴짐. 답변 생성 속도도 로컬 LLM 임을 감안하면 괜찮음. (1분 이내에 답변이 완료)
-> 하지만 Q2 질문에 사용자의 의도대로 답변하지 못하는 문제가 간헐적으로 있어서 자세한 추가 질문으로 답을 받아야 했음.
1-2. Qwen3.5-9b 테스트 결과
- Q1 질문에 적절한 샘플 코드를 생성.
- Q2 질문에 websocket + protocol 정의를 포함한 정확한 답변
- Q3 의 간단한 추가 질문에도 답변 완료
-> 사용자의 의도에 맞는 정확한 코드 생성. 답변 품질 좋음. 가끔 중국어가 섞임.
-> 속도도 GEMMA 보다 30% 정도 빠름
-> 답변 품질, 속도면에서 비교군 중 가장 좋았음
2. 신경망과 LLM 개론 강좌로 테스트
: 손글씨 인식 예시를 통해 신경망과 LLM 개론을 설명. 코드는 없고 개념, 이론에 대한 QnA 진행.
Q1: 손글씨 이미지 예제에서 각각의 은닉층은 어떤 역할을 하는가?
Q2: 가중치(Weights)와 편향(Bias)에서, 일반적으로 우리가 LLM 모델에서 말하는 파라미터 사이즈가 이 가중치를 의미하는건가?
Q3: 신경망 핵심 작동 메커니즘 카드에서 보여주는 설명이 실제 LLM 모델에도 동일하게 적용되는 것인가? 이것과 LLM 과는 이미지-텍스트의 차이가 있는 것 아닌가?
Q4: 그러면 트랜스포머 알고리즘과 어텐션도 이 구조 위헤서 수행되는 것인가?
Q5: 트랜스포머와 어텐션은 각각 무엇인가? 왜 이것들이 현대적 LLM 을 구성하는 주요한 알고리즘으로 언급되는가?
2-1. Gemma 4 12B QAT 테스트 결과
- Q1 ~ Q5 모두 적절히 답변함. 답변 품질이 높음.
-> 프롬프트 요청대로 강의 도우미에 맞는 답변 톤을 사용. 사용자의 문의사항에 대한 답변과 부가적인 정보를 적절히 제시.
-> 답변 생성 속도도 로컬 LLM 임을 감안하면 괜찮음. (1분 이내에 답변이 완료)
-> 답변 품질, 안정성면에서 비교군 중 가장 좋았음
2-2. Qwen3.5-9b 테스트 결과
- Q1 ~ Q5 모두 적절히 답변함. 답변 품질이 좋음. 가끔 중국어가 섞임.
-> 전반적으로 적절한 답변을 하지만, 이해에 도움이 되는 부가적인 정보와 문체가 GEMMA 보다는 부족
-> 속도는 GEMMA 보다 빠름
## 총평
전반적으로 답변 자체는 학습 도우미로 사용하기에 충분했음. 8~12B 수준의 모델도 정말 발전했음을 느낌.
답변 속도도 그리 나쁘지 않음. 1분 이내에 원하는 답을 얻을 수 있었음. (모델이 메모리에 로딩된 상태에서...)
1~2 세대 정도만 진화하면 로컬 LLM 으로도 정말 많은 것들을 할 수 있다는 희망(?)이 생김
다만 아직 로컬 LLM 을 쓰기에 아쉬운 점은...
- 프롬프트 크기가 늘어날 수록 매우 불안정 (16K 제한인데도...)
- 이 때문에 기존 QnA history 를 첨부하기 어려움. 컨텍스트 압축도 LLM 이 수행해야 해서 시간도 오래걸리고 비효율적.
- LLM 에 전달할 프롬프트 구성에 제약이 많으므로 프롬프트 관리도 어렵고, 긴 대화를 주고 받기 어려움.
- 개선되었다지만 그래도 상용 LLM 에 비해서는 느린 속도.
- 안정성 확보가 필요. 제 PC 상태가 메롱한지... System halt, LM Studio freeze, 답변 생성 중 멈춤 현상 등등이 사용 중 수시로 발생
- MAC 에서는 테스트를 못해봐서 제 Window PC 의 문제일 수도 있음.
결론. 아직은 DeepSeek V4 flash 같은 저렴이로 좀 더 버티자.
제 경우 괜찮다고 판단한 모델이 젬마와 Qwen에 더해서 IBM의 Granite 입니다만, 괜찮으시면 Granite도 한 번 테스트 해보시는 것도 좋을 것 같습니다.
- 매우 빠른 속도, qwen 도 응답이 빠르다고 생각했는데 그보다도 더 빠른 것 같습니다.
- 특히 응답 시작까지의 발화시간이 매우 짧았습니다. 응답 속도도 빨랐구요 -> 이 때문에 중간에 프롬프트 압축을 할 때 시간이 단축되어서 매우 좋았습니다.
- 응답 품질 : 전반적으로 만족스러웠습니다. 다만 가끔 영어로 대답할 때가 있고, ESP32 코딩 같은 경우 qwen 유사하게 원하는 답변 방향과 살짝 달라서 추가 질문을 통해 답을 얻어야 했습니다.
- 동작의 안정성도 좋았습니다. 제 PC 에서 특별한 문제 없이 계속 QnA 가 가능했어요 (이건 복불복일수도....)
--> 좋은 모델 알려주셔서 감사합니다. 8~12b 정도의 모델 중에서는 Granite 가 제일 좋았습니다!!