@푸풍푸님 글쎄요. LLM 모델도 구조가 바뀌어가면서 범용적 연산기 즉 GPU 가 그 변화에 신속히 대응하고 있는 부분은 다른 NPU 에서 쫓아가기 힘든 부분이죠. llama3.1 세대만 해도 행렬곱만 때려박으면 되는 수준이었지만. 최신 모델은 GDN 이니 n-gram 등으로 KV cache 까지 최적화 하려고 convolution 까지 다시 들고 오기 시작했어요. 기존 NPU 는 새로운 구조에 맞게 설계하면 나오는데 최소 2년은 걸리니 늘 이런 새로운 설계에 대해서 최적화 부분에서 뒤쳐지고요. 추론 최적화 업계에서 하는 얘기가 그거예요. 아직은 공짜로 NPU 를 갖다 써도 토큰 생산 원가 생각하면 GPU 가 더 싼 거라고.
그런데 정말 무서운 세상입니다. 심심해서 제가 20년전에 만든 덧셈기(Hierachial Carry Lookahead Adder) Verilog 코드를 주고 4096비트로 만들어보라니 ai에서 1초걸리더군요... 타이핑하기 귀찮아서 512비트까지만 만들고 안만들고 있었는데 1초 걸리더라구요... 놀라운 세상입니다. 참고로 제 코드는 수만비트까지도 쉽게 확장가능하게 구조화 되어 있습니다. 타이핑하기 귀찮았는데 ai 시켜서 10,240비트 만들라고 하면 1초면 나올듯
AI 연산의 시작과 끝이 행렬계산(벡터계산)입니다. kv cache건 뭐건.. AI시장이라고 하시면 너무 크고 모델 학습 시장은 Nvidia가 5년은 더 먹겠지만 AI추론 시장은 지금도 경쟁구도입니다.
어이가_없넹
IP 121.♡.113.148
03:40
2026-09-14 03:40:14
·
@MoonLin님 반 엔비디아 연합을 구성해봐라라고 ai 한테 물어봤더니 재미난 얘기를 하더라구요... 내용은 비공개입니다.
MoonLin
IP 183.♡.127.97
03:45
2026-09-14 03:45:27
·
@어이가_없넹님 그런건 아무 의미가 없습니다. HW연산기는 쉽게 만들지 몰라도 지원하는 명령어셋 호환이 문제입니다. AMD도 쿠다 대체하는 ROCm이 있지만 쓰는 사람이 적고 기존 소프트웨어와 호환성 문제가 따라 다닙니다. 결국 이미 뱥에 씨를 많이 뿌린 엔비디아가 독식하고 있는거죠. CUDA를 키운지 10년이 넘어가니까요. 즉 벡터 연산기를 hw로 만들어도 기존 AI 프로그램/패키지와 연동이 안되면 아무 쓸모가 없는거죠.
어이가_없넹
IP 121.♡.113.148
03:38
2026-09-14 03:38:27
·
장난으로 20,000,000비트 시켜보니깐 Python 으로 파일(cla20,000,000.v) 에다 f.write로 쓰는 코드 작성하네요
새로운 댓글이 없습니다.
이미지 최대 업로드 용량 15 MB / 업로드 가능 확장자 jpg,gif,png,jpeg,webp 지나치게 큰 이미지의 크기는 조정될 수 있습니다.
엔비디아 하나 값으로 2분의1성능 3개를 사고 세팅하면 같은 돈으로 더 빠르게 구축할 수 있죠.
문제는 옛날 게임들마냥 엔비디아만 지원하는게 대부분이라 이 부분만 인정받는 소프트가 나오면 양강구도로 가지 않을까 싶습니다.
혹시 맥 스튜디오 등에서 LLM 돌리는거도 쿠다불러서 돌리는걸까요?
제가 ai 나 S/W쪽으론 아는게 없어서
전에 H/W 설계자였습니다. 지금은 그만둔지 20년 됐긴 했습니다만... 디지털로직 쪽입니다.
추론 최적화 업계에서 하는 얘기가 그거예요. 아직은 공짜로 NPU 를 갖다 써도 토큰 생산 원가 생각하면 GPU 가 더 싼 거라고.
GPU나 NPU가 하는일이 행렬로 벡터비트연산 하는거 아닌가요?
그걸 왜 행렬연산하는지 제머리로는 도무지 이해가 안가네요
그래픽카드가 하루 종일 하는 일이 점 이동이 대부분이기 때문에 당연히 행렬로 계산되는 게 유리합니다.
쿠다는 그 행렬 벡터계산기의 모임으로 보입니다.
그런데 정말 무서운 세상입니다.
심심해서 제가 20년전에 만든 덧셈기(Hierachial Carry Lookahead Adder) Verilog 코드를 주고 4096비트로 만들어보라니 ai에서 1초걸리더군요... 타이핑하기 귀찮아서 512비트까지만 만들고 안만들고 있었는데 1초 걸리더라구요... 놀라운 세상입니다.
참고로 제 코드는 수만비트까지도 쉽게 확장가능하게 구조화 되어 있습니다. 타이핑하기 귀찮았는데 ai 시켜서 10,240비트 만들라고 하면 1초면 나올듯
10240비트 시켜보니 5초 (주석과 공백포함 118줄)
20496비트 시켜보니 10초쯤 걸리네요...(주석과 공백포함 127줄)
와 타이핑하기 귀찮았는데 대단하다 ai
kv cache건 뭐건..
AI시장이라고 하시면 너무 크고 모델 학습 시장은 Nvidia가 5년은 더 먹겠지만 AI추론 시장은 지금도 경쟁구도입니다.
반 엔비디아 연합을 구성해봐라라고 ai 한테 물어봤더니 재미난 얘기를 하더라구요... 내용은 비공개입니다.
그런건 아무 의미가 없습니다.
HW연산기는 쉽게 만들지 몰라도 지원하는 명령어셋 호환이 문제입니다.
AMD도 쿠다 대체하는 ROCm이 있지만 쓰는 사람이 적고 기존 소프트웨어와 호환성 문제가 따라 다닙니다.
결국 이미 뱥에 씨를 많이 뿌린 엔비디아가 독식하고 있는거죠.
CUDA를 키운지 10년이 넘어가니까요.
즉 벡터 연산기를 hw로 만들어도 기존 AI 프로그램/패키지와 연동이 안되면 아무 쓸모가 없는거죠.