리벨리온, 국산 NPU 서버 단 1대로 SKT 초거대 AI ‘A.X K1’ 구동 성공… “효율성과 실사용 가능성 모두 잡았다”

– A.X K1과 리벨리온 소프트웨어 기술로 AI 서비스 운영의 ‘인프라 효율성’을 극대화
– AI 에이전트 서비스 데모로 국산 기술 결합을 통한 실생활 AI 서비스 상용화 가능성 증명
– ‘독자 AI 파운데이션 모델’ 사업 비롯해 토종 모델과 국산 NPU를 결합한 다양한 사례로 K-AI 저변 확대
리벨리온(대표 박성현)이 SK텔레콤의 독자 AI 파운데이션 모델 ‘A.X K1(이하 K1)’을 자체 서버 인프라에서 성공적으로 구동하고, 이를 기반으로 여러 사용자의 다수 요청을 처리하는 에이전트 서비스 데모를 선보였다. 국산 대형 모델과 고성능 국산 NPU의 결합을 통해 복잡한 대규모 연산을 효율적으로 처리해 낸 사례로, 국산 기술 결합을 통한 실생활 AI 서비스 상용화의 발판을 마련했다.
이번 실증은 양사 기술의 최적화를 통해 초거대 AI 운영의 ‘인프라 효율성’을 극대화한 것이 핵심이다. 리벨리온은 5,000억(500B) 개 이상의 파라미터 규모의 국내 최대 초거대 언어모델을 자사의 고성능 AI 반도체 제품인 리벨서버(RebelServer)로 안정적으로 실행하며 탁월한 서빙 효율을 증명했다. 이는 단일 서버 구성만으로 글로벌 고성능 GPU 서버에 준하는 인프라 역량을 확보한 결과다. 한 대의 서버 안에서 초거대 모델 연산이 낭비 없이 이뤄지면서 데이터센터 구축 및 운영 부담을 크게 줄이기 때문이다. 이러한 강점은 대규모 AI 인프라 서비스에 적용될 경우 서비스 경쟁력으로도 이어진다.
이와 같은 고효율 인프라는 K1의 구조적 강점과 리벨리온의 소프트웨어 기술이 유기적으로 맞물린 결과다. K1은 높은 효율성으로 글로벌에서 많이 채택되는 MoE(Mixture of Experts) 구조를 바탕으로 500B 수준의 대형 모델에서도 효율성을 확보한 것이 특징이다. 리벨리온은 이런 MoE 모델 지원과 더불어 실제 서비스 환경에서 온전히 살려내기 위해 전용 소프트웨어를 최적화했다. 이로써 실시간으로 복잡하게 변화하는 AI 내부 연산을 지연 없이 처리했다. 특히 다양한 종류의 연산을 반도체 칩에 가장 효율적인 방식으로 나누어 병렬 처리하는 분산 기술을 구현함으로써, 단 한 대의 서버 안에서도 수많은 사용자의 요청을 병목 현상 없이 실시간으로 처리할 수 있도록 했다.
이번 실증에서 리벨리온은 단순한 모델 구동에 그치지 않고, ‘지도(Map)형 에이전트 서비스’ 데모로 실제 활용 가능성을 증명했다. 대중 서비스 구현의 기술적 난관 중 하나인 ‘다중 동시 요청’을 성공적으로 처리해 낸 것이 핵심이다. 여러 사용자가 동시에 접속해 ‘주말에 이용 가능한 약국’ 등 각기 다른 일상적인 질문을 동시에 던지더라도, A.X K1이 병목 현상 없이 실시간으로 처리해 지도 위에 즉시 결과를 표시해 준다. 이는 국산 AI 기술 조합만으로도 다수의 사용자가 동시에 이용하는 실생활 공공 AI 에이전트 서비스를 안정적으로 감당할 수 있음을 보여주는 대표적인 사례다.
리벨리온 박성현 대표는 “이번 실증은 국산 초거대 모델과 국산 NPU의 결합만으로 대규모 AI 서비스를 운영할 수 있음을 보여준 소버린 AI의 실질적 사례로, 인프라 효율성과 실사용 가능성을 모두 입증했다는 데 의미가 있다”며 “앞으로도 SK텔레콤과 함께 누구나 일상에서 AI를 누릴 수 있는 한국형 AI 인프라를 만들어가겠다”고 말했다.
리벨리온은 과학기술정보통신부의 독자 AI 파운데이션 모델 사업 SKT 컨소시엄의 구성원으로 국산 NPU 기반 인프라를 실증하며 국산 AI 모델의 산업·서비스 확산에 함께 나서고 있다. 더불어 ‘에이닷 전화 통화요약’ 등 대규모 트래픽이 발생하는 실시간 AI 서비스를 안정적으로 약 1년간 구동해왔다. 이러한 경험을 바탕으로 리벨리온은 정부가 ‘대한민국 대도약 3대 메가프로젝트’와 ‘모두의 AI’ 프로젝트를 통해 강조한 ‘누구나 부담 없이 활용하는’ AI 기반 구축에도 국산 NPU 인프라 파트너로서 기여해 나갈 계획이다.
*서빙(Serving): AI 모델이 실제 서비스로 구동되는 전 과정. 요청 수신부터 모델 실행, 결과 반환까지의 운영 파이프라인
** MoE(Mixture of Experts): 대규모 언어 모델의 효율성을 극대화하기 위해, 전체 모델을 여러 개의 작은 전문가 신경망(Expert Neural Network)으로 나누고, 게이트 신경망이 입력 데이터에 가장 적합한 전문가를 선택해 계산을 분산 처리하는 기술