스페이스XAI, 차세대 음성 모델 '그록 보이스 싱크 패스트 2.0' 출시 - AI타임스
스페이스XAI는 29일(현지시간) 개발자용 차세대 음성 에이전트 모델인 '그록 보이스 싱크 패스트 2.0(Grok Voice Think Fast 2.0)'을 출시했다.
이 모델은 기존 1.0 버전을 바탕으로 지능과 음성 전사 정확도, 자연스러운 대화 능력, 도구 호출 신뢰성을 크게 향상한 것이 특징이다.
음성과 동시에 추론을 수행하는 구조를 유지하면서도 추론 효율을 크게 높였다. 이를 통해 응답 지연을 늘리지 않으면서도 복잡한 질문을 처리할 수 있으며, 실제 서비스에서는 에이전트가 첫 문장을 끝내기 전에 필요한 외부 도구 호출을 완료하는 경우가 많아졌다고 설명했다.
음성 인식 성능도 크게 개선됐다. 24개 언어의 수천개 음성 문장을 대상으로 실시한 자체 평가에서 '딥그램 노바 3(Deepgram Nova 3)'와 '일레븐랩스 스크라이브 v2(ElevenLabs Scribe v2)'보다 1.5~2배 높은 정확도를 기록했으며, 기존 1.0 모델보다도 약 1.4배 향상된 성능을 보였다고 밝혔다.
특히 주변 소음이 심하거나 전화망 음성 압축이 적용된 환경에서는 전용 음성 인식 모델보다 약 10배 우수한 성능을 나타냈다고 강조했다.
Introducing Grok Voice Think Fast 2.0 | SpaceXAI
https://twitter.com/SpaceXAI/status/2082529280341553209
https://twitter.com/SpaceXAI/status/2082529281872388189
https://twitter.com/SpaceXAI/status/2082529282866450696
Speech to Speech Models and Providers Analysis | Artificial Analysis
https://twitter.com/ArtificialAnlys/status/2082528987272957960
https://twitter.com/ArtificialAnlys/status/2082528990796062913
https://twitter.com/ArtificialAnlys/status/2082528992977174828
https://twitter.com/ArtificialAnlys/status/2082528995065905376
https://twitter.com/ArtificialAnlys/status/2082528997041443262
https://twitter.com/ArtificialAnlys/status/2082528998861779139