https://www.clien.net/service/board/park/19264723CLIEN
https://twitter.com/SigGravitas/status/2100325221932958134
어제 jev관련해서 글을 썻는데요.
자율주행이 될지도 몰겠다고 썻는데
누가 진짜 시뮬레이터에 올려봤네요
결과는 자율주행이 됩니다.
다만 비전이 아직 없어서 입력값을 텍스트로 변환해서 받았다고는 합니다만
반응속도가 미쳤네요ㅎㅎ
llm보다 연산비용이 많게는 400배 가까이 쌉니다..
극단적으로 최적화하면 스마트폰에서도 돌아갈수도요..ㄷㄷ
그동안 굼뜨던 휴머노이드들과 별거아닌걸 생각하느라.. 멍청해보이던 자율주행을 돌파하는 기술인 것 같네요..
원본: llm보다 400배 비싸면... 사람이 더 싸서 계속 운전시킬수도 있겠네요
비싸다고 한적이 없는데요...
400배 싸다고 했습니다ㅎ;
ㅎㅎ 네..
정확히는..
공개한 워크플로 테스트에서 비용이 최대 444.6배 저렴했다고 하네요.
TypeSafe 홈페이지에 193.6× faster, 444.6× cheaper라고 표기되어 있습니다.
llm보다 193배 빠르고 444배 싸네요ㅎㅎ
결국 bottle neck 은 VLM인데
자율주행 모델들은 다 저 방식 아니에요? 대신 VLM -> 센서 값 직접 판단 -> 센서 값에 대한 모델
vlm이 병목이라기보다는
jev에 비전이 달리면 해결될 문제죠ㅎㅎ
굳이 판단모델을 두개를 굴릴필요가 없을것같습니다..
지금 vlm으로 이미지를 텍스트로 변환시켜 jev에 넘긴 이유는 jev가 현재 텍스트만 입력값을 받기 때문입니다.
jev에 비전이 달리면 vlm이 필요없죠
애초에 jev개념으로 비디오를 학습시키면 되는 문제 아닐까 합니다.
굳이..비디오를 텍스트로 변환할 필요가 없죠..
제작사도 이미지입력을 암시하고 있습니다.. 언젠가 된단 얘기죠