https://twitter.com/ozansihay/status/2095070306238931374/video/1
Atlas
텍스트 + 이미지 + 영상 + 카메라 위치 + depth + 3D를 하나의 모델에서 처리하도록 사전학습
실제 사진 2~3장 만으로 장소 복원
최대 100장의 이미지까지 컨텍스트에 넣을 수 있음
위의 X 예시처럼 360도 불렛타임처럼 보이지 않는 곳은 AI가 가장 어울리도록 예상하게 채워넣음
무엇보다 사진 몇장만으로 만들어낸 3d 현장에서 가상으로 로봇 트레이닝이 가능한 것이 핵심으로 보입니다.
GWM worlds 2
영상 : 720p / 24fps 실시간 생성
오디오 : 48kHz 실시간 생성
길이 : 이론상 고정 길이 없음
입력 : 카메라 이동 + 텍스트 행동 명령
시점 : 1인칭 / 3인칭
제어 : 캐릭터·사물·날씨·환경·대사 등
게임 → 인터랙티브 영화 → 가상 캐릭터 → 로봇 에이전트 훈련까지 목표로 하고 있음