[AI 논문 리뷰] Atlas: 사진 몇 장으로 3D 세계를 통째로 만드는 World Model
지난 9월 1일, Fei-Fei Li가 이끄는 World Labs가 Atlas라는 새 모델을 공개했다. 한 줄로 요약하면 "사진 몇 장 → 탐험 가능한 3D 세계"를 만드는 모델인데, 그냥 예쁜 영상 생성기가 아니라 생성·복원(reconstruction)·시뮬레이션을 전부 하나의 아키텍처로 처리한다는 점에서 눈여겨볼 만하다.
이미지 출처: World Labs
World Model이 뭔데?
World Model은 말 그대로 "세상이 어떻게 돌아가는지"를 내부적으로 표현하고, 그 표현을 바탕으로 다음 상태를 예측·시뮬레이션하는 모델이다. → 자율주행이나 로봇공학에서 "이 행동을 하면 세상이 이렇게 변한다"를 예측하는 데 쓰이는 개념인데, 최근에는 영상 생성 모델과 결합되면서 범위가 확 넓어졌다.
Atlas는 뭐가 다른가
기존 멀티모달 LLM이나 비디오 확산 모델은 데이터를 1차원(텍스트) 또는 2차원(프레임) 시퀀스로 다룬다. Atlas의 차별점은 여기서 시작한다.
- 입력되는 모든 이미지/깊이맵이 3D 공간상의 명시적 카메라 포즈에 고정됨
- 텍스트, 이미지, 카메라 포즈, 3D 깊이맵을 함께 입력받아 "multimodal autoregressive diffusion transformer" 구조로 처리
- LLM 쪽 기법(KV 캐싱)과 비디오 생성 쪽 기법(diffusion distillation)을 같이 사용
- 출력은 2D 영상(최대 1440p, 60초)뿐 아니라 포인트 클라우드·3D 가우시안 스플랫 같은 3D 기하 정보까지
즉 "카메라 경로를 지정해서 영상 뽑기", "사진 몇 장으로 3D 장면 복원하기", "물리 시뮬레이션" 이 세 가지가 별도 모델이 아니라 하나의 백본에서 나온다는 게 핵심이다. Fei-Fei Li는 이를 두고 "기존 아키텍처는 단순한 공간 작업조차 불필요하게 어렵게 만든다"고 지적했다.
성능은 실제로 어느 정도인가
카메라 제어 영상 생성 — 사람 평가자가 Atlas와 경쟁 모델을 비교했을 때 Atlas를 선택한 비율:
| 비교 대상 | Atlas 선호율 |
|---|---|
| MiniMax H | 75% |
| Gemini Omni Flash | 81% |
| Happy Horse 1.1 | 86% |
| FLUX 3 | 93% |
| Seedance 2.5 | 94% |
3D 재구성 정확도(AbsRel, 낮을수록 좋음)도 Atlas가 평균 8.6으로, 전문 재구성 모델인 Pi3X(11.1)나 π³/VGGT-Ω(16.2)보다 오차가 낮았다. 특히 궤적이 복잡해질수록 격차가 더 벌어진다는 점이 흥미로운데, 이는 "카메라 포즈를 명시적으로 조건화"하는 구조 덕분으로 보인다. (데모 영상과 추가 비교 이미지는 World Labs 공식 포스트에서 직접 볼 수 있다.)
실무 적용 — 금융권 폐쇄망 AI 엔지니어 관점에서
솔직히 말하면 Atlas는 3D 비전 모델이고 클라우드 early access로만 제공돼서, 우리 폐쇄망 LLM 스택에 바로 꽂을 수 있는 물건은 아니다. 그래도 몇 가지는 그대로 가져올 만하다.
- "좋아 보인다"와 "우리 환경에 들여올 수 있는가"는 다른 질문 — Atlas는 on-prem/자체 호스팅 옵션 없이 API로만 제공된다. 폐쇄망에서는 애초에 외부 API 자체를 붙이기 어려운 경우가 많고, 이미지·카메라 데이터가 외부로 나간다는 것 자체가 보안 검토 대상이다. 신규 AI 벤더 검토할 때 "성능"보다 "데이터가 어디로 가는가"를 먼저 물어야 한다는 걸 새삼 확인시켜준다.
- 단일 백본, 멀티태스크 설계 — 생성/복원/시뮬레이션을 하나의 트랜스포머로 처리한 구조는, 문서 분류·OCR·이상거래 탐지처럼 폐쇄망 안에서 태스크별로 모델을 따로 서빙 중이라면 "백본 하나 + 태스크별 헤드"로 통합해 모델 레지스트리·보안 감사 대상을 줄이는 방향을 고민해볼 근거가 된다.
- 합성 데이터로 학습한다는 방향성 — 금융권은 개인정보/거래 데이터를 실제 학습에 그대로 쓰기 어려워 synthetic data가 이미 화두다. Atlas가 시뮬레이션만으로 로봇 학습 데이터를 만드는 접근은 도메인은 다르지만(3D vs 정형·텍스트), "실데이터 접근이 제한된 환경에서 생성모델로 학습 데이터를 보강한다"는 방향성 자체는 참고할 만하다. 다만 금융 도메인에서는 생성 데이터의 분포 왜곡이 만드는 리스크를 훨씬 보수적으로 봐야 한다.
- 구조 정보를 명시적으로 조건화 — 카메라 포즈를 명시적으로 넣어준 게 성능 격차의 핵심이었듯, LLM 파인튜닝이나 RAG 설계에서도 모델이 "알아서 학습하길" 기대하기보다 스키마·메타데이터를 명시적으로 조건화해주는 쪽이 데이터 효율과 감사 용이성 양쪽에서 유리하다는 교훈은 계속 반복된다.
아직 early access 신청 단계라 직접 써보진 못했지만, 신청은 열려 있으니(링크) 한 번 넣어볼 생각이다. 접근 권한이 오면 실제 사용기로 다시 다뤄봐야겠다.
참고자료