NVIDIA Cosmos 3: 하나의 모델로 추론·생성·행동을 통합한 Physical AI 월드 파운데이션 모델
왜 지금 봐야 하나
로봇이나 자율주행 시스템을 훈련하는 전통적인 파이프라인은 크게 세 가지 모델을 따로 유지해왔다. 인식 모델(환경을 이해하는 VLM), 세계 모델(미래 상태를 예측하는 비디오 생성 모델), 그리고 정책 모델(행동을 결정하는 RL/BC 모델). 세 모델은 따로 훈련되고, 따로 배포되며, 서로 다른 표현 공간에 있기 때문에 인터페이스를 맞추는 것 자체가 공학적 비용이었다.
NVIDIA가 2026년 6월 1일 공개한 Cosmos 3는 이 세 역할을 단일 모델로 통합하려는 시도다. 추론(reasoning), 생성(generation), 행동(action)을 하나의 트랜스포머가 처리하며, 오픈 웨이트(NVIDIA Open Model License)로 공개되었다.
이 글은 Cosmos 3의 아키텍처가 어떻게 동작하는지, 그리고 실제로 Physical AI 파이프라인에 어떻게 연결하는지를 운영자 관점에서 정리한다.
기존 접근법의 구조적 한계
세 모델, 세 개의 표현 공간
기존 Physical AI 훈련 파이프라인의 병목은 모달리티 불일치다.
- VLM은 텍스트와 이미지를 이해하지만 행동 공간을 모른다.
- 비디오 생성 모델은 미래 프레임을 만들 수 있지만 행동 조건을 직접 받지 못한다.
- 정책 모델은 행동을 출력하지만 세계를 "상상"하지 못한다.
합성 데이터를 만들 때는 별도 파이프라인이 필요하다. 실제 로봇 데이터는 비싸고 위험하며 다양성이 부족하기 때문에 합성 데이터 의존도가 높아지는데, 모달리티가 다르면 생성 → 필터링 → 변환의 단계가 추가된다.
단일 모델이 필요한 이유
세계 이해(reasoning)와 세계 생성(generation)이 같은 파라미터를 공유하면:
- 추론 과정에서 학습된 물리적 일관성이 생성에 직접 반영된다.
- 행동 조건(action condition)을 별도 어댑터 없이 모델에 직접 부여할 수 있다.
- 합성 데이터 생성, 역동역학 추론, 정책 학습을 하나의 모델로 커버한다.
Mixture-of-Transformers (MoT) 아키텍처
Cosmos 3의 핵심은 Mixture-of-Transformers(MoT) 아키텍처다. 이름이 Mixture-of-Experts(MoE)와 비슷하지만 개념이 다르다. 토큰의 출처(AR vs DM)에 따라 같은 레이어 안에서 다른 파라미터 집합을 사용한다.
두 개의 부분 시퀀스
입력 토큰 시퀀스는 두 부분으로 나뉜다.
AR(Autoregressive) 서브시퀀스: 텍스트 토큰과 선택적으로 ViT 인코딩된 비전 토큰으로 구성된다. <EOS> 토큰과 생성 시작을 알리는 <BOG> 토큰으로 끝난다. 인과적(causal) 자기 어텐션으로 처리되며, 다음 토큰 예측 방식으로 동작한다. 언어 이해, 계획, 세계 추론에 쓰인다.
DM(Diffusion) 서브시퀀스: 이미지, 비디오, 오디오, 행동 토큰으로 구성된다. 훈련 중에는 노이즈가 추가된다. 전체 어텐션(full attention)으로 처리되며, 반복적 디노이징 방식으로 동작한다. 비디오 생성, 오디오 생성, 행동 시퀀스 예측에 쓰인다.
레이어 내부 구조
각 트랜스포머 레이어는 두 파라미터 집합(Reasoner와 Generator)을 포함하지만, 자기 어텐션은 공유된다. AR 토큰과 DM 토큰은 독립된 LayerNorm과 MLP를 통과하되, 공유된 self-attention 연산에서 만난다. 이 공유 어텐션이 두 서브시퀀스 간 정보 교환을 가능하게 한다.
위치 임베딩은 통합된 3D mRoPE(multi-dimensional Rotary Position Embedding)로 공유된다. 3D mRoPE는 시공간 구조를 모달리티 전반에 걸쳐 일관되게 인코딩한다.
두 가지 작동 모드
Cosmos 3는 동일한 모델 가중치로 두 가지 모드를 전환한다.
Reasoner Mode: AR 토큰이 인과 자기 어텐션을 통해 처리된다. VLM처럼 동작하며 텍스트, 이미지, 비디오를 이해하고, 계획을 세우고, 세계에 대한 질문에 답한다.
Generator Mode: DM 토큰이 전체 어텐션과 함께 반복적으로 디노이징된다. 텍스트, 이미지, 비디오 조건이 AR 서브시퀀스를 통해 주어진 상태에서 고품질 멀티모달 콘텐츠를 생성한다.
Physical AI 활용 파이프라인
세 가지 핵심 능력
Cosmos 3는 Physical AI 파이프라인에서 세 가지 역할을 담당한다.
순방향 역학(Forward Dynamics): 행동 조건이 주어졌을 때 미래 상태를 예측한다. 로봇이 특정 동작을 취하면 다음 프레임이 어떻게 되는지 시뮬레이션한다. 이 능력은 합성 훈련 데이터 생성에 활용된다.
역방향 역학(Inverse Dynamics): 관찰된 시연(demonstration)으로부터 취해진 행동을 추론한다. 실제 사람의 시연 비디오만 있을 때 해당 행동을 역산해서 레이블로 쓸 수 있다.
정책 생성(Policy Generation): 현재 관찰과 태스크 프롬프트를 바탕으로 행동 시퀀스를 직접 예측한다. 전통적인 별도 정책 모델을 대체할 수 있다.
합성 데이터 생성 흐름
Cosmos 3로 합성 데이터를 생성하는 전형적인 흐름은 다음과 같다.
- 실제 환경 또는 3D 시뮬레이터에서 소량의 시드 데이터를 수집한다.
- Cosmos 3 Super(또는 Nano)로 시드에서 조건부 비디오를 대량 생성한다.
- 생성된 비디오에서 역방향 역학으로 행동 레이블을 추출한다.
- (행동, 관찰) 쌍으로 정책 모델을 파인튜닝한다.
- 검증: 순방향 역학으로 정책이 예측한 행동의 결과를 Cosmos 3가 시뮬레이션하고 실제 값과 비교한다.
배포와 운영 고려사항
NIM 마이크로서비스
Cosmos 3는 NVIDIA NIM(NVIDIA Inference Microservices) 형태로 배포할 수 있다. NIM은 모델과 최적화된 추론 런타임을 패키징해서 수동 인프라 튜닝 없이 프로덕션 품질의 서빙을 제공한다. Hugging Face 허브에서 직접 내려받거나, NVIDIA API 카탈로그에서 API 호출로도 사용할 수 있다.
모델 스케일 선택 기준
| 모델 | 파라미터 | 권장 용도 |
|---|---|---|
| Edge (4B) | 4B (2B 밀집) | 로봇 온디바이스 추론, 실시간 정책 실행 |
| Nano (16B) | 16B (8B 밀집) | 합성 데이터 생성, 개발·실험 |
| Super (64B) | 64B (32B 밀집) | 대규모 연구, 고품질 합성 데이터 생성 |
Edge는 로봇 본체에서 직접 실행하는 상황을 위해 설계됐다. Super는 데이터센터에서 합성 데이터 파이프라인을 돌리는 용도다.
파인튜닝 전략
Cosmos 3는 세 가지 수준의 적응 파인튜닝을 지원한다.
Action post-training: 행동 레이블이 있는 데이터로 정책 능력을 추가한다. 역방향 역학(내 행동은 무엇이었나?)과 정책 생성(다음 행동은 무엇이어야 하는가?)을 동시에 훈련한다.
도메인 적응: 특정 환경(창고, 수술실, 공장)에 맞는 비주얼과 물리적 패턴으로 생성 능력을 조정한다.
기하 조건부 생성: 포인트 클라우드나 깊이 맵을 DM 서브시퀀스 조건으로 추가해서 물리적으로 일관된 합성 데이터를 생성한다.
운영자가 먼저 확인해야 할 것
1) 라이선스 범위
Cosmos 3는 NVIDIA Open Model License로 배포된다. 완전한 오픈소스 라이선스(Apache 2.0 등)와 다르다. 상업적 배포 전에 라이선스 조항을 직접 확인한다. 특히 경쟁 제품 개발이나 특정 애플리케이션 유형에 제약이 있을 수 있다.
2) 컴퓨팅 요구사항
Super(64B)는 단일 H100 80GB GPU 하나로는 실행이 어렵다. NIM으로 배포할 때는 NVIDIA가 권장하는 멀티 GPU 설정을 먼저 확인한다. Nano(16B)는 단일 A100 80GB에서 실행 가능하다.
3) 합성 데이터 품질 검증
Cosmos 3가 생성한 합성 데이터는 현실 세계에서 검증해야 한다. 시뮬레이션과 현실 사이의 갭(sim-to-real gap)은 여전히 존재한다. 생성된 데이터로 훈련한 정책은 반드시 실제 로봇 또는 제어된 실물 환경에서 테스트해야 한다.
4) 행동 공간 정의
Cosmos 3에 행동 포스트트레이닝을 적용하려면 행동 공간(action space)을 명확히 정의해야 한다. 관절 각도, 엔드이펙터 포즈, 힘 벡터 등 어떤 표현을 사용할지, 그리고 DM 서브시퀀스 토큰으로 어떻게 인코딩할지가 훈련 결과를 좌우한다.
도입 전 체크리스트
- [ ] 라이선스(NVIDIA Open Model License) 조항을 검토해 내부 사용과 배포 범위를 확인한다.
- [ ] 모델 스케일(Edge/Nano/Super)을 실제 컴퓨팅 자원과 용도에 맞게 선택한다.
- [ ] NIM 마이크로서비스 또는 Hugging Face 직접 배포 중 운영 환경에 맞는 방식을 결정한다.
- [ ] 합성 데이터 생성 파이프라인을 설계하고 시드 데이터의 품질과 다양성을 확보한다.
- [ ] 행동 포스트트레이닝 전에 행동 공간 표현을 정의하고 인코딩 방식을 결정한다.
- [ ] 합성 데이터로 훈련한 정책을 실물 환경에서 검증하는 sim-to-real 평가 계획을 수립한다.
- [ ] NVIDIA Cosmos Framework(GitHub)에서 공식 파인튜닝 예제를 먼저 실행한다.
한 문장으로
Cosmos 3는 공유된 자기 어텐션 레이어 아래 Reasoner와 Generator 두 파라미터 집합을 두는 Mixture-of-Transformers 구조로, 언어 추론·멀티모달 생성·행동 예측을 단일 오픈 웨이트 모델에서 처리해 Physical AI 훈련 파이프라인의 구성 요소 수를 줄이는 방식이다.
References
- NVIDIA Launches Cosmos 3, the Open Frontier Foundation Model for Physical AI (NVIDIA Newsroom): https://nvidianews.nvidia.com/news/nvidia-launches-cosmos-3-the-open-frontier-foundation-model-for-physical-ai
- Cosmos 3: Omnimodal World Models for Physical AI — Technical Report (arXiv): https://arxiv.org/abs/2606.02800
- Welcome NVIDIA Cosmos 3: The First Open Omni-model for Physical AI (Hugging Face Blog): https://huggingface.co/blog/nvidia/cosmos-3-for-physical-ai
- Develop Physical AI Reasoning, World, and Action Models with NVIDIA Cosmos 3 (NVIDIA Technical Blog): https://developer.nvidia.com/blog/develop-physical-ai-reasoning-world-and-action-models-with-nvidia-cosmos-3/
- How Cosmos 3 Helps Physical AI Think Before It Acts (NVIDIA Blog): https://blogs.nvidia.com/blog/cosmos-3-physical-ai-open-world-foundation-model/
- NVIDIA Cosmos GitHub Repository: https://github.com/NVIDIA/cosmos
- Introducing NVIDIA Cosmos Policy for Advanced Robot Control (Hugging Face Blog): https://huggingface.co/blog/nvidia/cosmos-policy-for-robot-control