왜 지금 봐야 하나
2026년 7월 8일 xAI가 Grok 4.5를 공개 출시했다. 스펙상으로는 1.5조 파라미터 MoE 모델이지만, 이 모델을 주목하는 이유는 세 가지 수렴점에 있다.
첫째, V9 파운데이션. Grok 4.5는 xAI의 V9 아키텍처 위에서 처음으로 전체 스케일로 공개된 모델이다. V9는 v8-small(~500B)의 약 세 배인 1.5T 파라미터 MoE 구조를 택했다. 기반 사전학습은 2026년 5월 26일 완료됐다.
둘째, Cursor 코파일럿 데이터 플라이휠. xAI가 2025년 Cursor를 인수하면서 코딩 세션 데이터에 직접 접근하게 됐다. 실제 버그 수정, 디버거 상호작용, 멀티파일 diff, 사용자 교정 패턴으로 이루어진 Cursor 세션 데이터를 기반 학습 이후 추가 학습(supplemental training)에 사용했다. 모델 소유자가 직접 코딩 도구를 운영하는 최초의 생산 사례다.
셋째, 토큰 효율. SWE-Bench Pro 기준으로 Grok 4.5는 과제당 평균 15,954 출력 토큰을 소비한다. Claude Opus 4.8의 67,020 토큰보다 4.2배 적다. 코딩 에이전트 루프를 프로덕션에서 운영하는 팀이라면 이 차이는 월별 API 비용에 직접 반영된다.
이 장에서는 V9 MoE 아키텍처, Cursor 데이터 학습 방식, 추론 성능과 토큰 효율, API 통합, 그리고 운영 판단 기준을 살펴본다.
모델 스펙 요약
| 항목 | 값 |
|---|---|
| 총 파라미터 | ~1.5T (V9 파운데이션) |
| 아키텍처 | MoE (Mixture of Experts) |
| 이전 세대 대비 | v8-small (~500B) 대비 ~3× |
| 컨텍스트 길이 | 500,000 토큰 |
| 사전학습 완료 | 2026-05-26 |
| 공개 출시 | 2026-07-08 |
| 입력 가격 | $2.00 / 1M 토큰 |
| 출력 가격 | $6.00 / 1M 토큰 |
| 캐시 입력 가격 | $0.50 / 1M 토큰 |
| 추론 처리량 | ~80–91 TPS |
| 인프라 | NVIDIA GB300 NVL72 클러스터 |
| 라이선스 | xAI 상업 이용 약관 |
V9 MoE 아키텍처: 왜 dense 대신 sparse인가
Dense vs. MoE의 비용 구조
Dense transformer는 모든 토큰이 모든 파라미터를 통과한다. 1.5T dense 모델을 추론하려면 포워드 패스 한 번에 1.5T 파라미터 전체의 가중치-활성값 연산이 필요하다. GPU 메모리에 전체를 올려야 하고, 연산량은 파라미터 수에 선형으로 비례한다.
MoE는 이 구조를 깬다. 각 transformer 레이어의 FFN(Feed-Forward Network) 부분을 여러 개의 "전문가(expert)" 서브네트워크로 분리한 뒤, 토큰별로 소수의 전문가만 활성화한다. V9의 게이팅 함수(라우터)는 각 토큰 표현을 보고 어느 전문가에게 보낼지를 결정한다. 선택되지 않은 전문가의 연산은 해당 토큰에 대해 발생하지 않는다.
결과적으로 총 파라미터 수(모델 용량)와 포워드 패스당 활성 파라미터 수(실제 연산량)가 분리된다. xAI가 1.5T 스케일의 품질을 확보하면서도 ~80–91 TPS 처리량을 유지할 수 있는 구조적 이유다.
라우터 학습과 전문화
MoE의 품질은 라우터가 적절한 전문가에게 토큰을 보내는 법을 얼마나 잘 학습하느냐에 달려 있다. 코딩에 특화된 훈련 데이터(Cursor 세션)가 추가된 Grok 4.5에서는 라우터가 코드 구문, 변수 참조, 디버그 패턴에 관련된 토큰을 코딩 최적화 전문가들에게 집중시키는 방향으로 학습됐을 가능성이 높다.
500K 컨텍스트 윈도우
전체 적용
Top-K 전문가 선택
코드 분석
✅ 활성
언어 번역
⬜ 비활성
디버그 추론
✅ 활성
수학 계산
⬜ 비활성
기타
⬜ 비활성
총 1.5T 파라미터 중 일부만 연산
~80–91 TPS
Cursor 데이터 플라이휠: 코딩 특화 학습의 구조
기존 코딩 모델 학습의 한계
GPT-4o, Claude 3.x 계열이 코딩 능력을 높일 때 주로 활용한 방식은 공개 코드 저장소(GitHub), 문서, 합성 데이터다. 이 데이터는 깨끗하지만 실제 개발자가 어떻게 오류를 만나고 고치는지의 패턴이 약하다. 실제 디버깅 세션, 중간에 되돌리는 diff, 반복 교정 흐름은 공개 커밋 이력에 남지 않는다.
Cursor 세션이 다른 이유
Cursor는 IDE 안에서 AI와의 대화가 코드 편집 행위와 직접 연결된다. 사용자가 무엇을 물어보고, 어떤 코드를 받아들이고, 어떤 부분을 거부하고 직접 수정했는지가 모두 기록된다.
xAI가 추가 학습에 사용한 데이터의 특성:
- 실제 버그 수정 흐름: 오류 메시지 → 진단 쿼리 → 수정 코드 → 테스트 통과 시퀀스
- 멀티파일 diff: 단일 파일이 아닌 여러 파일을 동시에 수정하는 리팩터링 패턴
- 디버거 상호작용: 스택 트레이스, 중단점, 변수 검사 단계가 있는 세션
- 사용자 교정: AI 출력 중 어느 부분을 받아들이고 어느 부분을 재작성했는지
이 데이터는 모델에게 "코드가 어떻게 생겼는가" 뿐 아니라 "코드 작업이 어떻게 진행되는가"를 가르친다. 에이전트가 긴 코딩 작업을 자율적으로 수행할 때 필요한 단계적 추론과 오류 복구 능력과 직결된다.
데이터 플라이휠의 장기 구조
Cursor 사용자가 많을수록 더 많은 세션 데이터가 생기고, 그 데이터로 더 나은 모델이 학습되며, 더 나은 모델이 Cursor에 배포되어 더 많은 사용자를 끌어당긴다. 이 구조를 한 회사가 소유하는 것은 다른 frontier lab이 쉽게 복제하기 어려운 진입장벽이다.
코딩 세션 생성
버그·diff·교정 패턴
V9 베이스 위에
코딩 품질 향상
500K 컨텍스트와 에이전트 루프 설계
긴 컨텍스트가 코딩 에이전트에 실질적으로 의미하는 것
500K 토큰 컨텍스트는 대략 다음을 동시에 담을 수 있다:
| 컨텍스트 내용 | 대략적 규모 |
|---|---|
| 중간 크기 Python 프로젝트 전체 | ~200K 토큰 |
| 긴 작업 이력 (도구 호출 + 응답) | ~100K 토큰 |
| 참조 문서, README, 스키마 | ~100K 토큰 |
| 현재 파일들과 diff 스냅샷 | ~100K 토큰 |
실제 코딩 에이전트 루프에서 컨텍스트 잘림(context truncation)은 이전 작업 상태를 잃어버리거나 에러 패턴을 놓치는 원인이 된다. 500K 컨텍스트는 한 번의 연속 에이전트 세션 안에 상당한 규모의 코드베이스와 작업 이력을 함께 담을 수 있게 한다.
캐시 입력 가격의 의미
$0.50/M 캐시 입력(일반 $2.00의 1/4)은 에이전트 루프를 반복 실행할 때 누적 비용을 낮추는 핵심 구조다. 시스템 프롬프트, 코드베이스 스냅샷, 도구 정의처럼 반복되는 부분이 캐시에 적중할수록 실효 단가가 내려간다.
추론 성능: SWE-Bench Pro와 토큰 효율
벤치마크 수치
| 벤치마크 | Grok 4.5 | 비고 |
|---|---|---|
| SWE-Bench Pro | 64.7% | 독립 검증 진행 중 |
| DeepSWE 1.0 | 62.0% (비교) | 2026년 7월 기준 |
| Terminal-Bench 2.1 | 83.3% | 터미널 에이전트 태스크 |
| Artificial Analysis 지능 지수 | 54 / 전체 #4 | 에이전트 도구 사용 #1 |
토큰 효율: 실제 비용 계산
SWE-Bench Pro 태스크당 출력 토큰 비교:
| 모델 | 출력 토큰/태스크 | $6/M 기준 비용 |
|---|---|---|
| Grok 4.5 | 15,954 | ~$0.096 |
| Claude Opus 4.8 (max) | 67,020 | ~$0.402 |
| 절감 | 4.2배 | ~$0.306/태스크 |
월 10,000건 SWE-Bench 수준 코딩 태스크를 에이전트로 처리한다면 출력 토큰 비용만으로 월 $3,060의 차이가 생긴다. 이 수치는 Grok 4.5가 같은 작업을 더 적은 중간 단계로 마무리한다는 것을 의미한다.
Grok 4.5가 적은 토큰으로 같은 결과를 내는 이유는 명확하게 공개되지 않았지만, Cursor 세션 기반의 추가 학습이 "완결된 답을 내기 전에 불필요하게 탐색하는 습관"을 줄이는 방향으로 작용했을 가능성이 높다.
API 통합과 모델 ID
xAI API 기본 사용법
Grok 4.5는 xAI API에서 OpenAI 호환 형식으로 제공된다.
POST https://api.x.ai/v1/chat/completions
Authorization: Bearer <XAI_API_KEY>
Content-Type: application/json
{
"model": "grok-4.5",
"messages": [
{"role": "system", "content": "You are a senior software engineer."},
{"role": "user", "content": "Refactor this function..."}
],
"max_tokens": 4096
}도구 호출(function calling) 사용
에이전트 루프에서는 tools 파라미터로 함수 정의를 전달하면 된다. 기존 OpenAI SDK를 사용하는 코드에서 base_url과 api_key만 교체하면 Grok 4.5를 사용할 수 있다.
from openai import OpenAI
client = OpenAI(
base_url="https://api.x.ai/v1",
api_key="<XAI_API_KEY>"
)
response = client.chat.completions.create(
model="grok-4.5",
messages=[...],
tools=[...],
tool_choice="auto"
)접근 경로
| 경로 | 비고 |
|---|---|
| xAI API | OpenAI 호환 REST API |
| Cursor 내장 | IDE에서 직접 사용 |
| Microsoft Office 애드인 | Excel, Word 통합 |
| OpenRouter | 다중 모델 게이트웨이 경유 |
운영 판단 기준
이 모델이 적합한 경우
- 코딩 에이전트 프로덕션 배포: SWE-Bench Pro 64.7% + 4.2× 토큰 효율은 코딩 중심 워크로드에서 비용 대비 성능 우위
- 긴 컨텍스트 멀티파일 작업: 500K 컨텍스트로 대규모 코드베이스를 한 번에 담는 워크플로
- 에이전트 도구 호출 집약적 태스크: Artificial Analysis 지수에서 에이전트 도구 사용 카테고리 1위
- 비용 제약이 있는 반복 파이프라인: 캐시 입력 $0.50/M + 낮은 출력 토큰 수
- OpenAI SDK를 이미 사용 중인 팀: base_url 교체로 즉시 전환 가능
주의해야 할 경우
- SWE-Bench Pro 64.7% 수치는 xAI가 자체 제시한 수치이며 독립 재현 결과가 아직 제한적이다. 실환경 타겟에서 직접 측정을 권장한다.
- 비코딩 태스크(의료, 법률, 복잡한 추론)에서의 성능은 현재 공개된 독립 벤치마크가 부족하다.
- xAI와 Cursor는 단일 생태계다. 벤더 lock-in과 데이터 정책에 대한 팀 내 검토가 필요하다.
- Grok 4.6(2T 파라미터)이 2~4주 후 출시 예정이므로, 장기 계약보다는 단기 검증 후 결정하는 전략이 합리적이다.
Open Questions
- SWE-Bench Pro 64.7%의 독립 재현 및 검증 결과 대기 중
- 실제 활성 파라미터 수와 전문가 구성(expert count, top-K)은 공식 기술 보고서 미발표
- V9 MoE 아키텍처의 전문가 수, 라우팅 정책 세부 사항은 공개되지 않음
- 컨텍스트 512K 이상 구간에서의 성능 저하(Needle-in-a-Haystack 등) 독립 측정 부재
- Grok 4.6(2T) 출시 이후 4.5 모델의 가용성과 가격 정책 변화 미확정
References
- Grok 4.5 Cursor Launch: Benchmarks & Pricing — ExplainX
- Grok 4.5: SpaceX's 1.5T V9 Model Trained on Cursor — Digital Applied
- xAI Corp. grok-4.5 API Pricing & Context Window — Requesty
- Grok 4.5 Developer Guide: API, Benchmarks, and When to Use It — byteiota
- Grok 4.5 Ships: SpaceXAI's Coding and Office Agent — Digital Applied
- Introducing Grok 4.5 — Cursor Blog
- Grok 4.5 Three Weeks In: Benchmarks, Pricing, and Cursor Co-Training Bet — The Agent Report
- Grok 4.5 Cuts Coding-Agent Cost 80%: Near-Frontier Speed — TechTimes
- Grok API Pricing (July 2026) — BenchLM.ai
- What Is Grok 4.6? xAI's 2T-Param Model Explained — kie.ai