LLM WikiAccess-protected knowledge portal

WIKI

Grok 4.5: Cursor 코파일럿 세션으로 학습된 V9 MoE가 코딩 에이전트 토큰 비용을 4.2배 낮추는 방법

왜 지금 봐야 하나 2026년 7월 8일 xAI가 Grok 4.5를 공개 출시했다. 스펙상으로는 1.5조 파라미터 MoE 모델이지만, 이 모델을 주목하는 이유는 세 가지 수렴점에 있다. 첫째, V9 파운데이션 . Grok 4.5는 xAI의 V9 아키텍처 위에서 처음으로 전체 스케일로 공개된 모델이다. V9는 v8 small ~500B 의 약 세 배인 1.5T 파라미터 MoE 구조를 택했다. 기반 사전학습은 2026년 5월 26

경로human/study/content/ai-frontier/61-grok-4-5-v9-moe-cursor-coding-agent.md
카테고리Study
태그#agent #ai-review #coding #cursor #grok #moe #study

왜 지금 봐야 하나

2026년 7월 8일 xAI가 Grok 4.5를 공개 출시했다. 스펙상으로는 1.5조 파라미터 MoE 모델이지만, 이 모델을 주목하는 이유는 세 가지 수렴점에 있다.

첫째, V9 파운데이션. Grok 4.5는 xAI의 V9 아키텍처 위에서 처음으로 전체 스케일로 공개된 모델이다. V9는 v8-small(~500B)의 약 세 배인 1.5T 파라미터 MoE 구조를 택했다. 기반 사전학습은 2026년 5월 26일 완료됐다.

둘째, Cursor 코파일럿 데이터 플라이휠. xAI가 2025년 Cursor를 인수하면서 코딩 세션 데이터에 직접 접근하게 됐다. 실제 버그 수정, 디버거 상호작용, 멀티파일 diff, 사용자 교정 패턴으로 이루어진 Cursor 세션 데이터를 기반 학습 이후 추가 학습(supplemental training)에 사용했다. 모델 소유자가 직접 코딩 도구를 운영하는 최초의 생산 사례다.

셋째, 토큰 효율. SWE-Bench Pro 기준으로 Grok 4.5는 과제당 평균 15,954 출력 토큰을 소비한다. Claude Opus 4.8의 67,020 토큰보다 4.2배 적다. 코딩 에이전트 루프를 프로덕션에서 운영하는 팀이라면 이 차이는 월별 API 비용에 직접 반영된다.

이 장에서는 V9 MoE 아키텍처, Cursor 데이터 학습 방식, 추론 성능과 토큰 효율, API 통합, 그리고 운영 판단 기준을 살펴본다.


모델 스펙 요약

항목
총 파라미터~1.5T (V9 파운데이션)
아키텍처MoE (Mixture of Experts)
이전 세대 대비v8-small (~500B) 대비 ~3×
컨텍스트 길이500,000 토큰
사전학습 완료2026-05-26
공개 출시2026-07-08
입력 가격$2.00 / 1M 토큰
출력 가격$6.00 / 1M 토큰
캐시 입력 가격$0.50 / 1M 토큰
추론 처리량~80–91 TPS
인프라NVIDIA GB300 NVL72 클러스터
라이선스xAI 상업 이용 약관

V9 MoE 아키텍처: 왜 dense 대신 sparse인가

Dense vs. MoE의 비용 구조

Dense transformer는 모든 토큰이 모든 파라미터를 통과한다. 1.5T dense 모델을 추론하려면 포워드 패스 한 번에 1.5T 파라미터 전체의 가중치-활성값 연산이 필요하다. GPU 메모리에 전체를 올려야 하고, 연산량은 파라미터 수에 선형으로 비례한다.

MoE는 이 구조를 깬다. 각 transformer 레이어의 FFN(Feed-Forward Network) 부분을 여러 개의 "전문가(expert)" 서브네트워크로 분리한 뒤, 토큰별로 소수의 전문가만 활성화한다. V9의 게이팅 함수(라우터)는 각 토큰 표현을 보고 어느 전문가에게 보낼지를 결정한다. 선택되지 않은 전문가의 연산은 해당 토큰에 대해 발생하지 않는다.

결과적으로 총 파라미터 수(모델 용량)와 포워드 패스당 활성 파라미터 수(실제 연산량)가 분리된다. xAI가 1.5T 스케일의 품질을 확보하면서도 ~80–91 TPS 처리량을 유지할 수 있는 구조적 이유다.

라우터 학습과 전문화

MoE의 품질은 라우터가 적절한 전문가에게 토큰을 보내는 법을 얼마나 잘 학습하느냐에 달려 있다. 코딩에 특화된 훈련 데이터(Cursor 세션)가 추가된 Grok 4.5에서는 라우터가 코드 구문, 변수 참조, 디버그 패턴에 관련된 토큰을 코딩 최적화 전문가들에게 집중시키는 방향으로 학습됐을 가능성이 높다.

입력 토큰 시퀀스
500K 컨텍스트 윈도우
어텐션 레이어
전체 적용
MoE 라우터
Top-K 전문가 선택
전문가 A
코드 분석
✅ 활성
전문가 B
언어 번역
⬜ 비활성
전문가 C
디버그 추론
✅ 활성
전문가 D
수학 계산
⬜ 비활성
전문가 …N
기타
⬜ 비활성
활성 전문가 출력 가중 합산
총 1.5T 파라미터 중 일부만 연산
출력 토큰
~80–91 TPS
Grok 4.5 V9 MoE 추론 흐름: 토큰별 희소 전문가 활성화

Cursor 데이터 플라이휠: 코딩 특화 학습의 구조

기존 코딩 모델 학습의 한계

GPT-4o, Claude 3.x 계열이 코딩 능력을 높일 때 주로 활용한 방식은 공개 코드 저장소(GitHub), 문서, 합성 데이터다. 이 데이터는 깨끗하지만 실제 개발자가 어떻게 오류를 만나고 고치는지의 패턴이 약하다. 실제 디버깅 세션, 중간에 되돌리는 diff, 반복 교정 흐름은 공개 커밋 이력에 남지 않는다.

Cursor 세션이 다른 이유

Cursor는 IDE 안에서 AI와의 대화가 코드 편집 행위와 직접 연결된다. 사용자가 무엇을 물어보고, 어떤 코드를 받아들이고, 어떤 부분을 거부하고 직접 수정했는지가 모두 기록된다.

xAI가 추가 학습에 사용한 데이터의 특성:

이 데이터는 모델에게 "코드가 어떻게 생겼는가" 뿐 아니라 "코드 작업이 어떻게 진행되는가"를 가르친다. 에이전트가 긴 코딩 작업을 자율적으로 수행할 때 필요한 단계적 추론과 오류 복구 능력과 직결된다.

데이터 플라이휠의 장기 구조

Cursor 사용자가 많을수록 더 많은 세션 데이터가 생기고, 그 데이터로 더 나은 모델이 학습되며, 더 나은 모델이 Cursor에 배포되어 더 많은 사용자를 끌어당긴다. 이 구조를 한 회사가 소유하는 것은 다른 frontier lab이 쉽게 복제하기 어려운 진입장벽이다.

Cursor 사용자
코딩 세션 생성
세션 데이터
버그·diff·교정 패턴
추가 학습
V9 베이스 위에
Grok 4.5
코딩 품질 향상
더 나은 모델 → 더 많은 Cursor 채택 → 더 많은 세션 → 다음 학습 사이클
Cursor 데이터 플라이휠: 코딩 세션 → 학습 → 배포 → 재수집

500K 컨텍스트와 에이전트 루프 설계

긴 컨텍스트가 코딩 에이전트에 실질적으로 의미하는 것

500K 토큰 컨텍스트는 대략 다음을 동시에 담을 수 있다:

컨텍스트 내용대략적 규모
중간 크기 Python 프로젝트 전체~200K 토큰
긴 작업 이력 (도구 호출 + 응답)~100K 토큰
참조 문서, README, 스키마~100K 토큰
현재 파일들과 diff 스냅샷~100K 토큰

실제 코딩 에이전트 루프에서 컨텍스트 잘림(context truncation)은 이전 작업 상태를 잃어버리거나 에러 패턴을 놓치는 원인이 된다. 500K 컨텍스트는 한 번의 연속 에이전트 세션 안에 상당한 규모의 코드베이스와 작업 이력을 함께 담을 수 있게 한다.

캐시 입력 가격의 의미

$0.50/M 캐시 입력(일반 $2.00의 1/4)은 에이전트 루프를 반복 실행할 때 누적 비용을 낮추는 핵심 구조다. 시스템 프롬프트, 코드베이스 스냅샷, 도구 정의처럼 반복되는 부분이 캐시에 적중할수록 실효 단가가 내려간다.


추론 성능: SWE-Bench Pro와 토큰 효율

벤치마크 수치

벤치마크Grok 4.5비고
SWE-Bench Pro64.7%독립 검증 진행 중
DeepSWE 1.062.0% (비교)2026년 7월 기준
Terminal-Bench 2.183.3%터미널 에이전트 태스크
Artificial Analysis 지능 지수54 / 전체 #4에이전트 도구 사용 #1

토큰 효율: 실제 비용 계산

SWE-Bench Pro 태스크당 출력 토큰 비교:

모델출력 토큰/태스크$6/M 기준 비용
Grok 4.515,954~$0.096
Claude Opus 4.8 (max)67,020~$0.402
절감4.2배~$0.306/태스크

월 10,000건 SWE-Bench 수준 코딩 태스크를 에이전트로 처리한다면 출력 토큰 비용만으로 월 $3,060의 차이가 생긴다. 이 수치는 Grok 4.5가 같은 작업을 더 적은 중간 단계로 마무리한다는 것을 의미한다.

Grok 4.5가 적은 토큰으로 같은 결과를 내는 이유는 명확하게 공개되지 않았지만, Cursor 세션 기반의 추가 학습이 "완결된 답을 내기 전에 불필요하게 탐색하는 습관"을 줄이는 방향으로 작용했을 가능성이 높다.


API 통합과 모델 ID

xAI API 기본 사용법

Grok 4.5는 xAI API에서 OpenAI 호환 형식으로 제공된다.

POST https://api.x.ai/v1/chat/completions
Authorization: Bearer <XAI_API_KEY>
Content-Type: application/json

{
  "model": "grok-4.5",
  "messages": [
    {"role": "system", "content": "You are a senior software engineer."},
    {"role": "user", "content": "Refactor this function..."}
  ],
  "max_tokens": 4096
}

도구 호출(function calling) 사용

에이전트 루프에서는 tools 파라미터로 함수 정의를 전달하면 된다. 기존 OpenAI SDK를 사용하는 코드에서 base_urlapi_key만 교체하면 Grok 4.5를 사용할 수 있다.

from openai import OpenAI

client = OpenAI(
    base_url="https://api.x.ai/v1",
    api_key="<XAI_API_KEY>"
)

response = client.chat.completions.create(
    model="grok-4.5",
    messages=[...],
    tools=[...],
    tool_choice="auto"
)

접근 경로

경로비고
xAI APIOpenAI 호환 REST API
Cursor 내장IDE에서 직접 사용
Microsoft Office 애드인Excel, Word 통합
OpenRouter다중 모델 게이트웨이 경유

운영 판단 기준

이 모델이 적합한 경우

주의해야 할 경우


Open Questions


References