LLM WikiAccess-protected knowledge portal
← 스터디 홈
70편 · 약 13분

GPT-5.6 Sol 자기 최적화: AI가 자신의 GPU 커널을 다시 쓰고 추론 비용을 20% 낮춘 방법

왜 지금 봐야 하나

2026년 7월 30일, OpenAI는 GPT-5.6 Luna의 API 가격을 80% 인하했다. 입력 토큰 $1.00 → $0.20, 출력 토큰 $6.00 → $1.20. 기술 발표 3주 만에 이뤄진 인하다.

가격 인하 자체보다 어떻게 가능했는지가 더 중요하다. OpenAI가 밝힌 경위는 이렇다: GPT-5.6 Sol이 자체 서빙 스택의 GPU 커널 코드를 직접 수정했다. Codex 환경 안에서, 사람의 코드 한 줄 없이.

이것은 AI 인프라 운영에서 처음으로 확인된 사례다: 프런티어 AI 모델이 자신을 실행하는 소프트웨어 스택을 스스로 최적화한다.

LLM 추론 비용이 어떻게 결정되는지, 그 비용을 어떻게 낮출 수 있는지, 그리고 이 자기 최적화 루프가 만드는 운영 환경의 변화를 이 챕터에서 정리한다.


사건의 경위: 2026년 7월 30일

가격 변화

모델이전 입력이후 입력이전 출력이후 출력변화율
GPT-5.6 Sol$10/MTok$10/MTok$50/MTok$50/MTok변동 없음
GPT-5.6 Terra$2.50/MTok$2.00/MTok$15/MTok$12/MTok-20%
GPT-5.6 Luna$1.00/MTok$0.20/MTok$6.00/MTok$1.20/MTok-80%

7월 9일 GPT-5.6 패밀리 출시 이후 21일 만의 인하다. 가격 경쟁이 격화된 상황에서 OpenAI는 인하 재원을 외부 투자나 마진 축소가 아닌 서빙 효율 개선에서 찾았다.

OpenAI의 설명

OpenAI가 공개한 과정은 두 단계다.

  1. GPT-5.6 Sol이 GA 이후 Codex 환경 안에서 자사 추론 인프라의 GPU 커널 코드를 분석하고 최적화했다.
  2. 동일한 방식으로 speculative decoding 드래프트 모델을 개선했다.

결과: 서빙 비용 20% 절감, 토큰 생성 효율 15% 향상. 이 절감분이 Luna 80% 인하의 재원이 됐다.


GPU 커널 자기 최적화의 구조

커널이란 무엇인가

GPU 커널(kernel)은 GPU가 실행하는 저수준 병렬 프로그램이다. 트랜스포머 모델의 추론 과정은 대부분 커널 호출로 이뤄진다.

트랜스포머 추론 요청 처리 경로
입력 토큰
임베딩 커널
어텐션 커널
FlashAttention / MLA
FFN / MoE 커널
GEMM · 활성화
샘플링 커널
출력 토큰
커널 최적화 기회
불필요한 메모리 이동 제거
연산 퓨전 (kernel fusion)
병렬화 수준 조정
사전 연산 (precompute)
Sol이 쓴 언어
Triton
OpenAI가 관리하는 오픈소스 GPU 프로그래밍 언어. CUDA보다 추상화 수준 높음.
Gluon
OpenAI가 관리하는 또 다른 GPU 커널 언어. Triton 기반 추상화.
트랜스포머 추론의 커널 계층 구조

자기 최적화 루프

Sol이 진행한 과정은 다음과 같다.

  1. 분석: Codex 환경에서 OpenAI 프로덕션 추론 스택 코드를 읽고 병목 구간을 식별.
  2. 수정: 어텐션 커널, 로드밸런서, KV 캐시 관리, speculative decoding 드래프트 모델 코드를 Triton·Gluon으로 재작성.
  3. 검증: FpSan(Floating-Point Sanitizer)으로 수치 정확도 자동 검증. 모델이 생성한 커널 코드가 원본과 동일한 수학적 결과를 내는지 확인.
  4. 배포: 검증 통과 후 프로덕션 반영.

이 루프에서 사람의 역할은 환경 설정과 최종 배포 승인이었다. 코드를 쓰거나 수정하는 과정은 Sol이 담당했다.

FpSan: 커널 검증의 핵심

AI가 생성한 저수준 GPU 코드를 어떻게 신뢰하는가. OpenAI는 FpSan(Floating-Point Sanitizer)을 활용했다.

FpSan은 부동소수점 연산의 수치 안정성을 검사하는 도구다. AI가 재작성한 커널이:

  • 원본 커널과 동일한 출력을 생성하는지
  • 특정 입력에서 수치 발산이 발생하지 않는지
  • 부동소수점 특수값(NaN, Inf)을 올바르게 처리하는지

를 자동으로 확인한다. FpSan 자체는 오픈소스로 공개돼 있다.


Speculative Decoding 드래프트 모델 개선

가격 인하에 기여한 두 번째 요인은 speculative decoding 드래프트 모델 개선이다.

Speculative decoding은 소형 드래프트 모델이 토큰 초안을 여러 개 생성하고, 대형 타깃 모델이 이를 병렬로 검증·수용하는 추론 가속 기법이다. 드래프트 모델의 수용률(acceptance rate)이 높을수록 타깃 모델 호출 횟수가 줄어 비용과 지연이 모두 낮아진다.

Sol은 이 드래프트 모델 자체의 효율도 개선했다. 수용률을 높이는 방향으로 드래프트 모델의 추론 경로를 최적화해, 토큰 생성 효율 15% 향상을 달성했다.

개선 전
드래프트 모델 → 토큰 k개 생성
타깃 모델 → 수용률 α%로 검증
낮은 수용률 → 잦은 타깃 모델 호출
높은 서빙 비용
Sol 최적화 후
드래프트 모델 → 수용률 개선
타깃 모델 호출 횟수 감소
토큰 생성 효율 +15%
서빙 비용 -20%
Speculative Decoding 비용 구조와 개선 효과

LLM 추론 비용 하락의 맥락

이 사건은 더 큰 흐름 위에 있다. 2022년 이후 LLM 추론 비용은 3년 동안 약 1,000배 하락했다.

연도GPT-4급 성능 비용 (입력 100만 토큰)주요 요인
2022~$20초기 H100 서빙, 단일 모델
2023~$5경쟁 심화, 양자화 적용
2024~$1FlashAttention, 모델 증류
2025~$0.10Blackwell GPU, MoE 확산
2026.07~$0.04Speculative decoding 최적화, AI 자기 최적화

Luna가 $0.20로 내려온 것은 이 흐름의 연장이다. 그러나 자기 최적화 루프는 새로운 가속 요인이다. 인간 엔지니어의 병목 없이 AI가 자신의 서빙 스택을 지속적으로 개선할 수 있다면, 비용 하락 속도가 더 빨라질 수 있다.


운영자에게 무엇이 바뀌나

비용 계산 재검토 타이밍

GPT-5.6 패밀리 기준으로 현재 시점의 최적 선택 기준이 바뀌었다.

사용 패턴이전 추천현재 추천
고볼륨 단순 작업 (요약·분류)소형 OSS 모델Luna ($0.20/$1.20) 검토 가능
중간 복잡도 작업TerraTerra (-20% 인하)
추론 집약 작업SolSol (변동 없음)
멀티모달·코딩 에이전트SolSol + Codex 통합 고려

Luna의 80% 인하로 API 비용이 오픈소스 자체 서빙 비용과 경쟁하는 수준이 됐다. GPU 운영 비용, 엔지니어링 인력, 인프라 관리 오버헤드를 합산하면 일부 워크로드에서 Luna 사용이 더 경제적일 수 있다.

체크리스트

  • [ ] 기존 워크로드 비용 재계산: Luna 인하가 자사 파이프라인에 미치는 영향을 시뮬레이션한다. (토큰 수 × 이전 단가) vs (토큰 수 × 이후 단가).
  • [ ] 모델 티어 적절성 검토: Terra·Sol을 사용 중인 작업 중 Luna로 다운그레이드 가능한 것을 식별한다. 품질 임계값을 명시적으로 정의한다.
  • [ ] 자체 서빙 비교 검토: Luna 가격이 오픈소스 자체 서빙(H100 1대 $3/시간 기준)과 경쟁하는 볼륨 임계점을 계산한다.
  • [ ] FpSan 참조: AI가 생성한 GPU 커널 코드를 쓰는 팀은 OpenAI의 FpSan 방법론을 참조한다.
  • [ ] 자기 최적화 패턴 모니터링: 다른 AI 랩(Anthropic, Google, Meta)이 유사한 자기 최적화 루프를 도입할 가능성을 추적한다. 경쟁 압력이 이 방향을 가속할 수 있다.

Open Questions

  • Sol의 자기 최적화 루프가 얼마나 정기적으로 실행되는지, 자동화 수준이 어느 정도인지 OpenAI가 공개하지 않았다.
  • FpSan이 검증하는 범위(커버리지)와 놓치는 엣지 케이스에 대한 공개 기술 문서가 없다.
  • 다른 AI 랩이 동일한 자기 최적화 방식을 채택하면 추론 비용 하락이 더 가속화될지, 아니면 서빙 스택의 복잡도 증가로 상쇄될지 미확인이다.
  • Luna 80% 인하가 오픈소스 추론 엔진(vLLM, SGLang 등) 자체 서빙 생태계에 미치는 수요 영향은 아직 관찰 중이다.

References