LLM WikiAccess-protected knowledge portal

WIKI

RLVR이 LLM 추론 경계를 실제로 넓히는 방법: GRPO의 내재적 보상 메커니즘과 CoT-Pass@K

요약 DeepSeek R1, Mistral Magistral 등의 추론 모델이 이진 binary 정답 신호만으로 수학·코딩 성능을 크게 높인 메커니즘을 두고 논쟁이 이어졌다. "단순히 올바른 답의 샘플 효율성을 높인 것인가, 아니면 실제로 추론 경로 자체가 개선되는가?" 2026년 6월 아르코브 arXiv 2506.14245 에 공개된 연구는 이 질문에 실험적·이론적 근거를 제시한다. 핵심 결과는 두 가지다. 첫째, RLVR은

경로human/study/content/ai-frontier/114-rlvr-grpo-implicit-reasoning-incentive-cot-pass-k.md
카테고리Study
태그#ai-review #cot #implicit #incentive #pass #reasoning #study

요약

DeepSeek-R1, Mistral Magistral 등의 추론 모델이 이진(binary) 정답 신호만으로 수학·코딩 성능을 크게 높인 메커니즘을 두고 논쟁이 이어졌다. "단순히 올바른 답의 샘플 효율성을 높인 것인가, 아니면 실제로 추론 경로 자체가 개선되는가?"

2026년 6월 아르코브(arXiv:2506.14245)에 공개된 연구는 이 질문에 실험적·이론적 근거를 제시한다. 핵심 결과는 두 가지다. 첫째, RLVR은 정답뿐 아니라 올바른 추론 과정(CoT)의 확률도 함께 높인다. 둘째, 이 효과는 기반 LLM이 충분한 사전 지식과 논리적 역량을 갖추었을 때 조기부터 나타난다. 이를 측정하기 위해 저자들은 CoT-Pass@K라는 새로운 지표를 도입했다.


배경: GRPO와 RLVR

PPO vs GRPO

OpenAI의 PPO(Proximal Policy Optimization)는 별도의 크리틱(value) 네트워크가 필요하다. LLM 크기의 크리틱을 함께 훈련하면 메모리와 계산 비용이 두 배로 늘어난다.

DeepSeek가 DeepSeekMath(2024)에서 제안한 GRPO(Group Relative Policy Optimization)는 크리틱 없이 그룹 내 상대적 비교로 어드밴티지를 추정한다.

동일한 프롬프트에 대해 G개의 응답을 샘플링한다. 각 응답의 보상 r_i를 계산한 뒤, 그룹 평균과 표준편차로 정규화해 어드밴티지를 구한다:

A_i = (r_i - mean(r)) / std(r)

G개 응답의 상대적 순위가 학습 신호가 된다. 크리틱 네트워크가 필요 없어 메모리가 절약되고 구현이 단순하다.

검증 가능한 보상(RLVR)

수학 문제의 정답 확인, 코드의 테스트 케이스 통과처럼 자동으로 검증 가능한 이진 보상을 사용하는 학습 방식이 RLVR이다. 인간 선호 데이터(RLHF)보다 확장성이 높고 보상 해킹이 어렵다는 장점이 있다.


핵심 질문: RLVR은 추론 경로를 실제로 개선하는가?

최종 답이 정답인지만 확인하는 이진 보상으로는, 모델이 운 좋게 정답을 찾는 방식(spurious guess)과 올바른 추론 과정을 거쳐 도달하는 방식이 구분되지 않는다. 따라서 기존 Pass@K 지표만으로는 RLVR이 추론 자체를 개선하는지 알 수 없었다.


CoT-Pass@K: 추론 경로를 평가하는 새 지표

저자들은 최종 답의 정확도와 중간 추론 단계의 올바름을 동시에 측정하는 CoT-Pass@K를 제안한다.

기존 Pass@K는 K번 시도 중 최소 1번 정답을 내면 성공으로 본다. CoT-Pass@K는 정답을 내면서도 추론 과정 자체가 올바른 경우만 성공으로 센다. 이를 통해 "정답이지만 엉터리 과정"과 "정답이면서 올바른 과정"을 분리할 수 있다.


아키텍처 다이어그램

훈련 루프 — RLVR(GRPO)
프롬프트 (수학·코딩 문제)
↓ G개 응답 샘플링
r₁, r₂, …, rG
이진 보상 (정답=1, 오답=0)
↓ 그룹 정규화
A_i = (r_i − μ) / σ
크리틱 없이 어드밴티지 추정
↓ PPO-clip 업데이트
정책(Policy) 갱신
평가 — CoT-Pass@K
Pass@K
답이 맞으면 성공
(추론 경로 불문)
CoT-Pass@K
답 + 추론 경로 모두
올바를 때만 성공
RLVR의 내재적 효과
올바른 CoT 확률 ↑
spurious guess 확률 ↓
이진 보상만으로도 추론 경로가 개선됨
전제 조건
기반 LLM이 충분한
사전 지식과 논리 역량을
이미 보유해야 효과 발현
RLVR(GRPO) 훈련 루프와 CoT-Pass@K 측정 흐름

주요 발견

1. RLVR은 추론 과정을 실제로 향상시킨다

CoT-Pass@K로 측정하면, GRPO 훈련 후 올바른 추론 경로를 통해 정답에 도달하는 비율이 유의미하게 증가한다. 단순히 정답을 더 자주 찾는 것이 아니다. 이진 보상만 주어졌음에도 중간 추론 단계가 더 논리적이고 정확해진다.

2. 효과는 훈련 초기부터 나타난다

훈련이 충분히 진행된 뒤에야 추론이 개선될 것이라는 예상과 달리, 기반 LLM의 역량이 충분하면 초기 훈련 단계에서도 CoT-Pass@K 개선이 관찰된다. 초기 그룹 샘플링 결과가 다양한 올바름의 수준을 포함하고, 이 다양성이 올바른 경로를 강화하는 신호로 작동하기 때문이다.

3. 수학과 코딩 모두에서 추론 경계가 확장된다

DeepSeekMath 실험에서 GRPO는 도메인 내(GSM8K: 82.9 → 88.2, MATH: 46.8 → 51.7)뿐 아니라 도메인 외 수학 벤치마크에서도 개선을 보였다. 코딩 작업에서도 테스트 케이스 통과율 기반 이진 보상으로 동일한 효과가 재현된다.


이론적 설명

저자들은 RLVR이 올바른 추론 경로를 내재적으로 선호하는 이유를 이론적으로 설명한다.

기반 LLM이 충분한 역량을 갖추면, 올바른 CoT를 거쳐 정답에 도달하는 경로는 spurious guess보다 더 높은 사전 확률을 갖는다. GRPO가 이 경로들에 양의 어드밴티지를 부여하면, 올바른 추론 경로의 확률이 다른 경로보다 더 빠르게 상승한다. 보상이 이진이어도 이 메커니즘이 작동하는 이유는, 그룹 내 상대적 비교가 올바른 경로와 엉터리 경로 간 확률 차이를 자연스럽게 증폭하기 때문이다.


기반 모델 역량의 중요성

이 메커니즘이 성립하는 전제 조건이 있다. 기반 LLM이 해당 도메인에 대한 충분한 사전 지식과 논리적 역량을 이미 갖추어야 한다. 역량이 부족한 모델에 RLVR을 적용하면 올바른 경로의 사전 확률 자체가 낮아, 그룹 내에 올바른 샘플이 등장하지 않는다. 학습 신호가 생기지 않거나 spurious 경로만 강화될 수 있다.

이것이 모든 추론 모델 훈련 레시피에서 강력한 기반 모델 또는 SFT(지도 미세 조정) 단계가 선행되는 이유다.


RLVR과 기존 방식 비교

항목SFT (지도 미세 조정)RLHF (인간 선호)RLVR (검증 가능한 보상)
보상 신호 출처레이블된 CoT 데이터인간 선호 점수자동 검증 (정답/테스트)
크리틱 네트워크불필요필요불필요 (GRPO)
확장성데이터 확보에 의존인간 평가자 비용자동 생성 가능
추론 경로 개선레이블 품질에 의존간접적내재적으로 촉진
보상 해킹 위험낮음높음낮음 (이진/객관적)

실제 모델에서의 활용

GRPO와 RLVR은 현재 여러 추론 모델의 핵심 훈련 기법이다.


운영 관점: 추론 모델 배포 시 주의점

RLVR로 훈련된 추론 모델을 운영할 때 알아야 할 특성이 있다.

더 긴 출력: 올바른 추론 과정을 명시적으로 생성하므로 출력 토큰이 크게 증가한다. KV 캐시와 응답 버퍼를 넉넉하게 설계해야 한다.

비결정적 추론 길이: 문제 복잡도에 따라 내부 추론 단계 수가 다르다. 고정 타임아웃 대신 토큰 예산 기반 제어를 권장한다.

온도 설정 주의: RLVR 모델에서 높은 샘플링 온도는 샘플 다양성을 위한 훈련 설정이다. 서빙 시에는 낮은 온도(0.6~0.7)나 greedy 디코딩이 더 안정적인 경우가 많다.

기반 역량 검증: 도메인 특화 작업에 RLVR 모델을 fine-tuning할 계획이라면, 기반 모델이 해당 도메인에 충분한 역량을 갖추었는지 먼저 확인한다.


정리

RLVR(GRPO)은 이진 보상만으로도 LLM의 추론 경로 자체를 향상시킨다. CoT-Pass@K라는 새 지표는 이 효과를 측정할 방법을 제공한다. 핵심 메커니즘은 기반 LLM의 사전 역량과 그룹 상대적 어드밴티지 추정이 결합되어, 올바른 추론 경로가 spurious 경로보다 더 빠르게 강화된다는 것이다. 이 연구는 현재의 추론 모델 훈련 레시피가 왜 효과적인지 이론적 근거를 제공하며, 기반 모델 역량이 RLVR 효과의 전제 조건임을 명확히 한다.


References