에이전트 루프의 숨겨진 병목
LLM 에이전트는 Thought → Action → Observation 루프를 반복한다. 모델이 생각을 완성하고 도구 이름을 결정하면 그 시점부터 도구가 결과를 반환할 때까지 GPU는 유휴 상태다. SPORK 논문(arXiv:2607.03333, 2026-07-03)은 이 대기 구간이 벽시간의 16–37%를 차지하며, 일부 선행 연구에서는 35–61%에 달한다고 측정한다.
지금까지의 해법은 별도의 예측 모델(드래프터)을 훈련하거나, 정적 워크플로우 그래프를 사전에 정의하거나, 과거 실행 로그에서 도구 패턴을 학습하는 방식이었다. 이 방식들은 새 도구나 새 에이전트에 바로 적용하기 어렵다.
SPORK의 관찰: 모델 자신이 예측기가 될 수 있다. 추론 초반에 분기(fork)된 프로브가 Qwen3-32B 기준으로 도구 이름을 74.6–99.6% 정확도로 예측한다. 추가 훈련이나 보조 모델 없이 Day-1 배포가 가능하다.
투기적 포킹의 4단계
SPORK는 기존 추론 파이프라인에 다음 4개 컴포넌트를 삽입한다.
1. 프리픽스 캐시 포크
사고 연쇄(chain-of-thought, CoT) 생성을 시작할 때 KV 캐시 스냅샷을 만들어 프로브 스트림을 병렬로 분기한다. 프로브는 메인 스트림과 KV 캐시를 공유하므로 재계산 비용이 없다. 프로브는 소수의 토큰만 생성해 도구 이름 결정을 앞당긴다.
2. 확신 게이트 (Confidence Gate)
프로브가 생성한 토큰의 소프트맥스 확률이 임계값 이하이면 투기를 포기한다. 잘못된 도구 호출이 발행되는 것을 막아 태스크 정확도 하락을 1 pp 이내로 제한한다.
3. 조기 도구 발행
확신 게이트를 통과하면 도구 호출 요청을 즉시 외부 시스템에 전달한다. 이 시점부터 메인 스트림의 CoT 생성과 도구 실행이 병렬로 진행된다.
4. 부분 토큰 수락 (Partial-Token Accept)
도구 결과가 돌아왔을 때 예측이 틀렸다면 일반 순차 실행으로 복귀한다. 이때 프로브 스트림에서 생성된 토큰이 실제 CoT와 일치하는 접두사 부분은 투기적 디코딩의 수락 토큰으로 재활용한다. 빈 손으로 버리지 않는다.
비용 모델: 언제 투기가 이득인가
SPORK는 투기가 손익분기점을 넘는 조건을 다음 부등식으로 포착한다.
p × T_save > (1 − p) × T_cost
p: 예측 성공 확률 (74.6–99.6%)T_save: 도구 대기 시간 중 숨길 수 있는 양T_cost: 예측 실패 시 재실행 비용
도구 실행 시간이 짧을수록(T_save 감소), 예측 정확도가 낮을수록 손익분기점이 나빠진다. SPORK의 신뢰도 게이트는 p가 낮은 상황에서 투기를 자동 억제해 이 균형을 유지한다.
실측 결과
Qwen3-32B 기준 GAIA 벤치마크(실제 도구를 호출하는 복잡한 에이전트 태스크):
| 지표 | 기준선 | SPORK | 개선 |
|---|---|---|---|
| P95 벽시간 | 131.9 s | 108.1 s | −18% |
| 태스크 정확도 | 기준 | 기준 −0.4 pp | 사실상 동등 |
| 적용 모델 범위 | — | 4B~32B, Dense+MoE | 훈련 불필요 |
도구 이름 예측 정확도는 벤치마크와 모델 크기에 따라 다르지만 최저 74.6%에서 최고 99.6% 사이이며, 낮은 경우는 신뢰도 게이트가 투기를 억제해 정확도 손실을 방지한다.
운영 고려사항
적합한 워크로드: 도구 실행 시간이 CoT 생성보다 긴 에이전트(웹 검색, 데이터베이스 조회, 코드 실행). 도구 응답 시간이 수백 ms 이하인 경우 이득이 줄어든다.
신뢰도 임계값 튜닝: 기본값은 모든 모델에 범용으로 동작하도록 보수적으로 설정돼 있다. 도구 오호출 비용이 낮은 환경(멱등 GET 요청 등)에서는 임계값을 낮춰 더 많은 투기를 허용할 수 있다.
멀티-도구 시나리오: 하나의 CoT에서 여러 도구를 순서대로 호출하는 경우 각 도구 발행 시점마다 SPORK가 작동한다. 병렬성이 중첩될수록 절감 효과가 누적된다.
실패 처리: 도구 오호출이 발생하면 취소(idempotent 도구) 또는 보상 트랜잭션이 필요하다. SPORK는 오류 경로에 대한 정책을 사용자가 정의하도록 요구한다.
SPORK 동작 흐름
기존 접근과 비교
| 방식 | 훈련 필요 | 워크플로우 사전 정의 | Day-1 배포 |
|---|---|---|---|
| 드래프터 보조 모델 | 예 | 아니요 | 어려움 |
| 정적 그래프 예측 | 아니요 | 예 | 제한적 |
| 실행 로그 기반 학습 | 예 | 아니요 | 어려움 |
| SPORK | 아니요 | 아니요 | 즉시 |
SPORK은 추가 훈련 없이 모든 도구 집합에 바로 적용된다. 단, 도구 실행 시간이 짧거나 예측 정확도가 낮을 경우 확신 게이트가 투기를 억제해 기본 순차 실행으로 자동 폴백한다.