LLM WikiAccess-protected knowledge portal

WIKI

Speculate with Memory: 메모리가 LLM 에이전트 추론을 가속하는 방법 (arXiv:2607.12236)

요약 에이전트는 두 가지 이유로 느리다. LLM이 토큰을 생성하는 데 시간이 걸리고, 환경 도구·API·셸 을 실행하는 데도 시간이 걸린다. 스펙레티브 에이전트 실행 Speculative Agent Execution 은 두 번째 병목을 줄이는 접근법이다. 소형 추측자 모델이 다음 에이전트 액션을 미리 예측하고 환경 실행을 선제적으로 시작한다. 대형 모델이 추측을 승인하면 이미 실행 중이거나 완료된 결과를 재활용한다. 문제는 기

경로human/study/content/ai-frontier/122-speculate-with-memory-lossless-acceleration-llm-agents.md
카테고리Study
태그#acceleration #agents #ai-review #llm #lossless #memory #study

요약

에이전트는 두 가지 이유로 느리다. LLM이 토큰을 생성하는 데 시간이 걸리고, 환경(도구·API·셸)을 실행하는 데도 시간이 걸린다. 스펙레티브 에이전트 실행(Speculative Agent Execution)은 두 번째 병목을 줄이는 접근법이다. 소형 추측자 모델이 다음 에이전트 액션을 미리 예측하고 환경 실행을 선제적으로 시작한다. 대형 모델이 추측을 승인하면 이미 실행 중이거나 완료된 결과를 재활용한다.

문제는 기존 추측자가 무상태(stateless)라는 점이다. 태스크가 끝나면 경험을 버린다. 다음 태스크에서 같은 실수를 반복하고, 이전에 잘 된 패턴도 기억하지 못한다.

Speculate with Memory(arXiv:2607.12236, 2026년 7월)는 추측자에 세 가지 온라인 메모리 시스템을 장착해 이 문제를 해결한다.

결과는 액션 예측 정확도에서 19~39% 상대적 향상, 반복성이 높은 관찰 예측에서 최대 2.5× 개선이다.


배경: 에이전트 추론의 두 가지 속도 병목

토큰 생성 지연

LLM이 다음 액션을 결정하기 위해 토큰을 하나씩 생성하는 단계다. 긴 시스템 프롬프트와 과거 관찰 이력을 KV 캐시로 처리하더라도, 새 출력 토큰은 순차 생성이 필요하다. 이 지연은 모델 크기에 비례해 늘어난다.

환경 실행 지연

에이전트가 결정한 액션을 실제로 실행하는 단계다. 파일시스템 읽기, API 호출, 셸 명령 실행, 웹 검색 등이 여기 해당한다. 환경 실행은 LLM이 아무것도 하지 않는 유휴 시간이다.

[에이전트 루프 타임라인]

LLM 추론 ████████░░░░░░░░░░░░░░░░░░░░░░░░░░
               └─── 액션 결정
환경 실행       ██████████████████████
                                    └─── 관찰 반환
LLM 추론                                          ████████
...

스펙레티브 에이전트 실행은 환경 실행 유휴 구간을 활용한다. 대형 모델이 현재 액션을 결정하는 동안, 소형 추측자 모델이 그 다음 액션을 미리 예측하고 환경에서 실행을 시작한다.


스펙레티브 에이전트 실행의 원리

스펙레티브 토큰 디코딩(speculative decoding)과 스펙레티브 에이전트 실행은 다른 개념이다.

구분스펙레티브 토큰 디코딩스펙레티브 에이전트 실행
추측 대상다음 출력 토큰다음 에이전트 액션(도구 호출 등)
추측 모델소형 LLM 드래프터소형 추측자 모델
검증 주체대형 LLM (병렬 로짓 비교)대형 LLM (액션 재생성 후 비교)
병렬화 효과토큰 생성 가속환경 실행 유휴 시간 제거

실행 흐름

  1. 대형 모델이 현재 관찰 $o_t$를 받아 액션 $a_t$를 결정
  2. 동시에 추측자 모델이 $o_t$를 보고 $a_{t+1}$을 추측
  3. 추측된 $a_{t+1}$로 환경 실행 선제 시작
  4. 대형 모델이 $o_{t+1}$을 받아 $a_{t+1}^*$을 결정
  5. $a_{t+1}^* = a_{t+1}$이면 환경 결과 재활용, 아니면 환경을 다시 실행

추측이 맞으면 환경 지연 0으로 다음 스텝 진행이 가능하다. 틀려도 정확성(lossless)은 보장된다 — 대형 모델의 결정이 항상 최종 권한을 가지기 때문이다.


기존 방식의 한계: 무상태 추측자

기존 스펙레티브 에이전트 실행 연구들(e.g., SPORK arXiv:2607.03333, Act While Thinking arXiv:2603.18897)의 추측자는 무상태다. 각 태스크가 시작될 때 추측 능력은 초기화된다.

결과적으로:

복잡한 컴퓨터 제어 에이전트나 장기 실행 에이전트의 경우, 액션 공간의 분포가 도메인에 따라 강하게 편향된다. 파일 관리 에이전트는 read_file 다음에 write_file을 자주 호출한다. 고객 지원 에이전트는 lookup_order 다음에 send_email을 반복한다. 이 패턴을 기억하면 추측 정확도를 크게 높일 수 있다.


Speculate with Memory: 세 가지 온라인 메모리

Speculate with Memory — 아키텍처 개요 환경 도구 실행 API / 파일 / 셸 선제 실행 (추측 기반) 관찰 반환 o_t, o_{t+1} (실제 or 재활용) 대형 모델 최종 액션 결정 a_t* (ground truth) 추측자 모델 다음 액션 추측 â_{t+1} (예측) 온라인 메모리 시스템 (배포 중 갱신) ① 대조적 전이 테이블 Contrastive Transition Table • 액션 시퀀스 통계 누적: P(a_{t+1} | a_t, 상태) • 대조적 학습으로 오답 액션 확률 하향 보정 • 트래젝터리 완료마다 온라인 갱신 ② 에피소드 메모리 Episodic Memory • 과거 트래젝터리 세그먼트 임베딩 저장 • 현재 컨텍스트와 유사한 과거 세그먼트 검색 • 검색 결과를 추측자 프롬프트에 인컨텍스트 삽입 ③ 혼동 추적기 Confusion Tracker • 반복적으로 잘못 예측된 액션 기록 • 혼동 점수가 높은 액션의 확률 억제 • 추측자가 자신의 약점을 자가 인식 o_t o_t â_{t+1} 참조 갱신 추측이 맞으면: 환경 실행 지연 ≈ 0 / 추측이 틀려도: 대형 모델 결정이 최종 권한 (lossless 보장)
메모리 강화 스펙레티브 에이전트 실행 아키텍처

세 가지 메모리 시스템 상세

① 대조적 전이 테이블 (Contrastive Transition Table)

전이 테이블은 관찰된 에이전트 트래젝터리에서 액션 간 전이 확률을 추적한다.

P(a_{t+1} | context) ← 누적 트래젝터리 통계

일반 전이 테이블과의 차이는 대조적 학습 요소다. 단순히 "어떤 액션이 자주 온다"를 기록하는 게 아니라, "어떤 액션이 더 자주 오고 어떤 액션이 덜 와야 하는지"를 대조 쌍(contrastive pair)으로 기록한다.

대형 모델이 $a_{t+1}^* = B$를 선택했는데 추측자가 $\hat{a}_{t+1} = A$를 예측했다면:

② 에피소드 메모리 (Episodic Memory)

과거 에이전트 세그먼트(관찰+액션 시퀀스의 짧은 구간)를 벡터 임베딩으로 저장한다. 추측자가 현재 컨텍스트를 임베딩하고, 가장 유사한 과거 세그먼트를 검색한다.

검색된 세그먼트는 추측자 프롬프트에 인컨텍스트 예시로 삽입된다:

[시스템 프롬프트]
과거 유사 상황에서 에이전트는 다음과 같이 행동했습니다:
<episodic_example>
  관찰: "파일 foo.py 오류: NameError at line 42"
  액션: read_file("foo.py", lines=38-48)
  다음 관찰: ...
  다음 액션: edit_file("foo.py", line=42, ...)
</episodic_example>

에피소드 메모리는 드문 패턴의 예측 정확도를 높이는 데 특히 효과적이다. 전이 테이블이 커버하지 못하는 긴 문맥 의존성을 보완한다.

③ 혼동 추적기 (Confusion Tracker)

추측자가 반복적으로 틀리는 액션을 기록한다. 어떤 액션 $a$에 대해 혼동 점수를 다음과 같이 갱신한다:

confusion_score(a) ← α × confusion_score(a) + (1-α) × [추측이 틀린 경우 1, 맞은 경우 0]

혼동 점수가 임계값을 넘으면 해당 액션의 추측 확률에 페널티를 부여한다. 이 자기 억제 메커니즘은 "추측자가 잘 못 맞추는 상황"을 인식하고 과신을 줄인다.


평가 결과

실험은 여러 컴퓨터 제어 에이전트 벤치마크(OSWorld, WebArena 등 유사 환경)에서 진행됐다.

액션 예측 정확도

방법액션 예측 정확도베이스라인 대비
무상태 추측자 (베이스라인)1.0×
+ 전이 테이블만+11~18%1.11~1.18×
+ 에피소드 메모리만+8~14%1.08~1.14×
+ 혼동 추적기만+5~9%1.05~1.09×
전체 메모리 (3가지 합산)+19~39%1.19~1.39×

세 메모리 시스템은 독립적으로도 기여하지만, 합산 효과가 개별 효과의 단순합보다 크다. 에피소드 메모리가 찾아온 유사 과거 상황에서 전이 테이블과 혼동 추적기가 더 정확하게 작동하기 때문이다.

관찰 예측 (반복성이 높은 태스크)

반복적 액션 공간(파일 관리, 폼 입력 등)에서 관찰 예측 정확도는 최대 2.5× 증가했다. 관찰 예측이 맞으면 선제 실행에서 얻은 환경 결과를 그대로 재활용할 수 있어 지연이 크게 줄어든다.

메모리 갱신 비용

세 메모리 시스템의 온라인 갱신은 트래젝터리 완료 후 발생한다. 논문이 측정한 갱신 오버헤드는 추측자 추론 시간 대비 무시할 수 있는 수준(<3%)이었다.


에이전트 유형별 효과

메모리 강화의 효과는 에이전트 워크로드에 따라 다르다.

효과가 크다:

효과가 제한적이다:


기존 스펙레티브 디코딩과의 관계

Speculate with Memory는 기존 토큰 수준 스펙레티브 디코딩과 직교적(orthogonal)이다.

[결합 가능한 가속 레이어]

토큰 생성 가속          → 스펙레티브 디코딩 (EAGLE, XGrammar 등)
      +
환경 실행 가속          → 스펙레티브 에이전트 실행
      +
에이전트 추측 정확도    → Speculate with Memory

세 기법은 서로 다른 병목을 공략하므로 이론적으로 결합 적용이 가능하다. 실제로 추측자 모델이 스펙레티브 디코딩을 동시에 사용하는 것도 가능하다.


운영 도입 체크리스트

메모리 강화 추측자를 배포할 때 고려할 사항:


요점 정리

스펙레티브 에이전트 실행의 핵심 병목은 추측 정확도였다. 추측이 자주 틀리면 선제 실행이 헛수고가 되고, 오히려 환경 상태 오염 위험까지 생긴다.

Speculate with Memory는 이 병목을 세 가지 온라인 메모리로 공략한다:

결과는 무상태 베이스라인 대비 액션 예측 정확도 19~39% 향상, 관찰 예측 최대 2.5×다. 이 향상은 더 많은 GPU나 더 큰 모델 없이, 추측자가 경험에서 학습하는 것만으로 얻는다.

반복성이 높은 에이전트 워크로드를 운영하는 팀이라면 가장 먼저 살펴볼 최적화 레이어다.


References