LiveMem: 컨텍스트가 교체되어도 기억을 유지하는 장기 실행 LLM 추론 설계
요약
장기 실행 LLM 에이전트(코딩 어시스턴트, 멀티-턴 리서치 에이전트, 장기 고객 응대 봇)는 공통된 구조적 문제를 안고 있다. 인터랙션이 쌓일수록 전체 이력이 컨텍스트 창을 채우고, 오래된 정보는 잘려 나간다. 검색 증강(RAG)이나 요약(summarization)은 선택적 정보 보존이지, 상태 연속성(state continuity)은 아니다.
LiveMem(arXiv:2608.02515, 2026년 8월)은 이 문제를 "컨텍스트 교체 하의 상태 연속성(state continuity under context turnover)"으로 정의하고, 사전 학습된 전체 어텐션 LLM에 고정 용량의 메모리 상태 모듈을 결합해 풀어낸다. 메모리 상태는 활성 컨텍스트의 생애와 독립적으로 유지되며, LongMemEval 벤치마크에서 평가된 시스템 중 최고 성능을 달성한다.
문제: 컨텍스트 창을 벗어난 장기 기억
슬라이딩 윈도의 망각
표준 트랜스포머는 토큰 수로 제한된 컨텍스트 창을 갖는다. 대화가 길어질수록 앞쪽 토큰은 KV 캐시에서 밀려나고, 모델은 그 내용을 다시 볼 방법이 없다. 수 시간짜리 코딩 세션이나 수십 번 왕복하는 고객 대화에서는 초기에 공유된 중요한 정보(시스템 요구사항, 사용자 선호도, 이전 결정)가 흔적 없이 사라진다.
문제는 단순히 "긴 컨텍스트 모델을 쓰면 되지 않냐"가 아니다. 컨텍스트 창 크기를 두 배로 늘리면 어텐션 연산 비용은 네 배로 증가한다. 그리고 이론적 창 크기와 상관없이 충분히 오래 실행하면 어떤 창도 가득 찬다.
기존 해법의 구조적 한계
| 해법 | 작동 방식 | 근본 한계 |
|---|---|---|
| 요약(Summarization) | 잘린 이력을 LLM으로 압축 | 압축 손실, 어떤 세부사항이 나중에 필요할지 미리 알 수 없음 |
| 검색 증강(RAG) | 외부 벡터 DB에서 관련 이력을 쿼리 | 쿼리 시점에 무엇이 필요한지 명시해야 하며, 검색 실패 가능 |
| 긴 컨텍스트 모델 | 컨텍스트 창을 수백만 토큰으로 확장 | 비용이 길이에 제곱 비례, 전체 세션 이력을 영구 유지 불가 |
| 어텐션 싱크(Attention Sink) | 중요 토큰을 캐시에 고정 | 고정 토큰 수 제한, 이력 전체를 보존하지 않음 |
세 해법 모두 모델 내부 상태가 아닌 외부 메커니즘에 의존한다. "상태 연속성"이 아니라 "정보 검색 또는 보존"이다.
LiveMem의 설계
핵심 개념: 컨텍스트 교체 하의 상태 연속성
LiveMem이 정의하는 미싱 기능은 다음과 같다.
컨텍스트 교체 하의 상태 연속성(state continuity under context turnover): 활성 컨텍스트의 생애와 독립된 고정 용량 메모리 상태를 통해, 컨텍스트가 여러 번 교체되는 동안에도 계산을 연속적으로 이어가는 것.
"고정 용량"과 "생애 독립"이 핵심이다. 메모리 상태는 컨텍스트 창이 몇 번을 교체되더라도 살아있고, 그 크기는 일정하게 유지된다.
이중 경로 아키텍처
LiveMem은 사전 학습된 전체 어텐션 LLM에 두 개의 병렬 경로를 추가한다.
주 어텐션 경로(Main Path): 현재 활성 컨텍스트 창의 KV 캐시를 이용하는 표준 셀프 어텐션. 창 크기는 제한된다.
메모리 상태 경로(Memory State Path): 컴팩트한 상태 벡터 집합이 전체 세션 생애를 통해 점진적으로 업데이트된다. 이 상태는 중요한 과거 정보를 압축하여 보존하며, 주 어텐션 경로가 각 추론 스텝에서 이를 추가 컨텍스트로 참조할 수 있도록 제공된다.
상태 업데이트 규칙: 컨텍스트 교체가 일어날 때(또는 주기적으로), 잘려 나가는 토큰의 KV 정보를 메모리 상태에 통합한다. 이 업데이트 함수는 현재 메모리 상태와 소멸될 KV 정보를 입력으로 받아 새 메모리 상태를 출력한다.
LongMemEval 벤치마크 결과
평가 설계
LongMemEval은 장기 대화 기억 능력을 평가하는 대표적인 벤치마크다. 평가의 핵심 시나리오는 다음과 같다.
- 수십~수백 턴 대화 이후, 초기 대화에서만 등장했던 사실에 대한 질문
- 결정적 테스트: 지원 증거(supporting evidence)가 현재 컨텍스트에서 이미 제거된 상황에서 정답률을 측정
이 시나리오는 RAG나 긴 컨텍스트 확장으로는 해결할 수 없다. RAG는 명시적 쿼리가 필요하고, 긴 컨텍스트라도 창이 교체된 순간 정보를 잃는다.
결과 요약
논문이 보고하는 주요 결과:
- LongMemEval 전반적 성능: 평가된 시스템 중 최고 성능
- 핵심 결과: 지원 증거가 현재 컨텍스트에서 제거된 상황에서도 메모리 상태를 기반으로 정답률 유지
- 비교 대상: RAG 기반 방식, 요약 기반 방식, 기타 내재적 메모리(intrinsic memory) 방법
Open question: 구체적인 정확도 수치 및 비교 기법별 점수는 논문 원문(arXiv:2608.02515) 확인 필요.
기존 방식과의 차이
LiveMem vs 내재적 메모리 계열
LiveMem은 Mamba나 RWKV 같은 선형 재귀 모델(SSM)과 개념적으로 유사하지만 두 가지 점에서 다르다.
- 기반 모델: SSM은 처음부터 선형 재귀 구조로 학습한다. LiveMem은 사전 학습된 전체 어텐션 LLM에 메모리 상태 모듈을 추가한다.
- 목적: SSM은 효율적 처리를 목표로 한다. LiveMem은 장기 세션에서의 상태 연속성을 목표로 한다.
| 기준 | RAG | 요약 | SSM/RWKV | LiveMem |
|---|---|---|---|---|
| 저장 위치 | 외부 벡터 DB | 압축 텍스트 | 내부 재귀 상태 | 내부 메모리 상태 |
| 컨텍스트 독립 | ✓ | ✓ | ✓ | ✓ |
| 사전 학습 모델 재사용 | ✓ | ✓ | ✗ (재학습 필요) | ✓ |
| 검색 없이 항상 가용 | ✗ | ✗ | ✓ | ✓ |
| 고정 크기 상태 | — | 가변 | ✓ | ✓ |
운영 관점의 고려사항
언제 유용한가
LiveMem이 효과를 내는 시나리오:
- 수 시간 이상 지속되는 에이전트 세션: 리포지토리 탐색, 설계 결정, 이전 수정 이력이 축적되는 코딩 에이전트
- 반복 접촉 고객 서비스: 이전 문의 이력·해결 과정·사용자 선호도를 세션 전반에 걸쳐 참조해야 하는 봇
- 멀티-사이클 리서치 에이전트: 검색-읽기-종합 사이클을 여러 번 거치면서 초기 연구 방향과 가설을 유지해야 하는 에이전트
현재 상태
LiveMem은 2026년 8월 arXiv 프리프린트 단계다. 프로덕션 적용 전 확인이 필요한 사항:
- 지원하는 기반 LLM 아키텍처
- 훈련 방식(어댑터 파인튜닝인지 아닌지)
- 메모리 상태의 차원 크기와 추론 오버헤드
- 장기 업데이트 안정성(드리프트 여부)
Open question: 공개 코드 저장소 여부 및 상용 API 통합 지원 여부.
정리
LiveMem은 "컨텍스트 창을 키우는 것"과 "컨텍스트 밖의 정보를 검색하는 것" 두 기존 접근 모두와 다른 세 번째 길을 제안한다. 사전 학습된 LLM에 고정 용량의 영구 메모리 상태를 붙여, 컨텍스트가 교체되는 동안에도 계산 연속성을 유지한다. 에이전트 세션이 길어지고 도구 호출이 많아질수록 이런 내재적 기억 설계의 중요성은 커진다. MORI가 도구 대기 시간을 활용하는 것처럼, LiveMem은 컨텍스트 교체 순간을 메모리 갱신 기회로 전환한다.
References
- Zhichen Liu, Ruihan Sun, Hengjie Yang, Zipeng Wu, Zhaohan Chen, Xiaofan Zhang, Yang Xu, "LiveMem: Maintaining Memory State Continuity in Long-Running LLM Inference," arXiv:2608.02515, August 2026. https://arxiv.org/abs/2608.02515
- LongMemEval benchmark. https://github.com/xiaowu0162/LongMemEval
- Xiao et al., "Efficient Streaming Language Models with Attention Sinks," ICLR 2024. https://arxiv.org/abs/2309.17453
- Gu and Dao, "Mamba: Linear-Time Sequence Modeling with Selective State Spaces," arXiv:2312.00752. https://arxiv.org/abs/2312.00752
- Packer et al., "MemGPT: Towards LLMs as Operating Systems," NeurIPS 2024. https://arxiv.org/abs/2310.08560