Multi-Stream LLM: 병렬 스트림 계산으로 에이전트의 읽기·생각·행동을 동시에 실행하는 방법
요약
현재 LLM 기반 에이전트는 하나의 순차적 스트림 안에서 동작한다. 읽고, 생각하고, 행동하는 과정이 순서대로 이어진다. 읽는 동안 행동할 수 없고, 쓰는 동안 새 입력에 반응할 수 없다. 이 구조적 제약을 "차단(blocking)" 문제라고 부른다.
Multi-Stream LLMs(arXiv:2605.12460)는 이 문제를 근본에서 다룬다. 단일 순차 스트림 대신 여러 입출력 스트림을 하나의 포워드 패스에서 병렬로 처리하도록 LLM을 훈련시킨다. 이때 각 스트림은 서로의 이전 토큰을 참조할 수 있다(크로스-스트림 어텐션). 모델은 생각 스트림에서 추론하면서 출력 스트림에서 동시에 응답을 생성하고, 입력 스트림에서 새 정보를 읽을 수 있다.
- 병렬 스트림 수에 비례하는 이론적 처리량 향상
- 읽기·생각·행동의 구조적 분리 → 보안과 모니터링 가시성 개선
- 기존 배포된 모델에는 적용 불가 — 새 훈련 패러다임 필요
- arXiv:2605.12460 · Max Planck Institute / ETH Zurich / Tübingen AI Center · 2026-05-12
배경: 단일 스트림의 구조적 차단 문제
현재 에이전트 아키텍처의 공통 한계
현재 LLM 에이전트—Tool Use, ReAct, CoT, Computer Use를 막론하고—는 하나의 순차 메시지 스트림 위에서 동작한다. 각 포워드 패스는 이전까지의 모든 컨텍스트를 소비하고, 다음 토큰 하나를 생성한다.
이 구조에서 발생하는 네 가지 차단:
- 읽는 동안 행동 불가: 긴 시스템 프롬프트나 도구 응답을 처리하는 동안 다른 출력을 생성할 수 없다.
- 쓰는 동안 반응 불가: 긴 응답을 생성하는 중에 스트리밍으로 들어오는 새 이벤트를 처리할 수 없다.
- 행동하는 동안 생각 불가: 도구를 호출하고 결과를 기다리는 동안 다음 추론 단계를 준비하지 못한다.
- 읽는 동안 생각 불가: 컨텍스트 수집과 추론이 순차적이다.
Multi-Stream LLM 아키텍처
핵심 아이디어: 병렬 I/O 채널
Multi-Stream LLM은 LLM의 입출력을 복수의 채널(스트림)로 확장한다. 각 포워드 패스에서:
- 입력 측: 모델은 여러 입력 스트림에서 동시에 읽는다. 스트림마다 다른 역할(사용자 메시지, 시스템 컨텍스트, 도구 결과)을 담을 수 있다.
- 출력 측: 모델은 각 출력 스트림에 토큰 하나씩을 병렬로 생성한다. 한 스트림은 추론 체인, 다른 스트림은 사용자 응답, 또 다른 스트림은 도구 호출 파라미터일 수 있다.
- 자리 표시자: 특정 스텝에서 비어 있는 스트림은 자리 표시자 토큰으로 채워진다. 이렇게 하면 배치 효율이 유지된다.
크로스-스트림 어텐션
Multi-Stream LLM의 어텐션 마스크는 기존 인과적 자기-어텐션을 확장한다. 토큰은 자신의 스트림 내 이전 토큰뿐 아니라 다른 스트림의 이전 타임스텝 토큰에도 어텐션할 수 있다. 단, 인과성은 시간 축 기준으로 유지된다—미래 토큰에 어텐션하는 것은 불가능하다.
이 구조의 핵심 이점은 가중치를 공유한다는 점이다. 여러 스트림을 처리하기 위해 여러 모델이 필요하지 않다. 동일한 Transformer 가중치가 하나의 포워드 패스에서 모든 스트림 토큰을 동시에 처리한다.
훈련 방식
기존 체크포인트를 그대로 사용할 수 없다. Multi-Stream 형식을 이해하는 모델은 새로운 명령 조정(instruction-tuning)이 필요하다. 논문은 두 가지 경로를 제시한다.
| 경로 | 내용 | 비용 |
|---|---|---|
| 전체 훈련 | 처음부터 multi-stream 형식으로 사전 훈련 | 높음 — 새 모델 패밀리 필요 |
| 파인튜닝 | 기존 모델에 multi-stream 명령 조정 추가 | 상대적으로 낮음 |
논문의 실험은 파인튜닝 경로에서 수행됐다. GitHub 저장소(seal-rg/streaming)에서 코드와 모델이 공개돼 있다.
활용 패턴과 이점
1. 에이전트 지연 감소
순차 아키텍처에서 에이전트는 "생각 → 도구 호출 → 결과 처리 → 응답 생성"을 직렬로 수행한다. Multi-Stream에서는 생각 스트림이 추론을 이어가면서, 행동 스트림이 도구 호출 파라미터를 동시에 생성할 수 있다. 이론적으로 전체 지연은 직렬 합이 아닌 가장 긴 단일 스트림의 길이에 수렴한다.
2. 보안: 입출력 분리
현재 프롬프트 인젝션 공격은 사용자 입력이 시스템 프롬프트와 동일한 스트림에 흐른다는 점을 이용한다. Multi-Stream에서 시스템 프롬프트와 사용자 입력을 서로 다른 스트림에 배치하면, 사용자 텍스트가 시스템 명령어처럼 해석될 가능성이 구조적으로 줄어든다. 모델은 두 스트림 사이의 역할 경계를 학습 과정에서 내재화한다.
3. 모니터링 가시성
단일 스트림 CoT는 생각과 출력이 동일한 문자열에 섞여 있어, 추론 과정을 후처리로 분리해야 한다. Multi-Stream에서 생각 스트림은 물리적으로 분리돼 있으므로 별도 파싱 없이 추론 흔적을 독립적으로 기록할 수 있다. 감사 로그와 디버깅 파이프라인이 단순해진다.
한계와 미결 과제
배포 현실
논문 발표 시점 기준으로 vLLM, SGLang, TRT-LLM 같은 프로덕션 추론 엔진은 Multi-Stream 형식을 지원하지 않는다. 기존에 배포된 수십억 파라미터 모델(GPT-5, Claude, Gemma 등)은 이 방식으로 작동하지 않는다. 새 훈련 패러다임이므로 기존 생태계와의 단절이 상당하다.
성능 검증 범위
공개된 실험은 파인튜닝된 소규모 모델을 중심으로 한다. 대형 모델(70B 이상)에서의 크로스-스트림 어텐션 오버헤드와 품질 저하 여부는 미검증이다.
스트림 수 선택
최적 스트림 수는 태스크에 의존한다. 스트림이 많을수록 KV 캐시 메모리 요구량이 증가하고, 어텐션 마스크 복잡도가 늘어난다. 스트림 수를 동적으로 결정하는 기준이 아직 명확하지 않다.
새 훈련/파인튜닝 필요
프로덕션 엔진 미지원
대형 모델 미검증
도구 호출 성능 수치 부족
메모리 압박 가중
최적 스트림 수 미정립
GitHub 코드 공개
커뮤니티 검증 필요
운영자 시사점
Multi-Stream LLM은 현재 즉시 배포할 수 있는 기술이 아니다. 그러나 에이전트 인프라를 설계하는 입장에서 두 가지 관점이 중요하다.
아키텍처 방향 참고: 오늘날 에이전트 시스템은 멀티-에이전트 협업, MCP 프로토콜, 병렬 도구 호출로 단일 스트림의 한계를 우회한다. Multi-Stream LLM이 시사하는 것은 이 우회로가 언젠가 모델 아키텍처 수준에서 내재화될 수 있다는 방향성이다.
보안 설계 영향: 프롬프트 인젝션 방지를 위해 시스템 프롬프트와 사용자 입력을 구조적으로 분리하는 시도는 이미 여러 형태로 진행 중이다(System Prompt Isolation, Structured Output 등). Multi-Stream은 이 분리를 모델 계산 수준으로 가져온 것이다. 단기적으로는 현재 접근법이 유효하고, 중기적으로 Multi-Stream 계열의 모델이 가드레일 설계를 단순화할 가능성이 있다.
Open Question
- 프로덕션 추론 엔진(vLLM, SGLang)에서 Multi-Stream 어텐션 마스크를 효율적으로 구현하는 방법은?
- 스트림 수와 KV 캐시 메모리 간 최적 균형점은?
- 대형 모델(70B 이상)에서 크로스-스트림 어텐션이 품질에 미치는 영향은?
- 기존 모델의 파인튜닝만으로 완전한 Multi-Stream 능력을 획득할 수 있는가?
References
- arXiv:2605.12460 — "Multi-Stream LLMs: Unblocking Language Models with Parallel Streams of Thoughts, Inputs and Outputs" (2026-05-12), Guinan Su, Yanwu Yang, Xueyan Li, Jonas Geiping, Max Planck Institute for Intelligent Systems / ETH Zurich / Tübingen AI Center / ELLIS Institute Tübingen
- GitHub: https://github.com/seal-rg/streaming — 코드 및 공개 모델
- arXiv:2504.06261 — "Hogwild! Inference: Parallel LLM Generation via Concurrent Attention" (관련 병렬 디코딩 연구)
- arXiv:2606.05158 — "Streaming Communication in Multi-Agent Reasoning" (관련 멀티-에이전트 스트리밍 연구)