LLM WikiAccess-protected knowledge portal

WIKI

Ling-3.0-Flash: 에이전트 추론을 위한 1/64 전문가 희소성과 KDA+MLA 하이브리드 설계

1T 모델이 없어도 되는 이유를 묻기 시작했다 대형 언어 모델의 경쟁이 파라미터 수 경쟁처럼 보이던 시기가 있었다. 하지만 2026년 중반, 실제 프로덕션에서 AI 에이전트를 운영하는 팀들이 다른 질문을 꺼냈다. "API 호출 비용과 지연이 너무 비싸다. 더 작은 모델로 같은 결과를 낼 수 없는가?" Ant Group 앤트그룹 의 AI 연구 조직 InclusionAI는 2026년 7월 26일, Ling 3.0 Flash 를 공

경로human/study/content/ai-frontier/78-ling-3-0-flash-kda-mla-hybrid-expert-sparsity-agent-inference.md
카테고리Study
태그#agent #ai-review #expert #hybrid #inference #sparsity #study

1T 모델이 없어도 되는 이유를 묻기 시작했다

대형 언어 모델의 경쟁이 파라미터 수 경쟁처럼 보이던 시기가 있었다. 하지만 2026년 중반, 실제 프로덕션에서 AI 에이전트를 운영하는 팀들이 다른 질문을 꺼냈다. "API 호출 비용과 지연이 너무 비싸다. 더 작은 모델로 같은 결과를 낼 수 없는가?"

Ant Group(앤트그룹)의 AI 연구 조직 InclusionAI는 2026년 7월 26일, Ling-3.0-Flash를 공개했다. 124B 파라미터의 MoE 모델이지만 토큰 처리 시 실제로 활성화되는 파라미터는 약 5.1B에 불과하다. 자사의 1T 규모 플래그십 모델과 대부분의 벤치마크에서 동등하거나 더 나은 성능을 기록했다는 것이 Ant Group의 주장이다.

공식 기술 보고서나 arXiv 논문은 2026-08-02 기준 아직 발행되지 않았다. 이 글은 공개된 모델 카드, X 발표문, 배포 파트너 문서를 바탕으로 설계 원칙을 분석한다. 확인되지 않은 사항은 명시적으로 표기한다.


1/64 전문가 활성화: 왜 이 비율인가

일반적인 MoE 모델은 전체 전문가 중 1/8 정도를 토큰마다 활성화한다. Deepseek-V4는 256 라우팅 전문가 중 8개를 선택하므로 약 1/32다. Ling-3.0-Flash는 1/64 수준으로 훨씬 더 희소하다.

이 선택의 의미를 이해하려면 MoE 추론 비용 구조를 살펴봐야 한다.

구성 요소비용 기여
활성 파라미터선형 (활성 수에 비례)
전문가 라우팅 통신활성 수 × 전문가 크기
KV 캐시어텐션 레이어 수 × 시퀀스 길이에 비례
배치 오버헤드전문가 수 증가 시 불균형 할당 위험

전문가 활성화 비율을 1/64로 낮추면 게이트 라우팅 통신 비용이 극감하고, 한 GPU에서 서빙하기 위해 필요한 메모리 용량이 줄어든다. 124B 모델이지만 실제 추론 메모리 사용은 5.1B 활성 파라미터 기준으로 계산된다(가중치 적재 포함 전체 모델은 메모리에 있어야 하지만).

일반 MoE (1/8)
전문가 64개 중 8개 활성
라우팅 통신 ↑↑
배치 불균형 위험 ↑
vs
Ling-3.0-Flash (1/64)
전문가 중 1개(~1/64) 활성
라우팅 통신 최소화
5.1B 활성 파라미터
총 파라미터: 124B / 활성 파라미터: 5.1B
전문가 전체: 메모리에 적재 필요 / 활성 전문가: 추론 FLOP 기여
Ling-3.0-Flash MoE 전문가 희소성 비교

다만 이 설계에는 트레이드오프가 있다. 전문가 하나에 너무 많은 역할이 집중되면 전문가 붕괴(expert collapse) — 소수의 전문가에 트래픽이 쏠리는 현상 — 위험이 커진다. Ant Group이 이를 어떻게 해결했는지는 공식 문서가 없어 Open question으로 남는다.


KDA와 MLA: 두 어텐션 메커니즘의 역할 분리

Ling-3.0-Flash의 어텐션 레이어는 두 종류가 교대로 배치된다. KDA(Kimi Delta Attention) 레이어 5개 당 MLA(Multi-head Latent Attention) 레이어 1개라는 5:1 비율이다.

KDA: 상태 공간 방식으로 긴 문맥을 처리

KDA는 Moonshot AI의 Kimi K3(arXiv:2607.24653)에서 처음 선보인 메커니즘이다. 전통적인 소프트맥스 어텐션은 시퀀스 길이의 제곱에 비례하는 계산 비용이 발생한다. KDA는 Gated DeltaNet의 확장으로, 순환 상태 행렬 Wt를 유지하되 채널별(channel-wise) 대각 게이트 Diag(αt)로 각 채널의 망각 속도를 독립적으로 제어한다.

Wt = Diag(αt) ⊙ Wt-1 + (vt - Wt-1 kt) · kt^T

여기서 αt는 채널마다 다른 학습된 망각률이다. 긴 문서에서 특정 정보(예: 코드의 함수 시그니처)는 오래 유지하고, 일시적인 문맥(예: 지역 변수)은 빠르게 교체할 수 있다. 1M 토큰 컨텍스트에서도 계산 비용은 선형으로 유지된다.

Ling-3.0-Flash는 262K 토큰 네이티브 컨텍스트를 지원하며, KDA 레이어가 이 긴 문맥 처리의 핵심 엔진이다.

MLA: 정밀한 검색이 필요한 지점에 배치

MLA는 DeepSeek가 도입한 방식으로, KV 캐시를 저차원 잠재 벡터(latent vector)로 압축해 메모리 사용을 줄이면서도 표현력을 유지한다. Ling-3.0-Flash는 MLA를 전체 레이어의 1/6(5:1 비율에서 MLA 1)에만 적용한다.

Ling-3.0-Flash 어텐션 레이어 배치 (반복 블록)
KDA 레이어 1
KDA 레이어 2
KDA 레이어 3
KDA 레이어 4
KDA 레이어 5
MLA 레이어
KDA 역할
선형 복잡도 긴 문맥 처리
채널별 망각률 제어
262K 토큰 효율 처리
MLA 역할
정밀 소프트맥스 어텐션
KV 캐시 저차원 압축
전역 정보 통합
KDA + MLA 5:1 하이브리드 레이어 구성

이 설계의 의도는 명확하다. 대부분의 레이어(5/6)에서는 KDA의 선형 복잡도로 처리 효율을 극대화하고, 나머지(1/6)에서만 MLA의 표현력 있는 주의 메커니즘을 적용해 모델 품질을 보완한다.


계층적 캐싱 시스템: 에이전트 루프의 TTFT 문제를 어떻게 줄였나

에이전트 애플리케이션의 지연 문제 중 하나는 TTFT(Time-To-First-Token)다. 특히 멀티턴 대화나 툴 결과를 다시 컨텍스트로 넣는 에이전트 루프에서, 매번 긴 프리필(prefill) 계산을 반복해야 한다면 비용이 크게 증가한다.

Ling-3.0-Flash는 클러스터 수준의 계층적 캐싱 시스템을 도입해 이 문제를 완화한다. 이전 턴에서 계산한 KV 상태를 유지하고, 새 입력이 들어올 때 변경된 부분만 재계산한다. Ant Group의 발표에 따르면 이 시스템이 긴 입력의 TTFT를 60~80% 단축한다.

캐싱 없이 (기존 방식)
턴 1: 전체 시퀀스 프리필
턴 2: 전체 시퀀스 재계산 ↑
턴 N: 매번 O(L²) 비용
계층적 캐싱 (Ling-3.0-Flash)
① 시스템 프롬프트 KV: GPU L2 캐시
② 이전 턴 KV: CPU 메모리 오프로드
③ 새 토큰만 GPU 재계산
TTFT: 60~80% 단축 (장문 입력 기준)
실제 캐싱 계층 구성과 퇴거 정책은 공개 문서 없음 — Open question
계층적 캐싱 시스템: 에이전트 루프에서의 TTFT 절감

이 패턴은 Anthropic의 Prompt Cache, Google의 Context Caching과 유사한 개념이지만, 서버 측에서 클러스터 레벨로 관리한다는 점이 다르다. 특히 Alipay처럼 하루 수억 건의 사용자 세션을 처리하는 프로덕션 환경에서 이 최적화는 인프라 비용과 직결된다.


멀티에이전트 협력 아키텍처

Ant Group이 강조하는 또 다른 특징은 멀티에이전트 협력 지원이다. 에이전트 하나가 단독으로 판단하는 방식 대신, 여러 에이전트가 분업하고 결과를 상호 검증하는 패턴을 가속한다고 한다.

구체적으로:

기술적 메커니즘(예: 에이전트 간 상태 공유 방식, 라우팅 논리)은 공개 문서에서 확인하기 어렵다. Open question으로 남겨둔다.


배포 현황

Ling-3.0-Flash는 모델 가중치 오픈소싱 이전에 추론 서비스 형태로 먼저 공개됐다.

채널상태
OpenRouterAPI 제공 중 (inclusionai/ling-3.0-flash)
Vercel AI GatewayAPI 제공 중
무료 접근2026년 8월 3일까지 (이후 가격 정책 발표 예정)
모델 가중치오픈소스 예정 (2026-08-02 기준 미공개)
HuggingFace모델 카드 없음 (2026-08-02 기준)

이 배포 방식은 주목할 만하다. arXiv 논문이나 HuggingFace 모델 카드 없이 API 서비스부터 시작한 것은, 기존 대형 모델의 학술적 공개 관행과 다르다. 빠른 시장 검증을 우선시한 전략으로 보인다.


운영자가 확인할 사항

채택 전 검증 체크리스트

적합한 사용 시나리오

적합하지 않은 사용 시나리오 (현재 기준)


Open Questions


References