1T 모델이 없어도 되는 이유를 묻기 시작했다
대형 언어 모델의 경쟁이 파라미터 수 경쟁처럼 보이던 시기가 있었다. 하지만 2026년 중반, 실제 프로덕션에서 AI 에이전트를 운영하는 팀들이 다른 질문을 꺼냈다. "API 호출 비용과 지연이 너무 비싸다. 더 작은 모델로 같은 결과를 낼 수 없는가?"
Ant Group(앤트그룹)의 AI 연구 조직 InclusionAI는 2026년 7월 26일, Ling-3.0-Flash를 공개했다. 124B 파라미터의 MoE 모델이지만 토큰 처리 시 실제로 활성화되는 파라미터는 약 5.1B에 불과하다. 자사의 1T 규모 플래그십 모델과 대부분의 벤치마크에서 동등하거나 더 나은 성능을 기록했다는 것이 Ant Group의 주장이다.
공식 기술 보고서나 arXiv 논문은 2026-08-02 기준 아직 발행되지 않았다. 이 글은 공개된 모델 카드, X 발표문, 배포 파트너 문서를 바탕으로 설계 원칙을 분석한다. 확인되지 않은 사항은 명시적으로 표기한다.
1/64 전문가 활성화: 왜 이 비율인가
일반적인 MoE 모델은 전체 전문가 중 1/8 정도를 토큰마다 활성화한다. Deepseek-V4는 256 라우팅 전문가 중 8개를 선택하므로 약 1/32다. Ling-3.0-Flash는 1/64 수준으로 훨씬 더 희소하다.
이 선택의 의미를 이해하려면 MoE 추론 비용 구조를 살펴봐야 한다.
| 구성 요소 | 비용 기여 |
|---|---|
| 활성 파라미터 | 선형 (활성 수에 비례) |
| 전문가 라우팅 통신 | 활성 수 × 전문가 크기 |
| KV 캐시 | 어텐션 레이어 수 × 시퀀스 길이에 비례 |
| 배치 오버헤드 | 전문가 수 증가 시 불균형 할당 위험 |
전문가 활성화 비율을 1/64로 낮추면 게이트 라우팅 통신 비용이 극감하고, 한 GPU에서 서빙하기 위해 필요한 메모리 용량이 줄어든다. 124B 모델이지만 실제 추론 메모리 사용은 5.1B 활성 파라미터 기준으로 계산된다(가중치 적재 포함 전체 모델은 메모리에 있어야 하지만).
다만 이 설계에는 트레이드오프가 있다. 전문가 하나에 너무 많은 역할이 집중되면 전문가 붕괴(expert collapse) — 소수의 전문가에 트래픽이 쏠리는 현상 — 위험이 커진다. Ant Group이 이를 어떻게 해결했는지는 공식 문서가 없어 Open question으로 남는다.
KDA와 MLA: 두 어텐션 메커니즘의 역할 분리
Ling-3.0-Flash의 어텐션 레이어는 두 종류가 교대로 배치된다. KDA(Kimi Delta Attention) 레이어 5개 당 MLA(Multi-head Latent Attention) 레이어 1개라는 5:1 비율이다.
KDA: 상태 공간 방식으로 긴 문맥을 처리
KDA는 Moonshot AI의 Kimi K3(arXiv:2607.24653)에서 처음 선보인 메커니즘이다. 전통적인 소프트맥스 어텐션은 시퀀스 길이의 제곱에 비례하는 계산 비용이 발생한다. KDA는 Gated DeltaNet의 확장으로, 순환 상태 행렬 Wt를 유지하되 채널별(channel-wise) 대각 게이트 Diag(αt)로 각 채널의 망각 속도를 독립적으로 제어한다.
Wt = Diag(αt) ⊙ Wt-1 + (vt - Wt-1 kt) · kt^T여기서 αt는 채널마다 다른 학습된 망각률이다. 긴 문서에서 특정 정보(예: 코드의 함수 시그니처)는 오래 유지하고, 일시적인 문맥(예: 지역 변수)은 빠르게 교체할 수 있다. 1M 토큰 컨텍스트에서도 계산 비용은 선형으로 유지된다.
Ling-3.0-Flash는 262K 토큰 네이티브 컨텍스트를 지원하며, KDA 레이어가 이 긴 문맥 처리의 핵심 엔진이다.
MLA: 정밀한 검색이 필요한 지점에 배치
MLA는 DeepSeek가 도입한 방식으로, KV 캐시를 저차원 잠재 벡터(latent vector)로 압축해 메모리 사용을 줄이면서도 표현력을 유지한다. Ling-3.0-Flash는 MLA를 전체 레이어의 1/6(5:1 비율에서 MLA 1)에만 적용한다.
이 설계의 의도는 명확하다. 대부분의 레이어(5/6)에서는 KDA의 선형 복잡도로 처리 효율을 극대화하고, 나머지(1/6)에서만 MLA의 표현력 있는 주의 메커니즘을 적용해 모델 품질을 보완한다.
계층적 캐싱 시스템: 에이전트 루프의 TTFT 문제를 어떻게 줄였나
에이전트 애플리케이션의 지연 문제 중 하나는 TTFT(Time-To-First-Token)다. 특히 멀티턴 대화나 툴 결과를 다시 컨텍스트로 넣는 에이전트 루프에서, 매번 긴 프리필(prefill) 계산을 반복해야 한다면 비용이 크게 증가한다.
Ling-3.0-Flash는 클러스터 수준의 계층적 캐싱 시스템을 도입해 이 문제를 완화한다. 이전 턴에서 계산한 KV 상태를 유지하고, 새 입력이 들어올 때 변경된 부분만 재계산한다. Ant Group의 발표에 따르면 이 시스템이 긴 입력의 TTFT를 60~80% 단축한다.
이 패턴은 Anthropic의 Prompt Cache, Google의 Context Caching과 유사한 개념이지만, 서버 측에서 클러스터 레벨로 관리한다는 점이 다르다. 특히 Alipay처럼 하루 수억 건의 사용자 세션을 처리하는 프로덕션 환경에서 이 최적화는 인프라 비용과 직결된다.
멀티에이전트 협력 아키텍처
Ant Group이 강조하는 또 다른 특징은 멀티에이전트 협력 지원이다. 에이전트 하나가 단독으로 판단하는 방식 대신, 여러 에이전트가 분업하고 결과를 상호 검증하는 패턴을 가속한다고 한다.
구체적으로:
- 도메인별 특화 에이전트가 독립적으로 서브태스크 처리
- 결과 검증 에이전트가 오판 위험을 줄임
- Alipay의 금융 서비스 AI에서 검증된 패턴
기술적 메커니즘(예: 에이전트 간 상태 공유 방식, 라우팅 논리)은 공개 문서에서 확인하기 어렵다. Open question으로 남겨둔다.
배포 현황
Ling-3.0-Flash는 모델 가중치 오픈소싱 이전에 추론 서비스 형태로 먼저 공개됐다.
| 채널 | 상태 |
|---|---|
| OpenRouter | API 제공 중 (inclusionai/ling-3.0-flash) |
| Vercel AI Gateway | API 제공 중 |
| 무료 접근 | 2026년 8월 3일까지 (이후 가격 정책 발표 예정) |
| 모델 가중치 | 오픈소스 예정 (2026-08-02 기준 미공개) |
| HuggingFace | 모델 카드 없음 (2026-08-02 기준) |
이 배포 방식은 주목할 만하다. arXiv 논문이나 HuggingFace 모델 카드 없이 API 서비스부터 시작한 것은, 기존 대형 모델의 학술적 공개 관행과 다르다. 빠른 시장 검증을 우선시한 전략으로 보인다.
운영자가 확인할 사항
채택 전 검증 체크리스트
- [ ] 벤치마크 주장 독립 검증: 공식 수치 없이 "1T 모델과 동등"이라는 주장을 수용하기 전, 자체 태스크로 직접 평가할 것
- [ ] TTFT 측정: 계층적 캐싱 효과는 입력 길이와 캐시 히트율에 따라 달라짐 — 실제 워크로드로 측정
- [ ] 긴 문맥 품질 확인: KDA 레이어에서 긴 시퀀스의 정보 유지가 얼마나 잘 되는지 확인 (262K 전체 활용 시)
- [ ] 전문가 불균형 모니터링: 1/64 희소 활성화에서 hot expert 문제 발생 여부 프로파일링
- [ ] 모델 가중치 공개 대기: 오픈소스 가중치가 공개되면 내부 추론 서버 운영 가능 여부 재검토
적합한 사용 시나리오
- 도구 호출이 많은 에이전트 루프 (짧은 입력+출력이 반복)
- 멀티턴 긴 대화에서 TTFT가 병목인 경우
- 1T 모델 대비 인프라 비용을 줄여야 하는 고빈도 서비스
적합하지 않은 사용 시나리오 (현재 기준)
- 정밀한 벤치마크 기반 모델 선택이 필요한 경우 (공식 데이터 없음)
- 온-프레미스 배포가 필요한 경우 (가중치 미공개)
- 규제 검증이 필요한 금융·의료 AI (기술 보고서 없음)
Open Questions
- 공식 기술 보고서와 arXiv 논문이 언제 발행될지 확인 필요
- 1/64 전문가 활성화에서 전문가 붕괴를 어떻게 방지했는지 불명
- 계층적 캐싱의 세부 구조(캐시 계층 수, 퇴거 정책, 클러스터 분산 방식)
- 독립적으로 검증된 벤치마크 결과 없음
- 오픈소스 가중치 공개 일정
References
- Ant Group Unveils Ling-3.0-Flash — Business Wire (2026-07-26)
- Ant Ling X announcement @AntLingAGI
- Ling-3.0-Flash on OpenRouter — InclusionAI
- Ling 3.0 Flash: Ant Group's Efficiency Play in MoE — Digital Applied
- How to Run Ling 3.0 Flash Locally — AIMadeTools
- Kimi K3 Technical Report — arXiv:2607.24653 (KDA 원출처)
- Kimi Linear Attention Paper — arXiv:2510.26692 (KDA 기반 연구)
- InclusionAI Ling 3.0 Flash Complete Guide — AIMadeTools
- Ling-3.0-flash (free) Coding Benchmark — Kilo Code