LLM WikiAccess-protected knowledge portal

WIKI

Gemini 3.6 Flash·3.5 Flash-Lite: 에이전트 루프에서 토큰 비용을 다시 계산하게 만드는 두 모델

왜 지금 봐야 하나 2026년 7월 21일, Google은 Gemini 3.6 Flash, 3.5 Flash Lite, 3.5 Flash Cyber 세 모델을 동시에 공개했다. 이 릴리스를 단순히 "Flash 계열 업그레이드"로 읽으면 핵심을 놓친다. 이번 릴리스의 진짜 질문은 하나다. 에이전트 루프를 대규모로 운영할 때, 모델을 더 좋게 만드는 것과 더 효율적으로 만드는 것 중 무엇이 먼저인가? Google의 답은 명확하다.

경로human/study/content/ai-frontier/41-gemini-3-6-flash-3-5-flash-lite-token-efficiency-agentic.md
카테고리Study
태그#agentic #ai-review #efficiency #flash #lite #study #token

왜 지금 봐야 하나

2026년 7월 21일, Google은 Gemini 3.6 Flash, 3.5 Flash-Lite, 3.5 Flash Cyber 세 모델을 동시에 공개했다. 이 릴리스를 단순히 "Flash 계열 업그레이드"로 읽으면 핵심을 놓친다. 이번 릴리스의 진짜 질문은 하나다.

에이전트 루프를 대규모로 운영할 때, 모델을 더 좋게 만드는 것과 더 효율적으로 만드는 것 중 무엇이 먼저인가?

Google의 답은 명확하다. 3.6 Flash는 정확도를 높이면서 동시에 출력 토큰을 17% 줄였고, 특정 에이전트 코딩 벤치마크(DeepSWE)에서는 65%까지 줄였다. 3.5 Flash-Lite는 초당 350토큰이라는 처리량을 앞세워 분류·추출·라우팅 같은 대량 호출의 단가를 다시 설정했다.

이 두 모델이 같은 날 나온 이유는 Flash 계열의 용도를 두 층으로 분리하겠다는 의도다.


두 모델 한눈에 보기

항목Gemini 3.6 FlashGemini 3.5 Flash-Lite
공개일2026-07-212026-07-21
입력 가격$0.30 / 1M 토큰$0.30 / 1M 토큰
출력 가격$7.50 / 1M 토큰 (3.5 Flash: $9.00)$2.50 / 1M 토큰
처리량350 토큰/초
컨텍스트 창1,048,576 토큰1,048,576 토큰
최대 출력65,536 토큰65,536 토큰
생각(Thinking)지원 (구성 가능)minimal / low / higher 3단계
멀티모달 입력지원 (네이티브)지원 (네이티브)
Computer Use포함포함
주요 용도에이전트 워크플로, 대용량 입력분류·추출·라우팅·번역·문서 처리

에이전트 루프에서 토큰 비용은 복리로 쌓인다

Gemini 3.6 Flash를 이해하려면 에이전트 루프의 토큰 구조부터 봐야 한다. 단순 API 호출은 "입력 → 출력"으로 끝나지만, 에이전트 루프는 다르다.

에이전트 루프: 단계가 줄면 입력도 복리로 줄어든다 Gemini 3.5 Flash — 5단계 루프 이력 100K 출력 단계1 55K tkn 이력+도구1 155K 출력 단계2 52K tkn 이력+도구1+2 207K 출력 단계3 48K tkn 이력+도구1+2+3 255K 출력 단계4 43K tkn 이력+도구1~4 298K 출력 단계5 37K tkn 총 입력: ~1,015K 토큰 | 총 출력: ~235K 토큰 출력 $9/1M 기준 약 $2.12 Gemini 3.6 Flash — 3단계 루프 (동일 작업) 이력 100K 출력 단계1 45K tkn 이력+도구1 145K 출력 단계2 38K tkn 이력+도구1+2 183K 출력 단계3 14K tkn 단계 4·5 없음 (루프 종료) 단계 4·5 없음 (루프 종료) 총 입력: ~428K 토큰 | 총 출력: ~97K 토큰 출력 $7.50/1M 기준 약 $0.73 (절감율 ~65%) 누적 입력 이력 모델 출력
에이전트 루프에서 토큰 비용이 복리로 쌓이는 구조

위 그림의 핵심은 이것이다. Gemini 3.6 Flash가 동일한 작업을 5단계 대신 3단계로 완료하면, 출력 토큰 절감(235K → 97K)보다 입력 토큰 절감(1,015K → 428K)이 더 크다. 에이전트 루프에서 출력 효율이 의미하는 절감은 단순 비율보다 훨씬 크다.


Gemini 3.6 Flash: 같은 작업, 더 적은 단계

수치로 보는 변화

3.6 Flash는 3.5 Flash와 동일한 입력 가격($0.30/1M)을 유지하면서 출력 가격을 $9.00에서 $7.50으로 낮췄다. 그러나 가격표보다 중요한 것은 모델이 실제로 내뱉는 토큰 수다.

Google이 공개한 수치에 따르면 DeepSWE 기준 출력 가격 인하(17%)와 토큰 감소(65%)를 합치면, 이미 Gemini 3.5 Flash 사용자의 경우 같은 작업에 대한 실질 비용이 약 31% 하락하고 에이전트 코딩 워크로드에서는 최대 71%까지 줄어든다고 본다.

왜 "더 짧게" 쓰는가

"같은 정확도에 더 짧은 출력"이 가능한 이유는 모델 학습 과정에서 불필요한 추론 단계와 중간 반복을 줄이는 방향으로 강화학습이 이루어졌기 때문이다. 이것은 단순히 출력을 잘라내는 것이 아니라 실제로 더 짧은 경로로 답에 도달하는 것이다.

이 차이는 에이전트 루프에서 다음과 같이 나타난다.

Open question: 생각(thinking) 토큰은 Artificial Analysis 지수에 포함되는지, 아니면 가시적 출력 토큰만 비교한 것인지 공식 문서에서 명확히 언급하지 않는다.


Gemini 3.5 Flash-Lite: 처리량이 먼저인 계층

350 토큰/초의 의미

3.5 Flash-Lite의 핵심 지표는 초당 350토큰이다. 이것은 비교 기준이 있을 때 의미가 생긴다. 에이전트 서브 라우터나 분류기로 쓰는 경우, 하루 1억 건 요청을 처리할 때 대기 시간이 짧고 가격이 낮을수록 실제 운영 비용이 크게 달라진다.

$0.30 입력 / $2.50 출력 가격에 350토큰/초 처리량은 대량 분류·추출·번역 작업에서 GPT-4o mini 계열과 정면 경쟁하는 포지션이다.

구성 가능한 생각 수준

Flash-Lite는 thinking을 세 단계로 조절할 수 있다.

이 설계는 "단순 작업은 단순하게, 복잡한 작업은 필요한 만큼만" 쓰게 한다. 같은 모델을 파이프라인의 여러 위치에 다른 설정으로 배치할 수 있다.

Flash-Lite가 맞는 작업


3.5 Flash Cyber: 간략 소개

같은 날 공개된 3.5 Flash Cyber는 보안 전문 모델이다. 취약점 분석, 침투 테스트 시나리오, CTF 문제 해결에 특화된 파인튜닝이 적용됐다고 설명되며, Flash-Lite보다 이 계층에서 차별화된다. 운영 목적의 일반 에이전트 워크플로에는 3.6 Flash나 Flash-Lite가 더 적합하다. 보안 특화 워크로드에만 Cyber를 검토하면 된다.


운영 관점 체크리스트

3.6 Flash 도입 판단

3.5 Flash-Lite 도입 판단


한 줄 결론

Gemini 3.6 Flash는 에이전트를 더 빠르게 만드는 것이 아니라 더 짧게 생각하게 만드는 방향으로 튜닝됐고, 에이전트 루프에서 그 절감은 단계마다 복리로 누적된다. 3.5 Flash-Lite는 속도와 단가가 기준인 대량 처리 계층에 자리 잡았다.

References