Gemini 3.6 Flash·3.5 Flash-Lite: 에이전트 루프에서 토큰 비용을 다시 계산하게 만드는 두 모델
왜 지금 봐야 하나
2026년 7월 21일, Google은 Gemini 3.6 Flash, 3.5 Flash-Lite, 3.5 Flash Cyber 세 모델을 동시에 공개했다. 이 릴리스를 단순히 "Flash 계열 업그레이드"로 읽으면 핵심을 놓친다. 이번 릴리스의 진짜 질문은 하나다.
에이전트 루프를 대규모로 운영할 때, 모델을 더 좋게 만드는 것과 더 효율적으로 만드는 것 중 무엇이 먼저인가?
Google의 답은 명확하다. 3.6 Flash는 정확도를 높이면서 동시에 출력 토큰을 17% 줄였고, 특정 에이전트 코딩 벤치마크(DeepSWE)에서는 65%까지 줄였다. 3.5 Flash-Lite는 초당 350토큰이라는 처리량을 앞세워 분류·추출·라우팅 같은 대량 호출의 단가를 다시 설정했다.
이 두 모델이 같은 날 나온 이유는 Flash 계열의 용도를 두 층으로 분리하겠다는 의도다.
두 모델 한눈에 보기
| 항목 | Gemini 3.6 Flash | Gemini 3.5 Flash-Lite |
|---|---|---|
| 공개일 | 2026-07-21 | 2026-07-21 |
| 입력 가격 | $0.30 / 1M 토큰 | $0.30 / 1M 토큰 |
| 출력 가격 | $7.50 / 1M 토큰 (3.5 Flash: $9.00) | $2.50 / 1M 토큰 |
| 처리량 | — | 350 토큰/초 |
| 컨텍스트 창 | 1,048,576 토큰 | 1,048,576 토큰 |
| 최대 출력 | 65,536 토큰 | 65,536 토큰 |
| 생각(Thinking) | 지원 (구성 가능) | minimal / low / higher 3단계 |
| 멀티모달 입력 | 지원 (네이티브) | 지원 (네이티브) |
| Computer Use | 포함 | 포함 |
| 주요 용도 | 에이전트 워크플로, 대용량 입력 | 분류·추출·라우팅·번역·문서 처리 |
에이전트 루프에서 토큰 비용은 복리로 쌓인다
Gemini 3.6 Flash를 이해하려면 에이전트 루프의 토큰 구조부터 봐야 한다. 단순 API 호출은 "입력 → 출력"으로 끝나지만, 에이전트 루프는 다르다.
- 단계마다 대화 이력 전체를 다시 읽는다. 모델이 5단계를 거쳐 해결한 작업을 3단계로 줄이면, 2단계 분의 출력 토큰이 줄어드는 것은 물론이고 3, 4, 5단계에서 반복해서 읽었을 이력도 함께 사라진다.
- 도구 호출도 입력 토큰을 소모한다. 함수 정의와 도구 호출 결과가 컨텍스트에 쌓이기 때문에, 도구 호출 횟수를 줄이면 이후 단계의 입력 크기도 줄어든다.
- 결과적으로 효율 개선은 선형이 아니다. 단계 수를 10에서 7로 줄이면 출력이 30% 줄고, 입력 누적도 상당히 줄어 전체 비용이 30% 이상 감소할 수 있다.
위 그림의 핵심은 이것이다. Gemini 3.6 Flash가 동일한 작업을 5단계 대신 3단계로 완료하면, 출력 토큰 절감(235K → 97K)보다 입력 토큰 절감(1,015K → 428K)이 더 크다. 에이전트 루프에서 출력 효율이 의미하는 절감은 단순 비율보다 훨씬 크다.
Gemini 3.6 Flash: 같은 작업, 더 적은 단계
수치로 보는 변화
3.6 Flash는 3.5 Flash와 동일한 입력 가격($0.30/1M)을 유지하면서 출력 가격을 $9.00에서 $7.50으로 낮췄다. 그러나 가격표보다 중요한 것은 모델이 실제로 내뱉는 토큰 수다.
- Artificial Analysis Index 기준: 평균 출력 17% 감소
- DeepSWE(에이전트 코딩 벤치마크): 태스크당 출력 65% 감소 (276K → 97K 토큰)
- OSWorld-Verified: 78.4% → 83% (에이전트 클릭·타이핑 작업)
Google이 공개한 수치에 따르면 DeepSWE 기준 출력 가격 인하(17%)와 토큰 감소(65%)를 합치면, 이미 Gemini 3.5 Flash 사용자의 경우 같은 작업에 대한 실질 비용이 약 31% 하락하고 에이전트 코딩 워크로드에서는 최대 71%까지 줄어든다고 본다.
왜 "더 짧게" 쓰는가
"같은 정확도에 더 짧은 출력"이 가능한 이유는 모델 학습 과정에서 불필요한 추론 단계와 중간 반복을 줄이는 방향으로 강화학습이 이루어졌기 때문이다. 이것은 단순히 출력을 잘라내는 것이 아니라 실제로 더 짧은 경로로 답에 도달하는 것이다.
이 차이는 에이전트 루프에서 다음과 같이 나타난다.
- 동일한 지식을 더 간결하게 표현
- 도구 호출 전에 불필요한 자기 점검 단계 생략
- 최종 답을 표현할 때 불필요한 부연 설명 제거
Open question: 생각(thinking) 토큰은 Artificial Analysis 지수에 포함되는지, 아니면 가시적 출력 토큰만 비교한 것인지 공식 문서에서 명확히 언급하지 않는다.
Gemini 3.5 Flash-Lite: 처리량이 먼저인 계층
350 토큰/초의 의미
3.5 Flash-Lite의 핵심 지표는 초당 350토큰이다. 이것은 비교 기준이 있을 때 의미가 생긴다. 에이전트 서브 라우터나 분류기로 쓰는 경우, 하루 1억 건 요청을 처리할 때 대기 시간이 짧고 가격이 낮을수록 실제 운영 비용이 크게 달라진다.
$0.30 입력 / $2.50 출력 가격에 350토큰/초 처리량은 대량 분류·추출·번역 작업에서 GPT-4o mini 계열과 정면 경쟁하는 포지션이다.
구성 가능한 생각 수준
Flash-Lite는 thinking을 세 단계로 조절할 수 있다.
- minimal: 생각 없음에 가까움. 규칙 기반 분류, 단순 변환, 라우팅.
- low: 짧은 추론 허용. 중간 난이도 추출, 요약.
- higher: 멀티스텝 서브 에이전트. 데이터 정제, 복잡한 판단.
이 설계는 "단순 작업은 단순하게, 복잡한 작업은 필요한 만큼만" 쓰게 한다. 같은 모델을 파이프라인의 여러 위치에 다른 설정으로 배치할 수 있다.
Flash-Lite가 맞는 작업
- 수백만 건의 문서 분류
- 스트리밍 이벤트 파싱과 구조화
- 에이전트 오케스트레이터의 라우팅 판단
- 번역 파이프라인 (품질이 인간 검수를 받지 않는 구간)
- Google Search 내부 처리 (Google이 직접 배포 중)
3.5 Flash Cyber: 간략 소개
같은 날 공개된 3.5 Flash Cyber는 보안 전문 모델이다. 취약점 분석, 침투 테스트 시나리오, CTF 문제 해결에 특화된 파인튜닝이 적용됐다고 설명되며, Flash-Lite보다 이 계층에서 차별화된다. 운영 목적의 일반 에이전트 워크플로에는 3.6 Flash나 Flash-Lite가 더 적합하다. 보안 특화 워크로드에만 Cyber를 검토하면 된다.
운영 관점 체크리스트
3.6 Flash 도입 판단
- 현재 3.5 Flash를 에이전트 루프로 쓰고 있다면 테스트부터 시작하라. 출력 품질이 유지되면서 단계 수가 줄어드는지 5개 이상의 실제 작업으로 측정하라.
- 토큰 감소 폭은 작업 유형에 따라 크게 다르다. 단순 QA 작업에서는 감소가 작고 복잡한 에이전트 코딩 태스크에서 크다.
- 생각 기능이 켜진 상태라면 thinking 토큰을 별도로 추적하라. 출력이 짧아도 thinking 토큰이 길다면 실제 절감이 예상보다 작을 수 있다.
3.5 Flash-Lite 도입 판단
- 현재 단순 분류·추출 작업에 3.5 Flash를 쓰고 있다면 Flash-Lite로 교체를 검토하라.
- thinking level을 minimal로 고정하고 정확도 테스트를 먼저 하라. 대부분의 분류 작업은 minimal에서 충분하다.
- 350토큰/초라는 처리량은 서버 측 프록시가 없는 단일 연결 기준이다. 실제 운영에서 병렬 연결 수와 레이트 리밋을 함께 검토하라.
한 줄 결론
Gemini 3.6 Flash는 에이전트를 더 빠르게 만드는 것이 아니라 더 짧게 생각하게 만드는 방향으로 튜닝됐고, 에이전트 루프에서 그 절감은 단계마다 복리로 누적된다. 3.5 Flash-Lite는 속도와 단가가 기준인 대량 처리 계층에 자리 잡았다.
References
- Google Gemini 3.6 Flash, 3.5 Flash-Lite, 3.5 Flash Cyber 릴리스 블로그 (2026-07-21): https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/
- MarkTechPost 분석: https://www.marktechpost.com/2026/07/21/google-releases-gemini-3-6-flash-3-5-flash-lite-and-3-5-flash-cyber-a-cheaper-more-token-efficient-flash-tier-built-for-agentic-workloads/
- VentureBeat 보도 (DeepSWE 65% 수치 출처): https://venturebeat.com/technology/googles-gemini-3-6-flash-model-cuts-ai-agent-token-costs-by-up-to-65-on-long-horizon-engineering-tasks-and-3-5-pro-is-on-the-way
- 9to5Google 출시 보도: https://9to5google.com/2026/07/21/gemini-3-6-flash-launch/
- Artificial Analysis Index (처리량·토큰 수 측정): https://artificialanalysis.ai/