LLM WikiAccess-protected knowledge portal
← 스터디 홈
41편 · 약 16분

Gemini 3.6 Flash·3.5 Flash-Lite: 에이전트 루프에서 토큰 비용을 다시 계산하게 만드는 두 모델

왜 지금 봐야 하나

2026년 7월 21일, Google은 Gemini 3.6 Flash, 3.5 Flash-Lite, 3.5 Flash Cyber 세 모델을 동시에 공개했다. 이 릴리스를 단순히 "Flash 계열 업그레이드"로 읽으면 핵심을 놓친다. 이번 릴리스의 진짜 질문은 하나다.

에이전트 루프를 대규모로 운영할 때, 모델을 더 좋게 만드는 것과 더 효율적으로 만드는 것 중 무엇이 먼저인가?

Google의 답은 명확하다. 3.6 Flash는 정확도를 높이면서 동시에 출력 토큰을 17% 줄였고, 특정 에이전트 코딩 벤치마크(DeepSWE)에서는 65%까지 줄였다. 3.5 Flash-Lite는 초당 350토큰이라는 처리량을 앞세워 분류·추출·라우팅 같은 대량 호출의 단가를 다시 설정했다.

이 두 모델이 같은 날 나온 이유는 Flash 계열의 용도를 두 층으로 분리하겠다는 의도다.


두 모델 한눈에 보기

항목Gemini 3.6 FlashGemini 3.5 Flash-Lite
공개일2026-07-212026-07-21
입력 가격$0.30 / 1M 토큰$0.30 / 1M 토큰
출력 가격$7.50 / 1M 토큰 (3.5 Flash: $9.00)$2.50 / 1M 토큰
처리량350 토큰/초
컨텍스트 창1,048,576 토큰1,048,576 토큰
최대 출력65,536 토큰65,536 토큰
생각(Thinking)지원 (구성 가능)minimal / low / higher 3단계
멀티모달 입력지원 (네이티브)지원 (네이티브)
Computer Use포함포함
주요 용도에이전트 워크플로, 대용량 입력분류·추출·라우팅·번역·문서 처리

에이전트 루프에서 토큰 비용은 복리로 쌓인다

Gemini 3.6 Flash를 이해하려면 에이전트 루프의 토큰 구조부터 봐야 한다. 단순 API 호출은 "입력 → 출력"으로 끝나지만, 에이전트 루프는 다르다.

  • 단계마다 대화 이력 전체를 다시 읽는다. 모델이 5단계를 거쳐 해결한 작업을 3단계로 줄이면, 2단계 분의 출력 토큰이 줄어드는 것은 물론이고 3, 4, 5단계에서 반복해서 읽었을 이력도 함께 사라진다.
  • 도구 호출도 입력 토큰을 소모한다. 함수 정의와 도구 호출 결과가 컨텍스트에 쌓이기 때문에, 도구 호출 횟수를 줄이면 이후 단계의 입력 크기도 줄어든다.
  • 결과적으로 효율 개선은 선형이 아니다. 단계 수를 10에서 7로 줄이면 출력이 30% 줄고, 입력 누적도 상당히 줄어 전체 비용이 30% 이상 감소할 수 있다.
에이전트 루프: 단계가 줄면 입력도 복리로 줄어든다 Gemini 3.5 Flash — 5단계 루프 이력 100K 출력 단계1 55K tkn 이력+도구1 155K 출력 단계2 52K tkn 이력+도구1+2 207K 출력 단계3 48K tkn 이력+도구1+2+3 255K 출력 단계4 43K tkn 이력+도구1~4 298K 출력 단계5 37K tkn 총 입력: ~1,015K 토큰 | 총 출력: ~235K 토큰 출력 $9/1M 기준 약 $2.12 Gemini 3.6 Flash — 3단계 루프 (동일 작업) 이력 100K 출력 단계1 45K tkn 이력+도구1 145K 출력 단계2 38K tkn 이력+도구1+2 183K 출력 단계3 14K tkn 단계 4·5 없음 (루프 종료) 단계 4·5 없음 (루프 종료) 총 입력: ~428K 토큰 | 총 출력: ~97K 토큰 출력 $7.50/1M 기준 약 $0.73 (절감율 ~65%) 누적 입력 이력 모델 출력
에이전트 루프에서 토큰 비용이 복리로 쌓이는 구조

위 그림의 핵심은 이것이다. Gemini 3.6 Flash가 동일한 작업을 5단계 대신 3단계로 완료하면, 출력 토큰 절감(235K → 97K)보다 입력 토큰 절감(1,015K → 428K)이 더 크다. 에이전트 루프에서 출력 효율이 의미하는 절감은 단순 비율보다 훨씬 크다.


Gemini 3.6 Flash: 같은 작업, 더 적은 단계

수치로 보는 변화

3.6 Flash는 3.5 Flash와 동일한 입력 가격($0.30/1M)을 유지하면서 출력 가격을 $9.00에서 $7.50으로 낮췄다. 그러나 가격표보다 중요한 것은 모델이 실제로 내뱉는 토큰 수다.

  • Artificial Analysis Index 기준: 평균 출력 17% 감소
  • DeepSWE(에이전트 코딩 벤치마크): 태스크당 출력 65% 감소 (276K → 97K 토큰)
  • OSWorld-Verified: 78.4% → 83% (에이전트 클릭·타이핑 작업)

Google이 공개한 수치에 따르면 DeepSWE 기준 출력 가격 인하(17%)와 토큰 감소(65%)를 합치면, 이미 Gemini 3.5 Flash 사용자의 경우 같은 작업에 대한 실질 비용이 약 31% 하락하고 에이전트 코딩 워크로드에서는 최대 71%까지 줄어든다고 본다.

왜 "더 짧게" 쓰는가

"같은 정확도에 더 짧은 출력"이 가능한 이유는 모델 학습 과정에서 불필요한 추론 단계와 중간 반복을 줄이는 방향으로 강화학습이 이루어졌기 때문이다. 이것은 단순히 출력을 잘라내는 것이 아니라 실제로 더 짧은 경로로 답에 도달하는 것이다.

이 차이는 에이전트 루프에서 다음과 같이 나타난다.

  • 동일한 지식을 더 간결하게 표현
  • 도구 호출 전에 불필요한 자기 점검 단계 생략
  • 최종 답을 표현할 때 불필요한 부연 설명 제거

Open question: 생각(thinking) 토큰은 Artificial Analysis 지수에 포함되는지, 아니면 가시적 출력 토큰만 비교한 것인지 공식 문서에서 명확히 언급하지 않는다.


Gemini 3.5 Flash-Lite: 처리량이 먼저인 계층

350 토큰/초의 의미

3.5 Flash-Lite의 핵심 지표는 초당 350토큰이다. 이것은 비교 기준이 있을 때 의미가 생긴다. 에이전트 서브 라우터나 분류기로 쓰는 경우, 하루 1억 건 요청을 처리할 때 대기 시간이 짧고 가격이 낮을수록 실제 운영 비용이 크게 달라진다.

$0.30 입력 / $2.50 출력 가격에 350토큰/초 처리량은 대량 분류·추출·번역 작업에서 GPT-4o mini 계열과 정면 경쟁하는 포지션이다.

구성 가능한 생각 수준

Flash-Lite는 thinking을 세 단계로 조절할 수 있다.

  • minimal: 생각 없음에 가까움. 규칙 기반 분류, 단순 변환, 라우팅.
  • low: 짧은 추론 허용. 중간 난이도 추출, 요약.
  • higher: 멀티스텝 서브 에이전트. 데이터 정제, 복잡한 판단.

이 설계는 "단순 작업은 단순하게, 복잡한 작업은 필요한 만큼만" 쓰게 한다. 같은 모델을 파이프라인의 여러 위치에 다른 설정으로 배치할 수 있다.

Flash-Lite가 맞는 작업

  • 수백만 건의 문서 분류
  • 스트리밍 이벤트 파싱과 구조화
  • 에이전트 오케스트레이터의 라우팅 판단
  • 번역 파이프라인 (품질이 인간 검수를 받지 않는 구간)
  • Google Search 내부 처리 (Google이 직접 배포 중)

3.5 Flash Cyber: 간략 소개

같은 날 공개된 3.5 Flash Cyber는 보안 전문 모델이다. 취약점 분석, 침투 테스트 시나리오, CTF 문제 해결에 특화된 파인튜닝이 적용됐다고 설명되며, Flash-Lite보다 이 계층에서 차별화된다. 운영 목적의 일반 에이전트 워크플로에는 3.6 Flash나 Flash-Lite가 더 적합하다. 보안 특화 워크로드에만 Cyber를 검토하면 된다.


운영 관점 체크리스트

3.6 Flash 도입 판단

  • 현재 3.5 Flash를 에이전트 루프로 쓰고 있다면 테스트부터 시작하라. 출력 품질이 유지되면서 단계 수가 줄어드는지 5개 이상의 실제 작업으로 측정하라.
  • 토큰 감소 폭은 작업 유형에 따라 크게 다르다. 단순 QA 작업에서는 감소가 작고 복잡한 에이전트 코딩 태스크에서 크다.
  • 생각 기능이 켜진 상태라면 thinking 토큰을 별도로 추적하라. 출력이 짧아도 thinking 토큰이 길다면 실제 절감이 예상보다 작을 수 있다.

3.5 Flash-Lite 도입 판단

  • 현재 단순 분류·추출 작업에 3.5 Flash를 쓰고 있다면 Flash-Lite로 교체를 검토하라.
  • thinking level을 minimal로 고정하고 정확도 테스트를 먼저 하라. 대부분의 분류 작업은 minimal에서 충분하다.
  • 350토큰/초라는 처리량은 서버 측 프록시가 없는 단일 연결 기준이다. 실제 운영에서 병렬 연결 수와 레이트 리밋을 함께 검토하라.

한 줄 결론

Gemini 3.6 Flash는 에이전트를 더 빠르게 만드는 것이 아니라 더 짧게 생각하게 만드는 방향으로 튜닝됐고, 에이전트 루프에서 그 절감은 단계마다 복리로 누적된다. 3.5 Flash-Lite는 속도와 단가가 기준인 대량 처리 계층에 자리 잡았다.

References

  • Google Gemini 3.6 Flash, 3.5 Flash-Lite, 3.5 Flash Cyber 릴리스 블로그 (2026-07-21): https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/
  • MarkTechPost 분석: https://www.marktechpost.com/2026/07/21/google-releases-gemini-3-6-flash-3-5-flash-lite-and-3-5-flash-cyber-a-cheaper-more-token-efficient-flash-tier-built-for-agentic-workloads/
  • VentureBeat 보도 (DeepSWE 65% 수치 출처): https://venturebeat.com/technology/googles-gemini-3-6-flash-model-cuts-ai-agent-token-costs-by-up-to-65-on-long-horizon-engineering-tasks-and-3-5-pro-is-on-the-way
  • 9to5Google 출시 보도: https://9to5google.com/2026/07/21/gemini-3-6-flash-launch/
  • Artificial Analysis Index (처리량·토큰 수 측정): https://artificialanalysis.ai/