요약
2026년 8월 13일 Google이 출시한 Gemini 3.7 Flash는 단순히 이전 Flash를 업그레이드한 모델이 아니다. 소프트웨어 엔지니어링 벤치마크 DeepSWE v1.1에서 65.3% 를 달성해 전작 3.6 Flash(48.6%) 대비 약 17포인트 앞서며, 프론티어 수준의 코딩 능력을 중간 가격대에 제공한다.
결정적 변화는 추론 제어 방식이다. 기존 thinking_budget 파라미터가 완전히 제거되고 thinking_level 문자열(low / medium / high) 로 대체됐다. 이 변화는 단순한 API 리네이밍이 아니다. 요청 단위로 "얼마나 깊이 생각할 것인가"를 명시적으로 선택할 수 있게 되어, 에이전트 루프 안에서 단순 도구 호출은 low로, 복잡한 계획 단계는 high로 설정해 토큰 비용과 응답 품질을 요청별로 최적화할 수 있다.
핵심 요약:
- 모델 ID:
gemini-3.7-flash(API 안정 버전) - 컨텍스트: 입력 1,048,576 토큰 / 출력 65,536 토큰
- 멀티모달: 텍스트·이미지·오디오·비디오·PDF 입력, 텍스트 출력
- 사고 제어:
thinking_level="low"/"medium"/"high" - 소프트웨어 엔지니어링: DeepSWE v1.1 65.3%, FrontierCode 1.1 Main 43.6%
- 가격(도입 특가, 2026년 말까지): 입력 $0.75 / 출력 $3.75 (1M 토큰 기준)
배경: Flash 계열의 포지셔닝
Google Gemini 모델 패밀리는 두 축으로 구분된다. Pro/Ultra 계열은 최대 정확도를 목표로 하고, Flash 계열은 속도·비용·에이전트 루프 최적화를 목표로 한다.
3.6 Flash까지는 "저렴하지만 성능이 낮은" 포지션이었다. 그런데 3.7 Flash는 DeepSWE와 Terminal-bench(85.8%) 기준으로 상위 모델과 경쟁하는 수준에 도달했다. 이는 Gemini 3 아키텍처의 추론 기반이 Flash 크기에서도 충분히 발현되기 시작했음을 의미한다.
핵심 변화 1: thinking_level API
thinking_budget 폐기
이전 세대 Gemini 추론 모델은 "몇 토큰을 사용해 생각할지"를 정수로 지정하는 thinking_budget 파라미터를 제공했다. 이 방식의 문제는 두 가지였다.
- 추상화 수준이 낮다: 개발자가 적절한 숫자를 추측해야 한다.
- 모델 의존성: 같은 숫자도 모델 버전마다 다른 결과를 낳는다.
3.7 Flash는 thinking_budget을 제거하고 thinking_level로 전환했다.
thinking_level 동작
import google.generativeai as genai
model = genai.GenerativeModel("gemini-3.7-flash")
# 복잡한 계획 — 깊은 추론
response = model.generate_content(
"이 파이썬 코드에서 버그를 찾아 수정 계획을 세워줘",
generation_config=genai.GenerationConfig(
thinking_config=genai.ThinkingConfig(thinking_level="high")
)
)
# 단순 추출 — 빠른 응답
response = model.generate_content(
"이 JSON에서 user_id 필드를 추출해줘",
generation_config=genai.GenerationConfig(
thinking_config=genai.ThinkingConfig(thinking_level="low")
)
)API 마이그레이션 주의: 3.7 Flash에서는 temperature, top_p, top_k, candidate_count를 비기본값으로 설정하면 400 오류가 반환된다. 이 파라미터들을 제거하고 thinking_level로 제어 전환이 필요하다.
에이전트 루프에서의 활용 패턴
def call_model(prompt: str, task_complexity: str) -> str:
level_map = {
"simple": "low", # 도구 결과 요약, 파라미터 추출
"moderate": "medium", # 멀티스텝 분기, 에러 분석
"complex": "high", # 계획 수립, 코드 생성, 아키텍처 결정
}
level = level_map.get(task_complexity, "medium")
response = model.generate_content(
prompt,
generation_config=genai.GenerationConfig(
thinking_config=genai.ThinkingConfig(thinking_level=level)
)
)
return response.text이 패턴은 에이전트 루프의 총 추론 토큰 비용을 태스크 분포에 따라 30~50% 절감할 수 있다.
핵심 변화 2: 소프트웨어 엔지니어링 성능
Gemini 3.7 Flash의 가장 두드러진 수치는 소프트웨어 엔지니어링 벤치마크다.
| 벤치마크 | 3.6 Flash | 3.7 Flash | 변화 |
|---|---|---|---|
| DeepSWE v1.1 | 48.6% | 65.3% | +16.7pp |
| FrontierCode 1.1 Main | 34.4% | 43.6% | +9.2pp |
| Terminal-bench 2.1 | 78.0% | 85.8% | +7.8pp |
DeepSWE v1.1은 실제 GitHub 리포지토리의 이슈를 해결하는 장기 소프트웨어 엔지니어링 작업을 평가한다. 단순 코드 완성이 아니라 테스트 실행, 디버깅, 파일 탐색을 포함하는 현실적 에이전트 시나리오다.
65.3%는 Flash 계열에서 처음으로 인간 시니어 개발자 수준에 근접한 수치다.
아키텍처 다이어그램: Gemini 3.7 Flash API 흐름
멀티모달 입력과 1M 컨텍스트
Gemini 3.7 Flash는 텍스트, 이미지, 오디오, 비디오, PDF를 단일 요청에 혼합 입력할 수 있다. 1,048,576 토큰 컨텍스트 창은 다음 시나리오를 가능하게 한다.
- 장문 코드베이스 분석: 수십만 줄의 소스 코드를 단일 컨텍스트에서 질문
- 멀티미디어 에이전트: 스크린샷 + 터미널 출력 + 설명 텍스트를 한 번에 처리
- 문서 파이프라인: PDF 수백 페이지를 분할 없이 요약·추출
주의: 1M 토큰을 모두 채우면 입력 비용만 $0.75이지만, 실제 에이전트 루프에서는 대부분 수천~수만 토큰 단위로 사용하므로 평균 비용은 훨씬 낮다.
운영 고려사항
API 마이그레이션 체크리스트
- [ ]
thinking_budget→thinking_level변경 ("low"/"medium"/"high") - [ ]
temperature,top_p,top_k,candidate_count기본값 이외 설정 제거 (400 오류 방지) - [ ] SDK:
google-generativeai >= 0.8.0또는google-genai >= 1.0.0 - [ ] 기존 3.6 Flash 코드에서
gemini-3.6-flash→gemini-3.7-flash모델 ID 교체
비용 최적화 패턴
에이전트 루프에서 모든 요청에 thinking_level="high"를 사용하면 비용이 높아진다. 단계별 분류가 중요하다.
| 작업 유형 | 권장 thinking_level | 예시 |
|---|---|---|
| 파라미터 추출 | "low" | JSON 필드 파싱, 날짜 추출 |
| 분류·라우팅 | "low" | 의도 분류, 에러 유형 분류 |
| 코드 리뷰·디버깅 | "medium" | 버그 원인 분석, 단위 테스트 생성 |
| 아키텍처 설계 | "high" | 시스템 설계, 리팩터링 계획 |
| 장기 소프트웨어 엔지니어링 | "high" | 이슈 해결, PR 생성 |
Spark 통합 (Google 에이전트 플랫폼)
Google의 상시형 개인 에이전트 Spark는 Gemini 3.7 Flash를 기반으로 구동된다. Google AI Pro/Ultra 구독자는 Gemini 앱에서 3.7 Flash를 기본 모델로 사용할 수 있다. 이는 소비자 제품과 개발자 API가 동일 모델 기반을 공유한다는 점에서 에코시스템 통합 측면에서 주목할 만하다.
제한사항과 열린 질문
- 출력 한도 65,536 토큰: 매우 긴 코드 생성 시 잘림 발생 가능. 스트리밍 + 청크 방식 권장.
- 컴퓨터 사용은 프리뷰: 화면 조작 기능은 아직 GA 아님. 프로덕션 의존 주의.
- 지식 기준일 2026년 3월: 2026년 4월 이후 사건은 검색 그라운딩 없이 답변 불가.
- 사고 토큰 가시성:
thinking_level결과의 내부 사고 토큰은 응답에 포함되지 않는다. 디버깅 투명성이 제한적이다.
Open question:
thinking_level="high"사용 시 내부 추론 토큰 수가 얼마나 발생하는지 Google이 공개하지 않는다. 비용 예측을 위해 실측이 필요하다.
References
- Google DeepMind Model Card — Gemini 3.7 Flash: https://deepmind.google/models/model-cards/gemini-3-7-flash/
- Google AI for Developers, What's new in Gemini 3.7 Flash: https://ai.google.dev/gemini-api/docs/latest-model
- Google Blog, Introducing Gemini 3.7 Flash (2026-08-13): https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash/
- MiraFlow, Gemini 3.7 Flash Explained — DeepSWE benchmarks: https://miraflow.ai/blog/gemini-3-7-flash-explained-coding-benchmarks-2026
- DataCamp, Gemini 3.7 Flash Features and Benchmarks: https://www.datacamp.com/blog/gemini-3-7-flash
- Bloomberg, Google Unveils Gemini 3.7 Flash (2026-08-13): https://www.bloomberg.com/news/articles/2026-08-13/google-debuts-new-gemini-flash-while-top-ai-model-still-delayed