LLM WikiAccess-protected knowledge portal

WIKI

Gemini 3.7 Flash: 튜너블 사고 수준과 DeepSWE 65% 로 에이전트 작업의 기준을 바꾼 모델

요약 2026년 8월 13일 Google이 출시한 Gemini 3.7 Flash는 단순히 이전 Flash를 업그레이드한 모델이 아니다. 소프트웨어 엔지니어링 벤치마크 DeepSWE v1.1에서 65.3% 를 달성해 전작 3.6 Flash 48.6% 대비 약 17포인트 앞서며, 프론티어 수준의 코딩 능력을 중간 가격대에 제공한다. 결정적 변화는 추론 제어 방식이다. 기존 thinking budget 파라미터가 완전히 제거되고 t

경로human/study/content/ai-frontier/138-gemini-3-7-flash-thinking-level-deepswe-agentic-workhorse.md
카테고리Study
태그#agentic #ai-review #deepswe #level #study #thinking #workhorse

요약

2026년 8월 13일 Google이 출시한 Gemini 3.7 Flash는 단순히 이전 Flash를 업그레이드한 모델이 아니다. 소프트웨어 엔지니어링 벤치마크 DeepSWE v1.1에서 65.3% 를 달성해 전작 3.6 Flash(48.6%) 대비 약 17포인트 앞서며, 프론티어 수준의 코딩 능력을 중간 가격대에 제공한다.

결정적 변화는 추론 제어 방식이다. 기존 thinking_budget 파라미터가 완전히 제거되고 thinking_level 문자열(low / medium / high) 로 대체됐다. 이 변화는 단순한 API 리네이밍이 아니다. 요청 단위로 "얼마나 깊이 생각할 것인가"를 명시적으로 선택할 수 있게 되어, 에이전트 루프 안에서 단순 도구 호출은 low로, 복잡한 계획 단계는 high로 설정해 토큰 비용과 응답 품질을 요청별로 최적화할 수 있다.

핵심 요약:


배경: Flash 계열의 포지셔닝

Google Gemini 모델 패밀리는 두 축으로 구분된다. Pro/Ultra 계열은 최대 정확도를 목표로 하고, Flash 계열은 속도·비용·에이전트 루프 최적화를 목표로 한다.

3.6 Flash까지는 "저렴하지만 성능이 낮은" 포지션이었다. 그런데 3.7 Flash는 DeepSWE와 Terminal-bench(85.8%) 기준으로 상위 모델과 경쟁하는 수준에 도달했다. 이는 Gemini 3 아키텍처의 추론 기반이 Flash 크기에서도 충분히 발현되기 시작했음을 의미한다.


핵심 변화 1: thinking_level API

thinking_budget 폐기

이전 세대 Gemini 추론 모델은 "몇 토큰을 사용해 생각할지"를 정수로 지정하는 thinking_budget 파라미터를 제공했다. 이 방식의 문제는 두 가지였다.

  1. 추상화 수준이 낮다: 개발자가 적절한 숫자를 추측해야 한다.
  2. 모델 의존성: 같은 숫자도 모델 버전마다 다른 결과를 낳는다.

3.7 Flash는 thinking_budget을 제거하고 thinking_level로 전환했다.

thinking_level 동작

import google.generativeai as genai

model = genai.GenerativeModel("gemini-3.7-flash")

# 복잡한 계획 — 깊은 추론
response = model.generate_content(
    "이 파이썬 코드에서 버그를 찾아 수정 계획을 세워줘",
    generation_config=genai.GenerationConfig(
        thinking_config=genai.ThinkingConfig(thinking_level="high")
    )
)

# 단순 추출 — 빠른 응답
response = model.generate_content(
    "이 JSON에서 user_id 필드를 추출해줘",
    generation_config=genai.GenerationConfig(
        thinking_config=genai.ThinkingConfig(thinking_level="low")
    )
)

API 마이그레이션 주의: 3.7 Flash에서는 temperature, top_p, top_k, candidate_count를 비기본값으로 설정하면 400 오류가 반환된다. 이 파라미터들을 제거하고 thinking_level로 제어 전환이 필요하다.

에이전트 루프에서의 활용 패턴

def call_model(prompt: str, task_complexity: str) -> str:
    level_map = {
        "simple": "low",    # 도구 결과 요약, 파라미터 추출
        "moderate": "medium",  # 멀티스텝 분기, 에러 분석
        "complex": "high",     # 계획 수립, 코드 생성, 아키텍처 결정
    }
    level = level_map.get(task_complexity, "medium")
    response = model.generate_content(
        prompt,
        generation_config=genai.GenerationConfig(
            thinking_config=genai.ThinkingConfig(thinking_level=level)
        )
    )
    return response.text

이 패턴은 에이전트 루프의 총 추론 토큰 비용을 태스크 분포에 따라 30~50% 절감할 수 있다.


핵심 변화 2: 소프트웨어 엔지니어링 성능

Gemini 3.7 Flash의 가장 두드러진 수치는 소프트웨어 엔지니어링 벤치마크다.

벤치마크3.6 Flash3.7 Flash변화
DeepSWE v1.148.6%65.3%+16.7pp
FrontierCode 1.1 Main34.4%43.6%+9.2pp
Terminal-bench 2.178.0%85.8%+7.8pp

DeepSWE v1.1은 실제 GitHub 리포지토리의 이슈를 해결하는 장기 소프트웨어 엔지니어링 작업을 평가한다. 단순 코드 완성이 아니라 테스트 실행, 디버깅, 파일 탐색을 포함하는 현실적 에이전트 시나리오다.

65.3%는 Flash 계열에서 처음으로 인간 시니어 개발자 수준에 근접한 수치다.


아키텍처 다이어그램: Gemini 3.7 Flash API 흐름

Gemini 3.7 Flash — thinking_level 요청 흐름 클라이언트 Python / REST thinking_level Gemini API gemini-3.7-flash 추론 깊이 라우터 low → 빠른 경로 medium → 균형 high → 심층 추론 low 경로 직접 응답 생성 medium / high 경로 내부 사고 토큰 생성 후 응답 응답 텍스트 (사고 토큰 제외) 지원 기능 (3.7 Flash) ✓ 함수 호출 (Function Calling) ✓ 코드 실행 (Code Execution) ✓ 구조화 출력 (Structured Output) ✓ 검색 그라운딩 (Search Grounding) ✓ 컴퓨터 사용 (프리뷰) ✓ 멀티모달 입력 ✓ 1M 토큰 컨텍스트 ✓ 지식 기준일 2026-03 가격 (1M 토큰 기준) 도입 특가 (2026년 말까지): 입력 $0.75 / 출력 $3.75 이후 정가: 입력 $1.50 / 출력 $7.50
Gemini 3.7 Flash 요청 흐름 — thinking_level에 따른 추론 경로

멀티모달 입력과 1M 컨텍스트

Gemini 3.7 Flash는 텍스트, 이미지, 오디오, 비디오, PDF를 단일 요청에 혼합 입력할 수 있다. 1,048,576 토큰 컨텍스트 창은 다음 시나리오를 가능하게 한다.

주의: 1M 토큰을 모두 채우면 입력 비용만 $0.75이지만, 실제 에이전트 루프에서는 대부분 수천~수만 토큰 단위로 사용하므로 평균 비용은 훨씬 낮다.


운영 고려사항

API 마이그레이션 체크리스트

비용 최적화 패턴

에이전트 루프에서 모든 요청에 thinking_level="high"를 사용하면 비용이 높아진다. 단계별 분류가 중요하다.

작업 유형권장 thinking_level예시
파라미터 추출"low"JSON 필드 파싱, 날짜 추출
분류·라우팅"low"의도 분류, 에러 유형 분류
코드 리뷰·디버깅"medium"버그 원인 분석, 단위 테스트 생성
아키텍처 설계"high"시스템 설계, 리팩터링 계획
장기 소프트웨어 엔지니어링"high"이슈 해결, PR 생성

Spark 통합 (Google 에이전트 플랫폼)

Google의 상시형 개인 에이전트 Spark는 Gemini 3.7 Flash를 기반으로 구동된다. Google AI Pro/Ultra 구독자는 Gemini 앱에서 3.7 Flash를 기본 모델로 사용할 수 있다. 이는 소비자 제품과 개발자 API가 동일 모델 기반을 공유한다는 점에서 에코시스템 통합 측면에서 주목할 만하다.


제한사항과 열린 질문

Open question: thinking_level="high" 사용 시 내부 추론 토큰 수가 얼마나 발생하는지 Google이 공개하지 않는다. 비용 예측을 위해 실측이 필요하다.


References