LLM WikiAccess-protected knowledge portal

WIKI

GPT-Realtime 2.1: SIP 전화·원격 MCP·추론 강도로 실시간 음성 에이전트의 운영 경계를 다시 그은 릴리스

왜 지금 봐야 하나 2026년 7월 6일 OpenAI는 Realtime API에 gpt realtime 2.1 과 gpt realtime 2.1 mini 를 추가했다. 단순한 모델 업데이트가 아니다. 이번 릴리스에서 Realtime API는 세 가지 새로운 인프라 경계를 열었다. 1. SIP 전화 연결 AI 음성 에이전트를 공용 전화망 PSTN 에 직접 붙일 수 있게 됐다. 2. 원격 MCP 서버 음성 세션 중에 도구를 외부

경로human/study/content/ai-frontier/64-gpt-realtime-2-1-sip-mcp-reasoning-voice-agent.md
카테고리Study
태그#agent #ai-review #mcp #reasoning #sip #study #voice

왜 지금 봐야 하나

2026년 7월 6일 OpenAI는 Realtime API에 gpt-realtime-2.1gpt-realtime-2.1-mini를 추가했다. 단순한 모델 업데이트가 아니다. 이번 릴리스에서 Realtime API는 세 가지 새로운 인프라 경계를 열었다.

  1. SIP 전화 연결: AI 음성 에이전트를 공용 전화망(PSTN)에 직접 붙일 수 있게 됐다.
  2. 원격 MCP 서버: 음성 세션 중에 도구를 외부 MCP 서버에서 가져올 수 있다.
  3. 이미지 입력: 음성과 텍스트에 이어 시각 정보가 Realtime 세션으로 들어온다.

기존 Realtime API는 "말로 대화하는 챗봇"에 가까웠다. 이번 업데이트로 전화 상담 자동화, 실시간 영상 분석 + 음성 설명, 도구 연결 음성 에이전트처럼 실제 산업 워크플로에 직접 끼워 넣을 수 있는 경계까지 확장됐다. 동시에 레거시 모델 스냅샷 퇴장 공지도 나왔다. 운영하고 있는 파이프라인이라면 마이그레이션 시한을 확인해야 한다.


모델 비교

항목gpt-realtime-2.1gpt-realtime-2.1-mini
기반GPT-Realtime-2 개선판추론 특화 경량 모델
추론 경로reasoning_effort 지원reasoning_effort 지원
병렬 도구 호출지원지원
이미지 입력지원지원
SIP 전화지원지원 (일부 제약 있음)
가격gpt-realtime-2 기준 유지gpt-realtime-mini와 동일
출시일2026-07-062026-07-06

mini 모델의 핵심은 추론 기능을 이전 mini 가격에 그대로 제공한다는 점이다. 가격을 올리지 않고 추론을 추가했다.


아키텍처: Realtime 세션의 구조

클라이언트 연결
브라우저
WebRTC
서버 파이프라인
WebSocket
전화망(PSTN)
SIP ← NEW
Realtime Session (최대 60분)
오디오 입출력
STT + TTS 통합
이미지 입력
← NEW
session.update로 설정 변경
reasoning_effort / voice / turn_detection / tools
함수 도구
인라인 정의
원격 MCP
← NEW
모델
gpt-realtime-2.1
추론 지원
gpt-realtime-2.1-mini
경량 추론
32,768 토큰 컨텍스트
최대 응답: 4,096 토큰
GPT-Realtime 2.1 세션 아키텍처

세션 상태와 이벤트

Realtime API는 클라이언트 이벤트서버 이벤트를 양방향으로 교환하며 세션 상태를 유지한다.

이벤트 방향예시설명
클라이언트 → 서버session.update세션 설정 변경
클라이언트 → 서버conversation.item.create메시지·오디오 추가
클라이언트 → 서버response.create응답 생성 요청
서버 → 클라이언트response.audio.delta오디오 스트리밍 청크
서버 → 클라이언트response.function_call_arguments.done도구 호출 완료
서버 → 클라이언트session.created세션 시작 확인

세션은 비활동 15분 후 타임아웃된다. 애플리케이션은 이 시한 전에 헬스킵(무음 오디오나 핑) 이벤트를 보내거나 재연결 로직을 갖춰야 한다.


새 기능 1: 추론 강도 (reasoning_effort)

gpt-realtime-2.1은 추론 경로를 켜고 강도를 조정할 수 있다. 음성 에이전트에서 추론이 중요한 이유는 단순 QA가 아니라 다단계 계획, 외부 도구 시퀀싱, 복잡한 사용자 의도 처리가 필요한 케이스가 늘고 있기 때문이다.

import openai

client = openai.OpenAI()

# 세션 생성 시 추론 강도 설정
session = client.beta.realtime.sessions.create(
    model="gpt-realtime-2.1",
    instructions="당신은 예약을 도와주는 AI입니다.",
    voice="alloy",
    # 추론 강도: minimal | low | medium | high | xhigh
    # 기본값은 low — 대부분의 음성 에이전트에 충분
    reasoning={"effort": "low"},
    tools=[
        {
            "type": "function",
            "name": "check_availability",
            "description": "예약 가능 시간을 확인합니다",
            "parameters": {...},
        }
    ],
)
reasoning.effort내부 CoT레이턴시 영향적합한 케이스
minimal없음가장 낮음단순 FAQ 응답
low (기본값)매우 짧음낮음대부분의 음성 에이전트
medium보통중간다단계 예약·검색
high긴 추론높음복잡한 기술 지원
xhigh매우 긴 추론가장 높음고도 분석 필요 케이스

OpenAI는 low에서 시작하고 레이턴시 허용 범위를 측정한 뒤 필요한 경우에만 올리라고 권고한다. 음성 에이전트는 응답 지연이 UX에 직접 영향을 미치므로, 추론 강도는 벤치마크로 결정해야 한다.

병렬 도구 호출은 reasoning 모델(gpt-realtime-2gpt-realtime-2.1 계열)에서만 지원된다. 비추론 모델은 도구를 순차 호출한다.


새 기능 2: SIP 전화 연결

공용 전화망 (PSTN)
일반 전화기
스마트폰
SIP
SIP 제공자
Twilio / Vonage
WebRTC→SIP 브리지
WebSocket
Realtime API
gpt-realtime-2.1
음성 ↔ 도구 루프
⚠ SIP 세션은 연결 후 즉시 응답해야 함 — 첫 응답 지연이 수화기를 끊는 원인이 됨
SIP 전화 통합 아키텍처

SIP 지원의 실질적 의미: Twilio 같은 텔레포니 제공자가 기존 PSTN 전화를 WebSocket으로 변환한 뒤 Realtime API에 붙인다. 코드 관점에서는 WebSocket 연결과 동일하다. 차이는 오디오 코덱(G.711 μ-law)과 첫 응답 타이밍이다.

전화 에이전트 운영 시 주의할 점:


새 기능 3: 원격 MCP 서버

Realtime 세션에서 이제 원격 MCP 서버를 도구 소스로 등록할 수 있다. 이전까지는 Realtime 세션에 도구를 인라인으로 정의해야 했다. MCP 통합으로 중앙 도구 레지스트리를 Realtime 에이전트에서도 재사용할 수 있게 됐다.

session = client.beta.realtime.sessions.create(
    model="gpt-realtime-2.1",
    tools=[
        {
            "type": "mcp",
            "server_label": "calendar_tools",
            "server_url": "https://mcp.example.com/calendar",
            "headers": {"Authorization": "Bearer ..."},
            # 허용할 도구 이름 목록 — 생략 시 전체 허용
            "allowed_tools": ["get_availability", "create_event"],
        }
    ],
)

MCP 도구는 함수 도구와 동일하게 병렬 호출이 가능하다. 다만 외부 HTTP 라운드트립이 추가되므로 MCP 서버 레이턴시가 음성 응답 지연에 직접 가산된다는 점을 고려해야 한다.


레이턴시와 성능

OpenAI는 이번 릴리스에서 p95 레이턴시를 25% 줄였다고 발표했다. 개선 방법은 세션 내 응답 캐싱이다. 같은 세션에서 동일하거나 유사한 오디오 패턴이 반복될 때 이전 처리 결과를 재사용한다.

컨텍스트 관리:

세션 시간이 최대 60분(이전 30분)으로 늘었다. 상담 에이전트처럼 긴 대화가 필요한 케이스에서 세션 재연결 비용을 줄일 수 있다.


레거시 모델 퇴장 일정

2026년 7월 20일 OpenAI는 레거시 오디오·Realtime·트랜스크립션 모델 스냅샷의 퇴장을 고지했다.

퇴장 시점대상
2027-01-20레거시 오디오·Realtime·트랜스크립션 모델 패밀리 전체

퇴장 대상 모델 ID는 gpt-4o-realtime-preview-* 계열 스냅샷 및 gpt-4o-mini-realtime-preview-* 계열이다. 운영 중인 파이프라인에 고정된 모델 ID가 있다면 2027년 1월 20일 전에 gpt-realtime-2.1 또는 gpt-realtime-2.1-mini로 교체해야 한다.

마이그레이션 체크리스트:


운영 결정 기준

gpt-realtime-2.1-mini가 적합한 경우:

gpt-realtime-2.1이 적합한 경우:

Realtime API 자체가 맞지 않는 경우:


Open question


References