GPT-Realtime 2.1: SIP 전화·원격 MCP·추론 강도로 실시간 음성 에이전트의 운영 경계를 다시 그은 릴리스
왜 지금 봐야 하나
2026년 7월 6일 OpenAI는 Realtime API에 gpt-realtime-2.1과 gpt-realtime-2.1-mini를 추가했다. 단순한 모델 업데이트가 아니다. 이번 릴리스에서 Realtime API는 세 가지 새로운 인프라 경계를 열었다.
- SIP 전화 연결: AI 음성 에이전트를 공용 전화망(PSTN)에 직접 붙일 수 있게 됐다.
- 원격 MCP 서버: 음성 세션 중에 도구를 외부 MCP 서버에서 가져올 수 있다.
- 이미지 입력: 음성과 텍스트에 이어 시각 정보가 Realtime 세션으로 들어온다.
기존 Realtime API는 "말로 대화하는 챗봇"에 가까웠다. 이번 업데이트로 전화 상담 자동화, 실시간 영상 분석 + 음성 설명, 도구 연결 음성 에이전트처럼 실제 산업 워크플로에 직접 끼워 넣을 수 있는 경계까지 확장됐다. 동시에 레거시 모델 스냅샷 퇴장 공지도 나왔다. 운영하고 있는 파이프라인이라면 마이그레이션 시한을 확인해야 한다.
모델 비교
| 항목 | gpt-realtime-2.1 | gpt-realtime-2.1-mini |
|---|---|---|
| 기반 | GPT-Realtime-2 개선판 | 추론 특화 경량 모델 |
| 추론 경로 | reasoning_effort 지원 | reasoning_effort 지원 |
| 병렬 도구 호출 | 지원 | 지원 |
| 이미지 입력 | 지원 | 지원 |
| SIP 전화 | 지원 | 지원 (일부 제약 있음) |
| 가격 | gpt-realtime-2 기준 유지 | gpt-realtime-mini와 동일 |
| 출시일 | 2026-07-06 | 2026-07-06 |
mini 모델의 핵심은 추론 기능을 이전 mini 가격에 그대로 제공한다는 점이다. 가격을 올리지 않고 추론을 추가했다.
아키텍처: Realtime 세션의 구조
WebRTC
WebSocket
SIP ← NEW
STT + TTS 통합
← NEW
reasoning_effort / voice / turn_detection / tools
인라인 정의
← NEW
추론 지원
경량 추론
최대 응답: 4,096 토큰
세션 상태와 이벤트
Realtime API는 클라이언트 이벤트와 서버 이벤트를 양방향으로 교환하며 세션 상태를 유지한다.
| 이벤트 방향 | 예시 | 설명 |
|---|---|---|
| 클라이언트 → 서버 | session.update | 세션 설정 변경 |
| 클라이언트 → 서버 | conversation.item.create | 메시지·오디오 추가 |
| 클라이언트 → 서버 | response.create | 응답 생성 요청 |
| 서버 → 클라이언트 | response.audio.delta | 오디오 스트리밍 청크 |
| 서버 → 클라이언트 | response.function_call_arguments.done | 도구 호출 완료 |
| 서버 → 클라이언트 | session.created | 세션 시작 확인 |
세션은 비활동 15분 후 타임아웃된다. 애플리케이션은 이 시한 전에 헬스킵(무음 오디오나 핑) 이벤트를 보내거나 재연결 로직을 갖춰야 한다.
새 기능 1: 추론 강도 (reasoning_effort)
gpt-realtime-2.1은 추론 경로를 켜고 강도를 조정할 수 있다. 음성 에이전트에서 추론이 중요한 이유는 단순 QA가 아니라 다단계 계획, 외부 도구 시퀀싱, 복잡한 사용자 의도 처리가 필요한 케이스가 늘고 있기 때문이다.
import openai
client = openai.OpenAI()
# 세션 생성 시 추론 강도 설정
session = client.beta.realtime.sessions.create(
model="gpt-realtime-2.1",
instructions="당신은 예약을 도와주는 AI입니다.",
voice="alloy",
# 추론 강도: minimal | low | medium | high | xhigh
# 기본값은 low — 대부분의 음성 에이전트에 충분
reasoning={"effort": "low"},
tools=[
{
"type": "function",
"name": "check_availability",
"description": "예약 가능 시간을 확인합니다",
"parameters": {...},
}
],
)reasoning.effort | 내부 CoT | 레이턴시 영향 | 적합한 케이스 |
|---|---|---|---|
minimal | 없음 | 가장 낮음 | 단순 FAQ 응답 |
low (기본값) | 매우 짧음 | 낮음 | 대부분의 음성 에이전트 |
medium | 보통 | 중간 | 다단계 예약·검색 |
high | 긴 추론 | 높음 | 복잡한 기술 지원 |
xhigh | 매우 긴 추론 | 가장 높음 | 고도 분석 필요 케이스 |
OpenAI는 low에서 시작하고 레이턴시 허용 범위를 측정한 뒤 필요한 경우에만 올리라고 권고한다. 음성 에이전트는 응답 지연이 UX에 직접 영향을 미치므로, 추론 강도는 벤치마크로 결정해야 한다.
병렬 도구 호출은 reasoning 모델(gpt-realtime-2와 gpt-realtime-2.1 계열)에서만 지원된다. 비추론 모델은 도구를 순차 호출한다.
새 기능 2: SIP 전화 연결
스마트폰
WebRTC→SIP 브리지
음성 ↔ 도구 루프
SIP 지원의 실질적 의미: Twilio 같은 텔레포니 제공자가 기존 PSTN 전화를 WebSocket으로 변환한 뒤 Realtime API에 붙인다. 코드 관점에서는 WebSocket 연결과 동일하다. 차이는 오디오 코덱(G.711 μ-law)과 첫 응답 타이밍이다.
전화 에이전트 운영 시 주의할 점:
- G.711 μ-law 코덱 수락 여부를 SIP 제공자 설정에서 확인해야 한다.
- 첫 응답이 3초를 넘으면 사람들이 전화를 끊는다.
reasoning_effort="low"이하를 사용해야 하는 이유다. - gpt-realtime-2.1-mini에서 SIP 사용 시 일부 함수 도구 호출이 작동하지 않는 버그가 커뮤니티에 보고됐다. 운영 전 기능 검증이 필요하다.
새 기능 3: 원격 MCP 서버
Realtime 세션에서 이제 원격 MCP 서버를 도구 소스로 등록할 수 있다. 이전까지는 Realtime 세션에 도구를 인라인으로 정의해야 했다. MCP 통합으로 중앙 도구 레지스트리를 Realtime 에이전트에서도 재사용할 수 있게 됐다.
session = client.beta.realtime.sessions.create(
model="gpt-realtime-2.1",
tools=[
{
"type": "mcp",
"server_label": "calendar_tools",
"server_url": "https://mcp.example.com/calendar",
"headers": {"Authorization": "Bearer ..."},
# 허용할 도구 이름 목록 — 생략 시 전체 허용
"allowed_tools": ["get_availability", "create_event"],
}
],
)MCP 도구는 함수 도구와 동일하게 병렬 호출이 가능하다. 다만 외부 HTTP 라운드트립이 추가되므로 MCP 서버 레이턴시가 음성 응답 지연에 직접 가산된다는 점을 고려해야 한다.
레이턴시와 성능
OpenAI는 이번 릴리스에서 p95 레이턴시를 25% 줄였다고 발표했다. 개선 방법은 세션 내 응답 캐싱이다. 같은 세션에서 동일하거나 유사한 오디오 패턴이 반복될 때 이전 처리 결과를 재사용한다.
컨텍스트 관리:
- 세션 컨텍스트: 32,768 토큰
- 최대 응답: 4,096 토큰
- 입력 한도: 28,672 토큰 (= 32,768 - 4,096)
- 모델은 28,672 토큰 도달 시 자동으로 오래된 메시지를 잘라낸다. 트랜스크립트가 있는 경우 오디오 토큰을 우선 제거한다.
세션 시간이 최대 60분(이전 30분)으로 늘었다. 상담 에이전트처럼 긴 대화가 필요한 케이스에서 세션 재연결 비용을 줄일 수 있다.
레거시 모델 퇴장 일정
2026년 7월 20일 OpenAI는 레거시 오디오·Realtime·트랜스크립션 모델 스냅샷의 퇴장을 고지했다.
| 퇴장 시점 | 대상 |
|---|---|
| 2027-01-20 | 레거시 오디오·Realtime·트랜스크립션 모델 패밀리 전체 |
퇴장 대상 모델 ID는 gpt-4o-realtime-preview-* 계열 스냅샷 및 gpt-4o-mini-realtime-preview-* 계열이다. 운영 중인 파이프라인에 고정된 모델 ID가 있다면 2027년 1월 20일 전에 gpt-realtime-2.1 또는 gpt-realtime-2.1-mini로 교체해야 한다.
마이그레이션 체크리스트:
- [ ] 현재 사용 중인 모델 ID 확인
- [ ]
session.update로 세션 중 설정 변경 테스트 - [ ] 새
reasoning_effort파라미터로 레이턴시 측정 - [ ] SIP 전화 사용 시 G.711 μ-law 코덱 설정 확인
- [ ] MCP 통합 시 도구 서버 레이턴시 측정
운영 결정 기준
gpt-realtime-2.1-mini가 적합한 경우:
- 상담 FAQ, 예약 접수처럼 정해진 흐름의 전화 에이전트
- 가격 민감도가 높고 추론 깊이가 낮아도 되는 케이스
- SIP 전화 연결이 필요하지만 도구 호출이 단순한 경우
gpt-realtime-2.1이 적합한 경우:
- 다단계 도구 시퀀싱이 필요한 복잡한 에이전트 (병렬 도구 호출)
- 기술 지원, 의사 결정 보조처럼 추론 강도를 올려야 할 케이스
- 이미지 + 음성 통합 분석 (시각 보조, 화면 공유 분석 등)
Realtime API 자체가 맞지 않는 경우:
- 실시간성이 불필요한 비동기 음성 처리 → Whisper + TTS 파이프라인이 더 저렴하다
- 고도의 정확도가 필요한 트랜스크립션 →
gpt-4o-transcribe같은 전용 모델을 쓴다
Open question
- gpt-realtime-2.1-mini에서 SIP + 함수 도구 호출 버그의 공식 수정 시점이 명시되지 않았다. 운영 환경 배포 전 재현 테스트가 필요하다.
- 원격 MCP 서버의 허용 도구 목록(
allowed_tools)을 생략할 경우 세션 토큰 소비 패턴이 어떻게 달라지는지 공식 문서에 상세하지 않다. - xhigh 추론 강도에서 SIP 전화 연결이 실용적인지(첫 응답 지연 허용치 내) 아직 검증된 운영 사례가 공개되지 않았다.
References
- Introducing gpt-realtime and Realtime API updates for production voice agents — OpenAI
- GPT-Realtime-2.1 Model — OpenAI API Docs
- GPT-Realtime-2.1-mini Model — OpenAI API Docs
- Realtime conversations — OpenAI API Guide
- OpenAI adds MCP and SIP support to gpt-realtime for smarter voice-based agents — InfoWorld
- OpenAI Releases GPT-Realtime-2.1 and GPT-Realtime-2.1-mini — MarkTechPost
- OpenAI Deprecations — OpenAI API Docs