$ cat wiki/models/grok-voice-think-fast-2.md
Grok Voice Think Fast 2.0
스펙
| 속성 | 값 |
|---|---|
| Developer | xAI |
| Released | 2026-07-29 |
| Announced | 2026-07-29 |
| Context window | unknown |
| Pricing | speech-to-speech 분당 $0.08 · 텍스트 입력당 $0.004 |
| License | proprietary |
| Availability | xAI API (grok-voice-think-fast-2.0), Grok Voice Agent Builder |
| 읽은 어느 소스에도 파라미터 수도 아키텍처도 컨텍스트 윈도도 공개되지 않았다 | |
| (source) — 읽지 못한 | |
필드가 아니라 진짜 unknown 이며, xAI 가 Grok Voice 계열의 나머지를 출시해 온 방식과 | |
| 일치한다. |
출시일
2026-07-29 출시 (source).
2026-08-05 포착 — 늦은 포착, day +7. x.ai 는 피드를 내지 않아 prefetch 원장이 아니라
스크랩·검색으로 폴링되며, 그래서 일주일을 묵었다. 이것을 수면 위로 올린 것은 출시가 아니라
별칭 전환이었다.
2026-08-05 에 grok-voice-latest 별칭이 grok-voice-think-fast-1.0 에서
grok-voice-think-fast-2.0 으로 자동 이동한다
(source). xAI 는 이번
업그레이드가 기존 프롬프트를 고치지 않고도 거의 모든 활용 사례에서 성능을 개선할 것으로
기대한다고 밝힌다 — 자동 별칭 전환이 딛고 서야 하는 주장이 바로 이것인데,
grok-voice-latest 를 호출하던 모든 쪽이 스스로 선택하지 않은 채 옮겨지기 때문이다.
벤치마크
| 측정 항목 | 값 |
|---|---|
| 첫 오디오 응답까지의 시간 | ~0.70 s |
| — 이전 Think Fast 모델 | 1.25 s |
| Artificial Analysis speech-to-speech, overall | 82.9% |
| — Think Fast 1.0 | 75.7% |
| — GPT-Realtime-2.1 | 79.1% |
| — Gemini 3.1 Flash | 69.5% |
| (source) |
이 수치들은 리더보드 캡처로 검증된 것이 아니라 보도된 대로 기록된 것이다. "Artificial Analysis 의 speech-to-speech 벤치마크"를 인용한 제3자 보도를 거쳐 이 위키에 들어왔는데, 이 저장소가 보유한 Artificial Analysis 스냅숏에는 speech-to-speech 열이 없어 (source) 대조할 로컬 자료가 없다. GPT-Realtime-2.1 과 Gemini 3.1 Flash 의 비교 수치도 같은 보도가 인용한 것이며 같은 지위를 물려받는다.
이 위키에서 전작의 벤치마크는 자체 시행이었다 — Think Fast 1.0 은 xAI 내부 tau-voice Bench 에서 67.3% 로 기록돼 있다 (source). 제3자 벤치마크는 건너 들은 것일지라도 그보다는 한 단계 위다.
활용 사례
speech-to-speech 음성 에이전트. 밝혀진 설계 선택은 Think Fast 2.0 이 말하면서 동시에 추론한다는 것으로, 더 복잡한 질의를 처리하면서도 지연을 낮게 유지하려는 의도다 (source) — 모든 speech-to-speech 시스템이 하는 거래인데, 말하기 전에 생각하는 모델은 느리게 들리고 생각하기 전에 말하는 모델은 틀리게 들리기 때문이다.
이것은 xAI 음성 에이전트 스택의 엔진이다: Voice Agent Builder(노코드, 첫날부터 MCP 지원)와 Realtime Voice Agent API.
비교
- GPT-Realtime-2 (OpenAI) — OpenAI 의 실시간 음성 모델. 위 비교에 나온 버전은 GPT-Realtime-2.1 이며, 이 모델의 82.9% 에 대해 79.1% 다.
- GPT-Live-1 — OpenAI 의 풀 듀플렉스 음성 모델로, 2026년 7월 전 등급에서 ChatGPT Voice 를 대체했다. API 쪽이 아니라 소비자 쪽 비교 대상.
- Gemini Omni — Google DeepMind 의 옴니모달 계열.