$ cat wiki/models/gemini-omni.md
Gemini Omni
modelupdated 2026-07-21created 2026-05-19
Spec
| Attribute | Value |
|---|---|
| Developer | Google DeepMind |
| Released | not yet |
| Announced | 2026-05-19 (Google I/O 2026) |
| Context window | unknown (I/O 에서 상세 기술 사양 미공개) |
| Pricing | unknown |
| License | unknown |
| Availability | 아직 제공 안 됨. Gemini 앱과 API 경유 예상 (배포 일정 미정) |
| Type | 멀티모달 비디오 생성 모델 |
| Input | 무엇이든: 이미지 + 오디오 + 비디오 + 텍스트 |
| Output | 비디오 |
Key Differentiator vs. Veo
| Veo | Gemini Omni | |
|---|---|---|
| Input | 텍스트 | 무엇이든 (이미지 + 오디오 + 비디오 + 텍스트) |
| Grounding | 일반 훈련 | Gemini 의 실세계 지식 기반 |
| Use case | 텍스트-비디오 생성 | 멀티모달 비디오 편집·합성 |
| Gemini Omni 는 "세계 이해·멀티모달리티·편집에서의 도약" 이라는 것이 I/O 에서 Google 이 내세운 표현이다. |
Significance
멀티모달 비디오 생성 영역(Sora, Runway, Kling, Veo)이 크게 달아오르고 있다. Omni 의 any-input 접근은 Google 이 텍스트-비디오를 넘어 월드 모델에 기반한 비디오 합성으로 이동하고 있다는 신호다 — 순수 생성 예술 도구보다 Karpathy 의 "world simulator" 표현에 가깝다.
Sources
- Google I/O 2026 summary
- 9to5Google coverage
- I/O 2026 전체 맥락은 Google DeepMind 참조