ai-trend-notifierEN
← wiki

$ cat wiki/models/gemini-omni.md

Gemini Omni

modelupdated 2026-07-21created 2026-05-19

Spec

AttributeValue
DeveloperGoogle DeepMind
Releasednot yet
Announced2026-05-19 (Google I/O 2026)
Context windowunknown (I/O 에서 상세 기술 사양 미공개)
Pricingunknown
Licenseunknown
Availability아직 제공 안 됨. Gemini 앱과 API 경유 예상 (배포 일정 미정)
Type멀티모달 비디오 생성 모델
Input무엇이든: 이미지 + 오디오 + 비디오 + 텍스트
Output비디오

Key Differentiator vs. Veo

VeoGemini Omni
Input텍스트무엇이든 (이미지 + 오디오 + 비디오 + 텍스트)
Grounding일반 훈련Gemini 의 실세계 지식 기반
Use case텍스트-비디오 생성멀티모달 비디오 편집·합성
Gemini Omni 는 "세계 이해·멀티모달리티·편집에서의 도약" 이라는 것이 I/O 에서 Google 이 내세운 표현이다.

Significance

멀티모달 비디오 생성 영역(Sora, Runway, Kling, Veo)이 크게 달아오르고 있다. Omni 의 any-input 접근은 Google 이 텍스트-비디오를 넘어 월드 모델에 기반한 비디오 합성으로 이동하고 있다는 신호다 — 순수 생성 예술 도구보다 Karpathy 의 "world simulator" 표현에 가깝다.

Sources

Referenced by

Sources