$ cat wiki/models/gemma-4-12b.md
Gemma 4 12B
modelupdated 2026-07-21created 2026-06-04
Spec
| Attribute | Value |
|---|---|
| Developer | Google DeepMind |
| Released | 2026-06-03 |
| Announced | 2026-06-03 |
| Context window | unknown |
| Pricing | unknown |
| License | Apache 2.0 (무료, 상업적 사용 가능) |
| Availability | Hugging Face 와 Kaggle 에 공개 가중치 |
| Parameters | 12B (dense decoder-only 트랜스포머) |
| Architecture | 인코더 없음 — 비전·오디오 입력이 별도 인코더 없이 LLM 백본으로 직접 흐른다 |
| Modalities | 텍스트, 이미지, 오디오, 비디오 (네이티브 통합, 인코더 브리지 없음) |
| Deployment | vLLM, SGLang, MLX, llama.cpp 호환 |
Release Date
2026-06-03
Local Requirements
- 전정밀도: VRAM 16GB (RTX 4060, RTX 5090, Apple Silicon Mac)
- 양자화: VRAM 8GB
- 추론에 클라우드 컴퓨트가 필요 없다
Benchmarks
모든 수치는 Google 내부 평가 기준이며, 2026년 6월 4일 시점 독립 제3자 벤치마크는 아직 없다.
| Benchmark | Score | Notes |
|---|---|---|
| GPQA Diamond | 78.8 | 대학원 수준 추론 |
| MMLU Pro | 77.2% | 폭넓은 지식 |
| Vision | 강함 | 별도 인코더 없음 |
| Coding | 경쟁력 있음 | 에이전틱 함수 호출 |
- 메모리 사용량이 약 절반인 상태로 더 큰 Gemma 26B MoE 모델에 근접한다
- 선택적 thinking 모드(단계별 CoT 추론)를 지원한다
Features
- 함수 호출: 로컬 에이전틱 워크플로를 위한 텍스트·멀티모달 함수 호출
- Thinking 모드: 필요할 때 사고 연쇄 방식으로 추론
- 에이전틱 사용: 로컬에서 계획하고 앱을 탐색하며 다단계 과제를 완료한다
Use Cases
- 로컬 AI 에이전트 워크플로 (클라우드 의존 없음)
- 멀티모달 분석: 온디바이스 이미지 캡셔닝, 오디오 전사, 비디오 이해
- 프라이버시가 민감한 기업 배포
- 개발자 실험: VRAM 8GB 이상에서 파인튜닝
Compared To
| Model | Params | License | Multimodal | Local 16GB | Notes |
|---|---|---|---|---|---|
| Gemma 4 12B | 12B | Apache 2.0 | 텍스트+이미지+오디오+비디오 | ✅ | 인코더 없는 통합 구조 |
| Gemma 3n (이전) | 5-8B | Apache 2.0 | 텍스트+이미지 | ✅ | 모바일 우선 (PLE 구조) |
| Llama 4 Scout | 활성 ~17B | Llama 라이선스 | 텍스트+이미지 | ⚠️ 부분적 | Meta MoE |
| Mistral Small | 22B | Apache 2.0 | 텍스트 | ✅ 8GB+ | 텍스트 전용 |
| Phi-4 | 14B | MIT | 텍스트+이미지 | ✅ | Microsoft |
Significance
- 인코더 없는 멀티모달: 새로운 통합 아키텍처가 오디오·비전 인코더 오버헤드를 없앤다 — 진짜 노트북급 전 모달 AI 가 가능해진다
- 오픈소스 프런티어 압박: 12B 규모의 Apache 2.0 멀티모달은 2026년 6월 기준 이 역량대에서 가장 뛰어난 공개 가중치 온디바이스 모델이다
- 로컬 에이전트: 이전에는 클라우드 추론이 필요했던 로컬 자율 에이전트 워크플로를 곧바로 가능하게 한다
- Gemma 3n(2026년 5월, 모바일 우선)에 이어, Gemma 4 12B 는 Google 공개 모델 전략의 노트북·데스크톱 계층이다
Open Questions
- 소비자 하드웨어에서의 독립 제3자 벤치마크는?
- Gemma 4 27B 또는 더 큰 변형이 계획돼 있는가?
- 파인튜닝 가이드와 instruction-tuned 변형은?