ai-trend-notifierEN
← wiki

$ cat wiki/models/gemma-4-12b.md

Gemma 4 12B

Spec

AttributeValue
DeveloperGoogle DeepMind
Released2026-06-03
Announced2026-06-03
Context windowunknown
Pricingunknown
LicenseApache 2.0 (무료, 상업적 사용 가능)
AvailabilityHugging Face 와 Kaggle 에 공개 가중치
Parameters12B (dense decoder-only 트랜스포머)
Architecture인코더 없음 — 비전·오디오 입력이 별도 인코더 없이 LLM 백본으로 직접 흐른다
Modalities텍스트, 이미지, 오디오, 비디오 (네이티브 통합, 인코더 브리지 없음)
DeploymentvLLM, SGLang, MLX, llama.cpp 호환

Release Date

2026-06-03

Local Requirements

  • 전정밀도: VRAM 16GB (RTX 4060, RTX 5090, Apple Silicon Mac)
  • 양자화: VRAM 8GB
  • 추론에 클라우드 컴퓨트가 필요 없다

Benchmarks

모든 수치는 Google 내부 평가 기준이며, 2026년 6월 4일 시점 독립 제3자 벤치마크는 아직 없다.

BenchmarkScoreNotes
GPQA Diamond78.8대학원 수준 추론
MMLU Pro77.2%폭넓은 지식
Vision강함별도 인코더 없음
Coding경쟁력 있음에이전틱 함수 호출
  • 메모리 사용량이 약 절반인 상태로 더 큰 Gemma 26B MoE 모델에 근접한다
  • 선택적 thinking 모드(단계별 CoT 추론)를 지원한다

Features

  • 함수 호출: 로컬 에이전틱 워크플로를 위한 텍스트·멀티모달 함수 호출
  • Thinking 모드: 필요할 때 사고 연쇄 방식으로 추론
  • 에이전틱 사용: 로컬에서 계획하고 앱을 탐색하며 다단계 과제를 완료한다

Use Cases

  • 로컬 AI 에이전트 워크플로 (클라우드 의존 없음)
  • 멀티모달 분석: 온디바이스 이미지 캡셔닝, 오디오 전사, 비디오 이해
  • 프라이버시가 민감한 기업 배포
  • 개발자 실험: VRAM 8GB 이상에서 파인튜닝

Compared To

ModelParamsLicenseMultimodalLocal 16GBNotes
Gemma 4 12B12BApache 2.0텍스트+이미지+오디오+비디오인코더 없는 통합 구조
Gemma 3n (이전)5-8BApache 2.0텍스트+이미지모바일 우선 (PLE 구조)
Llama 4 Scout활성 ~17BLlama 라이선스텍스트+이미지⚠️ 부분적Meta MoE
Mistral Small22BApache 2.0텍스트✅ 8GB+텍스트 전용
Phi-414BMIT텍스트+이미지Microsoft

Significance

  • 인코더 없는 멀티모달: 새로운 통합 아키텍처가 오디오·비전 인코더 오버헤드를 없앤다 — 진짜 노트북급 전 모달 AI 가 가능해진다
  • 오픈소스 프런티어 압박: 12B 규모의 Apache 2.0 멀티모달은 2026년 6월 기준 이 역량대에서 가장 뛰어난 공개 가중치 온디바이스 모델이다
  • 로컬 에이전트: 이전에는 클라우드 추론이 필요했던 로컬 자율 에이전트 워크플로를 곧바로 가능하게 한다
  • Gemma 3n(2026년 5월, 모바일 우선)에 이어, Gemma 4 12B 는 Google 공개 모델 전략의 노트북·데스크톱 계층이다

Open Questions

  • 소비자 하드웨어에서의 독립 제3자 벤치마크는?
  • Gemma 4 27B 또는 더 큰 변형이 계획돼 있는가?
  • 파인튜닝 가이드와 instruction-tuned 변형은?

Referenced by

Sources