$ cat wiki/models/diffusion-gemma.md
DiffusionGemma
modelupdated 2026-07-27created 2026-07-27
⚡ 늦은 캡처 (릴리스 2026년 6월 11일 기준 +46일)
Gemma 4 26B MoE 백본 위에 만든 Google DeepMind 의 첫 공개 가중치 텍스트 디퓨전 모델.
Spec
| Attribute | Value |
|---|---|
| Developer | Google DeepMind |
| Released | 2026-06-11 |
| Announced | 2026-06-11 |
| Context window | unknown |
| Pricing | 무료 (공개 가중치) |
| License | Apache 2.0 |
| Availability | Hugging Face (google/diffusiongemma-26B-A4B-it), Kaggle, Google Cloud Vertex AI Model Garden |
Release Date
2026년 6월 11일.
Architecture
- 기반: Gemma 4 26B-A4B Mixture-of-Experts (총 25.2B 파라미터, 순전파당 약 3.8B 활성)
- 디코딩: 이산 텍스트 디퓨전 — 왼쪽에서 오른쪽으로 가는 자기회귀가 아니라, 반복적 디노이징(Uniform State Diffusion)으로 256 토큰 블록을 병렬 생성한다
- 메모리: 약 18 GB VRAM (MXFP4 양자화) — 동급 모델보다 로컬 배포 문턱이 크게 낮다
- 프레임워크: vLLM 네이티브 지원
Benchmarks
DiffusionGemma 는 자기회귀 Gemma 4 26B-A4B 기준선 대비 정확도를 처리량과 맞바꾼다:
| Benchmark | DiffusionGemma | Gemma 4 26B-A4B (자기회귀) |
|---|---|---|
| AIME 2026 | 69.1% | 88.3% |
| MMMU Pro | 54.3% | 73.8% |
| 다단계 추론(수학, 비전-언어)이 정확도 손해를 더 크게 본다. 순수 텍스트 과제는 덜하다. 그 대가로 처리량이 약 4배가 된다. |
Performance
- H100 GPU 한 장에서 초당 1,000 토큰 이상
- RTX 5090 에서 초당 700 토큰 이상
- 처리량이 병목인 워크로드에서 동등한 벤치마크 품질 기준 자기회귀 Gemma 4 26B-A4B 대비 약 4배 빠르다
Use Cases
- 토큰당 지연이나 비용이 주된 제약인 고처리량 텍스트 생성 워크로드
- 최고 수준의 추론 정확도가 필요한 과제(다단계 수학, 복잡한 비전-언어)에는 맞지 않는다
Compared To
| Model | Type | Speed (H100) | AIME 2026 | License |
|---|---|---|---|---|
| DiffusionGemma | 디퓨전 MoE | 1,000+ t/s | 69.1% | Apache 2.0 |
| Gemma 4 26B-A4B | 자기회귀 MoE | 약 250 t/s (추정) | 88.3% | Apache 2.0 |
| Kimi K3 | 자기회귀 MoE | unknown | — | Modified MIT |
Significance
DiffusionGemma 는 주요 AI 랩이 프로덕션에 올린 첫 공개 가중치 텍스트 디퓨전 모델이다. 반복당 256 토큰을 병렬 디코딩하는 방식은 자기회귀만이 규모에서 유효한 디코딩 경로라는 전제에 도전한다. 공학적 절충 공간을 연다 — 운영자가 이제 과제별 추론 품질 대신 처리량을 고를 수 있고, 이 절충은 이번 릴리스 이전의 공개 가중치 프로덕션 모델에는 없던 것이다.
Sources
- Google DeepMind: DiffusionGemma 모델 페이지
- Hugging Face 모델 카드: google/diffusiongemma-26B-A4B-it
- MarkTechPost: DiffusionGemma release
- The Register: text diffusion speed story
- 소스 스냅샷: sources/blogs/deepmind-2026-06-11-diffusion-gemma.md