ai-trend-notifierEN
← wiki

$ cat wiki/models/diffusion-gemma.md

DiffusionGemma

⚡ 늦은 캡처 (릴리스 2026년 6월 11일 기준 +46일)

Gemma 4 26B MoE 백본 위에 만든 Google DeepMind 의 첫 공개 가중치 텍스트 디퓨전 모델.

Spec

AttributeValue
DeveloperGoogle DeepMind
Released2026-06-11
Announced2026-06-11
Context windowunknown
Pricing무료 (공개 가중치)
LicenseApache 2.0
AvailabilityHugging Face (google/diffusiongemma-26B-A4B-it), Kaggle, Google Cloud Vertex AI Model Garden

Release Date

2026년 6월 11일.

Architecture

  • 기반: Gemma 4 26B-A4B Mixture-of-Experts (총 25.2B 파라미터, 순전파당 약 3.8B 활성)
  • 디코딩: 이산 텍스트 디퓨전 — 왼쪽에서 오른쪽으로 가는 자기회귀가 아니라, 반복적 디노이징(Uniform State Diffusion)으로 256 토큰 블록을 병렬 생성한다
  • 메모리: 약 18 GB VRAM (MXFP4 양자화) — 동급 모델보다 로컬 배포 문턱이 크게 낮다
  • 프레임워크: vLLM 네이티브 지원

Benchmarks

DiffusionGemma 는 자기회귀 Gemma 4 26B-A4B 기준선 대비 정확도를 처리량과 맞바꾼다:

BenchmarkDiffusionGemmaGemma 4 26B-A4B (자기회귀)
AIME 202669.1%88.3%
MMMU Pro54.3%73.8%
다단계 추론(수학, 비전-언어)이 정확도 손해를 더 크게 본다. 순수 텍스트 과제는 덜하다. 그 대가로 처리량이 약 4배가 된다.

Performance

  • H100 GPU 한 장에서 초당 1,000 토큰 이상
  • RTX 5090 에서 초당 700 토큰 이상
  • 처리량이 병목인 워크로드에서 동등한 벤치마크 품질 기준 자기회귀 Gemma 4 26B-A4B 대비 약 4배 빠르다

Use Cases

  • 토큰당 지연이나 비용이 주된 제약인 고처리량 텍스트 생성 워크로드
  • 최고 수준의 추론 정확도가 필요한 과제(다단계 수학, 복잡한 비전-언어)에는 맞지 않는다

Compared To

ModelTypeSpeed (H100)AIME 2026License
DiffusionGemma디퓨전 MoE1,000+ t/s69.1%Apache 2.0
Gemma 4 26B-A4B자기회귀 MoE약 250 t/s (추정)88.3%Apache 2.0
Kimi K3자기회귀 MoEunknownModified MIT

Significance

DiffusionGemma 는 주요 AI 랩이 프로덕션에 올린 첫 공개 가중치 텍스트 디퓨전 모델이다. 반복당 256 토큰을 병렬 디코딩하는 방식은 자기회귀만이 규모에서 유효한 디코딩 경로라는 전제에 도전한다. 공학적 절충 공간을 연다 — 운영자가 이제 과제별 추론 품질 대신 처리량을 고를 수 있고, 이 절충은 이번 릴리스 이전의 공개 가중치 프로덕션 모델에는 없던 것이다.

Referenced by

Sources