$ cat wiki/models/gemini-3-5-flash-lite.md
Gemini 3.5 Flash-Lite
modelupdated 2026-07-22created 2026-07-22
Spec
| Attribute | Value |
|---|---|
| Developer | Google DeepMind |
| Released | 2026-07-21 |
| Announced | 2026-07-21 |
| Context window | 1,048,576 토큰 (1M) |
| Pricing | $0.30/M input · $2.50/M output |
| License | proprietary |
| Availability | Gemini API, Google AI Studio, Vertex AI |
Benchmarks
| Benchmark | Gemini 3.5 Flash-Lite | Gemini 3.1 Flash-Lite (이전 세대) |
|---|---|---|
| Terminal-Bench 2.1 | 54% | 31% |
| GDM-MRCR v2 (롱컨텍스트) | 72.2% | 60.1% |
| GDPval-AA v2 | 1140 | 642 |
| AA Intelligence Index | 이전 세대 대비 +11점 | 기준 |
| 과제당 소요 시간 | 이전 세대의 약 절반 | 기준 |
| 출력 속도 | 350.2 t/s | unknown |
Use Cases
- 고처리량·저지연 에이전틱 파이프라인 (에이전틱 검색, 문서 처리)
- 하루 수백만 호출이 필요한 비용 민감 애플리케이션
- 대규모 고속 분류·라우팅·요약
Key Differentiators
- 가장 싼 프로덕션 Gemini 모델: 100만 토큰당 $0.30/$2.50
- 속도: 350.2 t/s — 범주 중앙값(약 107 t/s)을 크게 웃돈다
- 조절 가능한 thinking 수준: 빠른 추론과 깊은 추론 모드를 지원한다
- Gemini 3.6 Flash 를 보완하는 고처리량 계층으로 자리한다
Related
- Google DeepMind — 개발사
- Gemini 3.6 Flash — 같은 날 공개된 상위 성능 형제 모델
- Gemini 3.5 Flash Cyber — 같은 날 공개된 보안 특화 형제 모델
- Agents (LLM Agents) — 주된 배포 맥락
Sources
- Google Blog (2026년 7월 21일): https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/
- DeepMind Flash-Lite 페이지: https://deepmind.google/models/gemini/flash-lite/