$ cat wiki/models/deepseek-v4-flash.md
DeepSeek V4-Flash
model갱신 2026-08-01생성 2026-08-01
스펙
| 속성 | 값 |
|---|---|
| Developer | DeepSeek |
| Released | 2026-07-31 (정식 / 퍼블릭 베타, 빌드 0731; 이전 Preview) |
| Announced | 2026-07-31 |
| Context window | unknown |
| Pricing | 입력 $0.14/M (캐시 미스) · 입력 $0.0028/M (캐시 히트) · 출력 $0.28/M — 상충 보고 참조 |
| License | MIT (오픈 웨이트) |
| Availability | DeepSeek API (Responses 형식, Codex 대응), Hugging Face (deepseek-ai/DeepSeek-V4-Flash-0731) |
벤치마크
아래는 보도가 전한 벤더 발표 수치다. 원본 모델 카드는 이 환경에서 읽을 수 없었다. 비교 열은 DeepSeek 자신의 더 큰 모델인 V4-Pro-Preview 다 (source):
| 벤치마크 | Flash Preview | Flash 0731 | V4-Pro-Preview |
|---|---|---|---|
| Terminal Bench 2.1 | 61.8 | 82.7 | 72.1 |
| DeepSWE | 7.3 | 54.4 | unknown |
| Cybergym | 38.7 | 76.7 | unknown |
| NL2Repo | 39.4 | 54.2 | unknown |
| Toolathlon-Verified | 49.7 | 70.3 | unknown |
| 보도는 재훈련된 Flash 가 활성 파라미터가 훨씬 적은데도 에이전트 벤치마크 아홉 개에서 | |||
| V4-Pro (Preview) 를 앞섰다고 전한다 | |||
| (source). |
Eval Harness Configuration 에 따라, 이 수치들은 하네스 구성이 공개되지 않은 에이전트 벤치마크에서 벤더가 직접 돌린 값이므로 모델의 속성이 아니라 (모델, 하네스) 쌍에 대한 주장으로 기록한다.
아키텍처
- MoE, 총 284B / 활성 13B — Preview 에서 변경 없음
- 자체 호스팅: 최소 H100 한 장(FP8), 전체 가중치는 약 170 GB VRAM (source)
활용 사례
- 에이전트 코딩과 터미널/도구 사용 — 움직인 벤치마크가 모두 에이전트 계열이다
- V4-Pro 가 부담스러운 비용 민감 서빙
- MIT 라이선스 하의 로컬·자체 호스팅 추론
비교
| 모델 | Terminal Bench 2.1 | 오픈? |
|---|---|---|
| DeepSeek V4-Flash 0731 | 82.7 (벤더 발표) | 예 (MIT) |
| DeepSeek V4-Pro-Preview | 72.1 (벤더 발표) | 예 (MIT) |
| DeepSeek V4 (V4-Pro-Max) | unknown | 예 (MIT) |
상충 보고
- 가격. 위의 요율(입력 캐시 미스 $0.14 / 출력 $0.28)은 digitalapplied 의 릴리스 기사에서 왔다. AlphaSignal 은 같은 모델에 대해 헤드라인에서 "100만 토큰당 $0.08" 을 제시한다. 확보한 자료 중 둘을 조정해 주는 것은 없다 — $0.08 이 혼합 요율이거나 오프피크 요율일 수 있으나, 그렇게 말하는 소스는 읽지 못했다 (source).
- Artificial Analysis 순위. r/LocalLLaMA 는 이 모델을 Artificial Analysis Intelligence Index 50 점, GLM-5.2 와 GPT-5.6 보다 1점 아래로 보고한다. 이는 DeepSeek 의 주장이 아니라 서드파티 지수에 대한 커뮤니티 보고이며, 이 저장소가 직접 수집한 Artificial Analysis 스냅샷에는 아직 이 모델이 없으므로 기록하되 벤치마크로 인용하지는 않는다 (source).