$ cat briefs/daily/2026-07-20.md
2026-07-20
2026년 7월 20일 (월)
ingest-agent + brief-agent 생성. 관심 가중치는 `interests.md` 기준.
주요 소식
1. Kimi K3 — Moonshot 의 2.8T MoE 오픈 가중치, Frontend Code Arena 에서 Fable 5 를 앞서다 (점수: 1.7)
베이징의 Moonshot AI 가 7월 16일 Kimi K3 를 공개했다. 2.8조 파라미터 MoE 로 전문가 896개 중 토큰당 16개가 활성화된다(밀도 약 1.8%). 컨텍스트 창은 1M 토큰. 아키텍처는 KDA(Key Decomposed Attention) — 선형 어텐션과 softmax 어텐션의 하이브리드로, 긴 컨텍스트에서 품질을 떨어뜨리지 않고 메모리 부담을 줄인다고 Moonshot 은 주장한다. 변형은 둘이다: K3 Max(전체)와 K3 Swarm Max(다중 에이전트). 가격은 Mtok 당 $0.30/$3(입력·출력 표준), 확장 사고는 Mtok 당 $15. 오픈 가중치 공개는 7월 27일까지로 계획돼 있다. 벤치마크 하이라이트: Frontend Code Arena 에서 Fable 5 를 앞선다(사람 선호 Elo 기준). 의의: Kimi K3 는 일주일 사이 나온 세 번째 중국 오픈 가중치 모델이지만(DeepSeek V4, Qwen 3.8 과 함께) 기술적으로 가장 차별화돼 있다 — KDA 는 Llama·Qwen 을 키운 변형이 아니라 새로운 아키텍처이고, Fable 5 를 상대로 한 Frontend Code Arena 결과는 지금까지 나온 오픈 가중치 프런티어 주장 중 가장 강하다.
→ Moonshot AI | Kimi K3 | source
2. DeepSeek V4 일반 가용성(GA) 도달 — SWE-bench Verified 80.6%, MIT 라이선스, 레거시 모델은 7월 24일 퇴역 (점수: 1.7)
2026년 4월 프리뷰됐던 DeepSeek V4 가 7월 16일 GA 에 도달했다. 크기 변형은 둘이다: V4-Pro(총 1.6T / 활성 49B)와 V4-Flash(284B / 13B). 컨텍스트 창은 1M 토큰, 라이선스는 MIT. 벤치마크는 SWE-bench Verified 80.6% 로 오픈 가중치 SOTA 이며, 비공개 모델인 Gemini 3.1 Pro 와 동률이다. 가격은 피크·오프피크 차등을 둔다(V4-Pro: Mtok 입력당 $2.25/$0.75, 피크/오프피크). 레거시 모델 퇴역: deepseek-chat 과 deepseek-reasoner 엔드포인트가 2026년 7월 24일 15:59 UTC 에 퇴역한다 — 옛 엔드포인트를 쓰는 애플리케이션에는 하드 컷오프다. 의의: SWE-bench 80.6% 의 MIT 라이선스 모델은 오늘 기준 오픈 가중치 역량의 천장이며, Fable 5 를 제외한 최고 수준의 비공개 모델과 대등하다. MIT 라이선스는 상업적 이용 제한을 전부 없애므로 어떤 제품에든 배포할 수 있다.
→ DeepSeek | DeepSeek V4 | source
3. Claude 의 가치는 모델과 언어에 따라 달라진다 — 정렬 안정성에 대한 도전 (점수: 1.69)
Anthropic 이 7월 13일 "How Claude's Values Vary by Model and Language" 를 공개했다. 실제 대화 30만 9천 건 이상을 분석해 표현된 규범 3,307개를 네 축으로 압축했다: 순응/신중, 온기/엄밀, 깊이/간결, 솔직/실행. 발견: (1) Opus 4.6 과 Opus 4.7 의 가치 프로파일이 다르다 — 모델 업데이트가 표현되는 가치를 바꿨다. (2) 같은 가중치 가 영어와 아랍어에서 다른 프로파일로 응답한다. 아랍어는 순응+온기+간결+실행 쪽으로, 영어는 신중+엄밀+깊이+솔직 쪽으로 기운다. 의의: 순응/신중 축이 안전 측면에서 가장 중요하다 — 아랍어로는 사용자 의도에 순응하고 영어로는 신중을 적용하는 모델은 언어 공동체마다 안전 경계를 다르게 다루게 된다. 정렬이 분포에 불변이 아니라는 가장 분명한 실증이다.
→ Anthropic | Mechanistic Interpretability | AI Alignment | source
4. GPT-Red — OpenAI 의 자기대전 자동 레드티밍, 인간 레드팀 대비 84% 대 13% (점수: 1.69)
OpenAI 가 7월 15일 GPT-Red 연구를 공개했다. 자기대전으로 훈련해 프롬프트 인젝션 취약점을 찾아내고 프로덕션 모델을 강화하는 내부 LLM 이다. 프롬프트 인젝션 발견에서 GPT-Red 는 인간 레드팀을 84% 대 13% 로 이겼다. GPT-Red 의 결과로 강화한 GPT-5.6 Sol 은 가장 어려운 직접 프롬프트 인젝션 벤치마크에서 4개월 전 대비 실패가 6분의 1 이 됐다. GPT-Red 의 가장 강력한 공격은 GPT-5(2025년 8월)에는 90% 이상 성공했지만 GPT-5.6 에는 23% 미만만 성공했다. 의의: 프로덕션 규모에서 AI 대 AI 안전 강화 루프를 공개한 첫 사례다. 프런티어 모델의 역량이 커질수록 인간 레드티밍의 처리량이 병목이 되며, 자동화된 자기대전이 유일하게 그럴듯한 확장 경로다.
→ OpenAI | AI Alignment | source
5. Muse Image + Muse Video — MSL 의 첫 배포 모델이 Arena 2위·3위에 오르다, 네이티브 에이전틱 생성 (점수: 1.1)
Meta Superintelligence Labs 가 7월 7일 Muse Image 를 내놨다 — MSL 이 개발한 모델 중 공개 배포된 첫 사례다. 기술 순위: Text-to-Image 및 편집 아레나의 사람 선호 Elo 2위. 핵심 차별점은 에이전틱 생성 이다 — Muse Image 는 생성 도중 검색과 코드 도구를 쓴다(순수 픽셀 예측이 아니다). 워터마킹으로 Content Seal 이 삽입된다. 같은 날 프리뷰로 나온 Muse Video 는 같은 사전학습 기반을 공유하고 네이티브 오디오 출력(후처리가 아니다)을 더했으며, 프리뷰 시점 text-to-video 아레나 3위였다. GA 일자는 미발표다. Instagram 자동 옵트인을 둘러싼 동의 논란은 아직 해소되지 않았다. 의의: 6개월 전에는 존재하지도 않던 랩이 첫 공개 배포에서 아레나 2위·3위를 했다. 생성 도중 도구를 쓰는 에이전틱 아키텍처는 디퓨전만 쓰는 접근과 구조적으로 다르며, 에이전틱이 아닌 경쟁자와의 격차를 벌릴 수 있다.
→ Meta AI | Muse Image | Muse Video | source
논문 선정
오늘 인제스트에서 임계값을 넘은 새 논문은 없다(지난주 arXiv 관련 논문은 2026-07-19 실행에서 모두 캡처했다). 다음 논문 창: 화요일 인제스트.
주시
1. DeepSeek 레거시 엔드포인트 퇴역 — 7월 24일 15:59 UTC 마감 deepseek-chat 또는 deepseek-reasoner API 엔드포인트를 쓰는 애플리케이션은 V4 엔드포인트로 옮기지 않으면 7월 24일에 멈춘다. 프로덕션 시스템에 7일 통지는 매우 짧다. 컷오프 이후 개발자들의 장애 보고를 지켜볼 것.
2. Kimi K3 오픈 가중치 공개 (목표: 7월 27일까지) Moonshot 은 7월 27일까지 오픈 가중치를 공개하겠다고 했다. 지켜진다면 2.8T 의 K3 가 배포되는 오픈 가중치 모델 중 최대가 된다. KDA 아키텍처도 독립적으로 재현할 수 있게 된다. 볼 것: (1) HuggingFace 호스팅이 가중치 배포 부하를 감당하는가, (2) Frontend Code Arena 순위가 커뮤니티 벤치마킹에서도 유지되는가.
3. Qwen 3.8 Max 벤치마크 공개 Qwen 3.8 프리뷰에는 독립적인 벤치마크가 없다 — "Fable 5 다음" 이라는 자체 주장뿐이다. 오픈 가중치가 공개되면(시점 미정) 커뮤니티 벤치마크가 첫 실측을 내놓을 것이다. 벤치마크를 공개했던 Qwen 3.7-Max 와의 격차는 설명되지 않았다.
위키 신규
| Page | Type | Summary |
|---|---|---|
| Moonshot AI | entity | 베이징의 Moonshot AI(Yang Zhilin). Kimi 계열. 프런티어 오픈 가중치 랩 |
| DeepSeek | entity | DeepSeek(High-Flyer Capital, 항저우, Liang Wenfeng). V4 는 오픈 가중치 SOTA |
| Kimi K3 | model | 2.8T MoE, KDA 아키텍처, 1M ctx, 오픈 가중치, Frontend Code Arena 에서 Fable 5 앞섬 |
| DeepSeek V4 | model | 1.6T/49B(Pro) + 284B/13B(Flash), MIT, SWE-bench 80.6%, 7월 16일 GA |
| Qwen 3.8 Max (Preview) | model | 2.4T MoE 프리뷰, 벤치마크 없음, 오픈 가중치 예정 — 벤치마크 주시 |
| Muse Image | model | Meta MSL, Arena 2위, 에이전틱 생성(검색+코드 도구), Content Seal |
| Muse Video | model | Meta MSL 프리뷰, Arena 3위, 네이티브 오디오, Muse Image 와 기반 공유 |
갱신
| Page | What changed |
|---|---|
| Alibaba / Qwen AI Lab | Models & Products 와 Recent Activity 에 Qwen 3.8 Max 항목 추가(7월 19일) |
| OpenAI | Recent Activity 에 GPT-Red 항목 추가(7월 15일) |
| Anthropic | Recent Activity 에 Claude 가치 연구 항목 추가(7월 13일) |
| Google DeepMind | Recent Activity 에 Hassabis 의 FINRA 모델 AGI 프레임워크 항목 추가(7월 14일) |
| Meta AI | Muse Image 항목에 MSL 기술 맥락 반영. Models & Products 에 Muse Image·Video 추가 |
| Mechanistic Interpretability | Claude 의 가치가 모델·언어에 따라 달라진다는 섹션 추가(Anthropic, 7월 13일) |
| AI Governance | Hassabis 의 FINRA 모델 표준기구 섹션 추가(7월 14일). WAICO 와 대비해 배치 |