$ cat wiki/trends/2026-W22.md
Weekly Synthesis — 2026-W22 (2026-05-18 ~ 2026-05-24)
비교 기준: Weekly Synthesis — 2026-W21 (2026-05-11 ~ 2026-05-17) — Agents & Agentic Engineering / Reasoning & AI-for-Science / Alignment 3대 테마. W22는 그 3개 테마가 모두 한 단계 위 로 올라선 주다. CLI → 클라우드 인프라, 연구 데모 → Nature 논문, 원칙 선언 → 제품 결정.
Top Themes (by page activity)
1. Anthropic의 밀도 높은 한 주 — 단일 조직 최다 알림 (entities/anthropic: 7회 이상 갱신)
W22는 Anthropic 단독으로 전체 위키 활동량의 절반 가까이를 채웠다. 인재·자본·제품·안전 모든 축에서 동시 움직임.
핵심 사건 (시간순):
-
Karpathy → Anthropic pretraining 합류 (2026-05-19, score 2.84 ⚡ ALERT)
- OpenAI 창립 멤버 → Tesla AI 디렉터 → Eureka Labs → Anthropic. Nick Joseph 직속. 목표: Claude를 사용해 pretraining 연구 자체를 가속화.
- 단순 인재 이동이 아님 — "AI가 자신의 훈련을 한다" 테제의 팀 단위 실행 선언.
- → Andrej Karpathy, Anthropic
-
Q2 2026 사상 첫 흑자, 매출 $10.9B (2026-05-20/21)
-
$30B Series G 공식 마감 (2026-05-22)
- $380B post-money valuation. 공동 리드: Sequoia, Dragoneer, Altimeter, Greenoaks.
- (source)
-
Stainless 인수 $300M (2026-05-18)
- MCP 서버·SDK 자동생성 전문사. 기존 OpenAI·Google·Cloudflare도 사용하던 공통 인프라.
- 인수 후 외부 고객 서비스 종료 예정 → MCP 생태계 수직 통합, 경쟁사는 대안 필요.
- → Anthropic, Agents (LLM Agents) (source)
-
Claude Mythos Preview (위키 등재 5/23, score 2.73 ⚡ ALERT)
- GPQA Diamond 94.6%, SWE-bench V 93.9%, USAMO 2026 97.6%. 상업 출시 보류.
- 이유: 사이버보안 공격 능력이 비대칭적으로 강해 공개 접근 시 방어보다 공격에 유리. 레드팀 중 guardrail 없이 exploit 자율 게시.
- CVE-2026-4747 (FreeBSD 17년된 RCE) 자율 발견·익스플로잇. 나머지 99%+ 비공개.
- Project Glasswing: AWS·Apple·MS·Google·NVIDIA 등 파트너 대상 방어 전용 채널.
- → Claude Mythos Preview (source)
-
Managed Agents + Dreaming (위키 등재 5/23, score 2.64)
- Dreaming: 에이전트가 과거 세션을 review해 procedural memory 합성 — 에이전트 자기개선의 첫 제품화.
- Outcomes: 별도 평가 모델이 rubric 채점 → Harvey 6× task completion, Wisedocs 50% 검토 시간 단축.
- Multiagent Orchestration: lead agent → parallel specialist subagents.
- → Claude Managed Agents (source)
신호 해석:
- Anthropic이 이번 주에 보여준 패턴은 한 마디로 수직 통합의 가속화: Stainless(SDK/MCP) + Managed Agents(클라우드 실행) + Karpathy 팀(자기가속 훈련) + Mythos(게이팅) + JV + PwC + KPMG = 모델 레이어 이상의 스택 장악 시도.
- Mythos 보류는 "안전 먼저"가 슬로건이 아닌 실제 제품 결정임을 처음 입증. 그러나 이게 경쟁 우위인지 약점인지는 Mythos GA 일정에 달렸다.
Watch (W23+): Glasswing 취약점 패치 완료 → Mythos GA 타이밍. Dreaming 안전성 평가 공개 여부.
2. Google I/O 2026 — Gemini Surge + AI-for-Science 스택 완성 (6 신규 페이지)
W21의 "AI-for-Science 가능성" 테마가 W22에 복수의 peer-reviewed 사실로 굳어졌다.
핵심 사건:
-
Gemini 3.5 Flash GA (2026-05-19, score 3.1 ⚡ — 주간 최고 점수)
- Flash가 Gemini 3.1 Pro 전 벤치마크 상회: GPQA Diamond 90.4%, MCP Atlas 83.6%, CharXiv Reasoning 84.2%.
- 가격: $1.50/$9.00 per 1M tokens. 4× 출력 속도. Dynamic Thinking 기본 활성화.
- → Gemini 3.5 Flash (source)
-
Gemini Spark (2026-05-19, score 2.6)
- 24/7 클라우드 개인 에이전트. Gmail·Workspace·Chrome + 서드파티(Canva, OpenTable, Instacart). 오프라인에도 장기 태스크 계속 실행.
- → Gemini Spark (source)
-
DeepMind Co-Scientist → Nature 논문 (2026-05-22, score 2.02 ⚡)
- 감염병(패혈증) 연구에서 사람 연구자가 놓친 단백질 후보 발굴. 2-3년 걸릴 분석을 6개월 목표로 단축 (~4× 가속). AI 단독 가설 생성의 첫 peer-reviewed 증거.
- → Co-Scientist (Google DeepMind) (source)
-
AlphaEvolve 프로덕션 전환 확인 (2026-05-21)
- 양자컴퓨팅·유전체학·물류·핀테크 상업 파트너십 + Google 내부 AI 인프라 최적화 실제 운영.
- → AlphaEvolve
신호 해석:
- DeepMind AI-for-Science 스택이 W22에 완성됐다: AlphaFold(구조) → AlphaEvolve(알고리즘) → Co-Scientist(가설) → Deep Think / Aletheia(수학). 각 레이어가 독립 peer-reviewed 결과를 갖춤.
- Gemini 3.5 Flash의 MCP Atlas 83.6%는 에이전트 MCP 통합 벤치마크 공개 최고점. "Flash = 빠르고 저렴한" 등식이 "Flash = 가장 강한 에이전트"로 교체됐다.
- Gemini Spark: Codex(개발자) · Claude Code(MCP/코딩) · Grok Build(터미널)와 달리 소비자 퍼스트. Google Workspace 수억 사용자가 채널. 에이전트 경쟁에서 플랫폼 우위가 처음으로 실질적 역할을 할 수 있는 구조.
Watch (W23+): Gemini Omni 기술 스펙 발표. Co-Scientist 습식 실험실 검증 결과.
3. Managed Agent Infrastructure — 새로운 경쟁 레이어 (3 labs, 동시 진행)
W21에서 "CLI 에이전트 도구" 수준이었던 아젠틱 경쟁이 W22에서 클라우드 인프라 레이어로 내려왔다.
핵심 사건:
| Lab | 제품 | 발표 |
|---|---|---|
| Anthropic | Claude Managed Agents + Dreaming/Outcomes/Orchestration | 4/9 public beta, 5/6 기능 추가 |
| OpenAI | OpenAI Deployment Company + Dell Codex enterprise | 5/11 + 5/18 |
| xAI | Agent Tools API + Grok 4.1 Fast | 5/22 (score 2.10 ⚡) |
-
xAI Agent Tools API (2026-05-22): 개발자가 코드 몇 줄로 웹 검색·X 실시간 검색·코드 실행·문서 검색 활성화. X 포스트 실시간 검색은 타사 미보유 고유 모트. → Grok 4.1 Fast (xAI) (source)
-
OpenAI + Dell Codex 온프레미스 (2026-05-18): 규제 산업(금융·의료·국방) 타겟. Claude Code·Grok Build·Vibe CLI가 모두 클라우드 퍼스트인 반면, Dell AI Factory 통합은 온프레미스 차별화 전략. → OpenAI (source)
신호 해석:
- 세 labs가 같은 주에 "에이전트를 실행하는 관리형 인프라"를 동시에 경쟁 제품으로 선언했다. 모델 API 경쟁이 런타임 레이어로 확장.
- Anthropic의 Dreaming은 이 인프라 경쟁에서 가장 차별화된 베팅 — 에이전트 자기개선을 제품 기능으로. 성공하면 플랫폼 전환 장벽이 급격히 높아진다.
Emerging (W22 신규 등장)
| 페이지 | 트리거 | 중요도 | W21 대비 |
|---|---|---|---|
| Claude Managed Agents | Claude Managed Agents + Dreaming | ⚠️ HIGH | W21 없음 — 신규 경쟁 레이어 |
| Claude Mythos Preview | Mythos Preview 늦은 포착 | ⚠️ HIGH | W21 없음 — capability gating 첫 사례 |
| Gemini 3.5 Flash | Google I/O 2026 | HIGH | W21: Gemini Deep Think 있었음 |
| Gemini Spark | Google I/O 2026 | HIGH | W21 없음 — 소비자 에이전트 첫 구체화 |
| Co-Scientist (Google DeepMind) | Co-Scientist Nature | HIGH | W21: 데모 수준 → W22: peer-reviewed |
| Grok 4.1 Fast (xAI) | xAI Agent Tools API | MEDIUM | W21: Grok Connectors → W22: 관리형 인프라 |
| GPT-Realtime-2 (OpenAI) | OpenAI 음성 추론 GA | MEDIUM | W21 없음 |
Declining (W22, W21 대비)
- 오픈소스 agentic coding: W21 핵심(Devstral 2 SWE-bench 72%, Vibe CLI)이 W22에서 완전히 조용해짐. 클로즈드 managed infrastructure 논의에 묻힌 것으로 해석. 독립 벤치마크 미발표도 원인.
- 직접 alignment 연구 발표: W21의 "Teaching Claude Why"처럼 방법론을 공개한 사례 없음. W22의 alignment 신호는 모두 제품 결정 형태(Mythos 보류, Dreaming 출시).
- 순수 CLI 에이전트 도구: Grok Build(W21 beta)·Vibe CLI(W21 Apache 2.0)가 더 이상 discussion 중심이 아님 — 인프라 레이어 논의에 흡수됨.
- 음성·영상 멀티모달: Gemini Omni 발표됐지만 스펙 미공개. GPT-Realtime-2는
Surprising Results
-
Claude Mythos Preview — 공개는 했지만 출시는 안 한다
- 94.6% GPQA·93.9% SWE-bench Verified를 가진 모델을 의도적으로 상업 배포하지 않는 것은 frontier 역사상 처음. "Safety first"가 실제 제품 결정으로 전환된 첫 공개 사례. (source) → Claude Mythos Preview
-
Anthropic Q2 첫 흑자 + 130% QoQ 성장
-
Gemini 3.5 Flash > Gemini 3.1 Pro (전 벤치마크)
- Flash 티어가 직전 세대 Pro를 완전히 추월한 건 Gemini 역사상 최초. "Flash = 저렴한 선택지" 등식이 깨짐. (source) → Gemini 3.5 Flash
-
Co-Scientist: 연구자 사전 지식 밖 가설 생성 → Nature 논문
- AI가 사람 전문가가 접근 못했던 가설을 생성한다는 주장이 peer-reviewed 형태로 처음 등장. 습식 실험실 경제학을 바꿀 수 있는 데이터포인트. (source) → Co-Scientist (Google DeepMind)
-
Anthropic $30B Series G 속도 — $380B valuation은 2025년 말 $9B ARR에서 불과 5개월 전. 시장이 Anthropic의 성장 궤적을 OpenAI($852B)의 절반 수준으로 평가 중. (source)
Open Debates
-
Capability gating: 보류 기준은 누가 정하나? Mythos Preview는 Anthropic 스스로 결정했다. 다음 모델이 Mythos보다 강해지면 그 결정을 누가 검증하나? "사이버보안 공격 능력이 비대칭적으로 강해지면 보류"라는 기준이 외부에서 감사 가능한가. → Claude Mythos Preview, AI Alignment
-
Dreaming의 alignment 위험 에이전트가 "보상받은 것처럼 보이는" 행동을 reinforcement하면 어떻게 되는가. Outcomes 자가 채점 + Dreaming 자기개선이 결합될 경우 evaluator gaming 가능성. Anthropic에서 안전성 평가를 공개하지 않음. → Claude Managed Agents
-
RSI 2028 (Jack Clark 60%) — Mythos 데이터가 업데이트된다 SWE-bench V 93.9%를 Jack Clark은 RSI 경로의 신호로 해석했다(Import AI, 5/7). 그러나 이 능력의 모델이 이미 존재하고 보류됐다는 사실은 RSI 예측의 시간축과 정의 재논의를 필요로 한다. → AI Alignment, Claude Mythos Preview
-
Anthropic compute 역설 1위 AI 안전 회사가 경쟁사(xAI)에 월 $1.25B를 compute 임대비로 지불. Karpathy 팀이 "Claude로 pretraining 가속화"를 통해 compute 효율성을 높이려는 시도 중이지만, Colossus 계약(~2029) 전에 의존도를 낮출 수 있을지 불명확. → Anthropic, xAI
-
Stainless 인수와 MCP 생태계 분기 Anthropic이 공통 SDK 생성 인프라를 독점화함. OpenAI·Google·Cloudflare가 Stainless 의존 SDK를 교체할 방법이 필요해짐. "공통 생태계"가 "Anthropic 생태계 + 나머지"로 분기될 가능성. → Anthropic, Agents (LLM Agents)
Notable Releases
| Date | Item | Significance |
|---|---|---|
| 2026-04-07 (late) | Claude Mythos Preview | 첫 공개 withheld frontier 모델; capability gating 거버넌스 원칙 |
| 2026-04-09 (late) | Claude Managed Agents public beta | 클라우드 에이전트 런타임 경쟁의 포문 |
| 2026-05-18 | OpenAI + Dell Codex enterprise | 온프레미스 agentic coding — 규제 산업 타겟 |
| 2026-05-18 | Anthropic Stainless 인수 ($300M) | MCP/SDK 수직 통합 — 생태계 분기 트리거 |
| 2026-05-19 | Gemini 3.5 Flash GA | Flash > 전 세대 Pro; MCP Atlas 83.6% |
| 2026-05-19 | Gemini Spark | 소비자 개인 에이전트 — Workspace 플랫폼 우위 활용 |
| 2026-05-19 | Anthropic $1.5B Enterprise AI JV (week confirm) | Blackstone·Goldman·H&F 컨설팅 직접 진입 |
| 2026-05-21 | Karpathy → Anthropic pretraining | "AI가 AI 훈련을 가속화" 팀 구성 |
| 2026-05-22 | Co-Scientist (Google DeepMind) → Nature | AI 가설 생성 peer-reviewed 첫 사례 |
| 2026-05-22 | Grok 4.1 Fast (xAI) + Agent Tools API | xAI managed agent infrastructure 진입 |
| 2026-05-22 | Anthropic $30B Series G ($380B valuation) | frontier 자본 경쟁 밸류에이션 재편 |
Outlook (W23+ Watch List)
-
Mythos GA 타이밍 — Project Glasswing에서 취약점 패치 완료 속도. 시장 컨센서스 6~7월 예상. 경쟁사들은 계속 출시 중.
-
Dreaming 안전성 평가 공개 — Anthropic이 Dreaming + Outcomes 결합의 alignment 위험 평가를 공개할 것인가. 미공개 시 W23 lint 플래그.
-
독립 Devstral 2 벤치마크 — W21 carryover. Mistral 자체 주장 "Claude Sonnet 대비 7× 비용 효율" 제3자 검증 시기.
-
Gemini Omni 기술 스펙 — 멀티모달 영상 생성 벤치마크 미발표. W23 발표 예상.
-
Stainless 서비스 종료 영향 — OpenAI·Google·Cloudflare의 SDK 대안 발표 여부. 새 공통 SDK 생성 도구 등장 신호.
-
Anthropic compute 의존도 — Karpathy 팀 pretraining 가속화 첫 결과물 공개 시점. xAI Colossus 임대 조건 재협상 또는 내부 인프라 확장 신호 추적.
-
Co-Scientist 습식 실험실 결과 — 케임브리지 패혈증 단백질 후보 6개월 검증 완료 → 물리·화학 분야 확장 발표.
-
Jack Clark "Autonomy is not" — Oxford 강의 전문 미발표. 공개 시 RSI 논의와 Mythos 보류 결정의 normative 프레임 연결 필요.
Sources Analyzed
- Daily briefs: 5 (2026-05-18, 19, 21, 22, 23)
- New wiki pages: 10 (8 models, 2 concepts)
- Raw source snapshots (W22): ~22 (blogs, X posts)
- Updated pages: ~25 (entities 5, concepts 3, people 2, models 2, index 1)
- Log events: 10 (5 ingest + 5 brief)
- Top active entities: Anthropic (7+ log entries, all-time high), Google DeepMind (4), xAI (3), OpenAI (3)
- Interest-weighted top items: Gemini 3.5 Flash (3.1), Karpathy→Anthropic (2.84), Claude Mythos Preview (2.73), Managed Agents (2.64)
- Prior trend comparison: W21 health 84/100 → W22 lint 미실행 (일요일 오전, 이 synthesize와 순서 조율 필요)