AI Trend Notifier
EN
← 아카이브

$ cat briefs/daily/2026-05-31.md

2026-05-31

2026년 5월 31일 (일)

주요 소식 2 · 논문 선정 1 · 주시 3 · 신규 페이지 3

+3new pages
[01]

주요 소식

1. Anthropic AAR: AI가 alignment 연구 자체를 인간보다 4× 빠르게 수행

  • Claude Opus 4.6 기반 9개 자율 에이전트(AARs)를 weak-to-strong supervision 연구 문제에 배치 (April 14, source)
  • 1주 만에 PGR 97% 달성 (인간 연구자 동기간 23%)
  • 각 AAR은 독립 코딩 샌드박스 + 에이전트 간 공유 포럼 — 아이디어 제안 → 실험 → 결과 분석 → 공유 자율 사이클
  • 컴퓨팅 병렬화로 수개월 연구를 수 시간으로 압축 가능
  • 왜 중요한가: 컴퓨트를 직접 alignment 진전으로 변환할 수 있음의 첫 실증. RSI 함의: alignment 연구 자동화가 recursive 개선 루프를 닫는 핵심 레이어. Jack Clark의 "RSI 60%/2028" 예측의 구체적 메커니즘이 눈앞에 나타나고 있다.
  • Automated Weak-to-Strong Researcher (AAR), AI Alignment, Anthropic

2. Microsoft MAI: Build 2026(6/2)에서 독자 frontier 모델 4종 발표 예정

  • Mustafa Suleyman (전 Google DeepMind 공동창업자, Inflection CEO) 이끄는 MAI 팀이 Build 키노트에서 공개 예정 (source)
  • 모델 라인업: 범용 다중 크기 + GitHub Copilot 전용 코딩 모델 + 에이전트 + 추론 특화
  • 배경: 2026년 4월 OpenAI 파트너십 재협상으로 "독자 frontier 모델 훈련 불가" 조항 철폐
  • GitHub Copilot 과금 체계도 6월 1일부터 AI-credit 방식으로 전환
  • 왜 중요한가: Microsoft가 사실상 frontier 4강 체제에 진입. 독자 코딩 모델 + GitHub Copilot(수천만 개발자)은 즉각적인 개발자 생태계 임팩트. OpenAI-Microsoft 관계가 "주요 고객/파트너"에서 "경쟁자 포함"으로 전환되는 역사적 분기점.
  • Microsoft (🆕 신규 페이지)
[02]

논문 선정

Positive Alignment: Artificial Intelligence for Human Flourishingarxiv:2605.10310

  • Oxford/Google DeepMind/Anthropic/Stanford 등 16인 공동 논문 (submitted May 11, source)
  • TL;DR: 현재 AI alignment은 "해를 끼치지 않는" negative alignment에만 집중 → 이는 "floor 없는 ceiling". AI는 sycophancy, 자율성 침해, engagement hacking을 하면서도 모든 안전 기준을 만족할 수 있다. 해법으로 "positive alignment" 제안 — AI가 적극적으로 번영(wellbeing, wisdom, autonomy, truth-seeking, 사회적 협력)을 지원하도록 훈련
  • 왜 봐야 하나: 각자 조직의 접근법을 비판적으로 바라보는 Anthropic·DeepMind 연구자들의 공동 문서. Pope Leo XIV 회칙(2026-05-25)과 같은 시기에 같은 방향으로 수렴 중 — "안전만으로는 충분하지 않다"는 시대적 합의가 형성되고 있다.
  • Positive Alignment: Artificial Intelligence for Human Flourishing, AI Alignment
[03]

주시

  • Constitution compliance 급개선 (arxiv 2605.24229, May 22): DeepMind 팀(Neel Nanda 등)이 Claude / GPT 계열의 헌법 준수율 측정. Claude 위반율: Sonnet 4 15.0% → Sonnet 4.6 2.0% (7.5× 개선). GPT: GPT-4o 11.7% → GPT-5.2 3.6%. 훈련 방법론이 실제로 작동하고 있다는 정량 증거. 잔여 2%/3.6%가 어떤 케이스인지가 다음 질문. (source) → AI Alignment

  • Gemini 3.5 Pro 엔터프라이즈 대기자 오픈 (May 28~): Sundar Pichai가 I/O에서 "give us until next month" → Vertex AI enterprise allowlist 오픈, Google AI Studio 대기자 접수 중. Gemini 3.5 Flash의 Pro 버전 — 추론/코딩 최고 성능 예상. GA 시 frontier 순위 재편 가능. → Google DeepMind, Gemini 3.5 Flash

  • GitHub Copilot 과금 전환 (June 1): Codex Pro 2× 프로모션 오늘(5/31) 종료. 내일부터 AI-credit 기반 과금 시작. Microsoft MAI 코딩 모델 도입 시 Copilot 생태계의 모델 경쟁 가속화 예상.

[04]

위키 신규

[05]

갱신

  • AI Alignment: AAR 결과 + Positive Alignment 프레임워크 + Constitution compliance 수치 추가
  • Anthropic: AAR 발표 Recent Activity 추가
  • Google DeepMind: Constitution compliance paper 추가