$ cat wiki/papers/2026/2605.10310-positive-alignment.md
Positive Alignment: Artificial Intelligence for Human Flourishing
paperupdated 2026-05-31created 2026-05-31
TL;DR
Oxford/DeepMind/Anthropic 등 16인 공동 논문. "해를 끼치지 않는" 현재의 alignment(negative alignment)만으로는 불충분하며, AI가 적극적으로 인간 번영(flourishing)을 지원하는 "positive alignment" 패러다임을 제안.
Authors & Org
- Lead author: Ruben Laukkonen (Oxford)
- Collaborators: 15인, Oxford + Google DeepMind + Anthropic + Stanford + 기타
- arXiv 제출: 2026-05-11
Method
- 철학적 프레임워크 제안 (실험 없음)
- 현행 alignment 연구의 문제 진단 → 대안 원칙 제시
- 긍정심리학의 "mental illness 회피"에서 "flourishing 추구"로의 전환 역사를 AI alignment에 적용
Negative vs Positive Alignment
| 구분 | Negative Alignment (현재) | Positive Alignment (제안) |
|---|---|---|
| 목표 | 해 끼치지 않음 (floor) | 번영 지원 (ceiling) |
| 전략 | 위험 회피 | 가치 증진 |
| 문제 | sycophancy, 자율성 침해, 진실추구 실패, engagement hacking 방치 | |
| 비유 | 정신 질환 치료 | 번영 증진 |
Core Argument
현재 alignment의 미해결 실패:
- Engagement hacking — 해롭지 않지만 중독적인 상호작용 유도
- 자율성 침해 — 사용자의 독립적 사고·결정 능력 약화
- 진실추구 실패 — 정확성보다 사용자 만족에 최적화
- 낮은 인식론적 겸손 — 불확실할 때도 자신감 있게 답변
- 반응적(reactive) 윤리 — 사전 능동적 윤리보다 규칙 위반 감지에만 집중
Significance
- 패러다임 전환 제안: 현 시대의 alignment 담론을 "왜 해를 끼치면 안 되나"에서 "어떻게 도움을 적극 줄 수 있나"로 이동
- 멀티랩 공동: DeepMind·Anthropic 연구자들이 현 자사 접근법을 비판적으로 바라보는 드문 사례
- 타이밍: Pope Leo XIV "Magnifica humanitas" 회칙(2026-05-25, → Chris Olah)과 유사한 시기에 등장 — 외부 기관과 연구자 모두 "harm-avoidance만으로는 부족하다"는 방향으로 수렴 중
Open Questions
- Flourishing을 측정·최적화할 수 있는가? (정의가 문화·개인별로 다름)
- Positive alignment 달성은 negative alignment 달성보다 훨씬 어렵지 않나?
- AI가 "번영 지원"을 목표로 할 때 paternalism 위험은?
Cite
Laukkonen et al. (2026). Positive Alignment: Artificial Intelligence for Human Flourishing.
arXiv:2605.10310. https://arxiv.org/abs/2605.10310
Related
- AI Alignment — 이 논문이 비판하는 현재 패러다임과 대안
- Anthropic, Google DeepMind — 공저 기관
- Automated Weak-to-Strong Researcher (AAR) — 같은 시기 alignment 연구 자동화 논문
- Chris Olah — Vatican 회칙 참석으로 동일한 "외부 거버넌스" 담론과 연결