$ cat wiki/papers/2026/2606.03237-solipsistic-si.md
Solipsistic Superintelligence is Unlikely to be Cooperative
paperupdated 2026-06-06created 2026-06-06
TL;DR
현재의 RL/RLHF 훈련은 세계를 고정된 외생 환경으로 다룬다. 실제로 배치된 시스템은 이 가정을 깬다(멀티에이전트 동역학, 내생적 비정상성). 결과적으로 이런 방식으로 만든 초지능은 구조적으로 협력하기 어렵다 — 창발적 실패가 아니라 설계 결함이다. 해법은 보상을 더 잘 만드는 것이 아니라 균형 선택(equilibrium-selection)이다.
Authors & Org
- Rakshit S Trivedi, Natasha Jaques, Logan Cross, Alexander Sasha Vezhnevets, Joel Z Leibo
- Google DeepMind — 멀티에이전트 시스템 그룹
- arXiv: 2606.03237 · 제출: 2026년 6월 4일
Method
게임이론과 멀티에이전트 RL 에 기반한 형식적 논증:
- 유아론적(solipsistic) 훈련 정의: 에이전트가 환경을 외생적이고 고정된 피드백 원천으로 다루는 것 (표준 RL/RLHF 패러다임)
- 자기 훼손 성질 제시: 그런 에이전트를 여럿 배치하면 내생적 비정상성이 생긴다 → 훈련-시험-배치 간극
- 일방적 최적화가 신뢰할 만한 협력을 못 하는 에이전트를 만든다고 논증한다(다른 에이전트의 목표나 전략을 모델링하지 않기 때문)
- 규범적 대안으로 균형 선택을 제안한다: 고정된 신호에 대해 최적화만 하는 것이 아니라 다자 협력 동역학에 참여하는 AI
Results
이론 논문이며 실험 벤치마크는 없다. 주요 형식적 결과:
- 표준 멀티에이전트 형식론 아래에서 일방적 최적화는 안정적 협력과 양립할 수 없음을 보인다
- "자기 훼손" 성질은 유아론적 훈련 패러다임의 필연적 귀결이지 우연이 아니다
- 균형 선택은 훈련 시점에 에이전트 간 상호의존을 함께 모델링할 것을 요구한다
Significance
프런티어 모델 훈련에 대한 구조적 비판: RLHF, RLAIF, constitutional AI 는 모두 유아론적 패러다임 안에서 작동한다(인간 피드백을 고정 신호로 취급). 논문은 이것이 정렬로서 불완전하다고 주장한다 — 고립 상태에서는 안전하지만 다른 에이전트(AI 든 인간이든) 사이에 배치되면 비협력적인 모델을 만들어낼 수 있다.
이것이 점점 중요해지는 이유:
- AI 에이전트가 멀티에이전트 환경에 배치되고 있다 (Claude Managed Agents, OpenAI Codex 멀티태스크, Grok 4.1 Fast Agent Tools API)
- AI 출력의 사회적·경제적 내생성이 커지고 있다 (AI 출력이 미래 AI 의 훈련 데이터에 영향을 준다)
- 단일 에이전트 정렬 접근으로는 다룰 수 없는 정렬 실패 부류를 짚어낸다
Open Questions
- 인간이 충분히 다양하다면 인간 피드백 기반 RLHF 가 균형 선택을 근사할 수 있는가? (저자들의 견해: 부분적으로는 가능하나 구조적으로 불충분)
- 균형을 선택하는 AI 의 실무적 훈련 체계는 무엇인가? (미해결 연구 문제 — DeepMind 멀티에이전트 랩이 다루기 좋은 위치에 있다)
- 이것이 현재 프런티어 모델에도 적용되는가, 아니면 "초지능"이 문턱인가? (논문은 SI 에 초점을 두지만 논증은 멀티에이전트 맥락의 유능한 에이전트 전반에 적용된다)
Cite
Trivedi, R.S., Jaques, N., Cross, L., Vezhnevets, A.S., Leibo, J.Z. (2026). Solipsistic Superintelligence is Unlikely to be Cooperative. arXiv:2606.03237.
Related
- AI Alignment — 정렬에 대한 이론적 기여. 단일 에이전트 접근을 보완한다
- Agentic Reinforcement Learning — 이 논문이 비판하는 RL 패러다임
- Agents (LLM Agents) — 멀티에이전트 배치 맥락
- Google DeepMind — DeepMind 멀티에이전트 그룹
- Positive Alignment: Artificial Intelligence for Human Flourishing — 상호 보완적. positive alignment 는 AI 가 무엇을 해야 하는지를 겨냥하고, 이 논문은 훈련 구조가 어떻게 협력을 훼손하는지를 겨냥한다