ai-trend-notifierEN
← wiki

$ cat wiki/papers/2026/2606.03237-solipsistic-si.md

Solipsistic Superintelligence is Unlikely to be Cooperative

TL;DR

현재의 RL/RLHF 훈련은 세계를 고정된 외생 환경으로 다룬다. 실제로 배치된 시스템은 이 가정을 깬다(멀티에이전트 동역학, 내생적 비정상성). 결과적으로 이런 방식으로 만든 초지능은 구조적으로 협력하기 어렵다 — 창발적 실패가 아니라 설계 결함이다. 해법은 보상을 더 잘 만드는 것이 아니라 균형 선택(equilibrium-selection)이다.

Authors & Org

  • Rakshit S Trivedi, Natasha Jaques, Logan Cross, Alexander Sasha Vezhnevets, Joel Z Leibo
  • Google DeepMind — 멀티에이전트 시스템 그룹
  • arXiv: 2606.03237 · 제출: 2026년 6월 4일

Method

게임이론과 멀티에이전트 RL 에 기반한 형식적 논증:

  1. 유아론적(solipsistic) 훈련 정의: 에이전트가 환경을 외생적이고 고정된 피드백 원천으로 다루는 것 (표준 RL/RLHF 패러다임)
  2. 자기 훼손 성질 제시: 그런 에이전트를 여럿 배치하면 내생적 비정상성이 생긴다 → 훈련-시험-배치 간극
  3. 일방적 최적화가 신뢰할 만한 협력을 못 하는 에이전트를 만든다고 논증한다(다른 에이전트의 목표나 전략을 모델링하지 않기 때문)
  4. 규범적 대안으로 균형 선택을 제안한다: 고정된 신호에 대해 최적화만 하는 것이 아니라 다자 협력 동역학에 참여하는 AI

Results

이론 논문이며 실험 벤치마크는 없다. 주요 형식적 결과:

  • 표준 멀티에이전트 형식론 아래에서 일방적 최적화는 안정적 협력과 양립할 수 없음을 보인다
  • "자기 훼손" 성질은 유아론적 훈련 패러다임의 필연적 귀결이지 우연이 아니다
  • 균형 선택은 훈련 시점에 에이전트 간 상호의존을 함께 모델링할 것을 요구한다

Significance

프런티어 모델 훈련에 대한 구조적 비판: RLHF, RLAIF, constitutional AI 는 모두 유아론적 패러다임 안에서 작동한다(인간 피드백을 고정 신호로 취급). 논문은 이것이 정렬로서 불완전하다고 주장한다 — 고립 상태에서는 안전하지만 다른 에이전트(AI 든 인간이든) 사이에 배치되면 비협력적인 모델을 만들어낼 수 있다.

이것이 점점 중요해지는 이유:

  • AI 에이전트가 멀티에이전트 환경에 배치되고 있다 (Claude Managed Agents, OpenAI Codex 멀티태스크, Grok 4.1 Fast Agent Tools API)
  • AI 출력의 사회적·경제적 내생성이 커지고 있다 (AI 출력이 미래 AI 의 훈련 데이터에 영향을 준다)
  • 단일 에이전트 정렬 접근으로는 다룰 수 없는 정렬 실패 부류를 짚어낸다

Open Questions

  1. 인간이 충분히 다양하다면 인간 피드백 기반 RLHF 가 균형 선택을 근사할 수 있는가? (저자들의 견해: 부분적으로는 가능하나 구조적으로 불충분)
  2. 균형을 선택하는 AI 의 실무적 훈련 체계는 무엇인가? (미해결 연구 문제 — DeepMind 멀티에이전트 랩이 다루기 좋은 위치에 있다)
  3. 이것이 현재 프런티어 모델에도 적용되는가, 아니면 "초지능"이 문턱인가? (논문은 SI 에 초점을 두지만 논증은 멀티에이전트 맥락의 유능한 에이전트 전반에 적용된다)

Cite

Trivedi, R.S., Jaques, N., Cross, L., Vezhnevets, A.S., Leibo, J.Z. (2026). Solipsistic Superintelligence is Unlikely to be Cooperative. arXiv:2606.03237.

Related

Referenced by

Sources