ai-trend-notifierEN
← wiki

$ cat wiki/people/chris-olah.md

Chris Olah

Latest

  • 2026-05-25

    교황 레오 14세의 초청으로 회칙 "Magnifica humanitas: 인공지능 시대의 인간 존엄 수호에 관하여" 의 바티칸 발표 자리에서 연설했다. 추기경·신학자들과 함께 발언했다. AI 거버넌스를 위한 교회와 기술 산업 간 기관 협력을 촉구했다. 업계의 …

Overview

Anthropic 공동창업자. 기계적 해석가능성(mechanistic interpretability) 의 개척자로, 회로와 특징을 들여다봄으로써 신경망이 무엇을 계산하는지 역설계하는 연구 프로그램을 이끈다. AI 안전·해석가능성 분야에서 가장 많이 인용되는 연구자 중 한 명이다.

소속: Anthropic (공동창업자, 연구자); 이전 Google Brain / OpenAI.

Why Significant

  • 기계적 해석가능성의 핵심 어휘를 만들거나 함께 발전시켰다: superposition, features as directions, circuits, polysemanticity
  • 2020년 공동 저자들과 낸 "Circuits" 연재가 해석가능성을 엄밀한 하위 분야로 출범시켰다
  • 정렬 연구에 깊이 집중하는 Anthropic 공동창업자로서, 랩 내부의 안전 우선 문화를 대표한다
  • 2026년 5월, 프런티어 랩이 옳은 일을 하는 것과 충돌할 수 있는 인센티브 안에서 움직인다고 공개적으로 인정했다 — 랩 내부자로서는 드문 솔직함이다

Key Contributions

  • Circuits 연재 (2020–2024): 비전 모델의 어텐션 헤드, 곡선 검출기, 멀티모달 뉴런을 역설계했다. 해석가능성의 토대가 된 작업이다.
  • Superposition Hypothesis: 모델이 뉴런 수보다 많은 특징을 압축된 중첩 표현으로 담아낸다는 것을 보였다.
  • Features as linear directions: 개념이 모델 가중치에 인코딩되는 기하 구조.
  • Anthropic 해석가능성 팀: Claude 모델에서 대규모 기계적 해석가능성 연구를 수행하는 팀을 만들고 이끈다.

Recent Activity

  • 2026-05-25: 교황 레오 14세의 초청으로 회칙 "Magnifica humanitas: 인공지능 시대의 인간 존엄 수호에 관하여" 의 바티칸 발표 자리에서 연설했다. 추기경·신학자들과 함께 발언했다. AI 거버넌스를 위한 교회와 기술 산업 간 기관 협력을 촉구했다. 업계의 인센티브 충돌을 공개적으로 인정했다. (source)

Affiliations

  • Anthropic — 공동창업자, 해석가능성 연구
  • 이전: Google Brain, OpenAI (초기)

Related

External Links

Referenced by

Sources