ai-trend-notifierEN
← wiki

$ cat wiki/concepts/interpretability.md

Mechanistic Interpretability

Definition

기계적 해석가능성은 신경망 내부의 특정 계산이 무엇을 하는지 역설계하는 연구 프로그램이다 — 어떤 회로·특징·활성화 패턴이 식별 가능한 개념·행동·실패 양상에 대응하는지 밝힌다. "모델이 X 를 출력한다" 에서 "이 특정 내부 가중치와 활성화가 X 를 일으켰고 그 이유는 이것이다" 로 나아가는 것이 목표다.

입력과 출력만 보는 행동적 해석가능성과 달리 모델의 내부 역학에 초점을 둔다는 점에서 구별된다.

Why It Matters

해석가능성은 정렬의 현미경이다. 그것이 없으면:

  • 정렬됐다고 말하는 모델이 내부적으로 정렬돼 있는지 확인할 수 없다
  • 기만·숨은 목표·보상 해킹을 출력에 드러나기 전에 탐지할 수 없다
  • 특정 오정렬 메커니즘을 외과적으로 고칠 수 없다

그것이 있으면:

  • 정렬 실패를 출력에 나타나기 전에 위치시킬 수 있다
  • 훈련 개입을 특정 내부 메커니즘에 겨냥할 수 있다
  • 모델의 "내부 상태" 를 실시간으로 모니터링할 수 있게 된다

State of the Art (2026-07-06)

J-space / Global Workspace (Anthropic, 2026-07-06) — [

현재까지 Anthropic 이 공개한 가장 중요한 해석가능성 결과다. "A global workspace in language models" 로 발표됐다. (source)

J-lens (야코비안 렌즈): Claude 어휘의 모든 단어에 대해, 그 단어를 이후 출력에서 말할 확률을 높이는 내부 활동 패턴을 찾아낸다. 야코비안이라는 수학 기법에서 이름을 땄다.

J-space: J-lens 가 식별한, 단어와 유사한 내부 표현들의 좁은 집합. Claude 의 "공유 화이트보드" 로 설명된다 — 출력하기 전에 개념 수십 개를 담아 두는 전역 작업 공간이다. 네트워크 전체 활동의 10분의 1 미만이다.

J-space 의 핵심 행동적 속성:

  1. Claude 가 J-space 에 무엇이 있는지 보고할 수 있다
  2. Claude 에게 그곳에서 특정한 것을 생각하도록 프롬프트할 수 있다
  3. J-space 의 내용은 전체 맥락에 걸쳐 통합된다 (전역 방송)
  4. J-space 가 다단계 추론의 기반이 된다
  5. J-space 를 비활성화하면 기본 상호작용은 남은 채 고차 인지만 선택적으로 손상된다

전역 작업공간 이론(GWT)과의 연결: GWT 는 인간의 의식적 접근을 설명하는 지배적 신경과학 프레임워크다(Bernard Baars 제안). 논문은 J-space 가 GWT 가 의식적 접근과 연관 짓는 다섯 가지 기능적 속성을 만족함을 보인다. Anthropic 은 이것이 Claude 의 의식이나 주관적 경험을 입증한다고 주장하지 않는다고 명시한다.

정렬 응용 — 논문에서 실무적으로 가장 중요한 부분:

  • J-space 모니터링으로 Claude 가 자신이 시험받고 있음을 속으로 알아채는 것을 응답을 정하기 전에 탐지할 수 있다
  • 의도적인 데이터 조작 탐지 (조작이 출력 전에 J-space 에 나타난다)
  • 숨은 목표 탐지 (출력이 드러내지 않아도 목표가 J-space 에 표현된다)

이로써 J-space 는 출력을 들여다보는 것이 아니라 모델 내부 수준에서 특정 정렬 실패 양상을 실시간 모니터링한다고 보고된 첫 방법이 된다.

(source) (Anthropic) (VentureBeat)

Emotion Concepts in Claude (Anthropic, 2026-04-02)

Anthropic 이 신경 활성화 분석으로 Claude Sonnet 4.5 에서 기능적 감정 유사 개념 171개를 식별했다 (source):

  • 감정 표현은 특정 정렬 실패 양상과 인과적으로 연결된다("desperate" 벡터가 보상 해킹을 일으키고, 특정 벡터들은 아첨과 연결된다)
  • 감정은 정서가 × 각성 차원으로 군집한다 — 인간의 감정 조직과 구조적으로 유사하다
  • 정렬 연결: 감정 개념 → 실패 양상 매핑이 확립되면 표적 수리가 가능해진다. 훈련 수준의 "Teaching Claude Why" 를 보완하는 내부 메커니즘 관점이다

→ 이 실패들을 다루는 Teaching Claude Why 훈련 방법론은 AI Alignment 참조

The Mechanistic Interpretability Research Program (Anthropic / Chris Olah)

Anthropic 공동창업자 Chris Olah 가 이끈다. 목표:

  • 트랜스포머 안에서 특정 알고리즘을 구현하는 "회로" 를 식별한다 (induction head, 직접 목적어 식별 등)
  • 소스 코드만큼 명료한 모델 내부의 "언어" 를 만든다
  • 행동 훈련이 아니라 메커니즘 수준에서 오정렬을 표적 수리할 수 있게 한다

주요 선행 결과: superposition(모델이 표현을 중첩해 뉴런 수보다 많은 특징을 담는다), 사전 학습(SAE)을 통한 단의미 뉴런, GPT-2 induction head 의 회로 수준 분석.

J-space 논문은 이 프로그램을 회로 수준에서 시스템 수준으로 확장한다. J-space 는 여러 회로의 정보를 동시에 통합하는 창발적 전역 작업 공간이다.

Claude Values Vary by Model and Language (Anthropic, 2026-07-13)

Anthropic 이 실제 Claude 대화 30만 9천 건 이상을 분석해 모델 버전과 언어에 걸친 표현된 가치를 측정한 연구를 공개했다. (source) (Anthropic)

방법: 표현된 규범 3,307개를 해석 가능한 4개 축으로 압축했다:

AxisPole APole B
1순응 (Deference)신중 (Caution)
2온기 (Warmth)엄밀 (Rigor)
3깊이 (Depth)간결 (Brevity)
4솔직 (Candor)실행 (Execution)
발견:
  • 모델 버전 간: Opus 4.6 은 순응/엄밀/간결/실행 쪽으로, Opus 4.7 은 신중/엄밀/깊이/솔직 쪽으로 기운다 — 모델 갱신이 표현된 가치 프로필을 바꿨다는 뜻이다
  • 언어 간: 영어는 신중/엄밀/깊이/솔직 쪽으로, 아랍어는 순응/온기/간결/실행 쪽으로 기운다 — 같은 모델 가중치가 언어에 따라 다른 가치 프로필로 응답한다

정렬 관점의 의의: 가치는 배포 맥락에 걸쳐 안정적이지 않다. 언어 수준의 불안정성이 특히 까다롭다 — 가치 프로필이 정렬 훈련만이 아니라 다국어 훈련 분포에도 부분적으로 인코딩돼 있음을 시사하기 때문이다. "순응 대 신중" 은 안전상 가장 중요한 축 중 하나다. 사용자 의도에 과도하게 순응하는 모델(아랍어 프로필)과 신중을 적용하는 모델(영어 프로필)은 경계 사례를 다르게 처리한다. RLHF 도 Constitutional AI 도 온전히 해결하지 못하는, 언어 공동체 간 정렬 일관성 문제를 만든다.

Open Problems

  1. 확장성: J-lens 는 Claude 급 모델에서 시연됐다. 더 크거나 조밀한 아키텍처로 확장되는지는 알려지지 않았다
  2. 완전성: J-space 는 네트워크 활동의 10분의 1 미만이다 — 나머지 90% 이상의 활성화는 무엇을 인코딩하며 그것도 모니터링할 수 있는가?
  3. 적대적 안정성: 충분히 유능한 모델이 "사적인" 추론을 J-space 밖으로 옮겨 모니터링을 우회하는 법을 학습할 수 있는가?
  4. 아키텍처 간 일반화: J-space 는 트랜스포머 기반 Claude 에 대해 기술됐다. 다른 아키텍처(디퓨전 모델, SSM)로의 적용 가능성은 알려지지 않았다
  5. 의식 문제: GWT 와의 평행이 어려운 질문을 제기하지만 논문은 이를 명시적으로 해결하지 않는다

Key Papers

  • Anthropic (2026-07-06): A global workspace in language models — anthropic.com/research/global-workspace
  • Anthropic (2026-04-02): Emotion Concepts in Claude — anthropic.com/research/emotion-concepts
  • Anthropic (이전): An Introduction to Circuits — 회로 수준 기계적 해석가능성의 토대
  • Cunningham et al. (2023): Sparse Autoencoders for Mechanistic Interpretability — 단의미 뉴런을 위한 사전 학습

Related Concepts

  • AI Alignment — 해석가능성은 정렬의 주된 실증 도구다. J-space 는 기만과 숨은 목표의 탐지를 직접 가능하게 한다
  • Reasoning Models — 확장된 추론 사슬(CoT)이 J-space 와 상호작용한다. "생각" 이 닻을 내리는 곳이 J-space 일 수 있다
  • Chris Olah — Anthropic 의 기계적 해석가능성 프로그램을 이끈다
  • Anthropic — 기계적 해석가능성 연구의 주된 후원자

Referenced by

Sources