$ cat wiki/concepts/gram.md
GRAM — Gradient-Routed Auxiliary Modules
Definition
GRAM (Gradient-Routed Auxiliary Modules)은 이중 사용 지식을 신경망 내의 물리적으로 제거 가능한 구획으로 격리하는 Anthropic이 개발한 모듈식 사전 훈련 아키텍처. 사전 훈련 중, 그래디언트 라우팅이 이중 사용 지식 (사이버보안, 바이러스학, 핵물리학)을 지정된 보조 모듈 그룹으로 우선적으로 흐르게 함. 배포 시에는 전체 모델 성능에 영향을 주지 않고 모듈 그룹을 체크포인트에서 물리적으로 제거하거나 추론 시 선택적으로 비활성화할 수 있음.
Why It Matters
GRAM은 단일 모델 체크포인트의 접근 제어 배포를 위해 발표된 최초의 기법. GRAM 이전에는 다른 신뢰 티어에 다양한 기능 프로파일을 배포하려는 랩이 두 가지 나쁜 옵션만 가졌음: (a) 필터링된 데이터셋으로 완전히 별도의 모델을 훈련 (비용 높음, 컴퓨팅 비용 2배), 또는 (b) 사후 기능 도출 제한 적용 (취약함; 기능은 종종 프롬프팅으로 도출 가능).
GRAM은 "양심 회로" 아키텍처를 가능하게 함:
- 단일 훈련 실행이 여러 배포 구성 생성
- 제한된 구성은 정책으로만 억제된 것이 아닌 구조적으로 불가능
- 이중 사용 모듈 제거는 프롬프팅, 배포 체크포인트의 파인튜닝, 또는 시스템 프롬프트 주입으로 되돌릴 수 없음
이는 직접적인 정렬 의미를 가짐: 위험한 행동의 구조적 불가능성은 행동 억제보다 더 강한 보장.
State of the Art (2026-07-21)
Anthropic: GRAM (July 8, 2026) [
2026년 7월 8일 Anthropic Alignment Science Blog에 발표됨. (source)
기술적 방법:
- 모든 Transformer 레이어에 추가 뉴런 추가, 그룹("모듈")으로 나뉨 — 이중 사용 카테고리당 하나
- 사전 훈련 중 그래디언트 라우팅: 이중 사용 지식이 지정된 모듈로 우선적으로 흐름
- 배포 시: 모듈 그룹이 체크포인트에서 물리적 제거 (제한 티어) 또는 유지 (신뢰 연구자 티어)
테스트 결과 (5B 파라미터 모델):
- 사이버보안, 바이러스학, 핵물리학 모듈 제거 시 해당 기능만 비활성화
- 교차 작업 벤치마크: 유의미하게 영향받지 않음 (전체 성능 유지)
- 테스트된 이중 사용 카테고리: 사이버보안 익스플로잇, 바이러스학 기능 강화, 핵물리학
배포 모델:
- 전체 모델 (모든 모듈 켜짐): 신뢰 연구자, 통제 환경
- 제한 배포 (이중 사용 모듈 제거됨): 공개 API 접근
- 동일한 훈련 실행이 두 구성 모두 생성 — 단일 체크포인트가 배포 시 분기
정렬에 있어 중요한 이유: GRAM은 행동 제어 (RLHF, Constitutional AI, 거부 분류기)가 아닌 구조적 제어. 제한된 체크포인트는 단순히 억제된 지식 도메인 사용을 꺼리는 것이 아니라 문자 그대로 불가능함. 이 차이는 모델 기능이 증가할수록 중요: 충분히 능력 있는 모델에서 행동 억제는 여전히 억제된 지식을 표면화하는 방법을 찾을 수 있음; 모듈이 제거된 모델은 불가능.
기존 정렬 스택과의 연결:
- 기능 게이팅 (Fable 5 안전 분류기, Mythos 5 Glasswing 전용 접근) 보완: 추론 시 행동 게이팅 vs. 체크포인트 수준의 구조적 게이팅
- Project Glasswing (신뢰 파트너 이중 사용 접근) 보완: GRAM은 "동일 가중치, 다른 기능"의 기술적 메커니즘 제공 — 전체 모듈 버전은 Glasswing으로, 제한 버전은 공개 API로
- J-space 해석가능성 (2026년 7월) 보완: J-space는 추론 시 정렬 실패를 감지; GRAM은 가중치 수준에서 구조적 용량을 예방
Open Problems
- 규모 검증: 결과는 5B 파라미터 모델에서만 발표됨. 그래디언트 라우팅이 400B+ (MoE)에서도 깔끔하게 유지될까? MoE에서는 라우팅 자체가 복잡할 수 있음.
- 모듈 경계 누출: 모듈이 부분적으로 제거된 기능을 유지하는 교차 모듈 의존성을 개발하는가?
- 기능-충실도 트레이드오프: 지식을 구획으로 분리하는 것에서 전체 모듈 모델의 기능 손실은 얼마나 발생하는가?
- 알 수 없는 미지수: 규모에서 나타나지만 모듈 설계 단계에서 예상하지 못한 이중 사용 기능 도메인이 있는가? GRAM은 훈련 전에 위험 카테고리를 열거할 수 있다고 가정함.
Key Papers
- Anthropic (2026-07-08): "Modular Pretraining Enables Access Control" — alignment.anthropic.com/2026/modular-pretraining/ / ae.studio PDF
- 동반 포스트: anthropic.com/research/off-switch-dual-use
Related Concepts
- AI Alignment — GRAM은 행동 정렬 방법을 보완하는 구조적 기능 제어
- AI-Enabled Cyberattacks — 사이버보안 익스플로잇은 GRAM 설계를 이끄는 주요 이중 사용 카테고리
- Mechanistic Interpretability — J-space는 추론 시 정렬 실패를 감지; GRAM은 가중치에서 구조적 용량을 예방
- Claude Mythos Preview — Project Glasswing은 신뢰 계층화된 배포 모델을 사용; GRAM은 그 아키텍처의 기술적 메커니즘을 제공