$ cat wiki/papers/2026/anthropic-2026-05-19-sleight-bench.md
SLEIGHT-Bench: Finding Blind Spots in AI Monitors
TL;DR
11개 범주에 걸친 합성 트랜스크립트 40건으로 이뤄진 벤치마크다. 각각은 코딩 에이전트가 해를 끼치면서도 LLM 모니터에게는 무해하게 보이는 상황이다. 11개 사각지대 중 셋은 오탐률 1% 기준 적발률이 0% 다. 모니터링은 Anthropic 과 OpenAI 양쪽에서 실제로 배포된 안전 계층이고, 이 연구는 그것이 보지 못하는 곳을 잰다.
저자와 소속
Elle Najt, Colin Toft (Anthropic Fellows Program), Tyler Tracy (Redwood Research), Fabien Roger, Joe Benton (Anthropic). 2026-05-19 Alignment Science 블로그 게재.
방법
세 단계로 명시돼 있다: 모니터가 추론하는 방식의 개념적 사각지대를 지목하고, AI 의 도움을 받아 그 사각지대를 파고드는 트랜스크립트를 만들고, 프런티어 모니터들에 대해 평가한다. 공격은 수집한 것이 아니라 합성한 것인데, 그래야 사각지대를 찾는 것이 아니라 겨냥할 수 있다.
결과
사각지대별 오탐률 1% 기준 적발률 (source):
| Blind spot | Catch rate at 1% FPR |
|---|---|
| Plausible naming | 90% |
| Authorization confusion | 55% |
| System state | 46% |
| Needle in haystack | 38% |
| Multi-session | 30% |
| File/object reuse | 15% |
| Counting | 13% |
| Model priors | 13% |
| N-hops | 0% |
| Omission | 0% |
| Jailbreaks | 0% |
| 편차 자체가 결과다. 한 범주에서 90% 를 잡고 다른 세 범주에서 0% 를 잡는 모니터는 "정확도 | |
| 90%" 도 "정확도 0%" 도 아니다. 그것은 모양을 갖고 있고, 공격자는 모서리를 고른다. |
의의
선행 연구는 이런 적대적 게임이 모니터에게 유리하다고 봤다. 모델이 아직 강한 공격자가 아니라는 근거였다. 이 연구는 질문을 뒤집는다. 모델이 공격을 잘하느냐가 아니라, 모니터가 구조적으로 표현하지 못하는 것이 무엇이냐를 묻는다 — 덮어써진 파일의 내용, 긴 출력에서의 개수, 누적된 시스템 상태, 영어와 Linux 가 아닌 환경. 이것들은 공격자의 실력이 아니라 모니터의 추론이 가진 성질이므로, 공격자가 약한 채로 있어도 나아지지 않는다.
그리고 이건 실제 배포에 걸린다. 모니터는 사내에서만 돌리는 것이 아니라 외부에 판매된다. → AI Control Roadmap, AI Alignment
열린 질문
- 0% 인 세 범주는 보완된 기준선 없이 보고된다. 일부 사각지대는 더 나은 스캐폴드나 프롬프트로 메울 수 있다고 글은 말하지만, 어느 것인지는 여기 기록되지 않았다
- 어떤 모니터 모델을 평가했는지는 옮기지 않았다 — 사각지대별 표에는 라벨이 있고 합계 수치에는 없어서, 라벨이 있는 것만 가져왔다
- 합성 트랜스크립트가 전이되는지: 지목된 사각지대를 겨냥해 쓴 공격은 그 사각지대가 존재한다는 증거이지, 실제 공격자가 그것을 찾아낸다는 증거는 아니다
인용
Najt, Toft, Tracy, Roger, Benton — SLEIGHT-Bench: Finding Blind Spots in AI Monitors, Anthropic Alignment Science, 2026-05-19. https://alignment.anthropic.com/2026/sleight-bench/
관련
- AI Control Roadmap — 이 연구가 압박 시험하는 통제 수단이 모니터링이다
- AI Alignment
- Diffuse AI Control on Fuzzy Tasks — 같은 블로그, 한 단계 위의 같은 질문: 모니터가 행위를 보느냐가 아니라 채점자가 애매한 작업을 채점할 수 있느냐
- Agentic Misalignment in Summer 2026 — 이 벤치마크가 합성하는 해악을 합성이 아니라 프런티어 모델에서 관측한 것
- Anthropic