$ cat wiki/concepts/eval-harness-configuration.md
평가 하네스 설정
정의
하네스는 벤치마크 실행 중 모델을 둘러싼 스캐폴딩이다. 단계 사이에 컨텍스트를 어떻게 이어 가는지, 추론 흔적이 턴 경계를 넘어 살아남는지, 도구를 어떻게 노출하는지, 시도를 몇 번까지 허용하는지, 결과를 어떻게 파싱하는지. 이는 모델의 일부도 아니고 벤치마크 과제 집합의 일부도 아니지만, 에이전틱 벤치마크에서는 두 모델 세대 사이의 격차보다 더 크게 보고 점수를 움직일 수 있다.
따라서 벤치마크 수치는 언제나 (모델, 하네스) 쌍에 대한 주장이지, 모델 하나에 대한 주장이 아니다.
왜 중요한가
다단계 에이전틱 과제에서 하네스는 모델이 무엇을 기억하는지를 결정한다. 매 행동 뒤에 생각의 사슬을 버리면 모델은 턴마다 상태를 다시 쌓아야 하고, 그것을 보존하면 같은 가중치가 다른 시스템처럼 행동한다.
2026-07-29 의 ARC-AGI-3 사례가 그 깔끔한 실증이다 (source):
| Configuration | GPT-5.6 Sol |
|---|---|
| ARC Prize 공식 하네스 (ARC Prize 검증) | 7.8% |
| 공식 하네스, OpenAI 가 자체 재실행해 보고한 값 | 13.3% |
| Responses API + retained reasoning + compaction | 38.3% |
| 같은 모델, 같은 과제 집합, 하네스 설정만으로 4.9× 편차. 비교하자면 2026-07-27 에 | |
| Claude Opus 5 가 세운 검증된 SOTA 는 30.2% 였고, 인간 테스터 평균은 48% 다. |
- Retained reasoning 은 단계 사이에 생각의 사슬을 보존한다.
- Compaction 은 이전 컨텍스트를 잘라내는 대신 요약한다.
둘 다 ARC-AGI-3 을 위해 만들어진 것이 아니며, 모든 API 사용자가 쓸 수 있는 일반 Responses API 설정이다. OpenAI 는 이 설정이 출력 토큰도 6× 줄였다고 보고한다.
비교 가능성 문제
두 가지가 동시에 참이고, 그 사이의 긴장이 이 주제의 전부다:
- 벤치마크용으로 만들어지지 않고 모든 사용자가 쓸 수 있는 설정은 모델을 돌리는 정당한 방법이다. ARC Prize 가 밝힌 입장은 그런 설정이 제대로 보고된다면 문제없다는 것이고, 공동창업자 François Chollet 도 여기에 동의한 것으로 전해진다 (source).
- 공식 리더보드 점수는 서로 다른 랩의 수치가 동등한 조건으로 남도록, 공급자별 설정 없이 하나의 표준화된 하네스를 쓴다.
그래서 OpenAI 의 38.3% 와 Anthropic 의 30.2% 는 비교할 수 없다. Claude Opus 5 가 상태 보존에 해당하는 설정으로 측정되었는지를 밝힌 자료는 없으며, 그것 없이는 더 높은 수치가 더 나은 모델의 증거가 되지 않는다 (source).
열린 문제
- 하네스 설정을 보고하는 관행이 없다. 점수는 스칼라로 발표되고, 그것을 만들어 낸 설정은 대개 발표되지 않는다.
- 공급자별 설정에는 중립적 대응물이 없다. Retained reasoning 은 Responses API 기능이다. 경쟁 모델에 같은 상태 보존을 부여할 공급자 독립적 방법이 없으므로 "각자 최선의 설정으로 돌린다" 와 "모두 같은 방식으로 돌린다" 는 둘 다 옹호 가능하면서 서로 다른 순위를 낳는다.
- 과제 길이가 길수록 격차가 커진다. 하네스 효과는 단일 턴 벤치마크에서는 작고 장기 에이전틱 벤치마크에서는 크다 — 그리고 그것이 지금 평가가 움직이는 방향이다.
- 자체 보고된 실행은 기본적으로 검증되지 않는다. ARC Prize 검증은 별도 단계이며, 발표되는 에이전틱 수치 대부분은 그 과정을 거치지 않는다.
이 위키에서의 실무적 귀결
모델 페이지의 벤치마크 행은 알려진 경우 그 수치를 만들어 낸 하네스나 출처와 함께 기록하고,
다툼이 있는 수치는 조용히 조정되는 대신 ## Conflicting Reports 로 간다. GPT-5.6 Sol 의 "공식
하네스" 수치 두 개 — ARC Prize 가 검증한 7.8% 와 OpenAI 가 재실행한 13.3% — 는 읽은 자료 중
어느 것도 둘을 화해시키지 못하므로 서로 어긋나는 상태로 기록된다.
이 저장소가 스크랩하는 리더보드 스냅샷에도 같은 규율이 적용된다. LMArena 는 Elo 가 아니라 신뢰 구간을 동반한 백분율로 인용하고, Artificial Analysis 수치는 그 위의 열 제목과 함께 인용한다 (source).
주요 소스
- OpenAI, "How enabling two settings tripled our scores on the ARC-AGI-3 benchmark" (2026-07-29) (source)
- ARC Prize results — Claude Opus 5
- ARC Prize, analyzing GPT-5.5 & Opus 4.7 with ARC-AGI-3
- LMArena 스냅샷 (source)
- Artificial Analysis 스냅샷 (source)