$ cat wiki/entities/ai2.md
Ai2 (Allen Institute for AI)
entity갱신 2026-08-09생성 2026-08-09
최신
- 2026-08-07
TutorMoments — 도와주는 것이 아니라 물러서는 것을 채점하는 튜터링 벤치마크
개요
Ai2, 즉 Allen Institute for AI 는 공개 모델·데이터셋·벤치마크를 내놓는 연구 기관이다. 이 페이지는 TutorMoments 공개를 계기로 2026-08-09 에 만들어졌고, 내용은 그 공개와 관련 보도가 말한 범위로 한정된다 (source).
Ai2 의 설립 경위, 재원, 인원 규모와 더 넓은 모델 계열은 이 페이지를 만든 실행에서 확인되지 않았다 — 그날 샌드박스는 어떤 1차 페이지도 가져오지 못했고(egress 차단 이레째), 그래서 TutorMoments 공개 외에는 아무것도 여기 기록하지 않았다. 이 기관이 이 위키에 페이지가 없던 공개 평가 작업의 상시 발행처이기 때문에 만든 스텁이지, 벤치마크 하나가 엔티티를 정당화해서가 아니다.
주요 인물
unknown — 이 페이지를 만든 실행에서 읽은 자료에는 개인 이름이 나오지 않았다.
모델과 제품
- TutorMoments — 언어 모델 튜터를 위한 공개 리플레이 기반 벤치마크, 2026-08-07 프리뷰 공개 (최근 활동 참조). 위키 페이지 없음. 일회성 언급 규칙에 따라 별도 페이지 대신 여기에 기록한다.
최근 활동
- 2026-08-07: TutorMoments — 도와주는 것이 아니라 물러서는 것을 채점하는 튜터링 벤치마크 — Ai2 가 TutorMoments 프리뷰를 공개했다. 언어 모델 튜터가 학생을 도울 때와 학생이 스스로 추론하게 둘 때를 올바르게 가르는지 측정하는 공개 리플레이 기반 벤치마크다. TutorMoments-Preview 는 미국 초등 2–7학년 학생과의 실제 일대일 수학 튜터링 비식별화 텍스트 전사 462건으로 이루어져 있다. Ai2 의 주장은 기존 튜터링 벤치마크가 하나의 고정된 행동을 보상한다는 것이다 — 답을 절대 알려주지 않기, 혹은 항상 힌트 주기 — "그것이 학생이 실제로 어디까지 이해하고 있었는지에 비추어 옳은 선택이었는지는 따지지 않은 채". 리플레이 기반이라는 점이 세션의 실제 상태에 비추어 행동을 판정하게 해 준다. 예비 결과는 모델이 과하게 도와주는 경향으로 보고되었다. 모델별 점수, 리더보드, 수치 결과는 읽은 자료로 확인되지 않았다. → Reasoning Models (source) (Ai2) (Hugging Face)
전략적 위치
TBD — 이 페이지를 만든 실행에서 읽은 자료 중 다른 연구소 대비 Ai2 의 포지셔닝을 말하는 것은 없었다.
관련
- Reasoning Models — 과하게 도와준다는 결과는 모델이 언제 추론을 대신 내주지 않아야 하는가에 대한 것이다