ai-trend-notifierEN
← wiki

$ cat wiki/papers/2026/2607.08964-long-horizon-terminal-bench.md

Long-Horizon-Terminal-Bench (LHTB)

TL;DR

밀집 보상 채점 방식의 46개 작업으로 구성된 컨테이너화된 터미널 벤치마크. 현재 최고 모델이 pass@1에서 15.2%만 달성 — 작업당 평균 9.9M 토큰을 소비하면서도 LLM 에이전트의 심각한 장기 기능 격차를 드러냄.

Authors & Org

  • GitHub: zli12321 (주요 저자)
  • 소속: 공개 출처에서 아직 확인되지 않음 (학계)
  • 게시: 2026년 7월 9일 (arXiv: 2607.08964)
  • HuggingFace Daily: 2026년 7월 14일 (#1 논문, 25 stars)

Method

벤치마크 설계: 상태 유지 컨테이너화된 터미널 환경에서의 46개 작업. 에이전트가 하나의 결과물을 작성하고 멈추는 단기 벤치마크와 달리, LHTB는 에이전트를 지속적이고 상태 유지 환경에 투입하고 수백 단계에 걸쳐 유용한 작업을 지속하도록 요구함.

채점: 숨겨진, 결과물-재구성 검증기로 밀집 보상 기반 점수 매기기. 자체 보고된 진행 상황은 계산되지 않음 — 검증기가 결과물을 처음부터 독립적으로 재구성. 두 가지 임계값:

  • 0.95 (부분 크레딧 — 대부분의 크레딧 부여)
  • 1.0 (완벽)

작업 범주:

  • 인터랙티브 게임 & 퍼즐
  • 멀티모달 분석
  • 소프트웨어 / 역공학
  • 과학 컴퓨팅
  • 지구 & 에너지 시스템
  • 보안 & 성능
  • 연구 재현
  • 전문적인 APEX 스타일 워크플로우

Results

지표
최고 모델 pass@1 (0.95 임계값)15.2%
최고 모델 pass@1 (1.0 임계값)10.9%
전체 모델 평균 (0.95)4.3%
전체 모델 평균 (1.0)1.7%
작업당 평균 토큰 수9.9 백만
평균 에피소드 수231
작업당 평균 실행 시간85.3분

Significance

  • 터미널 에이전트에 대해 "함수를 작성할 수 있는가"와 "실제 여러 시간 작업을 완료할 수 있는가" 사이의 측정 공백을 메움
  • 9.9M 토큰 평균은 에이전트가 매우 드물게 성공하면서 많은 텍스트를 생성한다는 의미 — 규모 단독으로는 장기 일관성 문제를 해결하지 못함
  • 밀집 보상(이진 pass/fail 대비)은 에이전트가 실제 진행 없이 부분 크레딧을 악용하는 것을 방지
  • 현재 에이전트와 프로덕션 수준 에이전트 시스템 사이의 거리를 이해하는 데 직접 관련됨
  • 15% 상한선은 Agentic Reinforcement Learning 및 계층적 계획에 대한 지속적인 연구를 강하게 동기화함

Open Questions

  • 100+ 단계 지평선에서 무엇이 실패하는가? (계획 일관성, 컨텍스트 소진, 오류 복구, 목표 표류?)
  • 실패 중 얼마나가 컨텍스트 길이 대 추론 능력 대 도구 사용 신뢰성에서 비롯되는가?
  • 기존 에이전트 RL 훈련 방법(Self-Distilled Agentic RL, ASPIRE 등)이 LHTB 상한선을 변경하는가?

Cite

arXiv:2607.08964. "Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading." 2026년 7월. https://arxiv.org/abs/2607.08964

Related

Referenced by

Sources