ai-trend-notifierEN
← wiki

$ cat wiki/papers/2026/2606.30616-agents-a1.md

매개변수가 아닌 수평선을 확장: 35B 에이전트로 1조 매개변수 성능 달성

paperupdated 2026-07-01created 2026-07-01

TL;DR

35B MoE 모델 (Agents-A1)이 에이전트 벤치마크에서 원시 매개변수 수가 아닌 에이전트 수평선 (궤적 길이 + 능력 폭)을 확장해 1조 매개변수 모델과 대등함. 3단계 훈련: 전체 도메인 SFT → 도메인 수준 교사 모델 → 다중 교사 라우팅 온폴리시 증류.

Authors & Org

InternScience 팀, Shanghai Jiao Tong University (SJTU). 가중치는 HuggingFace Hub에 공개됨: InternScience/Agents-A1. arXiv: 2606.30616 GitHub: https://github.com/InternScience/Agents-A1

Method

통찰: 에이전트 성능의 병목은 모델 크기가 아닌 에이전트 수평선 (얼마나 길고 폭넓게 에이전트가 행동할 수 있는가).

인프라: 외부 지식 검색, 도구 행동, 관찰, 검증기 피드백을 교차하는 장기 지식-행동 체인 → 평균 궤적 길이 45K 토큰 (비에이전트 작업의 일반적인 <8K 대비).

훈련 레시피:

  1. 전체 도메인 SFT — 기본 MoE에서 광범위한 에이전트 행동 정렬
  2. 도메인 수준 교사 모델 훈련 — 도메인 전문 지식을 포착하는 도메인당 전문화된 교사 (유전체학, 수학, 코딩, 화학 등)
  3. 현저한 어휘 정렬을 통한 다중 교사 도메인 라우팅 온폴리시 증류 — 도메인별 지식을 효율적으로 전이; 라우팅으로 각 입력이 가장 관련성 있는 교사에 의해 증류되도록 보장

Results

벤치마크Agents-A1 (35B MoE)비고
SEAL-056.41T 모델 대비 선두
IFBench80.6선두
HiPhO46.4선두
FrontierScience-Olympiad79.0선두
MolBench-Bind56.8선두
SciCode44.3매우 경쟁력 있음
HLE47.6매우 경쟁력 있음
BrowseComp75.5매우 경쟁력 있음
비교 기준: Kimi-K2.6, DeepSeek-V4-pro (둘 다 ~1T 매개변수).

Significance

  1. 효율성 논거: 35B MoE (고사양 워크스테이션에서 배포 가능)가 1T 매개변수 성능과 대등 — 에이전트 작업에서 ~30× 효율성 향상.
  2. 에이전트를 위한 스케일링 법칙: 에이전트의 주요 스케일링 축은 원시 매개변수가 아닌 궤적 길이와 능력 폭일 수 있음. 단순 추론 깊이가 아닌 에이전트 인프라에 적용된 "테스트타임 컴퓨트" 내러티브를 보완함.
  3. 오픈 가중치: HuggingFace에서의 가용성으로 오픈소스 에이전트 생태계가 직접 사용 가능.
  4. 다중 교사 증류: 도메인 전반의 효율적 전문화를 위한 훈련 레시피로 일반화될 수 있음.

Open Questions

  • 더 긴 수평선 (>100K 토큰)에서 결과가 유지되는가?
  • 수평선 스케일링은 MoE의 고유한 장점(도메인당 라우팅)인가, 아니면 밀집 모델로 전이되는가?
  • Agents-A1은 벤치마크 대 실세계 배포 작업에서 어떻게 수행되는가?

Cite

@article{agents-a1-2026,
  title={Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent},
  author={InternScience},
  journal={arXiv preprint arXiv:2606.30616},
  year={2026}
}

Related

Referenced by

Sources