$ cat wiki/papers/2026/2606.30616-agents-a1.md
매개변수가 아닌 수평선을 확장: 35B 에이전트로 1조 매개변수 성능 달성
paperupdated 2026-07-01created 2026-07-01
TL;DR
35B MoE 모델 (Agents-A1)이 에이전트 벤치마크에서 원시 매개변수 수가 아닌 에이전트 수평선 (궤적 길이 + 능력 폭)을 확장해 1조 매개변수 모델과 대등함. 3단계 훈련: 전체 도메인 SFT → 도메인 수준 교사 모델 → 다중 교사 라우팅 온폴리시 증류.
Authors & Org
InternScience 팀, Shanghai Jiao Tong University (SJTU).
가중치는 HuggingFace Hub에 공개됨: InternScience/Agents-A1.
arXiv: 2606.30616
GitHub: https://github.com/InternScience/Agents-A1
Method
통찰: 에이전트 성능의 병목은 모델 크기가 아닌 에이전트 수평선 (얼마나 길고 폭넓게 에이전트가 행동할 수 있는가).
인프라: 외부 지식 검색, 도구 행동, 관찰, 검증기 피드백을 교차하는 장기 지식-행동 체인 → 평균 궤적 길이 45K 토큰 (비에이전트 작업의 일반적인 <8K 대비).
훈련 레시피:
- 전체 도메인 SFT — 기본 MoE에서 광범위한 에이전트 행동 정렬
- 도메인 수준 교사 모델 훈련 — 도메인 전문 지식을 포착하는 도메인당 전문화된 교사 (유전체학, 수학, 코딩, 화학 등)
- 현저한 어휘 정렬을 통한 다중 교사 도메인 라우팅 온폴리시 증류 — 도메인별 지식을 효율적으로 전이; 라우팅으로 각 입력이 가장 관련성 있는 교사에 의해 증류되도록 보장
Results
| 벤치마크 | Agents-A1 (35B MoE) | 비고 |
|---|---|---|
| SEAL-0 | 56.4 | 1T 모델 대비 선두 |
| IFBench | 80.6 | 선두 |
| HiPhO | 46.4 | 선두 |
| FrontierScience-Olympiad | 79.0 | 선두 |
| MolBench-Bind | 56.8 | 선두 |
| SciCode | 44.3 | 매우 경쟁력 있음 |
| HLE | 47.6 | 매우 경쟁력 있음 |
| BrowseComp | 75.5 | 매우 경쟁력 있음 |
| 비교 기준: Kimi-K2.6, DeepSeek-V4-pro (둘 다 ~1T 매개변수). |
Significance
- 효율성 논거: 35B MoE (고사양 워크스테이션에서 배포 가능)가 1T 매개변수 성능과 대등 — 에이전트 작업에서 ~30× 효율성 향상.
- 에이전트를 위한 스케일링 법칙: 에이전트의 주요 스케일링 축은 원시 매개변수가 아닌 궤적 길이와 능력 폭일 수 있음. 단순 추론 깊이가 아닌 에이전트 인프라에 적용된 "테스트타임 컴퓨트" 내러티브를 보완함.
- 오픈 가중치: HuggingFace에서의 가용성으로 오픈소스 에이전트 생태계가 직접 사용 가능.
- 다중 교사 증류: 도메인 전반의 효율적 전문화를 위한 훈련 레시피로 일반화될 수 있음.
Open Questions
- 더 긴 수평선 (>100K 토큰)에서 결과가 유지되는가?
- 수평선 스케일링은 MoE의 고유한 장점(도메인당 라우팅)인가, 아니면 밀집 모델로 전이되는가?
- Agents-A1은 벤치마크 대 실세계 배포 작업에서 어떻게 수행되는가?
Cite
@article{agents-a1-2026,
title={Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent},
author={InternScience},
journal={arXiv preprint arXiv:2606.30616},
year={2026}
}
Related
- Agents (LLM Agents) — 에이전트 시스템 일반
- Google ADK (Agent Development Kit) — 장기 에이전트 궤적을 위한 도구
- Agentic Reinforcement Learning — 에이전트 훈련의 RL 측면
- Test-Time Compute (Inference-Time Compute Scaling) — 관련 스케일링 패러다임 (추론 깊이 vs. 수평선 폭)