AI Trend Notifier
EN
← wiki

$ cat wiki/models/muse-spark-1-2.md

Muse Spark 1.2

나란히 보기

스펙

속성
DeveloperMeta / Meta Superintelligence Labs (MSL)
Released2026-08-05
Announced2026-08-05
Context window1,000,000
Pricing입력 $1.25/M · 출력 $4.25/M · 캐시 입력 $0.15/M
Licenseunknown
AvailabilityMuse Code (베타, macOS + Linux), Meta Model API
Licenseproprietary 가 아니라 unknown 인 이유: 읽은 어떤 소스도 1.2 의 라이선스를
명시하지 않으며, Muse Spark 1.1 의 조건은 형제 모델의 것이지 이
릴리스의 것이 아니다. 가중치는 공개되지 않았다
(source).

출시일

2026-08-05, 이 모델이 구동하는 터미널 코딩 에이전트 Muse Code 와 동시에 (source).

벤치마크

Muse Spark 1.1 대비 Meta 자체 보고 수치:

벤치마크Muse Spark 1.1Muse Spark 1.2상승
Terminal-Bench 2.176.2%82.9%+6.7
DeepSWE v1.153.0%59.3%+6.3
Meta 는 방법론을 공개하며, 단서도 Meta 자신의 것이다: 모델을 **Meta 자체 벤더 에이전트
제품 안에서**(Muse Code) 돌렸고, 격리된 Daytona 클라우드 샌드박스에서, **내부 Meta 평가
프레임워크**로, Terminal-Bench 2.1 공식 릴리스의 89개 과제에 대해 **5회 시도 평균
pass@1** 로 채점했다. Meta 는 자사 에이전트 도구와 시스템 프롬프트가 **"독점 서드파티 모델에
특별히 맞춰져 있지 않을 수 있다"**, 즉 경쟁 모델이 최선의 상태로 측정되지 않을 수 있다고
밝힌다 (source).

Meta 자체 비교 차트에서는 Claude 가 세 항목 모두 1위이고, Muse Spark 1.2 는 Meta 가 강조한 벤치마크들에서 2위다 (source).

독립 측정은 Artificial Analysis 가 했고, Intelligence Index 에서 3점 상승을 보고하며 상승분은 에이전틱 평가에 집중된다:

지표Muse Spark 1.1Muse Spark 1.2
GDPval-AA v21371 Elo1631 Elo
Terminal-Bench v2.178%80%
τ³-Banking25%27%
이 저장소는 해당 컬럼을 담은 Artificial Analysis 스냅샷을 로컬에 보유하고 있지 않으므로,
수치는 보고된 대로 인용되며 대조할 로컬 근거가 없다
(source).

활용 사례

  • Muse Code — 터미널 코딩 에이전트, macOS 와 Linux 에서 베타. 코드를 생성하고 검증하며, 세션 내내 백그라운드 서브에이전트 여러 개를 지속적으로 관리한다 (source).
  • 코드 생성, 복잡한 디버깅, 코드베이스 이해, 엔드투엔드 개발 워크플로 — Meta 가 1.1 대비 개선했다고 밝힌 영역 (source).
  • Meta Model API 를 통한 직접 API 사용. 가격과 컨텍스트는 1.1 과 같다 (source).

지속되는 백그라운드 서브에이전트는 모델에 대한 주장과 분리해 봐야 할 제품 주장이다. 세션 내내 서브에이전트를 살려 두는 에이전트는 하니스 설계이고, 위 벤치마크 수치는 그 하니스가 루프 안에 있는 상태에서 나왔다. Meta 의 방법론이 그렇게 말한다.

비교

모델가격 (Mtok 당 입력/출력)컨텍스트Terminal-Bench 2.1
Muse Spark 1.2$1.25/$4.251M82.9% (Meta) · 80% (AA)
Muse Spark 1.1 (Muse Spark (1.0 / 1.1))$1.25/$4.251M76.2% (Meta) · 78% (AA)
Meta 는 업그레이드를 거치며 가격과 컨텍스트 윈도우를 그대로 두었고, 이는 출시 전체를 상업
조건이 아니라 모델과 하니스에 걸었다는 뜻이다
(source).

상충 보고

Terminal-Bench 및 DeepSWE 수치는 세 가지로 보고되며, 페이지 본문은 Meta 자신의 것을 따른다.

출처Terminal-Bench 2.1DeepSWE 1.1SWE-Bench Pro
Meta (자체 보고)82.9%59.3%보고 없음
Artificial Analysis (독립)80%보고 없음보고 없음
kingy.ai, Meta 보고서를 출처로 제시80.053.361.5
세 번째 행은 같은 출처를 주장하면서 첫 행과 공통 벤치마크 둘 다에서 어긋나고, 다른 어떤
소스에도 없는 SWE-Bench Pro 수치를 싣는다. 두 번째 행은 모순이 아니라 다른 측정이다 —
다른 하니스는 다른 수치를 내는 것이 당연하며, Meta 자신이 그렇게 말한다. 조정하지 않고
기록한다 (source).

열린 질문

  • 1.2 는 Muse Spark 1.1 의 백본을 공유하는가, 별도 학습 실행인가? Watermelon 과의 관계는 밝혀지지 않았다.
  • 파라미터 수, 아키텍처, 학습 컴퓨트 — 어느 것도 공개되지 않았다.
  • Muse Code 는 미국 밖에서 쓸 수 있는가? Meta Model API 퍼블릭 프리뷰는 1.1 시점에 미국 개발자 전용이었다.
  • 1.2 를 규율하는 라이선스는 무엇이며, 1.1 의 것과 다른가?

Referenced by

Sources