$ cat wiki/models/muse-spark-1-2.md
Muse Spark 1.2
model갱신 2026-08-07생성 2026-08-07
나란히 보기
스펙
| 속성 | 값 |
|---|---|
| Developer | Meta / Meta Superintelligence Labs (MSL) |
| Released | 2026-08-05 |
| Announced | 2026-08-05 |
| Context window | 1,000,000 |
| Pricing | 입력 $1.25/M · 출력 $4.25/M · 캐시 입력 $0.15/M |
| License | unknown |
| Availability | Muse Code (베타, macOS + Linux), Meta Model API |
License 가 proprietary 가 아니라 unknown 인 이유: 읽은 어떤 소스도 1.2 의 라이선스를 | |
| 명시하지 않으며, Muse Spark 1.1 의 조건은 형제 모델의 것이지 이 | |
| 릴리스의 것이 아니다. 가중치는 공개되지 않았다 | |
| (source). |
출시일
2026-08-05, 이 모델이 구동하는 터미널 코딩 에이전트 Muse Code 와 동시에 (source).
벤치마크
Muse Spark 1.1 대비 Meta 자체 보고 수치:
| 벤치마크 | Muse Spark 1.1 | Muse Spark 1.2 | 상승 |
|---|---|---|---|
| Terminal-Bench 2.1 | 76.2% | 82.9% | +6.7 |
| DeepSWE v1.1 | 53.0% | 59.3% | +6.3 |
| Meta 는 방법론을 공개하며, 단서도 Meta 자신의 것이다: 모델을 **Meta 자체 벤더 에이전트 | |||
| 제품 안에서**(Muse Code) 돌렸고, 격리된 Daytona 클라우드 샌드박스에서, **내부 Meta 평가 | |||
| 프레임워크**로, Terminal-Bench 2.1 공식 릴리스의 89개 과제에 대해 **5회 시도 평균 | |||
| pass@1** 로 채점했다. Meta 는 자사 에이전트 도구와 시스템 프롬프트가 **"독점 서드파티 모델에 | |||
| 특별히 맞춰져 있지 않을 수 있다"**, 즉 경쟁 모델이 최선의 상태로 측정되지 않을 수 있다고 | |||
| 밝힌다 (source). |
Meta 자체 비교 차트에서는 Claude 가 세 항목 모두 1위이고, Muse Spark 1.2 는 Meta 가 강조한 벤치마크들에서 2위다 (source).
독립 측정은 Artificial Analysis 가 했고, Intelligence Index 에서 3점 상승을 보고하며 상승분은 에이전틱 평가에 집중된다:
| 지표 | Muse Spark 1.1 | Muse Spark 1.2 |
|---|---|---|
| GDPval-AA v2 | 1371 Elo | 1631 Elo |
| Terminal-Bench v2.1 | 78% | 80% |
| τ³-Banking | 25% | 27% |
| 이 저장소는 해당 컬럼을 담은 Artificial Analysis 스냅샷을 로컬에 보유하고 있지 않으므로, | ||
| 수치는 보고된 대로 인용되며 대조할 로컬 근거가 없다 | ||
| (source). |
활용 사례
- Muse Code — 터미널 코딩 에이전트, macOS 와 Linux 에서 베타. 코드를 생성하고 검증하며, 세션 내내 백그라운드 서브에이전트 여러 개를 지속적으로 관리한다 (source).
- 코드 생성, 복잡한 디버깅, 코드베이스 이해, 엔드투엔드 개발 워크플로 — Meta 가 1.1 대비 개선했다고 밝힌 영역 (source).
- Meta Model API 를 통한 직접 API 사용. 가격과 컨텍스트는 1.1 과 같다 (source).
지속되는 백그라운드 서브에이전트는 모델에 대한 주장과 분리해 봐야 할 제품 주장이다. 세션 내내 서브에이전트를 살려 두는 에이전트는 하니스 설계이고, 위 벤치마크 수치는 그 하니스가 루프 안에 있는 상태에서 나왔다. Meta 의 방법론이 그렇게 말한다.
비교
| 모델 | 가격 (Mtok 당 입력/출력) | 컨텍스트 | Terminal-Bench 2.1 |
|---|---|---|---|
| Muse Spark 1.2 | $1.25/$4.25 | 1M | 82.9% (Meta) · 80% (AA) |
| Muse Spark 1.1 (Muse Spark (1.0 / 1.1)) | $1.25/$4.25 | 1M | 76.2% (Meta) · 78% (AA) |
| Meta 는 업그레이드를 거치며 가격과 컨텍스트 윈도우를 그대로 두었고, 이는 출시 전체를 상업 | |||
| 조건이 아니라 모델과 하니스에 걸었다는 뜻이다 | |||
| (source). |
상충 보고
Terminal-Bench 및 DeepSWE 수치는 세 가지로 보고되며, 페이지 본문은 Meta 자신의 것을 따른다.
| 출처 | Terminal-Bench 2.1 | DeepSWE 1.1 | SWE-Bench Pro |
|---|---|---|---|
| Meta (자체 보고) | 82.9% | 59.3% | 보고 없음 |
| Artificial Analysis (독립) | 80% | 보고 없음 | 보고 없음 |
| kingy.ai, Meta 보고서를 출처로 제시 | 80.0 | 53.3 | 61.5 |
| 세 번째 행은 같은 출처를 주장하면서 첫 행과 공통 벤치마크 둘 다에서 어긋나고, 다른 어떤 | |||
| 소스에도 없는 SWE-Bench Pro 수치를 싣는다. 두 번째 행은 모순이 아니라 다른 측정이다 — | |||
| 다른 하니스는 다른 수치를 내는 것이 당연하며, Meta 자신이 그렇게 말한다. 조정하지 않고 | |||
| 기록한다 (source). |
열린 질문
- 1.2 는 Muse Spark 1.1 의 백본을 공유하는가, 별도 학습 실행인가? Watermelon 과의 관계는 밝혀지지 않았다.
- 파라미터 수, 아키텍처, 학습 컴퓨트 — 어느 것도 공개되지 않았다.
- Muse Code 는 미국 밖에서 쓸 수 있는가? Meta Model API 퍼블릭 프리뷰는 1.1 시점에 미국 개발자 전용이었다.
- 1.2 를 규율하는 라이선스는 무엇이며, 1.1 의 것과 다른가?