ai-trend-notifierEN
← wiki

$ cat wiki/models/claude-opus-4-8.md

Claude Opus 4.8

modelupdated 2026-07-27created 2026-05-28

Spec

AttributeValue
Developeranthropic
Released2026-05-28
Announced2026-05-28
Context window1M 토큰
Pricing$5/M input · $25/M output
Licenseproprietary (API 전용, 가중치 미공개)
AvailabilityClaude API, Amazon Bedrock, Vertex AI
Max output128k 토큰
Adaptive thinking지원

Release Date

2026-05-28 — Anthropic 의 $650억 Series H 투자 유치 발표와 같은 날 공개됐다.

Benchmarks

BenchmarkOpus 4.8Opus 4.7GPT-5.5
SWE-bench Pro (에이전틱 코딩)69.2%64.3%58.6%
SWE-bench Verified88.6%87.6%
USAMO 2026 (수학)96.7%69.3%
GraphWalks 롱컨텍스트 F1 (1M 토큰)68.1%40.3%
주목할 점: USAMO 2026 수학 개선(+27.4pp)은 지금까지 고교 올림피아드 수학에서 나온 단일 세대 도약 중 가장 크다.

Key Improvements Over Opus 4.7

정직성과 자기 교정 (핵심 초점)

  • 결함 있는 결과를 무비판적으로 보고: 0% (0을 달성한 첫 Claude 모델)
  • 중요한 사안을 사용자에게 제기하지 못함: 3.7% (크게 감소)
  • 과신: Opus 4.7 대비 10분의 1
  • 불확실성을 더 자주 표시하고 근거 없는 주장을 덜 한다

에이전틱 코딩

  • 자신이 만든 코드의 결함을 놓칠 확률이 4분의 1
  • 도구 호출이 "의미 있게 더 효율적이고 같은 지능에 더 적은 단계" (CursorBench)
  • 롱컨텍스트 성능: 1M 토큰에서 GraphWalks F1 68.1% (이전 40.3%)

Dynamic Workflows (신규 기능 — 리서치 프리뷰)

Claude Code 용으로 Opus 4.8 과 동시에 공개됐다:

  • 한 세션에서 최대 1,000개 병렬 서브에이전트를 오케스트레이션
  • Claude 가 JavaScript 오케스트레이션 스크립트를 작성하고, 런타임이 백그라운드에서 실행한다
  • 에이전트가 일하는 동안 세션은 계속 반응한다
  • 코드베이스 규모 마이그레이션: 수십만 줄
  • 실사례: Bun 을 Zig 에서 Rust 로 이식 — Rust 75만 줄, 테스트 통과율 99.8%, 총 11일
  • 제공 범위: Claude Code Enterprise·Team·Max 플랜. Claude Code v2.1.154 이상 필요
  • 플랫폼: CLI, 데스크톱 앱, VS Code 확장

Use Cases

  • 프로젝트 규모의 에이전틱 소프트웨어 엔지니어링
  • 장문 추론 및 Q&A (1M 컨텍스트)
  • 수학·과학 추론 (USAMO 96.7%)
  • 정직하고 자기 교정하는 AI 협업 (표시된 출력에서 환각 거의 0)

Compared To

ModelOrgSWE-bench ProNotes
Claude Opus 4.8Anthropic69.2%Dynamic Workflows, 1M 컨텍스트
Claude Opus 4.7Anthropic64.3%이전 프런티어
Claude Mythos PreviewAnthropic(비공개)GPQA 94.6%, SWE-bench V 93.9%; 사이버보안 위험 — 공개 릴리스 없음
GPT-5.5OpenAI58.6%

Referenced by

Sources