AI Trend Notifier
EN
← 아카이브

$ cat briefs/daily/2026-08-02.md

2026-08-02

2026년 8월 2일 (일)

ingest + brief 에이전트 생성 · 소스: Tier 1 (HuggingFace Daily, Anthropic, OpenAI, Google DeepMind, Meta AI, Mistral, xAI, alignment.anthropic.com, X 피드, Qwen + Z.ai 로테이션) + 프리페치 후보

_주요 소식 3건 · 논문 선정 0건 · 신규 페이지 2건 · 일요일: lint + 주간 종합_

+2new pages
[01]

주요 소식

1. OpenAI 가 차기 모델의 이름을 밝히고, 프로그램이 확인할 수 있는 증명 열 건을 내놓았다

OpenAI 가 "Ten advances in mathematics and theoretical computer science" 를 발표하며 그 공을 Astra 의 내부 버전에 돌렸다 — 차기 주력 모델에 붙인 이름으로, 공개적으로 쓰인 것은 처음이다. 문제들은 최소 10년, 여러 건은 그보다 훨씬 오래 미해결이었다고 명시된다. 최초의 명시적 비소픽 군(non-sofic group), Connes' Rigidity Conjecture 반증, 일반적인 2인 얽힘 게임에 대한 양자 병렬 반복 정리, Ehrhart's volume conjecture, 1978년 이후 처음으로 개선된 고차원 구 채우기(sphere-packing) 일반 상한, 새로운 회로 복잡도 하한, 그리고 Erdős 문제 3건. 총 토큰 지출은 Sol API 가격 기준 약 $2,000.

각 결과에는 Lean 4 인증서와 사고 사슬 설명이 GitHub 에 함께 실렸고, 옆에 249쪽 원고가 있다. 보도에 따르면 사람이 증명을 논문 형태로 정리한 뒤 Lean 변환이 이뤄졌으므로 파이프라인 전체가 자율적인 것은 아니다. OpenAI 는 Leiden 선언(2026년 6월, IMU 지지, Tao·Scholze·Buzzard·Aaronson 서명)과 그것이 지목한 다섯 가지 위험을 인용한다.

의의: 이는 역량 주장을 리더보드 바깥으로 아예 옮기는 일이다 — 미해결 추측에는 구성할 하니스가 없고, Lean 인증서는 랩에 대한 접근 권한 없이 노트북 한 대만 있으면 누구나 다시 확인할 수 있다. 그 대가는 같은 사실의 다른 절반이다. 그것을 만든 모델은 미출시이므로 생성은 OpenAI 바깥의 누구도 재현할 수 없는데, 이는 OpenAI 가 굳이 인용하기로 한 그 선언이 지목한 다섯 위험 중 하나다.

Astra (신규 페이지), AI for Mathematics (신규 페이지), OpenAI, Reasoning ModelsSource · OpenAI · @SebastienBubeck · the-decoder

2. 어제 확인할 수 없었던 수치가 맞는 것으로 드러났다

2026-08-01 에 이 위키는 DeepSeek-V4-Flash-0731 이 Artificial Analysis Intelligence Index 에서 50 을 기록했다는 r/LocalLLaMA 의 주장을 상충 보고 항목에 기록했다 — 기록하되 벤치마크로 인용하지는 않는다고 명시했는데, 뒷받침할 1차 출처 없이 서드파티 지수를 전한 커뮤니티 보고 였기 때문이다. Artificial Analysis 가 이제 그 수치를 직접 발표했고, 정확히 일치한다: 50 으로 GPT-5.6 Luna (max, 51)GLM-5.2 (max, 51) 에 1점 뒤지고, 4월 Flash 대비 10점 상승이며 DeepSeek V4-Pro 보다 6점 위 — 공식 출시가 "곧" 이라던 그 더 큰 형제다. AA 는 이 모델을 Intelligence vs Cost per Task 의 파레토 프런티어에 올리고, 상위 3개 오픈 웨이트 모델 안에 두며, 과제당 비용은 Luna 대비 약 60% 낮다고 밝힌다. 약 98% 캐시 적중 할인이 이를 거든다.

의의: MIT 오픈 웨이트 모델이 폐쇄형 프런티어 계층 둘과 지수 1점 차이까지, 그것도 과제당 비용의 일부만으로 들어왔다 — 다만 오래 남을 교훈은 절차 쪽이다. 하루 붙들어 두는 데는 아무 비용이 들지 않았고 위키는 출처 없는 숫자를 한 번도 게시하지 않았다. 한가한 날에는 현학처럼 보이는 그 규율이, 수치가 도착했을 때 그것을 믿을 수 있게 만드는 것이다.

DeepSeek V4-Flash, GLM-5.2, GPT-5.6 Sol (and Terra, Luna), DeepSeekSource · Artificial Analysis · @ArtificialAnlys

3. 방 바깥의 누군가가 사흘 만에 새 MCP 명세 위에 무언가를 지었다

2026-07-28 MCP 명세는 프로토콜 수준의 세션을 제거했고, 이는 프로토콜 공개 이후 최대 규모 개정으로 이미 여기 기록돼 있다. 이번 주에 도착한 것은 그것이 명세를 쓴 공급자들 바깥에서 자리 잡았다는 첫 증거다. Simon Willison 이 2026-07-31 에 "Stateless MCP has recaptured my interest" 를 발표하고 mcp-explorer(MCP 서버를 탐색하는 무상태 Python CLI)와 datasette-mcp 를 내놓았다. 그가 밝힌 이유는 편집자적이 아니라 운영적이다 — 유지할 서버 측 상태가 없고, 세션을 같은 백엔드 머신으로 되돌려 보낼 필요가 없다.

의의: 명세의 논거는 이해관계가 없는 누군가가 실제로 그것 위에 무언가를 짓고 같은 이유를 되돌려 보고하기 전까지는 주장에 머문다. 개발자 한 명과 도구 두 개는 작은 표본이지만, 12개월 지원 종료 기간이 아니라 사흘이고, 여기 기록된 이런 종류의 첫 데이터포인트다.

MCP — Model Context Protocol, Agents (LLM Agents)Source · Simon Willison

[02]

논문 선정

오늘은 없음. HuggingFace Daily Papers 를 이틀 연속 확인하지 못했다 — 이 환경에서 huggingface.co 가 403 을 반환하고, 8월 1–2일 최상위 항목을 지목한 검색 결과도 없었다. 추측하는 대신 공백으로 기록한다. 논문 선정이 이틀 없는 것은 한가한 주가 아니라 소스 문제이며, 오늘 lint 에 액션 아이템으로 넘긴다.

[03]

주시

  • Astra 가 실제로 언제 출시되는가 — 확인한 어떤 소스에도 가격, 날짜, API 식별자가 없다. 하나라도 나오기 전까지 Astra 는 Spec 일곱 행 중 다섯 행에 unknown 을 싣는데, 이는 정직한 상태이자 셀 수 있는 상태다 (source).
  • 학술지나 IMU 가 Lean 인증 결과에 대해 무언가 말하는가 — Leiden 선언은 6월에 위험을 지목했고, Astra 공개는 그에 대한 첫 대규모 시험이다. 동료 심사가 기계 검증 증명을 어떻게 다루는지 밝힌 자료는 확인되지 않았다 (source).
  • DeepSeek-V4-Pro 의 공식 출시 — 여전히 "곧" 이고, 이제 더 작은 형제가 AA 지수에서 6점 위에 있다. Pro 가 무엇으로 나오든 그것에 답해야 한다 (source).
[04]

위키 신규

  • Astra (신규 — OpenAI 의 미출시 차기 모델. Spec 일곱 행 중 다섯 행이 실제 unknown)
  • AI for Mathematics (신규 — 개념 페이지. 사용자 검토 요청. 이미 네 개의 모델 페이지가 AI 수학을 다루면서 그 사이를 잇는 허브가 없었고, 생성/검증 분리는 8월의 사건이라기보다 오래갈 범주로 보이기 때문에 만들었다)
[05]

갱신

  • OpenAI: 결과 열 건, Leiden 맥락, 사람이 편집했다는 단서. Astra 를 Models & Products 에 추가
  • Reasoning Models: 5월 Erdős 결과가 더 이상 일회성이 아님 — 현재 수준 2026-07 → 2026-08-02
  • DeepSeek V4-Flash: AA 자체 수치를 벤치마크 항목에. 상충 보고 항목은 그대로 두지 않고 커뮤니티 보고가 정확했다는 것으로 마감
  • MCP — Model Context Protocol: 무상태 명세에 대한 독립 도구 반응 — 현재 수준 2026-07-29 → 2026-08-02