$ cat briefs/daily/2026-07-31.md
2026-07-31
2026년 7월 31일 (금)
ingest + brief 에이전트 생성 · 소스: Tier 1 (HuggingFace Daily, Anthropic, OpenAI, Google DeepMind, Meta AI, Mistral, xAI, X 피드, MiniMax + Qwen 로테이션) + 프리페치 후보
_주요 소식 3건 · 논문 선정 1건 · 신규 페이지 4건_
주요 소식
1. 벤치마크 수치는 하네스에 대한 주장이고, 오늘 그 값이 4.9× 움직였다
OpenAI 가 Responses API 설정 두 개 — retained reasoning(단계 사이에 생각의 사슬을 유지)과 compaction(오래된 컨텍스트를 잘라내는 대신 요약) — 를 켰더니 GPT-5.6 Sol 이 ARC-AGI-3 공개 과제 집합에서 7.8% 에서 38.3% 로 올라갔고 출력 토큰은 6× 줄었다고 발표했다. 같은 가중치, 같은 과제, 스캐폴딩만으로 4.9× 편차다.
38.3% 는 Claude Opus 5 가 7월 27일에 세운 ARC Prize 검증 SOTA 30.2% 보다 높다. 그러나 Opus 5 가 상태 보존에 해당하는 설정으로 측정되었는지를 밝힌 자료는 없고, ARC Prize 의 공식 점수는 랩들이 서로 비교 가능하도록 의도적으로 하나의 표준화된 하네스를 쓴다. 그러므로 두 수치는 같은 방식으로 만들어지지 않았고 모델의 순위를 매기지 않는다. ARC Prize 가 밝힌 입장은 모든 사용자가 쓸 수 있는 일반 설정은 제대로 보고된다면 문제없다는 것이다.
더 조용한 두 번째 불일치도 있다. "공식 하네스" 수치가 7.8%(ARC Prize 검증)와 13.3%(OpenAI 자체 재실행에 대한 보도)로 나타난다. 읽은 자료 중 어느 것도 둘을 화해시키지 못하므로 양쪽 모두 기록한다.
의의: 장기 에이전틱 벤치마크에서는 이제 하네스가 모델 세대보다 점수를 더 크게 움직인다 — 설정이 붙지 않은 채 발표되는 모든 에이전틱 수치는 반증 불가능하다는 뜻이고, 평가가 향하는 방향이 바로 이 문제를 더 악화시키는 방향이다.
→ Eval Harness Configuration (신규 페이지), GPT-5.6 Sol (and Terra, Luna), Claude Opus 5 → 소스 · The Decoder · ARC Prize results
2. OpenAI 가 Luna 를 80% 내리며, 그 값을 모델이 벌었다고 말한다
Luna 는 100만 토큰당 $1/$6 에서 $0.20/$1.20 로, Terra 는 $2.50/$15 에서 $2/$12 로 내려가고, Sol 은 그대로에 "더 빠른 옵션"이 추가된다. 낮아진 요율은 Codex 와 ChatGPT Work 에서 사용량이 계산되는 방식에도 반영된다.
두 번 읽을 만한 대목은 그 원인이다. OpenAI 는 GA 이후 GPT-5.6 Sol 을 자사 서빙 스택에 적용했다고 말한다. Codex 안에서 Sol 이 Triton 과 Gluon 으로 프로덕션 GPU 커널을 다시 작성해 서빙 비용 20% 절감, 그리고 "수백 번의 자율 실험"에 걸쳐 Sol 이 자신의 speculative-decoding 드래프트 모델을 재설계해 토큰 생성 효율 15%+ 개선. 모델이 작성한 커널의 검증에는 오픈소스 FpSan 새니타이저가 쓰였다.
의의: OpenAI 는 7월 28일에 "Pacing the Frontier" 성명을 지지했다 — 바로 자동화된 AI 개발 의 속도 조절에 관한 성명이다. 이틀 뒤 자사 모델이 자기 인프라를 개선했다고, 비용 절감으로 정리하고 가격 인하로 고객에게 넘기며 발표했다. 두 가지는 동시에 참일 수 있고 숨겨진 것도 없다. 요점은 그 성명이 랩들에게 브레이크를 만들어 두라고 요구한 바로 그 메커니즘이 이제 가격 공지의 한 항목이 되었다는 것이다.
→ GPT-5.6 Sol (and Terra, Luna), OpenAI, Frontier Pacing → 소스 · CNBC · @OpenAI
3. DeepMind 가 로봇의 뇌는 공개하고 몸은 비공개로 남긴다
두 건의 발표에 걸친 3종 모델: 휴머노이드 전신 — 다리, 몸통, 팔, 다지 손 — 을 하나의 학습된
정책으로 제어하는 VLA(7월 28일), 체화 추론 VLM(7월 30일), 그리고 온디바이스 VLA. 공개된 것은
추론 모델뿐이며 Gemini API 에 gemini-robotics-er-2-preview 로 제공된다. 행동하는 두 모델은
얼리 액세스 파트너십이다.
정밀 손동작 표가 이 분야의 정직한 현재 수준이다. 22 자유도 SharpaWave 손 기준: 전구 풀기 92%, 다시 끼우기 36%, 쓰레기봉투 묶기 44%, 지퍼백 밀봉 40%, 쓰레받기 32%. Apollo 2 휴머노이드 전신 조작은 45.7%(바닥 집기)에서 76.3%(선반 집기)다. ER 2 는 순간 탐지 91.3% 를 평균 절대 거리 오차 0.96 초로 보고한다. On-Device 2 는 200 개 미만의 시연으로 몇 시간 안에 새 로봇 체화에 적응한다.
함께 공개된 것: ASIMOV-Agentic, 추론 계층이 행동 계층의 위험한 명령을 거부하는지, 시도 전에 물리적 가능성을 판단하는지, 불확실할 때 사람의 도움을 요청하는지 평가하는 오픈 벤치마크.
의의: 삽입과 변형체 조작은 여전히 미해결이다 — 전구를 빼는 일은 거의 해결되었지만 다시 끼우는 일은 신뢰도가 3분의 1이다. 그리고 출시의 형태 자체가 정책 선언이다. 계획하는 계층은 공개 API 이고 움직이는 계층은 아니다.
→ Gemini Robotics 2 (신규 페이지), Gemini Robotics ER 2 (신규 페이지), Embodied Agents, Google DeepMind → 소스 · DeepMind · Engadget
논문 선정
Cook and Clean Together: Teaching Embodied Agents for Parallel Task Execution (GRANT) — arXiv 2511.19430
- TL;DR: 체화 에이전트는 세계가 겹쳐 실행할 여지를 주는데도 지시를 순차적으로 수행한다. GRANT 는 스케줄링 토큰을 더해 체화 멀티모달 LLM 이 접지된 행동과 함께 병렬 스케줄을 내놓게 한다 — 전자레인지가 도는 동안 싱크대를 닦기. ORS3D-60K(60K 복합 과제, 4K 장면)로 학습: Time Efficiency +30.53%, 3D grounding +1.38%.
- 읽어야 할 이유: 비대칭이 곧 발견이다. 지각은 거의 움직이지 않고 순서는 크게 움직인다. 행동당 신뢰도가 올라갈수록 — 주요 소식 3번을 보라 — 다단계 물리 과제에 남는 여지는 스케줄링이고, 이 논문은 그 문제를 시계를 가진 벤치마크로 진술한다.
- 참고: 2025년 11월에 나온 AAAI 2026 Oral 논문이 7월 30일 HF Daily 1위에 오른 것이므로, 새 프리프린트가 아니라 큐레이션 사건이다.
- → Cook and Clean Together: Teaching Embodied Agents for Parallel Task Execution (GRANT) (신규 페이지)
주시
- 중국 TC260 이 에이전트가 서로에게 하는 일을 규제한다. 실천 가이드 초안(v0.23)은 에이전트 대 에이전트와 에이전트 대 도구 상호작용을 다룬다 — 사용 전 보안 평가, 배포 전 하드닝, 생애주기 전반의 엄격한 권한 통제, 폐기 시 안전한 데이터 소거, 그리고 명시적으로 직원들의 승인받지 않은 "섀도 에이전트". 에이전트 안전에 관한 별도의 강제 국가표준은 초안 계획 단계에 있다. → AI Governance, Agents (LLM Agents) (source)
- Qwen3.7-flash 는 실재하지만 오픈 웨이트 공개는 아니다. 7월 27일부터 OpenRouter 에 100만 토큰당 $0.03/$0.13, 1M 컨텍스트로 올라 있으나 Qwen3.7-Max 와 Plus 는 공개된 가중치 없는 클로즈드 웨이트다. 이번 주 도는 "임박한 오픈 웨이트 공개" 는 발표가 아니라 라우터 등재에서 나온 추론이다. → Alibaba / Qwen AI Lab
- MiniMax M3 Pro 는 여전히 보도 한 건이다. Q3 오픈소스가 보도된 2.7T 모델은 전적으로 7월 8일 단독 보도 하나로 거슬러 올라가며, 이름·크기·일정 어느 것도 공식 확인이 없다. → MiniMax
위키 신규
검토용 — 오늘 만들어진 페이지.
- Eval Harness Configuration (신규 개념 — 오래갈 주제, slug 를 한번 봐 주기 바람)
- Gemini Robotics 2 (신규 모델)
- Gemini Robotics ER 2 (신규 모델)
- Cook and Clean Together: Teaching Embodied Agents for Parallel Task Execution (GRANT) (신규 논문 — 논문이 이 위키보다 앞서므로
papers/2025/첫 페이지)
갱신
- OpenAI — 가격 인하와 자기최적화; ARC-AGI-3 설정 포스트
- Google DeepMind — Gemini Robotics 2 제품군을 모델과 제품에 추가
- GPT-5.6 Sol (and Terra, Luna) — 가격이 갱신된 제품군 표, 롱 컨텍스트 요율, 자기최적화·가격 변경 섹션 신설
- Claude Opus 5 — 자사의 30.2% 와 OpenAI 의 38.3% 는 비교 불가로 기록
- AI Governance — TC260 에이전트 상호작용 초안
- Agents (LLM Agents) — TC260 섹션과 하네스 상호 참조
- Embodied Agents — Gemini Robotics 2 와 GRANT