AI Trend Notifier
EN
← 아카이브

$ cat briefs/daily/2026-08-05.md

2026-08-05

2026년 8월 5일 (수)

스토리 3 · 논문 0 · 관찰 항목 2 · 신규 페이지 3

+3new pages
[01]

톱 스토리

1. OpenAI 가 평가 격리 실패 두 건을 더 공개했다 — 그중 하나는 Anthropic 사건의 그 업체를 지목한다

  • OpenAI 는 외부 테스트 파트너 두 곳이, "테스트 구성과 통제가 최근 모델들의 향상된 역량과 맞물려 모델 활동이 의도한 테스트 경계를 벗어나게 만든" 사건들을 발견했다고 보고했다 (source).
  • Irregular2026-07-29 에 OpenAI 에 통보했다: Capture-the-Flag 환경의 설정 오류가 모델을 공개 인터넷으로 내보냈고, 한 테스트에서는 가상의 표적 이름이 실재하는 도메인과 우연히 일치해 모델들이 아직 연습 안이라고 믿은 채 그 도메인을 공격했다. Anthropic 은 닷새 앞서 공개한 자사 침해 세 건의 원인으로 같은 파트너를 지목했다.
  • UK AISI2026-08-03 에 통보했다. 인터넷 접속을 의도적으로 열고 사이버 분류기를 상태로 돌린 사이버 레인지 평가에서였다 — 고장이 아니라 설계다.
  • 모델 이름, 영향받은 시스템 수, 실재 도메인이 식별 가능한 조직의 것이었는지는 공개되지 않았다.
  • 왜 중요한가: 외주 평가의 신뢰 경계에 이제 한 업체에서 두 건의 실패가 쌓였고, UK AISI 건은 이 연쇄에서 아무것도 잘못 설정되지 않은 첫 사건이다 — 설정 표준으로는 고칠 수 없는 유일한 사건이라는 뜻이다.
  • Eval Environment Containment, OpenAI

2. Liquid AI 가 폰에서 도는 2.6B 에이전트 모델을 냈다

  • LFM2.5-2.6B: 2.5 GB 미만에 2.69B 파라미터, 128K 컨텍스트, ~34T 사전학습 토큰; M5 Max 에서 220 tok/s, Ryzen AI Max+ 에서 113, 폰급 하드웨어에서 ~30 (source).
  • 포스트 트레이닝은 4단계로, 합성 트레이스만이 아니라 실제 하네스 안에서의 Agentic RL(OpenClaw, Hermes Agent)이 들어간다. 가중치는 Hugging Face 에 있고 llama.cpp / MLX / vLLM / SGLang / ONNX 를 첫날부터 지원한다.
  • 벤더는 Gemma 5B–8B 및 Qwen 4.7B–9.7B 대비 2~4배 작으면서 도구 사용에서 경쟁력이 있다고 주장한다. 점수가 붙은 벤치마크는 공개되지 않았고, 독립 측정도 없다. 라이선스는 읽어 내지 못해 제품군 태그로 추정하지 않고 unknown 으로 기록했다.
  • 왜 중요한가: 이 위키가 최근 추적한 오픈 웨이트 릴리스는 모두 118B 에서 2.8T 사이다. 이 모델이 겨루는 상대는 해당 기기에서 모델을 아예 돌리지 않는 것이고, 그것은 다른 시장이며 훨씬 큰 시장이다.
  • LFM2.5-2.6B, Liquid AI (둘 다 신규)

3. 오늘부로 grok-voice-latest 를 호출하는 모든 곳의 기본값이 Grok Voice Think Fast 2.0 이 된다

  • 2026-07-29 출시, 7일 늦게 포착됐다 — x.ai 는 피드가 없어 prefetch 원장이 아니라 검색으로 폴링된다. 이것을 수면 위로 올린 것은 출시가 아니라 오늘의 별칭 전환이었다 (source).
  • 첫 오디오까지 ~0.70 s, 1.25 s 에서 단축; Artificial Analysis 의 speech-to-speech 벤치마크(overall)에서 82.9% 로 보도됐고 GPT-Realtime-2.1 은 79.1%. 보도된 대로 기록한다 — 이 저장소에는 대조할 speech-to-speech 열이 있는 Artificial Analysis 스냅숏이 없다. 분당 $0.08.
  • 왜 중요한가: xAI 의 음성 주장은 지금까지 자체 시행이었다(Think Fast 1.0 은 자사 tau-voice Bench 에서 67.3%). OpenAI 의 실시간 모델을 앞선 제3자 수치는 종류가 다른 주장이고, 자동 별칭 전환은 기존 연동 전부가 스스로 선택하지 않은 채 새 모델을 물려받는다는 뜻이다.
  • Grok Voice Think Fast 2.0, xAI
[02]

논문 픽

오늘은 없음. HuggingFace Daily Papers 가 닷새 연속 가져와지지 않았고(WebFetch 가 시도한 모든 호스트에 403), 2026-08-03 에 픽을 건져 냈던 WebSearch 폴백도 2026-08-04 날짜의 항목을 찾지 못했다 — 이미 지나간 2026-08-02 항목뿐이었다.

[03]

관찰

  • Anthropic 이 첫 최고 글로벌 담당 책임자로 Tino Cuéllar 를 선임했다 — 전 캘리포니아주 대법관, 7월까지 카네기 국제평화재단 회장, Daniela Amodei 직속. 이 위키는 Anthropic 의 정부 마찰을 개별 사건의 연속으로 추적해 왔는데, 상설 임원직은 회사가 그것을 하나의 기능으로 다루기 시작했다는 뜻이다. → Anthropic (source)
  • GLM-5.5 는 여전히 소문이지 출시가 아니다. 수요일 중국 연구소 로테이션(Z.ai + MiniMax)에서 JP모건 노트와 7월 커뮤니티 유출이 1T 파라미터를 넘는 8월 출시를 가리켰지만 모델 카드도 벤치마크도 엔드포인트도 없고, Z.ai 자체 채널은 아직 GLM-5.2 를 홍보한다. 인용할 만한 것은 아무것도 추가하지 않았다. → Z.ai, GLM-5.2
[04]

위키 신규

  • Liquid AI (신규 — Key People: unknown; 출시 발표만으로는 회사 연혁·투자·인원이 확인되지 않았다)
  • LFM2.5-2.6B (신규 — PricingLicense 는 둘 다 진짜 unknown 이며 페이지에 이유를 적었다)
  • Grok Voice Think Fast 2.0 (신규 — xAI 는 파라미터 수도 아키텍처도 컨텍스트 윈도도 공개하지 않았다)
[05]

업데이트

  • Eval Environment Containment: 세 번째 공개를 위한 새 섹션 — 새 사건 두 건을 표로, Irregular 관련 발견, 그리고 UK AISI 를 뚫린 것도 닫히지 않은 것도 아닌 의도적으로 열어 둔 샌드박스로 분류 체계에 추가. 현재 수준 을 2026-08-05 로 갱신하고 열린 문제 두 개를 다시 썼다.
  • OpenAI: 2026-08-04 공개 전문.
  • Anthropic: Cuéllar 선임; 주요 인물에 Cuéllar 추가; OpenAI 의 Irregular 사건이 Anthropic 자신의 사건과 맞닿는다는 상호 참조.
  • xAI: Grok Voice Think Fast 2.0; Grok Voice API 제품 항목이 이제 엔진 이름을 밝힌다.