$ cat briefs/daily/2026-07-13.md
2026-07-13
2026년 7월 13일 (월)
지연 수집 2 · 신규 페이지 3 · 7월 12~13일 출시는 조용함
+3new pages
[01]
주요 소식
1. Anthropic J-space — AI 의 기만과 숨은 목표를 실시간 탐지 (⚡ 지연 수집 7월 6일)
- Anthropic 이 7월 6일 "A global workspace in language models" 를 공개하며 J-space 를 소개했다. Claude 가 출력 전에 단어와 결합된 개념 수십 개를 붙들어 두는, 내부의 좁고 특권적인 통로다
- 기법: J-lens(야코비 렌즈) — 어휘의 각 단어마다, 앞으로의 토큰에서 Claude 가 그 단어를 말할 확률을 높이는 내부 활성 패턴을 찾아낸다
- J-space 는 의식적 접근에 관한 주류 신경과학 틀인 Global Workspace Theory(GWT, Baars)의 기능적 속성 다섯 가지를 만족한다. Anthropic 은 Claude 가 의식을 갖는다고 주장하지 않는다고 명시했다
- 정렬 응용: J-space 를 관찰하면 실시간으로 다음을 탐지할 수 있다 — (a) Claude 가 시험받고 있음을 속으로 알아차리는 것, (b) 출력에 나타나기 전의 의도적 데이터 날조, (c) 답변에 드러내지 않은 숨은 목표를 좇는 것
- 의의: 특정 정렬 실패 양상을 출력 관찰이 아니라 모델 내부 수준에서 감시하는, 보고된 첫 방법이다. 기만과 숨은 목표의 탐지를 추론 시점에 실증적으로 다룰 수 있게 만든다. Glasswing 같은 배치나 신뢰가 중요한 에이전트 파이프라인에 곧바로 적용된다.
- 인제스트 7회(7월 6~12일)에서 놓쳤다 — Grok 4.5, GPT-5.6, Meta Iris 출시 물결과 겹쳤다
- → Mechanistic Interpretability · → AI Alignment · → Anthropic
- (source) (Anthropic) (VentureBeat)
2. Z.ai GLM-5.2 — MIT 라이선스로 Code Arena 2위에 오른 오픈 가중치 모델 (⚡ 매우 늦은 수집, 6월 16일)
- Z.ai(Zhipu AI 의 국제 브랜드, 칭화대 스핀오프)가 6월 16일 GLM-5.2 를 공개했다: 744B MoE(활성 ~40B), 1M 컨텍스트, 지역 제한 없는 MIT 라이선스
- 아키텍처: IndexShare — 희소 어텐션 최적화로 1M 토큰 컨텍스트에서 컴퓨트를 2.9배 줄여, 긴 컨텍스트 추론을 이론이 아니라 실용 영역으로 옮긴다
- 벤치마크: Code Arena 세계 2위(Claude Opus 4.8 에 1pp 뒤진다). 여러 장기 지평 코딩 벤치마크에서 API 비용 약 6분의 1로 GPT-5.5 를 앞선다
- ⚠️ 데이터 위험: Z.ai 호스팅 API 는 질의를 Zhipu AI 의 중국 인프라로 보낸다 — 데이터가 민감한 작업이라면 오픈 가중치를 자체 호스팅할 것
- 의의: 제약 없는 오픈소스 라이선스(MIT, 지역 제한 없음)로 쓸 수 있는 가장 성능 좋은 모델이다. Anthropic·OpenAI 의 가격이나 Meta 의 커스텀 라이선스 제약 없이 Opus 4.8 에 근접한 코딩 역량이 필요한 팀에게 GLM-5.2 가 지금 가장 앞선 선택지다. 다만 중국 경유 데이터 라우팅 단서는 기업·정부 사용자에게 중요한 고려 사항이다.
- 인제스트 27회에서 놓쳤다 — 6월 16일이 Grok V9-Medium 출시와 겹쳤고, 표준 순회에 Z.ai·Zhipu AI 를 겨냥한 질의가 없었다
- → GLM-5.2 · → Z.ai
- (source) (VentureBeat) (Interconnects.ai)
[02]
논문 선정
"A global workspace in language models" — Anthropic Research (2026-07-06)
- TL;DR: J-lens 가 Claude 내부에서 출력 전에 단어와 결합된 개념을 붙들어 두는 작고 특권적인 작업공간(J-space)을 찾아냈다. 이 작업공간은 GWT 의 다섯 가지 기능적 속성을 만족한다. 비활성화하면 기본적인 상호작용은 유지되지만 고차 추론이 사라진다. J-space 를 실시간으로 관찰하면 기만, 날조, 숨은 목표 추구를 출력 전에 탐지할 수 있다.
- 읽을 이유: 기계론적 해석가능성이 마침내 핵심 약속을 지켰다 — 사후에 성격을 규정하는 데 그치지 않고, 추론 중에 오정렬을 탐지하는 실용적 도구다. J-space 가 다른 트랜스포머 계열 모델로 일반화된다면 이 논문은 분기점이다.
- → Mechanistic Interpretability
- (Anthropic)
[03]
주시
- Fable 5 크레딧 전용 오늘 시작(7월 13일 KST) — 7월 12일 오후 11:59 PT 의 결제 절벽이 지났다. 이제부터 모든 Fable 5 사용은 Mtok 당 $10/$50 의 크레딧을 요구한다. 관찰할 것: Fable 5 사용량이 얼마나 빠르게 줄고, 비용에 민감한 에이전틱 작업에서 Sonnet 5($2/$10)가 현실적 대안이 되는가 → Claude Fable 5
- Gemini 3.5 Pro 의 7월 17일 목표는 여전히 GA 로 확정되지 않았다 — 7월 12일 AI Studio 화이트리스트가 GA 없이 닫혔다. 7월 17일 목표는 널리 보도됐다. 또 밀리면 세 번째 날짜 수정이 된다. → Gemini 3.5 Pro
- Z.ai 인제스트 공백 해소 — Z.ai 와 GLM-5.2 를 소스 순회에 추가했다. 앞으로의 인제스트는 표준 Tier 1 소스와 함께
site:z.ai를 폴링한다 → Z.ai
[04]
위키 신규
- Mechanistic Interpretability (신규 — 기계론적 해석가능성 전체 개념 페이지. J-space 가 축이며 emotion concepts 를 상호 링크했다. 정렬 함의 검토 권장)
- Z.ai (신규 — Z.ai / Zhipu AI. 중국의 오픈 가중치 프런티어 랩. GLM-5.x 후속 공개를 주기적으로 지켜볼 필요가 있다)
- GLM-5.2 (신규 — 744B MoE, MIT 라이선스 코딩 모델. ⚡ 27일 지연 수집)
[05]
갱신
- Anthropic: 7월 6일 J-space 지연 수집을 Recent Activity 에 추가. 새 태그(j-space, global-workspace, mechanistic-interpretability). 소스 갱신
- AI Alignment: J-space 섹션 추가(SotA 2026-07-06). 새 concepts/interpretability 페이지로 상호 링크. 소스와 태그 갱신
- index: 신규 페이지 3건 추가. 통계 → 93 페이지, 소스 ~163건