AI Trend Notifier
EN
← wiki

$ cat wiki/concepts/preparedness-framework.md

Preparedness Framework

정의

OpenAI 의 내부 정책으로, 모델이 무엇이 될 수 있는지 — 더 학습시킬지, 배포할지, 누구에게 열지 — 를 특정 위험 영역의 역량 임계값에 대한 평가 결과로 결정한다. 프레임워크는 등급을 정의하고, 모델이 받은 등급이 작업을 계속하기 전에 갖춰야 할 안전장치를 결정한다 (source).

이 위키가 보유한 소스에는 두 개의 등급이 등장한다:

등급실제로 의미해 온 것
High2026년 8월 이전에 사이버 역량 평가를 받은 모든 OpenAI 프런티어 모델의 판정. GPT-5.6 Sol (and Terra, Luna) 포함
Critical2026-08-07Astra 에 대해 처음 발동. 배포 게이트가 아니라 개발 감속을 촉발한다
OpenAI 가 명시한 Critical 사이버 임계값: 다수의 견고한 실제 핵심 시스템에서
모든 심각도의 작동하는 제로데이 익스플로잇사람의 개입 없이 식별하고
개발할 수 있거나, 높은 수준의 목표만 주어졌을 때 견고한 표적에 대해 **처음부터
끝까지 새로운 사이버 공격 전략을 고안하고 실행**할 수 있는 모델
(source).

왜 중요한가

  • 지켰을 때 비용이 드는 약속이다. 2026-08-07 OpenAI 는 Astra 에서 Critical 사이버 역량을 배제할 수 없다고 밝히고 그에 대한 대응으로 해당 모델의 개발 속도를 늦추겠다고 했다. 이 위키는 시작 이래 프런티어 랩들이 안전 프레임워크를 발표하는 것을 기록해 왔다. 공표된 프레임워크가 랩 자신의 플래그십이 지연되는 이유로 인용된 것은 이번이 처음이다.
  • 방아쇠는 "확인됨" 이 아니라 "배제할 수 없음" 이다. OpenAI 는 테스트가 진행 중이며 Astra 가 임계값을 넘었다고 확인하지 않았다고 명시한다. 프레임워크는 어떤 역량을 배제하지 못한다는 사실에서 발동하는데, 이는 긍정적 발견보다 실질적으로 낮은 기준이며 — 평가가 어려워질수록 통과하기 더 어려워지는 기준이다.
  • 등급은 평가에 관한 주장이고, 평가는 논쟁 대상이다. Eval Harness Configuration 을 보라: 모델의 점수는 그 점수를 매긴 스캐폴드에 달려 있다. 역량으로 표현된 임계값은 그 측정의 모호함을 전부 물려받는다.
  • 일방적이다. 프레임워크는 OpenAI 자신의 문서이고, 평가도 OpenAI 자신의 것이며, 구제책도 OpenAI 자신의 선택이다. 여기서 읽은 소스 중 어느 것도 그 어느 부분을 외부에서 검토 가능하게 만들지 않는다. 다만 2026-08-07 대응은 정부 기관과 선정된 AI 안전 기관을 테스트에 참여시킨다.

현재 수준 (2026-08-08)

프레임워크의 첫 Critical 지정은 엿새 됐고, 대응은 발표됐지만 밖에서 관찰할 수는 없다. 기록으로 남은 것:

  • 2026-08-07 — Astra 가 사이버보안에 대해 Critical 을 배제할 수 없다고 판정. 대응: 개발 감속, 격리된 테스트 환경, 네트워크·도구 접근 제한, 샌드박스 실행, 가중치 저장 강화, 모든 에이전트 실행에 대한 모니터링, 안전장치 견고성 테스트 확대, 정부 기관 및 안전 기관과의 외부 테스트, 서드파티 테스트 파트너에 대한 권장 보안 통제 제공 (source).
  • 그 이전에는 High 등급 사이버 역량을 작업 감속이 아니라 접근 차단으로 다뤘다: Daybreak 프로그램이 승인된 레드팀, 침투 테스트, 익스플로잇 검증 용도로 GPT-5.5-Cyber 를 포함한 사이버 특화 모델에 대한 통제된 접근을 Trusted Access 검증 뒤에서 판매하고 있고 (source), GPT-5.5-Cyber 의 EU 제공 자체도 단계적으로 이뤄졌다 (source).

기억해 둘 구분: High유통 정책을 낳았고, Critical개발 정책을 낳았다. 둘은 다른 종류의 약속이고, 출시 일정에 드러나는 것은 두 번째뿐이다.

열린 문제

  • 공표된 종료 조건이 없다. OpenAI 는 "올바른 안전장치가 갖춰질 때까지" 개발을 늦춘다고 말한다. 여기서 읽은 어느 소스도 무엇이 그것을 충족하는지, 누가 판단하는지, 어떤 근거로 판단하는지 밝히지 않는다 — 그래서 밖에서는 프레임워크가 작동하는 것과 상업적으로 불편해질 때 지연이 끝나는 것을 구분할 방법이 없다.
  • "배제할 수 없음" 에는 하한이 없다. 같은 표현이 Critical 확정까지 평가 하나를 남긴 모델과 평가가 그저 결론이 나지 않은 모델을 함께 덮는다. 읽은 소스 중 둘을 구분하는 것은 없다.
  • 자체 평가. 평가자, 프레임워크 작성자, 지연 비용을 부담하는 당사자가 같은 조직이다. 외부 테스트는 대응의 일부로 발표됐지, 그 대응을 촉발한 평가의 일부가 아니다.
  • 랩 간 공통 어휘가 없다. Anthropic, Google DeepMind, OpenAI 는 각자의 이름으로 각자의 임계값을 발표한다. 한 랩의 "Critical" 모델은 다른 랩의 어느 등급과도 정의된 관계가 없으므로, 업계는 두 모델이 비슷한 위험 수준인지 말할 수 없고 각 벤더가 그렇게 말하는지만 말할 수 있다.

주요 논문

논문 없음. 이것은 기업 정책 문서이며, 위키는 문헌이 아니라 OpenAI 자신의 글을 통해 보유한다 (source, source).

관련 개념

Referenced by

Sources