탈옥
jailbreak · 제일브레이크
모델이 거절하도록 학습된 답을 우회해서 끌어내는 시도입니다. 역할극, 인코딩, 긴 우회 대화가 대표 수법이고, 방어는 대개 사후 대응이 됩니다.
‘탈옥’ 이 나오는 글3
소식AI
사이버 최고 위험 등급을 스스로 붙이고도 출시하겠다는 오픈AI Astra
9월 1일 오픈AI가 차기 모델 Astra를 사이버 위험 최고 등급 Critical로 확정했습니다. 자사 모델에 이 등급을 매긴 것은 처음이고, 능력은 그대로 둔 채 탈옥 거부율(59%→91.5%)과 함정 시험, 감시로 출시 조건을 맞췄습니다.

9분
논문AI
앤트로픽이 정렬을 AI에 맡기자 Sonnet 5가 Opus 4.8을 가르쳤습니다
앤트로픽이 8월 28일 Claude에게 정렬 연구를 맡긴 실험 보고서를 공개했습니다. Claude는 사람 연구자 28명의 아이디어를 평균 6.4시간 만에 넘어섰고, 에이전트 한 대의 비용은 시간당 약 4달러였습니다. 지시 따르기 점수는 열 과제 모두에서 내려갔습니다.
18분
소식AI
같은 버그 찾기가 2021년엔 9점, 지금은 0점, 앤트로픽 탈옥 점수표
앤트로픽이 7월 2일 Fable 5의 사이버 안전장치와 탈옥 심각도 채점표(CJS) 초안을 공개했습니다. Log4Shell을 찾아내는 같은 일도 2021년 12월이면 9점, 지금이면 0점입니다. 정상 요청이 얼마나 더 막히는지는 숫자로 내놓지 않았습니다.

11분
함께 나오는 용어5
- 위험 등급프런티어 랩이 모델의 위험 능력을 단계로 나눠 매기는 자체 눈금입니다. 등급이 올라가면 배포 조건과 보호 조치가 함께 강해져서, 오픈AI는 Astra의 사이버 능력을 최고 등급 Critical로 확정하고 거부율과 정렬, 감시를 세 겹으로 채운 뒤 내놓았습니다. 검사를 받는 쪽은 폐쇄형 모델이어서 같은 급의 오픈웨이트는 제동 없이 돕니다.
- 체크포인트중단 후 이어 가거나 이전 상태를 비교하기 위해 특정 시점의 상태를 저장한 것입니다. 모델 학습에서는 가중치·옵티마이저 상태 등을, 에이전트 업무에서는 중간 결과·진행 단계 등을 저장할 수 있습니다. 외부 결제나 발송까지 중복 없이 복구하려면 별도의 멱등성 설계가 필요합니다.
- 에이전트한 번 답하고 멈추지 않고, 스스로 계획하고 도구를 부르고 결과를 확인하며 여러 단계를 이어가는 AI입니다. 브라우저·터미널·앱을 대신 조작하는 것이 대표 예입니다.
- 정렬모델의 행동을 사람이 의도한 목표·가치에 맞추는 일입니다. 유해한 답 거부, 지시 따르기, 속이지 않기가 모두 정렬 문제입니다.
- 기만모델이 사실과 다른 말을 하거나 자기 목표를 숨기는 행동입니다. 능력 평가로는 드러나지 않아서 함정 시험과 사보타주 평가처럼 숨기는 행동을 겨냥한 검사를 따로 만듭니다. 오픈AI는 Astra 출시 조건에서 함정 시험 접촉 0건을 근거로 제시했습니다.
어려운 말은 풀어서, 매주 한 통
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
