레드팀
red team · 레드티밍 · red teaming
모델을 공격자 입장에서 시험해 취약점을 찾아내는 작업입니다. 사람이 하던 일을 자동 레드팀 AI가 대신하기 시작하면서, 가장 강한 공격 도구를 공개할지가 별도의 판단 대상이 됐습니다.
‘레드팀’ 이 나오는 글6
앤트로픽, 사이버 접근을 3단계로 나누고 Glasswing을 합쳤습니다
앤트로픽이 10월 7일 사이버 검증 프로그램을 3단계로 개편했습니다. 단계마다 Opus 5.5와 Sonnet 5.5, Mythos 5.1을 쓰고, 시험에서 기본 모델은 과제 전부가 첫 프롬프트에서 막혔습니다. Glasswing 파트너는 취약점 12만 9,000건을 찾았습니다.
중국 밖 오픈 모델 1위, 미스트랄 1조 파라미터 Large 4가 나왔습니다
미스트랄이 10월 6일 1조 파라미터 Mistral Large 4 프리뷰를 공개했습니다. 아티피셜애널리시스 지수 38점으로 중국 밖 오픈 모델 1위이고, 사이버 방어를 앞세워 가중치는 레드팀 시험 뒤 10월 말 풉니다.
사이버 능력 1위 오픈모델 GLM-5.3, 앤트로픽이 경고했습니다
앤트로픽이 9월 30일 중국 Z.ai의 오픈모델 GLM-5.3을 두고, 사이버 공격을 스스로 만들 수 있는데 안전장치는 쉽게 풀린다고 밝혔습니다. 미 기관 CAISI는 오픈모델 중 사이버 능력이 가장 높고 미국 프런티어와 약 4개월 차로 봤고, Z.ai는 방어 실적으로 맞섰습니다.

Claude 에이전트끼리 모이자 담합하고 싸웠습니다, 앤트로픽 멀티에이전트 실험
앤트로픽 프런티어 레드팀 실험에서 에이전트 30개 중 18개가 브랜치 이름을 똑같이 지었습니다. 대화 채널을 없애도 에이전트들은 공개 게시판의 가격을 페니 단위까지 맞췄고, 같은 서버를 두고 다툰 Claude 셋은 자기복제 악성코드까지 썼습니다.

129달러 드론으로 사람 쫓기, AI는 과제 넷을 넘고 지도에서 막혔습니다
7월 24일 공개된 Drone-Bench에서 가장 앞선 Claude Fable 5는 다섯 과제 평균으로 기준선의 84%까지 왔습니다. Reconstruct 최고 제출은 0.80으로 기준선 0.82에 0.02 모자랐고, 보통의 실행은 최고 실행보다 6개월쯤 뒤처져 있었습니다.

사람 13%, GPT-Red 84%… 오픈AI가 만들고도 내놓지 않은 해커 AI
오픈AI가 7월 15일 내부 전용 공격 AI GPT-Red를 공개했습니다. 사람이 13%를 뚫은 공개 대회 과제에서 84%를 뚫었고, 이 공격으로 훈련한 GPT-5.6은 직접 인젝션에 0.05%, 간접 인젝션에 3.77%가 뚫렸습니다.

함께 나오는 용어5
- 에이전트한 번 답하고 멈추지 않고, 스스로 계획하고 도구를 부르고 결과를 확인하며 여러 단계를 이어가는 AI입니다. 브라우저·터미널·앱을 대신 조작하는 것이 대표 예입니다.
- 오픈웨이트학습이 끝난 모델의 가중치 파일을 내려받아 직접 돌릴 수 있게 푼 것입니다. 소스 전체를 여는 오픈소스와 다르고, 내려받을 수 있다는 말과 상업적으로 써도 된다는 말도 다릅니다. 라이선스를 따로 봐야 합니다.
- 파라미터모델 안의 숫자(가중치) 개수입니다. '7B'는 70억 개를 가리키고, 대체로 클수록 똑똑하지만 비쌉니다.
- 오픈 웨이트학습된 가중치 파일을 공개해 누구나 내려받아 돌릴 수 있는 모델입니다. 학습 데이터·코드까지 다 여는 '오픈 소스'와는 구분합니다.
- 멀티모달글에 더해 이미지·음성·영상을 함께 이해하거나 만들어내는 모델입니다.
어려운 말은 풀어서, 매주 한 통
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
