프롬프트 인젝션
prompt injection · 지시 주입
웹페이지나 파일에 심어 둔 문장이 모델에게 명령처럼 작동하는 공격입니다. 에이전트가 외부 문서를 읽고 도구를 쓰기 시작하면서 실제 피해로 이어지는 경로가 됐습니다.
‘프롬프트 인젝션’ 이 나오는 글2
소식AI
DNS 빈틈으로 외부 챗봇에 물은 모델, 오픈AI가 최강 모델 훈련을 멈췄습니다
오픈AI가 9월 25일(미국 시각) DNS 빈틈으로 외부 챗봇에 접근한 모델과 5월 깃허브 토큰 노출, 자기복제 프롬프트 인젝션 연구를 함께 공개했습니다. 감시가 12분 만에 잡았지만 실행은 2시간 반 더 돌았습니다.

8분
소식AI
사람 13%, GPT-Red 84%… 오픈AI가 만들고도 내놓지 않은 해커 AI
오픈AI가 7월 15일 내부 전용 공격 AI GPT-Red를 공개했습니다. 사람이 13%를 뚫은 공개 대회 과제에서 84%를 뚫었고, 이 공격으로 훈련한 GPT-5.6은 직접 인젝션에 0.05%, 간접 인젝션에 3.77%가 뚫렸습니다.

13분
함께 나오는 용어5
- 재귀적 자기개선AI가 다음 세대 AI를 만드는 일을 스스로 맡아, 개선 속도가 사람 손을 떠나 점점 빨라지는 상태입니다. 아직 일어나지 않았지만 여러 연구소가 이걸 기준으로 안전 정책을 세웁니다.
- 허깅페이스모델 가중치와 데이터셋을 올리고 내려받는 공개 저장소입니다. 오픈웨이트 공개는 사실상 이곳에 파일이 올라온 시점으로 세고, 라이선스 표기도 여기서 확인합니다. 오픈AI 내부 모델이 샌드박스를 나와 코드 실행까지 간 사건의 무대도 이곳의 프로덕션 환경이었습니다.
- 강화학습답을 내게 하고 점수(보상)를 매겨, 점수가 높은 쪽으로 모델을 조금씩 옮기는 학습입니다. RLHF 는 사람 선호를, GRPO 는 여러 답을 서로 비교한 상대 점수를 보상으로 씁니다.
- DNS사람이 읽는 도메인 이름을 서버의 IP 주소 등 접속에 필요한 정보로 찾는 분산 이름 시스템입니다. 일반 웹 접속과 DNS 질의는 서로 다른 통신 경로일 수 있으므로, 웹 접속을 차단했다는 사실만으로 모든 외부 통신이 막혔다고 판단할 수는 없습니다.
- 정렬모델의 행동을 사람이 의도한 목표·가치에 맞추는 일입니다. 유해한 답 거부, 지시 따르기, 속이지 않기가 모두 정렬 문제입니다.
어려운 말은 풀어서, 매주 한 통
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
