이 글 어땠어요?
결과가 나오면 맞았는지 그대로 적어요.
앤트로픽이 탐지 API를 자격을 갖춘 기관부터 제한적으로 연다
9월 1일 갱신된 설명에 따르면 탐지 API는 비공개 프리뷰로, EU 법이 정한 규제·수사 기관과 언론, 팩트체커, 독립 연구자, 교육기관, EU 시민단체, 준수 의무가 있는 기업에 먼저 열렸습니다.
다른 주요 모델 개발사도 각자의 텍스트 워터마크를 넣는다
앤트로픽은 약 190개 서명 조직 가운데 다른 주요 개발사도 같은 EU 실천규약에 서명했다고 밝혔습니다.
아무것도 더하지 않습니다. 숨은 문자나 추가 토큰 없이, 비슷하게 그럴듯한 단어 가운데 하나를 고를 때 쓰는 무작위 값의 출처만 비밀키로 바꿉니다.
맞춤법과 문장부호만 고친 글에는 표시가 거의 남지 않을 수 있고, 클로드가 모든 단어를 고르는 번역문에는 표시가 남습니다.
알 수 있는 것은 클로드가 글의 일부에 관여했을 가능성까지입니다. 클로드가 썼는지 많이 고쳤는지는 구분하지 못하고, 사용자나 조직을 추적할 정보도 담기지 않습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
앤트로픽이 10월 1일 공개한 로봇 노출 지수에서 로봇은 미국 물리 과업의 74%, 전체 노동시간의 34%를 해낼 수 있었습니다. 사람보다 싼 일은 0.3%였고, 로봇 가격이 지금 추세로 내리면 10%까지 40년이 걸립니다.

로이터가 9월 28일 입수해 보도한 앤트로픽 투자설명서 초안에 따르면 2025년 매출은 45억 9,000만 달러로 12배, 영업손실은 80억 6,000만 달러였습니다. 앞으로 낼 연산 약정 5,180억 달러의 약 80%는 무를 수 없습니다.
앤트로픽이 8월 11일 클로드가 만든 텍스트에 보이지 않는 워터마크를 넣는다고 밝혔습니다. 모델 단계에서 넣어 전 세계 출력에 붙고, 코드와 번역·교정 결과물에도 남습니다. 원리와 품질 영향, 지우는 공격, 한국 사용자에게 생기는 문제를 정리했습니다.

앤트로픽이 10월 1일 공개한 로봇 노출 지수에서 로봇은 미국 물리 과업의 74%, 전체 노동시간의 34%를 해낼 수 있었습니다. 사람보다 싼 일은 0.3%였고, 로봇 가격이 지금 추세로 내리면 10%까지 40년이 걸립니다.

로이터가 9월 28일 입수해 보도한 앤트로픽 투자설명서 초안에 따르면 2025년 매출은 45억 9,000만 달러로 12배, 영업손실은 80억 6,000만 달러였습니다. 앞으로 낼 연산 약정 5,180억 달러의 약 80%는 무를 수 없습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
8월 11일 지원 문서는 워터마크를 넣는다는 사실과 적용 범위를 알렸고, 원리와 우회 방법은 클로드 텍스트 워터마크의 원리와 약점을 다룬 글에 정리했습니다. 이번 설명은 그 표시로 무엇을 말할 수 있고 무엇을 말할 수 없는지를 회사가 직접 적었다는 데 쓸모가 있습니다.
언어 모델은 한 번에 한 단어씩 씁니다. 「오늘 날씨는 춥고」 다음에는 「흐렸다」와 「잿빛이었다」가 비슷하게 그럴듯하고, 어느 쪽을 골라도 뜻은 거의 같습니다. 이런 선택에서는 보통 무작위 값이 답을 정합니다. 워터마크는 이 무작위 값을 비밀키와 바로 앞의 몇 단어로 만든 값으로 바꿉니다. 선택은 여전히 무작위처럼 보이지만, 키를 가진 쪽은 단어 배열이 그 키로 골랐을 때의 선택과 맞아떨어지는지 확인할 수 있습니다.
앤트로픽은 이것을 모노폴리 같은 보드게임에 빗댔습니다. 말을 옮길 때 주사위 대신 원주율 숫자를 차례로 읽어 쓰면, 게임하는 사람에게는 여전히 무작위 이동입니다. 그런데 게임이 끝난 뒤 이동 기록 전체를 보면, 원주율을 아는 사람은 그 게임이 원주율로 진행됐는지 알아낼 수 있습니다.

앤트로픽은 이 방식이 SynthID-Text를 바탕으로 했고, 2022년 스콧 에런슨이 제안한 방식에서 이어지는 계열이라고 밝혔습니다. 워터마크는 모델을 특정 단어 쪽으로 계속 기울이지 않고, 원래라면 쓰지 않았을 낯선 단어를 고르게 하지도 않는다고 설명했습니다. 글에 덧붙는 문자나 숨은 기호가 없고, 추가 토큰도 쓰지 않아 속도와 가격에도 영향이 없다고 했습니다.
앤트로픽은 내부 시험에서 워터마크가 클로드 글의 내용과 창의성, 읽기 쉬움에 영향을 주지 않았다고 밝혔습니다. 근거로는 구글 딥마인드의 SynthID-Text 논문을 들었습니다. 제미나이 트래픽 일부에 워터마크 모델을 내보내 긍정 평가와 부정 평가 비율을 비교했더니 통계적으로 유의한 차이가 없었고, 사람 평가자가 두 답을 함께 놓고 비교해도 품질 차이를 찾지 못했다는 결과입니다.
앤트로픽의 내부 시험 방법과 수치는 공개되지 않았습니다. 구글의 결과는 구글의 방식과 설정을 잰 것이고, 앤트로픽이 클로드에 건 설정이 같은 결과를 내는지는 회사 설명에 기댈 수밖에 없습니다.
표시는 클로드가 직접 고른 단어에만 붙습니다. 사람이 쓴 글의 문법과 문장부호만 고치게 하면 클로드가 고친 몇 군데에만 표시가 들어갈 수 있어서, 탐지에 걸릴 만큼 쌓이지 않을 수 있습니다. 반대로 번역문은 모든 단어를 클로드가 고르니 표시가 온전히 붙는다고 앤트로픽은 적었습니다.
답이 하나뿐인 대목도 표시가 비어 갑니다. 「아이작 뉴턴의 대표작은 『프린키피아』」 다음에 올 말은 「마테마티카」 하나뿐이라 표시가 들어갈 틈이 없습니다. 코드도 대부분 정확해야 하는 글이라 다른 글보다 표시가 적고, 주석처럼 단어를 자유롭게 고를 수 있는 곳에만 들어갑니다. 앤트로픽은 실제 동작하는 코드에 미치는 영향은 무시할 만하다고 설명했습니다.
이 원리를 실무에 옮기면 들인 노동과 표시의 세기가 거꾸로 움직입니다. 자기가 쓴 한국어 원고를 클로드로 영어로 옮기기만 한 사람의 글에는 표시가 진하게 남고, 초안을 클로드에게 통째로 맡긴 뒤 사람이 거의 새로 쓰다시피 고친 글에는 표시가 흐려집니다. 탐지 결과를 성실성의 잣대로 쓰는 곳이 생기면, 영어 번역에 모델을 쓰는 비영어권 작성자가 먼저 걸립니다.
앤트로픽은 키로 답할 수 있는 질문이 「이 글의 일부를 클로드가 썼을 가능성은 얼마인가」 하나라고 적었습니다. 사람이 썼는지는 확인해 주지 못하고, 다른 회사의 AI가 쓴 글도 알아보지 못합니다. 다른 AI가 워터마크를 쓰더라도 키와 방식이 다르기 때문입니다. 「클로드가 썼다」와 「클로드가 많이 고쳤다」도 구분하지 못합니다.
표시에는 사용자나 조직, 대화를 알아볼 정보가 없어서, 워터마크나 키로 특정 개인을 추적할 수 없다고 했습니다. 가볍게 고치면 표시가 다 지워지지 않지만, 모든 단어를 바꿔 새로 쓰면 지워집니다. 워터마크는 소유권이나 저작자를 판정하지 않고, 이용 약관상 사용자의 권리나 법적 책임에도 영향을 주지 않는다고 밝혔습니다.

글 길이의 영향도 큽니다. SynthID-Text 논문 실험에서 오탐률을 1%로 묶으면, 토큰 400개 길이의 글에서도 탐지율이 90%에 못 미쳤습니다. 50토큰 안팎의 짧은 글은 60% 넘게 판정을 유보했습니다. 앤트로픽도 짧은 글에서는 탐지가 잘 되지 않고, 글이 길수록 판단의 확신이 커진다고 적었습니다.
앤트로픽은 Pangram 같은 AI 탐지 서비스와 워터마크의 차이도 설명했습니다. 탐지 서비스는 키가 없어서 AI 글에 자주 나오는 말버릇을 봅니다. 앤트로픽이 예로 든 말버릇은 「이건 X가 아니고 Y다」 같은 구문과, 사람보다 훨씬 자주 쓰는 「조용히(quietly)」라는 단어였습니다. 문체를 추측하는 방식이라 사람이 쓴 글이 우연히 비슷하면 걸리고, 워터마크는 키와의 일치를 계산한다는 점에서 원리가 다릅니다.
앤트로픽은 워터마크를 EU AI 법을 지키려고 넣는다고 밝혔습니다. 앤트로픽은 7월 약 190개 서명 조직과 함께 AI 생성 콘텐츠의 투명성에 관한 EU 실천규약에 서명했고, 이 규약은 AI 시스템 제공자에게 생성 텍스트를 표시하는 방법을 쓰라고 요구합니다. 출시 시점부터 전 세계에 적용하는 이유로는 아직 지역별로 안정적으로 나눠 적용할 방법이 없다는 점을 들었습니다. 8월 2일 이전에 나온 모델은 EU 법의 전환 기간에 맞춰 몇 달에 걸쳐 워터마크를 추가합니다.
앤트로픽은 다른 주요 모델 개발사도 같은 규약에 서명했고 각자의 워터마크를 넣을 것이라고 적었습니다. 키와 방식이 회사마다 다르면 모든 AI를 한 번에 가리는 판별기는 나오기 어렵고, 문서 한 건을 검사하려면 회사마다 따로 확인하는 수밖에 없습니다. 사람과 여러 모델이 함께 고친 문서라면 한 회사의 결과만으로 작성 과정을 설명할 수 없습니다. 규약 밖에서 직접 돌리는 오픈웨이트 모델의 출력에는 처음부터 표시가 없어서, 탐지를 돌리면 규정을 지킨 제공자의 출력만 걸리는 구조도 생깁니다.
앤트로픽은 비밀키를 공개하는 대신 탐지 API를 제공할 계획이라고 밝혔고, 8월 14일 기준으로 누가 쓸 수 있는지와 요금, 요청 제한, 판정 기준은 정해지지 않았습니다. 이 결정에는 두 방향의 압력이 걸립니다. 누구나 반복해서 검사할 수 있게 열면, 같은 문장을 조금씩 바꿔 넣으며 어디서 판정이 뒤집히는지 추적해 표시를 지우거나 남의 글에 심는 공격이 쉬워집니다. 좁게 열면 우회는 어려워지지만 판정 권한이 앤트로픽과 일부 기관에 모입니다.
탐지 결과가 과제 제출이나 원고 접수, 채용 서류 시스템에 연결되면 기준값 하나가 수많은 판정을 한꺼번에 정합니다. 결과 화면에 글 길이와 판정 기준, 판정 유보 여부가 함께 나오지 않으면, 우연히 점수가 높게 나온 짧은 글과 자기 원고를 옮긴 번역문을 가려낼 방법이 없습니다. 국내 대학과 기업이 이런 도구를 들이는 시점에 재검사와 이의제기 경로가 함께 갖춰져 있는지가, 워터마크가 오용 감시 도구로 쓰일지 개인 판정 도구로 쓰일지를 가릅니다.
읽어 주셔서 고맙습니다.
초이 드림