이 글 어땠어요?
이미 공개된 전문 설계 모델과 구조 예측 모델을 순서대로 불러 쓰고, 어느 표면을 노릴지와 무엇을 버릴지를 정하는 조율을 맡았습니다. 사람 전문가가 몇 주씩 하던 판단과 운영을 대신한 쪽입니다.
붙었는지와 얼마나 강하게 붙었는지까지입니다. 설계나 복합체의 실험 구조는 하나도 풀지 않아서, 보고서에 실린 입체 구조는 모두 예측입니다.
성과를 낸 Mythos Preview와 Opus 4.8은 일반 연구자가 쓸 수 없습니다. 단백질 설계 같은 이중용도 능력은 공개 모델에서 막혀 있고, 과학자용 접근 프로그램은 예고 단계입니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
Opus 5.5 공개 뒤 정리한 사례 40건 가운데 16건은 이미지·영상 모델 없이 코드로 그림과 소리를 만들었습니다. 12시간을 맡긴 뮤직비디오와 6억 9,700만 토큰짜리 데모까지 나왔지만 성공률을 밝힌 사례는 없었습니다.

앤트로픽이 9월 8일 Claude 비용을 성능 손해 없이 줄이는 방법을 공개했습니다. 단가가 같은 Opus 4.8과 Opus 5 사이에서도 옛 프롬프트를 그대로 쓰자 티켓당 비용이 36% 올랐고, 29CM는 같은 캐시 원칙으로 LLM 비용을 64% 줄였습니다.
새로 연 claude.ai에서 입력할 수 있기까지 걸리던 3.1초가 0.55초로 줄었습니다. 앤트로픽은 8월 2주 동안 Claude와 함께 변경 3,000건 넘게 병합했고 고객 장애와 롤백은 없었다고 밝혔습니다. 3배는 13개 측정의 기하평균입니다.

Opus 5.5 공개 뒤 정리한 사례 40건 가운데 16건은 이미지·영상 모델 없이 코드로 그림과 소리를 만들었습니다. 12시간을 맡긴 뮤직비디오와 6억 9,700만 토큰짜리 데모까지 나왔지만 성공률을 밝힌 사례는 없었습니다.

앤트로픽이 9월 8일 Claude 비용을 성능 손해 없이 줄이는 방법을 공개했습니다. 단가가 같은 Opus 4.8과 Opus 5 사이에서도 옛 프롬프트를 그대로 쓰자 티켓당 비용이 36% 올랐고, 29CM는 같은 캐시 원칙으로 LLM 비용을 64% 줄였습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.

결합체는 표적 단백질의 특정 표면에 달라붙는 작은 단백질입니다. 현대 의약품 상당수가 표적에 붙어 기능을 막거나 바꾸는 방식으로 듣기 때문에, 붙는 분자를 처음부터 설계하는 일은 신약 개발의 앞쪽 공정에 해당합니다. 앤트로픽은 이 공정 하나를 클로드에게 통째로 맡겼고, 만들어 재는 일은 계약 연구 기관인 Adaptyv Bio와 Twist Bioscience가 각각 독립적으로 맡았습니다.
앤트로픽이 클로드에게 준 것은 약 3만 토큰짜리 프롬프트 하나, 인터넷과 논문 자료, 전문 모델을 돌릴 GPU, 그리고 시간입니다. 표적 전부를 한 세션에서 동시에 다루는 방식에는 48시간과 H100 12,500시간, 표적을 하나씩 따로 맡는 방식에는 표적마다 24시간과 H100 2,500시간을 열어 뒀습니다. 기술 보고서에 적힌 클라우드 GPU 예산은 다중 표적 캠페인 한 번에 5만 달러, 단일 표적 캠페인 한 번에 1만 달러입니다.
프롬프트는 표적을 이름과 UniProt 등록번호, 생물종, 결합 상태로만 알려 줍니다. 표적의 어느 표면을 노릴지, 어떤 뼈대를 쓸지, 서열을 어떻게 짤지는 적혀 있지 않습니다. 기술 보고서를 보면 프롬프트 약 1만 6,000단어 가운데 과학 지식과 도구 설명은 34.2%이고, 나머지 3분의 2는 서브에이전트에 일을 나누는 법, 시계와 예산을 배분하는 법, 결과를 보고하기 전에 검증하는 법입니다. 24시간에서 48시간을 혼자 버티게 만든 내용이 과학 지식보다 많았습니다.
설계 도구는 하나도 미리 깔아 두지 않았습니다. 클로드가 공개 저장소에서 받아 컨테이너로 만들고 첫 시간 안에 제대로 도는지 확인하는 것까지 프롬프트에 적힌 절차입니다. 사람이 한 일은 표적을 고르고, 예산과 시간을 정하고, 네트워크 접근 요청을 승인하고, 완성된 설계를 실험실에 주문하고, 돌아온 측정값을 해석한 것입니다. 기반 설비 문제로 세션이 죽었을 때 다시 시작하라고 한 짧은 메시지 말고는 사람의 말이 들어가지 않았습니다.
노력 설정도 기록에 남아 있습니다. Opus 4.8은 추론 노력을 가장 높은 단계로, Mythos Preview는 high로 돌렸습니다. 같은 설정이 청구서와 작업량을 어떻게 움직이는지는 Claude Code의 모델·노력 설정을 다룬 글에 정리해 두었습니다.
클로드가 단백질을 혼자 접어낸 것이 아닙니다. 학계가 이미 쓰고 있는 공개 설계 모델과 구조 예측 모델을 순서대로 물려 후보를 만들고, 계산으로 걸러 내고, 다시 다듬는 과정을 지휘했습니다. 표적의 어느 표면을 노릴지 정하는 일, 어떤 도구를 어떤 비율로 쓸지 정하는 일, 어떤 후보를 버릴지 정하는 일을 클로드가 맡았습니다.

주문된 설계를 만든 구조 생성 도구는 10가지였고, 서열은 대부분 SolubleMPNN이 설계했습니다. 프롬프트는 표적마다 지정된 7가지 방법으로 각각 최소 50개의 뼈대를 만들고 최종 30개를 세 가지 이상에서 뽑되 한 방법이 절반을 넘지 못하게 정해 뒀는데, 그 안에서 조합을 고른 것은 클로드입니다. 시험된 설계는 최적화 전에 24가지 조합을 거쳐 나왔고, 7가지 주요 방법의 적중률은 22%에서 43% 사이였습니다. 클로드가 도구를 골랐기 때문에 이 숫자를 도구끼리의 공정한 비교로 읽으면 안 된다고 보고서는 못 박았습니다.
표적의 어느 표면을 노렸는지도 나중에 확인됐습니다. 자연의 상대 단백질이 붙는 표면이 알려진 표적 10개 가운데 8개에서 설계의 91~100%가 그 표면을 겨냥했습니다. 서열도 새것이었습니다. 시험된 설계 1,315개 가운데 1,285개(98%)는 단백질 구조 데이터베이스의 어떤 사슬과도 30% 이상 일치하지 않았습니다.
Adaptyv Bio는 설계 1,320개를 모두 받아 무세포 방식으로 만들어 센서에 고정하고 표적을 흘려 결합을 쟀습니다. Twist Bioscience는 그중 1,260개를 받아 사람 항체 조각에 붙인 형태로 세포에서 만들어 다른 형식으로 쟀습니다. 두 곳은 서로의 결과를 보지 못했고, 어느 모델이 어떤 순위로 낸 설계인지도 모르는 상태에서 측정했습니다.
앤트로픽은 두 측정을 각각 따로 판정한 뒤 고정된 규칙으로 합쳤습니다. 두 곳 모두에서 측정된 설계 1,235개 가운데 판정이 일치한 것은 1,099개(89%)였고, 엇갈린 136개는 원자료를 하나씩 다시 보고 결정했습니다. 같은 분자를 두 방식으로 재도 판정이 갈리는 구간이 10%쯤 남는다는 이야기입니다.
| 조건 | 모델 | 적중률 |
|---|---|---|
| 표적 전체 동시, 48시간 | Opus 4.8 | 88/390(22.6%) |
| 표적 전체 동시, 48시간 | Mythos Preview | 104/390(26.7%) |
| 표적 하나씩, 24시간 | Mythos Preview | 158/450(35.1%) |
| 업계 통상 보고치 | 사람 전문가 | 10~15% |
업계 통상치 10~15%는 앤트로픽이 공개 설계 데이터베이스 proteinbase의 기록으로 계산한 값입니다. 표에서 볼 대목은 셋째 줄로, 같은 Mythos Preview인데 표적을 한꺼번에 다룰 때와 하나씩 다룰 때의 적중률이 26.7%와 35.1%로 갈렸습니다. 같은 13개 표적으로 좁혀 비교하면 104개와 143개로 벌어지고, 통계 검정에서도 우연으로 보기 어려운 차이였습니다. 다만 단일 표적 방식은 표적마다 전용 세션과 2.8배의 계산 예산을 받았기 때문에, 집중의 효과와 예산의 효과를 갈라낼 수는 없다고 보고서는 적었습니다.
결합력은 다섯 자릿수에 걸쳐 퍼졌습니다. 354개 가운데 194개가 100nM보다 강하게, 90개가 10nM보다 강하게, 42개가 1nM보다 강하게 붙었습니다. 여섯 표적에서는 기존에 발표된 최고 결합력과 같거나 그보다 강한 설계가 나왔습니다.
앤트로픽이 고른 표적 가운데 여섯 개는 Adaptyv Bio가 공개 경진대회나 해커톤을 연 적이 있는 표적입니다. 같은 실험실에서 같은 방식으로 잰 기록이 남아 있어 비교가 됩니다.

가장 차이가 큰 표적은 RBX1입니다. 세포 안에서 특정 단백질을 골라 분해로 보내는 복합체의 한 부분인데, 대회에서는 참가작 245개 가운데 9개가 붙어 3.7%였습니다. 클로드의 설계는 캠페인을 합쳐 90개 중 28개가 붙었고, 표적 하나에 집중한 캠페인만 보면 30개 중 12개로 40%였습니다.
결합력 비교는 같은 판 위에서 이뤄졌습니다. 앤트로픽은 대회 우승작을 다시 합성해 자기 설계와 같은 측정판에 올렸는데, 클로드의 1위 설계가 3.9nM, 우승작이 45nM로 나왔습니다. 우승작이 대회 당시 기록한 값은 26nM이라, 측정판이 달라지면 값도 달라진다는 것을 같은 표가 함께 보여 줍니다. 여섯 표적 가운데 넷에서 클로드의 적중률이 대회 참가작 전체보다 높았고, EGFR과 15-PGDH에서는 차이가 통계적으로 의미 있는 수준이 아니었습니다.
TNFα는 염증 신호를 만드는 단백질이고, 이것을 막는 것이 휴미라 같은 대형 의약품의 작동 원리입니다. 세 개가 뭉친 구조라 두 단위체가 만드는 홈을 노려야 해서 여러 전문가 그룹이 결합체를 만들지 못했다고 보고한 표적입니다.

여기서는 더 유능하다고 평가받는 Mythos Preview의 설계 60개가 모두 실패했고, Opus 4.8의 설계에서만 결합체가 나왔습니다. TNFα 설계 150개 가운데 붙은 것은 12개(8.0%)이고 전부 Opus 4.8 캠페인에서 나왔습니다. 그중 일부는 사람과 원숭이와 쥐의 TNFα에 모두 붙었는데, 동물실험을 하려면 필요한 성질입니다. 앤트로픽은 왜 그런지 모른다고 적고, 캠페인이 한 번씩만 돌았고 두 모델이 서로 다른 구조 생성 도구를 썼기 때문에 모델 차이로 돌릴 수 없다고 덧붙였습니다.
12개는 서로 다른 뼈대 넷에서 나왔습니다. 다중 표적 캠페인의 결합체 여덟 개는 모두 같은 뼈대의 서열 변형이고, 단일 표적 캠페인의 넷은 다른 뼈대 셋에서 나왔습니다. 모델 순위표를 보고 최상위 하나만 붙여 두는 운영은 이런 표적에서 답을 놓칠 수 있습니다.
MBP는 대장균의 당 운반 단백질이고 표면이 매끄럽고 물을 좋아해서 붙잡을 데가 적습니다. 클로드의 설계 90개 가운데 결합이 확인된 것은 없었습니다. 측정 자체는 정상이었습니다. 같은 판에 대조군으로 올린 기존 MBP 결합체는 붙었습니다.

BBF-14는 자연에 없는 인공 구조입니다. 그 자체가 사람이 설계한 단백질이고, 진화 기록이 없는 표면이라 설계 방법을 시험하는 문제로 쓰입니다. 클로드의 설계 90개 가운데 셋이 붙었고 결합력은 0.37, 0.72, 0.98µM으로 약했습니다. 세 설계는 세 캠페인에서 하나씩 나왔고 뼈대도 각각 달랐습니다.
계산 점수는 이 실패를 미리 가려내지 못했습니다. 앤트로픽은 캠페인이 끝난 뒤 시험된 설계 전부를 같은 조건으로 다시 채점했는데, 표적 안에서 결합체와 비결합체를 가르는 능력은 13개 표적 가운데 12개에서 우연보다 나았습니다. 그런데 표적끼리 비교하면 사정이 다릅니다. 실패한 세 표적의 점수 중앙값은 0.68에서 0.70으로, 성공한 VEGF-A나 Nipah G의 0.72와 크게 다르지 않았습니다. 후보 안에서 좋은 것을 고르는 데는 쓸모가 있었고, 이 표적이 어려운 표적인지 미리 알려 주지는 못했습니다.
이 발표에서 실험으로 확인된 것은 붙었는지 아닌지와 얼마나 강하게 붙었는지입니다. 어떤 모양으로 붙었는지는 다릅니다. 기술 보고서는 설계나 복합체의 실험 구조를 하나도 풀지 않았고, 보고서에 실린 모든 입체 구조가 예측이라고 적었습니다. 베타 시트가 든 설계 15개가 정말 그 모양으로 접혔는지도 실험으로 확인되지 않았습니다.
구분이 필요한 대목이 하나 더 있습니다. 베타 시트가 든 설계는 시험된 125개 가운데 16개(12.8%)가 붙어, 알파 나선으로만 이뤄진 설계의 28.4%보다 낮았습니다. 베타 구조는 가닥이 서로 맞물려야 해서 설계가 어렵고 잘못 접히기도 쉽습니다. 프롬프트가 모양의 다양성을 부차 목표로 걸어 둔 덕에 나온 결과이고, 표적과 방법을 맞춰 비교한 값이 아닙니다.
종간 결합도 표적에 따라 갈렸습니다. 원숭이 단백질까지 측정된 결합체 179개 가운데 154개가 원숭이 쪽에도 붙었지만, 쥐 단백질은 233개 가운데 130개였습니다. TREM2에서는 69개 중 68개가 쥐 단백질에 붙었고 PD-L1에서는 36개 중 2개였는데, 두 표적의 사람 단백질과 쥐 단백질 사이 서열 일치도는 73%로 같습니다. 설계가 닿는 표면에 종간 차이가 몇 군데 있는지를 세어 봐도 결합 여부를 예측하지 못했습니다. 종간 결합은 표적의 성질이었고, 지금은 만들어 재 보기 전에 알 방법이 없습니다.
표적을 고른 방식도 숫자를 읽는 조건입니다. 대부분은 설계 벤치마크에서 자주 쓰여 비교가 가능한 표적이고, 학습 자료에 기록이 없는 새 표적은 두 개였습니다. 익숙한 표적에서 나온 성적이 처음 보는 표적에서 그대로 재현될지는 이 실험만으로 답이 나오지 않습니다.
무엇보다 결합체는 약이 아닙니다. 앤트로픽도 강하게 붙는 분자를 만드는 일이 약이 되기까지의 첫 단계일 뿐이라고 적었습니다. 결합 뒤에는 독성과 안정성, 생산성, 임상이 남아 있고 그 구간의 실패율은 이번 실험이 건드리지 않았습니다.
캠페인마다 클로드는 표적별 설계 30개에 순위를 매겨 넘겼고, 앤트로픽은 그 순서를 고치지 않고 그대로 주문했습니다. 결과를 보면 순위가 결합과 맞물려 있었습니다. 1위 설계만 모으면 적중률이 49%, 상위 5개는 44%, 상위 10개는 39%였고, 30개 전체는 28%였습니다.
이 숫자가 국내 연구실에 주는 의미는 합성과 측정 비용 쪽에 있습니다. 표적마다 1위 하나만 만들어 재도 41개 순위표 가운데 20개에서 결합체를 건졌고, 상위 5개까지 만들면 27개에서 건졌습니다. 후보를 수백 개 만들어 거르는 대신 잘 고른 다섯 개를 만드는 운영이 가능해진다는 이야기입니다. 다만 순위의 정확도는 계산 점수와 거의 같았고, 클로드가 그 점수 위에 얹은 판단이 점수를 넘어서지는 않았습니다.
공개 자료의 규모도 이번 발표에서 달라졌습니다. 앤트로픽은 설계 1,440개의 계산 모형과 측정값 1,320건을 허깅페이스에 공개했습니다. 기술 보고서에 따르면 공개된 두 대형 모음집을 합쳐도 표적 40개에 설계 5,700개, 결합체 약 770개 규모라, 이번 한 번의 공개가 공개 자료를 크게 늘렸습니다.
발표에는 이미 만든 물질을 확인하는 실험이 하나 더 실렸습니다. 화학자는 분자를 하나 만들 때마다 그것이 의도한 물질이 맞는지, 얼마나 순수한지를 장비로 재고 손으로 해석합니다. 장비가 도는 시간은 몇 분이고 해석이 오래 걸리는데, 시료 하나에 30분에서 한 시간이 드는 작업입니다.

앤트로픽은 계약 실험실의 원본 측정 파일과 한두 문장짜리 지시만 일반 공개 모델인 Opus 5에 줬습니다. 두 세션이 나란히 돌아 각각 23분과 19분 만에 처리된 결과가 나왔고, 봉우리마다 센 수소 개수는 실험실 값과 0.08개 안쪽에서 맞았습니다. 순도는 96.4%로 실험실이 낸 96.33%와 거의 같았습니다.

과정에서 짚어 볼 대목이 둘 있습니다. 클로드는 첫 판독에서 네 봉우리가 모두 사라졌다고 적었다가 자기 검토에서 둘만 사라졌다고 바로잡았습니다. 그리고 실험실 운영자가 3일 뒤 따로 돌렸던 것과 같은 후속 실험을 스스로 제안했습니다. LC-MS 원본은 제조사 소프트웨어로만 열리는 형식인데, 클로드는 인코딩 방식을 알아낸 뒤 장비가 기록한 2,664개 측정값의 합계를 스스로 재현해 파일을 제대로 읽었는지 확인하고 나서 분석에 들어갔습니다.
이쪽 실험이 국내에서 먼저 쓰일 가능성이 큽니다. 새 후보를 만드는 일과 달리 이미 쌓인 자료를 다시 읽는 일이고, 쓰인 모델이 일반 공개 모델 Opus 5입니다. 국내 연구소와 대학 실험실에는 제조사 전용 형식으로만 열리는 측정 파일이 수년치씩 쌓여 있습니다.
이번 성과를 낸 Mythos Preview와 Opus 4.8은 일반 연구자가 쓸 수 없습니다. 앤트로픽은 단백질 설계 같은 이중용도 생물학 능력을 일반 공개 모델 Fable 5에서 막아 뒀고, 같은 능력이 병원체 설계에도 쓰일 수 있다는 이유를 발표문에 그대로 적었습니다. 과학자용 접근 프로그램을 최우선 과제로 준비하고 있으며 곧 알리겠다는 것이 현재 상태입니다.
그래서 다음에 볼 지점은 적중률보다 접근 조건이라고 봅니다. 누구에게 어떤 검증을 거쳐 열어 주느냐에 따라 이 방식이 제약사 몇 곳의 내부 자산으로 남을지 연구실 단위로 퍼질지가 갈립니다. 쓰인 설계 도구가 전부 공개돼 있고 프롬프트와 측정 자료까지 공개된 상태라, 지금 잠겨 있는 것은 그 도구를 지휘한 모델 하나입니다.
국내 바이오 업계에는 갈라 볼 대목이 하나 더 있습니다. 설계가 값싸지면 다음 병목은 만들어 재는 쪽으로 옮겨 갑니다. 이번에도 설계는 48시간에 끝났고 결합을 확인하는 데는 두 실험실의 몇 주가 들었습니다. 위탁생산과 분석을 축으로 성장한 국내 기업들이 서 있는 곳이 그 병목 쪽입니다.
사람이 빠진 채 같은 방식으로 나온 다른 결과는 클로드가 리만 제타 함수 기록을 하루 반 만에 넘긴 기록에 있습니다. 수학 쪽은 검증이 몇 분이면 끝나고, 이번 실험은 검증에만 몇 주가 들었습니다. 검증이 느린 분야에서 자율 연구의 성적이 나온 첫 기록이라는 점이 이번 발표의 위치입니다.
읽어 주셔서 고맙습니다.
초이 드림