이 글 어땠어요?
Introspection이 내놓은 에이전트 레시피 초기판으로, 채점 모델과 평가, 스킬, 하네스 설정을 깃 저장소에 담아 버전으로 관리합니다. 오픈소스 하네스 Pi와 평가 도구 Harbor 위에서 돌아가고, 저장소는 아파치 2.0으로 공개돼 있습니다.
롤란드는 채점 모델과 평가를 만드는 일은 에이전트가 하고, 사람은 그 판단에 동의하는지 보정만 하면 된다고 했습니다. 바뀐 레시피는 오프라인 평가와 실제 사용자 A/B 시험을 거쳐 다음 버전으로 올립니다.
발표에는 고객 수나 채용 에이전트의 개선 폭 같은 숫자가 나오지 않았습니다. 같은 생각을 먼저 실험한 앤트로픽과 Pi, Cursor의 공개 기록에 숫자가 있습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
뉴욕시의회가 10월 5일 AI 4사 정책 책임자를 선서시키고 에이전트가 안전장치를 늘 지키느냐고 물었지만 보장한 회사는 없었습니다. 회사를 떠난 연구자 3명도 증언했고, 의회는 제3자 검증·신고 보상 법안 10건을 심사했습니다.

엔비디아가 9월 28일 Open Agent Safety Platform을 공개했습니다. 자체 실험에서 AI 심사관은 416번 결정 가운데 한 번 속았지만 바깥의 집행 장치가 막았고, 정책 증명기는 아직 MCP·GraphQL 규칙을 검사하지 못합니다.
Respan이 9월 24일 행동 판정 전용 모델 Span-01과 공개 평가 자료를 냈습니다. 입력 100만 토큰당 0.02달러에 전체 F1 0.843이고, 평가의 라벨은 프런티어 모델 두 개의 합의로 만들어졌습니다.

뉴욕시의회가 10월 5일 AI 4사 정책 책임자를 선서시키고 에이전트가 안전장치를 늘 지키느냐고 물었지만 보장한 회사는 없었습니다. 회사를 떠난 연구자 3명도 증언했고, 의회는 제3자 검증·신고 보상 법안 10건을 심사했습니다.

엔비디아가 9월 28일 Open Agent Safety Platform을 공개했습니다. 자체 실험에서 AI 심사관은 416번 결정 가운데 한 번 속았지만 바깥의 집행 장치가 막았고, 정책 증명기는 아직 MCP·GraphQL 규칙을 검사하지 못합니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
롤란드는 공동창업자와 함께 xAI에서 에이전트 인프라를 만들다가, 오래 켜 두고 긴 과제를 맡기는 에이전트를 어떻게 배포할지 따로 풀어야겠다고 판단해 회사를 나왔다고 했습니다. 그는 2025년 11월 24일 X에 Nuraline이라는 이름으로 창업을 알렸고, Introspection 블로그의 첫 글도 같은 날짜로 올라 있습니다. 블로그는 팀이 슈퍼휴먼과 xAI에서 에이전트를 키우며 이 문제를 직접 겪었다고 적었습니다.
@rolandgvcX 게시물 · 원문 보기
xAI에 있는 동안 측정 가능한 방식으로 정의할 수 있는 문제라면 무엇이든 점수를 끌어올릴 길이 보였습니다. 동시에 에이전트 하네스에 들어간 아주 사소한 사람의 실수가 날것의 지능을 망가뜨리는 것도 봤습니다.— 롤란드 가브릴레스쿠, 2025년 11월 X 게시물
롤란드는 발표를 오토리서치(autoresearch) 이야기로 열었습니다. 안드레이 카파시가 3월 공개한 저장소 autoresearch는 AI 에이전트가 GPU 한 장으로 nanochat 학습을 스스로 연구하게 한 실험이고, METR은 4월 이 방식이 nanochat 학습 속도를 끌어올린 사례를 AI 연구 가속의 일화로 꼽았습니다. 롤란드는 2026년 이후 오토리서치를 설계하는 청사진이 세 가지 생각으로 모인다며 루프, 시스템 증류, 와트당 가치를 차례로 꺼냈습니다.
롤란드가 꼽은 첫 루프는 코딩 에이전트가 아니었습니다. AJ라는 사용자가 지금은 OpenClaw로 이름을 바꾼 Clawdbot에게 자동차 값을 깎게 했다는 일화입니다. 에이전트는 레딧에서 시세를 찾고, 재고를 찾고, 딜러들과 대화하며 서로 경쟁을 붙이고, 가격이 맞는지 확인할 방법을 정한 뒤 계약을 잠갔고, 실제로 차를 샀다고 했습니다. 그는 이것을 루프가 곧 제품이 된 첫 사례로 불렀습니다.
그는 이 구조의 뿌리를 1970년대 미 공군이 전투기 조종사의 빠른 판단을 설명하려고 만든 OODA 루프(관찰, 방향 설정, 결정, 행동)에서 찾았습니다. 도구를 부르고 결과를 관찰하는 방식으로 모델이 이미 훈련돼 있다는 겁니다. 이 루프의 한쪽 끝에 신호를, 다른 끝에 검증 가능한 작업을 놓으면 Claude Code 같은 일꾼 에이전트가 됩니다.
신호의 질이 루프의 성공률을 정하고, 검증기의 질이 그 성공이 정말 맞는지를 가려냅니다.— 롤란드 가브릴레스쿠, Introspection 공동창업자
여기에 루프가 하나 더 붙습니다. 첫 루프가 끝날 때 남긴 산출물을 신호로 되먹여 두 번째 루프를 돌리고, 그렇게 계속 나아지게 하는 구조입니다. 그는 이것을 루프를 한 바퀴 더 도는 일이라고 불렀습니다.
두 번째 원칙은 시스템 증류가 해자라는 주장입니다. 첫 루프에서 무엇이 잘되고 무엇이 틀렸는지 알아내 두 번째 루프에 반영하는 능력을 말합니다. 루프 한 번마다 하네스와 설정, 평가, 모델, 도구, 실행 환경에 관한 정보가 나오는데, 이를 옮겨 다닐 수 있게 하고 버전을 매겨 키워 가자는 겁니다.
그는 강화학습의 데이터 레시피를 예로 들었습니다. 연구자들은 환각이나 보상 해킹 같은 행동을 막으려고 데이터 배합을 계속 고쳐 최종 레시피를 만들었는데, 하네스나 AI 시스템 전체에는 아직 그런 레시피가 없다는 겁니다. 그래서 그는 에이전트 레시피를 재현 가능한 최전선 AI 시스템을 만드는 묶음으로 정의했습니다. 회사 안에 두고 직접 소유하며, 어떤 모델이나 제공사를 쓰든 그대로 쓸 수 있어야 한다는 조건을 달았습니다.
| 루프에서 나온 것 | 레시피에서 바꿀 곳 |
|---|---|
| 실패 패턴 | 채점 모델(judge)과 평가 |
| 반복되는 행동 | 스킬과 프롬프트 |
| 사용자의 짜증 | 하네스 확장과 기억 |
Introspection은 이 레시피를 오픈소스 하네스 Pi와 평가 도구 Harbor 위에 얹고, 깃 저장소에 담아 모든 변경과 그 이유를 버전으로 남기게 했습니다. 롤란드는 초기판 Pi recipes를 2025년의 스킬과 비슷하지만 한 걸음 더 나간 것으로 소개했습니다. Introspection의 recipes 저장소는 깃허브에 6월 18일 만들어졌고 첫 시험판은 6월 25일 나왔으며, 라이선스는 아파치 2.0입니다.
Pi는 Earendil이 만드는 오픈소스 에이전트 하네스입니다. Pi 계정은 8월 20일 하네스가 모델을 에이전트로 바꾸는 장치이고 시스템 프롬프트, 도구, 에이전트 루프, 모델 간 번역 레이어 네 가지를 준다고 설명했습니다. 그 설명과 하네스별 비용 차이는 하네스를 다룬 글에서 다뤘습니다.
@pidotdevX 게시물 · 원문 보기
발표 후반은 인재 발굴 에이전트 하나를 고쳐 가는 과정입니다. 출발점은 웹 검색과 링크드인 도구, Codex와 Claude Code 같은 하네스가 퍼뜨린 하위 에이전트, 채용 담당자의 지시문을 담은 시스템 프롬프트입니다. 롤란드는 채용을 회사마다 방식이 다르고, 좋은 채용이 무엇인지를 그 채용을 이끄는 사람이 정하는 전형적인 사례로 소개했습니다.
롤란드가 보여 준 레시피 개선 순서
패턴 찾기
채점 모델 만들기
사람의 보정
레시피 후보와 오프라인 평가
운영 A/B 시험과 승격
빅테크 직원에게 연락을 몰아 보내는 행동은 누구도 미리 규칙으로 적어 두지 않았을 겁니다. 롤란드는 채용 담당자가 원하는 것은 숨은 인재라며, 존 카맥을 데려오려 할 담당자는 없어도 에이전트는 카맥이 훌륭하니 연락하지 않을 이유가 없다고 생각한다는 농담으로 이 대목을 설명했습니다. 이런 행동은 실행 기록을 들여다볼 때 비로소 드러납니다.
평가를 실제로 만드는 데 사람이 필요한 것은 아닙니다. 평가를 보정하는 데 사람이 필요합니다.— 롤란드 가브릴레스쿠, Introspection 공동창업자
그는 채점 모델의 기준을 보정하고 평가를 만드는 일은 그리 어렵지 않아 에이전트가 할 수 있고, 사람은 그 판단에 동의하는지만 말해 주면 된다고 했습니다. 만든 사람의 안목이 평가에 담겼는지 오프라인에서 먼저 보고, 실제 사용자도 그 안목에 동의하는지는 운영 환경에서 확인한다는 순서입니다.
세 번째 원칙은 측정 단위입니다. 롤란드는 와트당 만들어 낸 가치 있는 일(valued work per watt)을 최적화할 점수로 제시했습니다. 그는 Cursor와 Cognition이 최고의 제품을 만들고, 그 제품을 위한 최고의 평가를 만들고, 마지막에 앞의 두 산출물로 최고의 모델을 만드는 순서로 갔다며 이것이 앞으로의 공식이라고 했습니다. 코딩이 처음 성공한 분야이고, 고객 지원과 법률 조사 같은 분야가 뒤따를 것으로 봤습니다.
와트당 얼마나 가치를 얻고 있는가. 그 가치를 어떻게 잴지가 첫 단계이고, 그 가치에 맞는 값을 치르고 있는지 아는 것이 두 번째입니다.— 롤란드 가브릴레스쿠, Introspection 공동창업자
순서는 셋으로 정리됩니다. 기본 하네스와 기본 평가에서 시작해 운영 환경에서 돌려 보며 최전선 수준에 이르고, 그다음 같은 가치를 더 적은 비용으로 만드는 단계로 넘어갑니다. 그는 최전선이 어디인지는 운영해 보기 전에는 알 수 없다고 했고, 마지막 단계에서 따질 것을 사용자가 Claude Code를 떠나 다른 제품으로 옮겨 갈 만큼의 가격 차이로 정리했습니다.
발표에는 성공률이나 비용 같은 숫자가 없습니다. 같은 생각을 먼저 실험한 곳들의 기록에 숫자가 있습니다. 앤트로픽은 2025년 11월 장시간 에이전트 실험에서 나중에 투입된 에이전트가 이미 진척된 것을 보고 일이 끝났다고 선언하는 실패를 겪었습니다. 그래서 첫 에이전트가 claude.ai 복제 앱에 필요한 기능 200개 넘게를 요구 사항 파일로 쓰게 하고, 이후 에이전트는 기능마다 붙은 통과 여부 필드만 고치게 했으며, 테스트를 지우거나 고치는 것은 용납할 수 없다고 강하게 적었습니다.

이 실험의 실패 모드와 해법은 앤트로픽의 하네스 실험을 다룬 글에 정리했습니다. 롤란드의 용어로 옮기면 기능 목록 파일이 신호, 브라우저 끝단 시험이 검증기에 해당하고, 완료 선언은 에이전트의 말 대신 통과 필드로 받았습니다.
와트당 가치도 이미 재는 곳이 있습니다. Cursor는 9월 23일 모델과 가격을 그대로 둔 채 하네스만 고쳐, 매 턴 보내던 시스템 프롬프트의 약 66%를 지우고 사용자 토큰 비용을 품질 그대로 7% 줄였다고 밝혔습니다. 이틀 뒤 Claude Code 팀은 추론 설정(effort)을 가장 낮은 단계에서 가장 높은 단계로 올리자 370번 시도 중 통과가 140번에서 214번으로 늘었다는 실험을 냈고, 높은 설정이 숨은 예외가 많은 과제에서 특히 값을 한다고 적었습니다. 두 숫자는 Cursor와 Claude Code 팀의 실험을 함께 다룬 글에 있습니다.
데이터브릭스는 7월 같은 모델에 하네스만 바꿔 돌린 측정에서 작업 비용이 최대 2.08배 차이 났다고 밝혔습니다. 다만 Opus 4.8 최고 설정에서는 하네스에 따라 통과율도 82%와 89%로 갈렸습니다.
검증기가 허술하면 루프가 무엇을 하는지도 기록이 있습니다. 구글 연구진이 5월 낸 논문에서 나무 탐색 에이전트 ERA에게 하루 동안 햇빛을 가장 많이 받는 입체 태양광 구조를 찾게 하자, 처음 나온 고효율 설계들은 서로 이어지지 않은 단이 허공에 떠 있거나 광학 계산기의 격자 오차를 파고든 꼼수였습니다. 연구진은 코딩 에이전트가 물리 엔진에 제약을 하나씩 덧대게 한 뒤에야 쓸 만한 설계를 얻었습니다.

18분 발표에는 Introspection 고객이 몇 곳인지, 채용 에이전트가 레시피를 몇 번 고쳐 무엇이 얼마나 좋아졌는지가 나오지 않습니다. 자동차 흥정 일화도 사용자 이름 AJ 말고는 출처를 밝히지 않았습니다. 네이선 램버트는 3월 글에서 autoresearch 같은 방식이 테스트 손실 하나처럼 좁은 목표에서만 잘 통한다고 지적했는데, 채용처럼 사람마다 기준이 다른 일에서 채점 모델이 얼마나 오래 맞는지는 이 발표로 알 수 없습니다. 램버트의 관점은 에포크 AI 데냉과의 대담에서 다뤘습니다. 운영 A/B 시험은 비교할 만큼 사용자와 트래픽이 있어야 돌릴 수 있어, 초기 제품이나 사용자가 적은 기업용 에이전트에서는 마지막 단계가 늦어질 수 있습니다.
실행 기록을 평가로 바꾸려면 기록부터 남아 있어야 합니다. 그 기록에는 사용자와 에이전트가 주고받은 대화와 도구 결과가 들어가고, 채용 예시라면 후보자의 공개 정보도 섞입니다. 롤란드는 레시피가 회사 안에 있고 회사가 소유한다는 점을 강조했지만, 그 안에 담기는 기록을 얼마나 오래 무엇까지 보관할지는 발표에서 다루지 않았습니다.
그가 내놓은 공식은 루프가 제품이고, 시스템 증류가 해자이며, 점수는 와트당 가치 있는 일이라는 세 줄로 요약됩니다. 앞의 두 줄은 앤트로픽과 Pi, Cursor가 공개한 실험으로 일부 확인되고, 세 번째 줄의 숫자는 Introspection이 아직 내놓지 않았습니다. 레시피 저장소는 아파치 2.0으로 공개돼 있어 국내 팀도 구조를 내려받아 살필 수 있습니다.
읽어 주셔서 고맙습니다.
초이 드림