
저장소를 읽고 명령을 실행하며 코드를 끝까지 고치는 에이전트입니다. 최근 모델 도약이 지식 문답 대신 이쪽에 몰려서, 딥시크 V4-Pro는 코딩 에이전트 평가 DeepSWE에서 12.8점이 62.7점이 됐습니다. 같은 모델도 어떤 하네스에 올리느냐에 따라 점수가 크게 달라집니다.
용어 자세히 보기







Cline Desktop은 DeepSeek-V4.1-Flash, Musespark-1.3 같은 오픈 가중치 모델부터 원하는 API 모델까지 연결할 수 있습니다.
Claude Code나 Codex에서 진행하던 작업을 가져와 다른 모델로 그대로 이어서 작업할 수도 있습니다.
에이전트 예약 실행도 지원합니다.
예를 들어 매일 아침 PR 검토, 밤마다 보안 검사, 매주 문서 업데이트를 자동으로 돌릴 수 있고 웹 검색, 음성 입력, MCP·Skills·플러그인 설치까지 한곳에서 관리합니다.
특정 모델에 묶이지 않고 원하는 모델과 도구를 골라 자신만의 코딩 에이전트 환경을 만드는 방향입니다.
현재 macOS와 Windows에서 베타로 이용할 수 있습니다.
Choi
Claude Code나 Codex에서 하던 작업을 다른 모델로 이어 갈 수 있어, 사용자가 특정 모델 회사의 도구에 묶이지 않습니다. 예약 실행까지 붙어 사람이 부르지 않아도 에이전트가 정해진 시간에 PR 검토 같은 일을 합니다.
ARC-AGI-3는 규칙을 알려주지 않은 채 직접 부딪히며 알아내야 하는 시험입니다.
지난 3월만 해도 최상위 모델조차 1%를 넘기지 못했습니다.
AVO가 사용한 모델은 Claude Opus 5입니다.
모델만 단독으로 돌리면 30% 수준이지만, 자체 하네스를 붙이자 만점까지 올라갔습니다.
AVO는 원래 엔비디아가 자사 GPU 커널을 최적화하기 위해 만든 내부 도구입니다.
모델은 다른 회사 것을 가져다 써도, 에이전트를 더 오래, 더 깊게 움직이는 실행 도구를 쥐면 어떤 모델이 이기든 GPU 수요는 엔비디아로 흐를 수밖에 없습니다.
모델의 Nemotron, 서빙의 Dynamo에 이어 이제 하네스까지, 엔비디아는 칩 위에서 도는 소프트웨어를 하나씩 직접 만들어 왔습니다.
Choi
같은 Opus 5가 단독으로는 30% 수준이었고 엔비디아 하네스를 붙이자 만점이 나와, 점수 차이는 모델 밖의 실행 도구에서 나왔습니다.
fx는 원래 Vercel 내부에서 사용하던 도구입니다.
설치 파일이 6.3MB에 불과하고 실행 속도와 메모리 사용량을 최대한 줄인 것이 특징입니다.
쉽게 말하면 Cursor나 Claude Code처럼 많은 기능을 넣는 대신, AI 모델 성능 테스트나 제한된 환경에서 빠르게 코딩 작업을 시키는 데 초점을 맞췄습니다.
특정 AI 모델에 묶이지 않아 로컬·클라우드 모델을 사용할 수 있고, skills·plugins·MCP로 기능을 추가할 수도 있습니다.
사용 기록은 로컬에 저장되며 제품 사용 정보를 수집하는 텔레메트리도 없습니다.
현재는 실험 단계라 기능이 자주 변경될 수 있습니다.
Choi
fx는 특정 모델에 묶이지 않고 기능을 줄여 설치 파일이 6.3MB라, 여러 모델을 같은 도구에 붙여 성능을 비교하거나 자원이 제한된 환경에서 돌리는 용도로 만들어졌습니다.
지난주 Grok Build가 실행된 저장소를 통째로 자사 클라우드에 올려온 사실이 네트워크 분석으로 드러난 뒤 나온 조치입니다.
실제 코딩 작업에는 192KB면 충분했는데 5.1GB가 올라갔고, 읽지 말라고 지정한 파일과 지워진 시크릿까지 딸려 갔습니다.
SpaceXAI는 코드 공개와 함께 전 사용자 사용량 제한을 초기화하고, 데이터 보존을 기본값에서 끈 뒤 그동안 쌓인 기록도 전부 삭제했다고 밝혔습니다.
코드가 열렸으니 그 하네스가 내 저장소에서 무엇을 하는지 직접 읽어 확인할 수 있습니다.
Choi
SpaceXAI는 코드 공개와 함께 데이터 보존을 기본값에서 끄고 쌓인 기록을 삭제했다고 밝혔고, 사용자는 하네스가 저장소에서 무엇을 하는지 코드로 직접 확인할 수 있습니다.
한 보안 연구자가 네트워크 트래픽을 직접 분석한 결과입니다.
12GB 저장소에서 실제 코딩 작업에 오간 데이터는 192KB였는데, 별도 채널로 5.1GB가 xAI의 저장 버킷에 올라갔습니다.
저장소를 통째로 묶어 올리는 방식이라 에이전트에게 읽지 말라고 지정한 파일, 과거 커밋 이력, 지워진 시크릿까지 전부 딸려 갑니다.
'모델 개선' 옵트아웃을 꺼도 업로드는 계속됐습니다.
xAI는 분석이 공개된 다음 날 서버 쪽 숨은 플래그로 업로드를 중단했고, 수집 범위나 삭제 계획에 대한 공지는 아직 없습니다.
어차피 다 가져가지 않냐는 반응도 있지만, 재현 가능한 증거로 잡힌 이상 이야기가 다릅니다.
회사 코드에 에이전트를 붙이기 전에 네트워크 단 검증을 요구하는 흐름은 더 커질 것 같습니다.
Choi
옵트아웃을 꺼도 전송이 이어졌다는 대목이 약관보다 네트워크 검증을 앞세우게 만듭니다. 삭제 계획이 아직 없다는 점도 남습니다.
Claude Code, Codex 등 다양한 코딩 에이전트에서 사용할 수 있는 오픈소스 스킬 모음으로, 요구사항을 구체화하는 인터뷰부터 명세서 작성, 작업 티켓 생성, TDD, 버그 진단, 코드 리뷰, 코드베이스 설계 개선까지 실제 개발 과정에서 자주 필요한 작업을 지원합니다.
AI가 요구사항을 잘못 이해하거나, 코드 품질이 들쭉날쭉한 문제가 있다면 프롬프트를 계속 수정하는 대신 이러한 스킬을 함께 활용하는 것이 더 도움이 될 수 있습니다.
Choi
요구사항 인터뷰부터 명세서, 티켓, TDD, 코드 리뷰까지 작업 절차를 문서로 고정해 에이전트 결과의 편차를 줄이려는 접근입니다.
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.