이 글 어땠어요?
창 크기는 32K로 두고 창 안에 무엇을 남길지를 모델이 정하도록 훈련합니다. 같은 Qwen3-14B가 128K 창으로 받은 평균 53.26점보다 32K 창에서 정리하며 푼 72.20점이 높았고, 턴마다 읽는 입력은 8,000~1만 토큰에 머물렀습니다.
코드는 Apache 2.0이라 상업적으로 쓸 수 있습니다. 8B·14B·E4B 가중치 3종은 라이선스 첫 조항에 과학 연구·개발 목적으로만 쓸 수 있다고 적혀 있어, 서비스에는 코드로 자기 모델을 다시 훈련해 쓰게 됩니다.
논문은 영어 긴 문서 시험과 영어·중국어 검색 시험으로만 평가했습니다. 한국어 결과는 아직 없습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
8월 27일 arXiv에 올라온 Falcon은 선형 어텐션의 기억 갱신을 작은 예측기의 실시간 학습으로 보고 규칙 여섯 개를 내놨습니다. 32자리까지 배운 덧셈을 33~48자리로 늘린 시험에서 87.2%로 트랜스포머(65.8%)를 앞섰습니다.

딥시크 V4.1-Flash 보고서가 9월 17일 arXiv에 올라왔습니다. 전역 KV 캐시는 토큰당 890바이트로 V4-Flash의 4분의 1, SSD에 두는 캐시는 8분의 1이고, 문맥을 4K에서 1M으로 늘려도 토큰 하나 생성 계산은 4분의 1만 늘었습니다.
9개 기관 연구진 33명이 75쪽 논문에서 자기개선 연구 491편을 다섯 단계로 나눴습니다. 개선 절차까지 고쳐 물려주는 L5는 29편이었고, 그 절차가 다음 세대를 더 잘 만든다는 효과는 아직 통계로 확인되지 않았습니다.

8월 27일 arXiv에 올라온 Falcon은 선형 어텐션의 기억 갱신을 작은 예측기의 실시간 학습으로 보고 규칙 여섯 개를 내놨습니다. 32자리까지 배운 덧셈을 33~48자리로 늘린 시험에서 87.2%로 트랜스포머(65.8%)를 앞섰습니다.

딥시크 V4.1-Flash 보고서가 9월 17일 arXiv에 올라왔습니다. 전역 KV 캐시는 토큰당 890바이트로 V4-Flash의 4분의 1, SSD에 두는 캐시는 8분의 1이고, 문맥을 4K에서 1M으로 늘려도 토큰 하나 생성 계산은 4분의 1만 늘었습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
논문은 기존 방법의 한계를 세 가지로 짚었습니다. 정리 도구가 검색·삭제·요약에 그치고, 강화학습 과정에서 결과를 크게 흔드는 편집과 별 영향이 없는 편집을 똑같이 탐색하며, 마지막 정답 여부 하나로 중간 편집을 모두 채점한다는 것입니다. ContextPilot은 도구를 여덟 개 늘리고 탐색과 채점 방식을 새로 짜서 이 세 가지를 차례로 메웠습니다.
에이전트는 생각하고, 도구를 부르고, 그 결과를 받는 과정을 모두 컨텍스트 뒤에 덧붙이며 일합니다. 널리 쓰이는 ReAct 방식이 이렇게 움직이는데, 검색을 수십 번 되풀이하는 딥리서치나 소설 한 권을 읽고 답하는 과제에서는 이 기록이 끝없이 불어납니다.
논문이 쓴 시험지의 크기를 보면 사정이 드러납니다. 소설을 읽고 답하는 NovelQA는 평균 입력이 약 11만 9,000토큰이고, 고정된 문서 더미에서 답을 찾아내는 딥리서치 시험 BrowseComp+는 평균 55만 2,000토큰입니다. 128K 창에는 BrowseComp+ 입력의 4분의 1도 들어가지 않습니다.
지금까지 이 문제는 대개 사람이 정한 규칙으로 다뤘습니다. 컨텍스트가 일정 길이를 넘으면 오래된 도구 결과를 지우거나 요약하는 식입니다. 논문은 이런 방식이 모델에게 자기 컨텍스트를 다룰 권한을 전혀 주지 않고, 과제가 달라질 때마다 규칙을 새로 짜게 만든다고 지적했습니다.
앤트로픽이 2025년 9월 29일 Claude 개발자 플랫폼에 넣은 컨텍스트 편집이 대표적인 예입니다. 토큰 한도에 가까워지면 오래된 도구 호출과 결과를 자동으로 지우는 기능이고, 컨텍스트 창 밖의 파일에 정보를 적어 두는 메모리 도구와 함께 나왔습니다. 앤트로픽은 100턴짜리 웹 검색 평가에서 컨텍스트 편집이 토큰 사용량을 84% 줄였고, 메모리 도구와 함께 쓰면 사내 에이전트 검색 평가에서 성능이 기준보다 39% 올랐다고 밝혔습니다.
@claudeaiX 게시물 · 원문 보기
직접 규칙을 짜 본 회사의 기록도 있습니다. AI 모델 관측·평가 도구를 만드는 Arize의 샐리앤 델루시아는 AI Engineer 채널이 5월에 공개한 발표에서, 트레이스 데이터를 분석하는 자사 에이전트가 자기가 불러온 데이터로 컨텍스트를 넘치게 만들던 문제를 소개했습니다. 앞부분만 남기고 자르자 에이전트가 그 뒤 내용을 잊어 후속 질문을 새 대화처럼 받았고, 모델에게 요약을 맡기자 무엇을 남길지 통제할 수 없었다고 합니다.
최종안은 앞 100자와 뒤 100자만 남기고 가운데는 메모리 저장소에 넣어 뒀다가 필요할 때 꺼내는 방식이었습니다. 발표자는 아직 원칙 있는 컨텍스트 예산도, 컨텍스트 품질을 재는 지표도 없다고 털어놨습니다. 지금은 평가를 돌려 보며 컨텍스트를 다룬 결정이 맞았는지 확인한다고 했습니다.
같은 8월 28일, 텐센트는 100만 토큰 넘게 읽을 수 있는 7,700억 파라미터 모델 Hy4 프리뷰의 가중치도 Apache 2.0으로 풀었습니다. 창을 넓히는 경쟁이 100만 토큰대에 와 있으니, 길이 문제는 하드웨어와 모델 구조가 풀어 줄 일처럼 보입니다.
ContextPilot 논문의 숫자는 다른 쪽을 가리킵니다. Qwen3-14B 원래 모델은 128K 창을 다 쓰고도 네 시험 평균 53.26점에 그쳤는데, ContextPilot으로 훈련한 같은 모델은 32K 창에서 72.20점을 냈습니다. 여기서 32K는 입력 3만 토큰과 출력 2,000토큰을 합친 한도입니다.
평균 차이 18.94점 가운데 12.31점이 BrowseComp+ 한 과목에서 나왔습니다. 원래 모델은 평균 55만 토큰짜리 이 시험을 128K 창으로 치러 6.27점을 받았고, ContextPilot은 55.50점을 받았습니다. BrowseComp+를 빼고 나머지 세 과목만 평균 내도 68.92점 대 77.76점으로 9점 가까이 벌어집니다.
큰 모델에서도 같은 결과가 나왔습니다. 3,970억 파라미터 가운데 토큰마다 170억 개만 쓰는 Qwen3.5-397B-A17B는 도구 없이 256K 창으로 풀었을 때 평균 80.55점이었고, 32K 창에서 정리 도구를 받았을 때는 87.16점이었습니다. 창을 8분의 1로 줄이고도 6.61점이 올랐습니다.
모델에게 정리 도구를 쥐여 주자는 생각은 ContextPilot이 처음 낸 것이 아닙니다. 텐센트 연구진이 올해 ICLR에 낸 StateLM은 이 문제를 해리 포터의 펜시브(기억을 꺼내 담아 두는 그릇)에 빗댔습니다. 데이터베이스와 검색 시스템이라는 펜시브는 이미 있는데 모델 손에 지팡이가 없어서, 사람이 짜 준 컨텍스트를 기억의 전부로 받아들인다는 겁니다. StateLM은 색인 만들기, 컨텍스트 지우기, 메모 적기 같은 도구를 모델에게 주고 쓰는 법을 훈련했습니다.
ContextPilot은 StateLM의 도구 9개 위에 8개를 더했습니다. plan은 일을 시작하기 전에 짧은 계획을 적는 도구입니다. memorize는 인물·시점·사건을 뽑아 구조화된 기억으로 저장하고 관련 항목끼리 이어 두며, readMemory는 그 기억을 이웃 항목과 함께 불러옵니다.
세 번째 묶음은 소프트 오프로딩(당장 쓰지 않는 내용을 지우지 않고 덜어 두는 것)입니다. summarizeContext는 메시지를 요약본으로, compressContext는 LLMLingua-2 같은 경량 압축 모델로 줄인 판으로 바꿔 넣습니다. foldHistory는 지난 기록 전체를 키워드와 요약으로 접어 두는데, 나중에 그 키워드로 검색하면 접은 내용을 다시 찾을 수 있습니다. 기존 deleteContext는 메시지를 빈 표시로 바꿔 버려서 한 번 지우면 되살릴 방법이 없었습니다.
| 범주 | StateLM에서 이어받은 도구 | 새로 넣은 도구 |
|---|---|---|
| 파악·계획 | analyzeText, checkBudget | plan |
| 정보 찾기 | buildIndex, searchContext, readChunk | readMultiChunks |
| 기억 관리 | note, updateNote, readNote | memorize, updateMemory, readMemory |
| 덜어 두기 | deleteContext | summarizeContext, compressContext, foldHistory |
도구 묶음을 하나씩 더할 때마다 점수가 올랐습니다. 훈련하지 않은 Qwen3.5-397B-A17B에 도구를 차례로 붙여 잰 결과입니다.
| 도구 구성 (Qwen3.5-397B-A17B, 훈련 없음) | 네 시험 평균 | BrowseComp+ |
|---|---|---|
| StateLM 기본 도구 | 77.89 | 63.49 |
| + 계획 | 80.29 | 65.66 |
| + 소프트 오프로딩 | 83.08 | 71.20 |
| + 장기기억 | 87.16 | 80.96 |
기본 도구만 받았을 때의 77.89점은 도구 없이 256K 창으로 푼 80.55점보다 낮았습니다. 이 모델이 큰 창을 앞선 것은 새 도구 세 묶음이 다 붙은 뒤였고, BrowseComp+ 점수는 63.49점에서 80.96점으로 17점 넘게 올랐습니다.
작은 모델에서는 반대 결과가 나왔습니다. 같은 도구를 훈련 없이 주자 세 모델 모두 점수가 내려갔습니다.
| 모델 | 도구 없음 (128K 창) | 도구만 제공 (32K 창) | ContextPilot 훈련 후 (32K 창) |
|---|---|---|---|
| Qwen3-8B | 45.93 | 27.61 | 69.40 |
| Qwen3-14B | 53.26 | 44.78 | 72.20 |
| Gemma4-E4B | 31.01 | 23.55 | 60.96 |
Qwen3-8B는 18.32점, 40% 가까이 깎였고 Qwen3-14B는 8.48점, 구글의 소형 모델 Gemma4-E4B는 7.46점을 잃었습니다. 3,970억 파라미터 모델이 같은 도구로 6.61점을 얻은 것과 반대 방향입니다.
다만 이 비교에는 창 크기 차이가 섞여 있습니다. 도구 없는 조건은 128K 창, 도구를 준 조건은 32K 창에서 쟀고, 도구 없이 32K 창만 쓴 점수는 표에 없습니다. 하락분 가운데 얼마가 창이 좁아진 탓이고 얼마가 도구를 잘못 쓴 탓인지는 논문만으로 가를 수 없습니다.
도구를 잘못 쓰고 있었다는 흔적은 훈련 기록에 남아 있습니다. 큰 모델의 풀이를 따라 배우기만 한 Qwen3-8B는 강화학습 초기에 NovelQA에서 장기기억 도구와 메모 도구 호출의 약 11%가 오류를 냈습니다. 형식이 틀렸거나 인자가 잘못됐거나 도구의 전제 조건을 어긴 호출이고, 검색 도구의 오류율은 1% 안팎이었습니다. 논문은 이 모델이 도구를 부를 줄은 알아도 쓰임새는 제대로 이해하지 못한 상태였다고 적었습니다.
사내 서버에 8B~14B급 모델을 올리고 사내 위키 검색이나 결재 조회 같은 도구를 붙여 쓰는 국내 기업이라면 이 표의 두 번째 열이 남의 일이 아닙니다. 프롬프트에 도구 설명을 넣는 것만으로는 작은 모델이 도구를 쓸 줄 알게 되지 않았고, 큰 모델의 풀이를 따라 배우고 강화학습까지 거친 뒤에야 도구 없는 원래 모델을 크게 앞섰습니다.
훈련은 두 단계입니다. 먼저 Qwen3.5-397B-A17B를 교사로 세워 긴 문서 문제를 도구로 풀게 했습니다. 이때 검색한 뒤에는 readChunk로 내용을 읽게 하고, 컨텍스트가 정해진 길이를 넘으면 덜어 두기 도구만 쓰게 하는 보조 규칙을 붙였습니다. 보조 규칙은 풀이를 만들 때만 쓰고 학습 데이터에서는 지웠으며, 이렇게 모은 풀이를 편집 지점마다 잘라 스냅샷 51,469개를 만들었습니다.
강화학습에 들어가기 전에 논문은 도구마다 결과를 얼마나 흔드는지부터 쟀습니다. 기존 풀이에서 특정 도구를 부른 지점을 골라 그 뒤를 10번씩 새로 이어 풀게 하고, 10개 풀이의 정답률이 얼마나 퍼지는지(표준편차)를 본 것입니다. readChunk에서 갈라진 풀이는 표준편차가 2.79, deleteContext는 2.70이었고 finish는 0.74였습니다.
같은 한 번의 호출이라도 어느 도구냐에 따라 결과가 흔들리는 폭이 네 배 가까이 차이 납니다. 그래서 ContextPilot은 모든 편집을 똑같이 탐색하지 않고 편집마다 영향 점수를 매깁니다. 그 편집으로 컨텍스트 길이가 몇 퍼센트 변했는지와, 편집 직후 모델이 다음 말을 고르며 얼마나 망설이는지(엔트로피)가 처음 질문을 받았을 때보다 얼마나 커졌는지를 더한 값입니다.
문제 하나에 쓰는 탐색 예산은 스냅샷 128개로 정해 뒀습니다. 처음부터 끝까지 푸는 시도 8번으로 스냅샷을 최대 64개 얻고, 남은 예산은 영향 점수가 높은 편집 지점에서 가지를 쳐 이어 푸는 데 씁니다. 강화학습에서는 이렇게 끝까지 풀어 보는 시도를 만드는 데 연산이 많이 들어가므로, 어느 지점에서 더 풀어 볼지 고르는 규칙이 연산 예산의 쓰임을 정합니다.

논문에 실린 두 풀이에 채점의 문제가 담겨 있습니다. 둘 다 StateLM-8B가 BrowseComp+를 푼 기록입니다. 한 문제는 20세기 중반 한 대학 학술지의 서평 담당 편집자를 찾는 것이었는데, 모델은 검색과 readChunk를 되풀이하며 정리는 거의 하지 않고도 정답 Robert D. McBain을 맞혔습니다.
다른 문제는 1970년대 고등학생 시절 여러 언어로 노래하는 밴드를 만들었고 2003년에 세상을 떠난 기타리스트를 찾는 것이었습니다. 모델은 메모를 적고, 쓸모없어진 내용을 지우고, 메모를 고쳐 다시 읽으며 컨텍스트를 깔끔하게 관리했지만, 정답 Frank Leepa 대신 Ty Longley라고 답했습니다.
마지막 정답 여부 하나로 중간 편집을 모두 채점하면, 앞의 풀이는 비효율적인 검색 습관까지 칭찬받고 뒤의 풀이는 합리적인 정리까지 벌을 받습니다. ContextPilot은 편집 지점마다 그 지점을 거쳐 간 모든 풀이의 결과를 평균 내 그 편집의 점수로 씁니다. 같은 편집에서 갈라진 풀이들이 대체로 맞혔다면 좋은 편집으로, 대체로 틀렸다면 나쁜 편집으로 채점되는 구조입니다.

부품마다 기여도를 따로 잰 결과도 있습니다. 따라 배우기까지만 마친 Qwen3-8B에서 출발해 강화학습 방법을 하나씩 얹었는데, 엔트로피만 보고 가지를 치자 BrowseComp+ 점수가 오히려 1.32점 내려갔습니다. 컨텍스트 변화량을 함께 보자 1.44점 올랐고, 편집별 채점을 얹자 네 시험 모두 올랐으며 BrowseComp+에서는 3.10점이 더 붙었습니다.
| 훈련 방법 (Qwen3-8B) | NovelQA | ∞Bench | LongMemEval-S | BrowseComp+ |
|---|---|---|---|---|
| 따라 배우기만 | 82.56 | 71.03 | 60.67 | 48.84 |
| 일반 강화학습(GRPO) | 83.53 | 72.78 | 60.07 | 50.96 |
| + 엔트로피로 가지치기 | 82.52 | 73.07 | 62.13 | 49.64 |
| + 컨텍스트 변화량 | 83.05 | 73.94 | 61.40 | 51.08 |
| + 편집별 채점 | 83.88 | 75.25 | 64.27 | 54.18 |
강화학습을 거치며 도구를 부르는 비율도 달라졌습니다. NovelQA 훈련 초기에는 전체 도구 호출의 절반 남짓이 검색이었는데, 훈련이 끝날 무렵에는 30% 남짓으로 줄었습니다. 그만큼 계획, 장기기억, 덜어 두기 호출이 늘었고, 장기기억 도구의 오류율은 6%대로, 덜어 두기 도구의 오류율은 1% 아래로 내려갔습니다.
최종 점수표에서 ContextPilot-14B의 72.20점은 텐센트의 직전 연구 StateLM-14B의 70.11점을 넘었습니다. 과목별로 보면 NovelQA에서는 StateLM이 84.85점으로 ContextPilot의 84.81점과 거의 같았고, 차이는 ∞Bench·LongMemEval-S·BrowseComp+에서 2.6~2.9점씩 났습니다.
| 모델 (창) | NovelQA | ∞Bench | LongMemEval-S | BrowseComp+ | 평균 |
|---|---|---|---|---|---|
| Qwen3-14B 원래 모델 (128K) | 78.03 | 74.53 | 54.20 | 6.27 | 53.26 |
| StateLM-14B-RL (32K) | 84.85 | 78.46 | 64.47 | 52.67 | 70.11 |
| ContextPilot-14B-RL (32K) | 84.81 | 81.08 | 67.40 | 55.50 | 72.20 |
점수와 함께 논문이 내세운 것은 컨텍스트의 크기입니다. 15턴 이상 이어진 BrowseComp 풀이에서 턴마다 입력 토큰을 재 보니, 정리 도구가 없는 WebExplorer-8B는 입력이 거의 직선으로 불어 약 3만 토큰까지 갔고 ContextPilot-8B는 8,000~1만 토큰에서 멈췄습니다.
에이전트는 매 턴 앞서 쌓인 컨텍스트 전체를 다시 입력으로 넣습니다. 턴마다 입력이 일정하게 늘면 누적 입력량은 턴 수의 제곱에 비례해 커지고, 입력이 일정하면 턴 수에 비례해서만 늘어납니다. 모델이 답을 쓰기 전에 입력 전체를 읽어 들이는 프리필 단계의 비용은 하네스만 바꿔도 작업 비용이 두 배 넘게 갈린 사례에서 다뤘습니다.
KV 캐시(앞서 읽은 토큰의 계산 결과를 GPU 메모리에 보관해 두는 공간)도 컨텍스트 길이를 따라 커집니다. GPU 한 장에 동시에 올릴 수 있는 대화 수가 이 크기에 따라 정해지므로, 서빙 비용이 빠듯한 회사에는 점수표보다 이 그래프가 먼저 와닿을 수 있습니다.
긴 문서 시험에서 크게 벌어진 차이가 인터넷을 뒤지는 딥서치 과제에서는 좁아졌습니다. 논문은 이미 검색 능력을 갖춘 WebSailor-7B와 WebExplorer-8B에 따라 배우기 단계 없이 강화학습만 1,000문제로 시켜, GAIA(텍스트 문제 103개)·BrowseComp·BrowseComp-ZH(중국어)·xBench-DeepSearch 네 시험에서 쟀습니다.
| 방법 | WebSailor-7B 평균 | WebExplorer-8B 평균 |
|---|---|---|
| ReAct | 25.47 | 42.90 |
| ReAct + 오래된 메시지 자르기 | 27.31 | 43.10 |
| ReSum (추론 때 요약) | 32.09 | 45.11 |
| SUPO (요약을 강화학습으로 훈련) | 36.31 | 49.09 |
| OpenSeeker (같은 1,000문제, 정리 도구 없음) | 35.78 | 47.92 |
| ContextPilot | 38.32 | 50.10 |
평균으로는 두 모델 모두 ContextPilot이 가장 높았지만, 가장 강한 비교 대상인 SUPO와의 차이는 2.01점과 1.01점이었습니다. WebExplorer-8B의 xBench-DeepSearch에서는 SUPO가 58.00점으로 ContextPilot의 56.67점을 앞섰습니다. 세 번 돌린 결과의 표준편차가 대부분 1점 안팎이어서, 1점 차이는 실행을 다시 하면 뒤집힐 수 있는 폭입니다.
저자들이 직접 적은 한계는 세 가지입니다. 도구 목록이 모든 종류의 컨텍스트 편집을 담지는 못하고, 연산 제약 때문에 가지치기와 채점에 관련된 하이퍼파라미터를 충분히 탐색하지 못했으며, 실험이 긴 문서 질의응답과 딥서치에 집중돼 있다는 것입니다. 코딩 에이전트와 화면을 조작하는 에이전트로 넓히는 일은 다음 과제로 남겼습니다.
NovelQA 점수는 따로 볼 부분이 있습니다. 따라 배우기 데이터에 NovelQA의 다른 묶음(저작권이 풀린 소설)이 들어가 있고, 평가는 저작권이 남은 소설 묶음으로 했습니다. 논문도 이 과목에서 강화학습 효과가 작았던 이유로 이 점을 들었습니다.
채점 방식에도 제가 보기에 빈틈이 하나 있습니다. 편집의 점수는 같은 문제 안에서 갈라진 풀이들의 결과로만 매겨지므로, 지금 문제에는 필요 없지만 다음 문제에서 필요해질 정보를 버린 편집은 잘 판단한 압축과 같은 점수를 받습니다. 문제끼리 서로 독립인 이번 평가에서는 드러나지 않지만, 여러 날에 걸쳐 같은 사용자의 일을 이어 맡는 에이전트라면 그 비용이 나중에 나타납니다.
주요 결과는 연구진이 세 번씩 돌려 직접 잰 평균이고 외부 재현은 아직 없습니다. 평가도 영어 긴 문서 시험과 영어·중국어 검색 시험으로만 해서, 한국어 문서에서 같은 효과가 나는지는 알 수 없습니다.
모델이 자기 기억을 도구로 다루게 하자는 흐름은 2023년 UC 버클리에서 나온 MemGPT에서 시작됐습니다. 에이전트의 기억을 컴퓨터의 가상 메모리처럼 보고 도구 호출로 관리하게 한 연구입니다. 이번 논문이 비교하고 인용한 후속 연구는 대부분 중국 기업과 대학에서 나왔습니다.
| 연구 | 만든 곳 | 방식 |
|---|---|---|
| StateLM (ICLR 2026) | 텐센트 | 색인·삭제·메모 도구 사용을 훈련 |
| AgentFold | 알리바바 통이랩 | 지난 기록을 여러 단위로 접는 법을 학습 |
| ReSum | 알리바바 통이랩 | 추론 때 기록을 요약해 이어 감 |
| MemAgent | 바이트댄스 시드·칭화대 | 기억 갱신을 강화학습으로 훈련 |
| MemAct | 베이징교통대 | 컨텍스트 정리를 행동으로 학습 |
| ContextPilot (EMNLP 2026) | 텐센트 Youtu Lab·칭화대·상하이 AI랩 | 도구 확장, 영향 점수 기반 탐색, 편집별 채점 |
ContextPilot의 기반 모델은 Qwen3-8B·Qwen3-14B·Gemma4-E4B 같은 공개 모델이고, 시험도 NovelQA·BrowseComp+처럼 공개된 벤치마크입니다. 프런티어 모델을 새로 훈련할 예산이 없어도 같은 조건에서 겨룰 수 있는 문제라서, 국내 연구실이 과제를 고를 때도 현실적인 후보가 됩니다.
같은 문제를 모델 안쪽에서 푸는 연구도 있습니다. 컨텍스트 창 같은 바깥 기억 대신 모델 내부의 고정 크기 상태에 문맥을 눌러 담는 방식입니다.

공개된 것부터 보면, 코드는 Apache 2.0이라 상업 서비스에도 쓸 수 있습니다. 반면 Qwen3-8B·Qwen3-14B·Gemma4-E4B를 바탕으로 만든 가중치 3종은 라이선스 첫 조항에 과학 연구·개발 목적으로만 쓸 수 있다고 적혀 있습니다. 국내 기업이 이 방식을 서비스에 넣으려면 공개된 가중치 대신 코드로 자기 모델을 다시 훈련하게 됩니다.
작은 모델에 도구를 붙여 쓰는 팀에는 도구만 준 조건의 결과가 가장 가까운 이야기입니다. 훈련 없이 도구 설명만 받은 작은 모델 셋은 모두 도구 없는 원래 모델보다 낮은 점수를 받았고, 설명만으로 도구를 잘 쓴 것은 3,970억 파라미터 모델뿐이었습니다. 도구를 붙인 사내 에이전트의 점수를 도구를 모두 뗀 같은 모델의 점수와 함께 재 두면 이 차이가 각자의 환경에서도 나는지 알 수 있습니다.
연구실에는 영향 점수로 탐색 예산을 나누는 부분이 가장 가져다 쓰기 쉬운 부품이라고 저는 봅니다. 도구 구성이 달라도 편집마다 컨텍스트 변화량과 엔트로피를 재는 절차는 그대로 쓸 수 있고, 텐센트 연구진조차 연산 제약으로 하이퍼파라미터를 충분히 탐색하지 못했다고 밝힌 만큼 GPU가 넉넉하지 않은 곳일수록 어디를 더 풀어 볼지 고르는 규칙이 쓸모가 있습니다.
ContextPilot은 10월 24일부터 29일까지 부다페스트에서 열리는 EMNLP 2026에서 발표됩니다. 32K 창으로 128K 창을 앞선 결과가 코딩 에이전트 같은 다른 과제에서도 유지되는지는 외부 재현이 나와야 알 수 있고, 그 결과가 나오면 다시 전하겠습니다.
읽어 주셔서 고맙습니다.
초이 드림