SWE-bench
SWE-bench Pro · 스위벤치
실제 깃허브 이슈를 모델이 패치로 해결하는지 재는 코딩 평가입니다. 오픈AI 감사에서 공개 과제의 약 30%가 깨진 문제로 확인되면서 점수 해석에 주의가 필요해졌습니다.
‘SWE-bench’ 이 나오는 글6
24GB 그래픽카드에 들어가는 'Opus급', 알리바바 Qwen3.8-27B
알리바바가 8월 14일 Qwen3.8-27B 가중치를 Apache 2.0으로 공개했습니다. 파라미터 수와 구조가 4월 Qwen3.6-27B와 똑같은데 DeepSWE는 13.3에서 42.2로 올랐고, 4비트 판은 24GB 그래픽카드에 들어갑니다.
80%까지 오른 코딩 시험, 오픈AI "과제 30% 깨졌다"며 추천 철회
오픈AI가 7월 8일 SWE-Bench Pro 공개 과제 731개 중 약 30%가 깨진 문제라고 추정하고 이 시험을 쓰라던 추천을 철회했습니다. 최고 점수는 8개월 남짓 만에 23.3%에서 80.3%로 올라 있었습니다.
함께 나오는 용어5
- 토큰모델이 텍스트 등을 나누어 처리하는 단위입니다. 단어 전체, 단어의 일부, 문자나 기호가 토큰으로 나뉠 수 있으며, 같은 문장도 토크나이저와 언어에 따라 개수가 달라집니다. 글자 수와 고정된 비율로 대응하지 않습니다. 입력·출력 토큰 수는 컨텍스트 한도와 API 과금의 기준으로 쓰입니다.
- 에이전트한 번 답하고 멈추지 않고, 스스로 계획하고 도구를 부르고 결과를 확인하며 여러 단계를 이어가는 AI입니다. 브라우저·터미널·앱을 대신 조작하는 것이 대표 예입니다.
- 파라미터모델 안의 숫자(가중치) 개수입니다. '7B'는 70억 개를 가리키고, 대체로 클수록 똑똑하지만 비쌉니다.
- 코딩 에이전트저장소를 읽고 명령을 실행하며 코드를 끝까지 고치는 에이전트입니다. 최근 모델 도약이 지식 문답 대신 이쪽에 몰려서, 딥시크 V4-Pro는 코딩 에이전트 평가 DeepSWE에서 12.8점이 62.7점이 됐습니다. 같은 모델도 어떤 하네스에 올리느냐에 따라 점수가 크게 달라집니다.
- 하네스모델을 감싸 실제 작업을 시키는 바깥 장치입니다. 프롬프트·도구·재시도·검증 규칙이 여기 들어가서, 같은 모델도 하네스에 따라 결과가 크게 다릅니다.





