커널
GPU 커널 · kernel
GPU 한 장 안에서 실제 계산을 돌리는 작은 프로그램입니다. 같은 모델이라도 커널을 그 칩에 맞게 다시 쓰면 처리량이 몇 배 갈립니다. 다룰 줄 아는 사람이 회사마다 몇 명뿐인 층입니다.
‘커널’ 이 나오는 글8
Mythos가 찾았다는 리눅스 버그 79건, 크로아하트만 "진짜 수정은 10건"
그렉 크로아하트만은 9월 22일 발표에서 Mythos가 찾았다는 리눅스 버그 79건 가운데 필요한 수정은 20건, 진짜 수정은 10건이라고 했습니다. 커널 CVE는 하루 33건으로 늘었고, 그는 LLM이 만든 패치의 절반은 틀린다고 봤습니다.

사이버 요청 응답률 95%로 연 오픈AI, 공격 성공률은 따로입니다
GPT-5.6-Cyber가 크롬 V8에서 취약점 두 개를 찾아 구글이 패치했고, 커널에서는 400건 넘는 취약점이 나왔습니다. 다만 95%는 거절하지 않은 비율이고, 가장 어려운 ExploitBench 300턴에서는 범용 Sol이 전용 모델을 앞섰습니다.

AI가 AI를 고치는 속도, 커널은 며칠인데 송전선은 4~8년입니다
GPT-5.6 Sol은 자기 커널을 다시 써 서빙 비용을 20% 줄였고, AlphaEvolve는 1969년의 행렬 곱셈 기록을 깼습니다. IEA는 데이터센터 전력이 2030년 약 945TWh로 두 배를 넘고, 선진국에서 송전선 하나를 새로 놓는 데 4~8년이 걸린다고 봤습니다.

GPT-5.6이 자기 GPU 코드를 고쳐 오픈AI 서빙 비용이 20% 줄었습니다
GPT-5.6 Sol이 다시 쓴 커널로 종단 서빙 비용이 20% 줄고, 스스로 개선한 초안 모델로 토큰 생성 효율이 15% 넘게 올랐습니다. 하네스는 도구 출력을 기본 1만 토큰에서 자르고 기록을 뒤에만 덧붙여, 일반 입력의 10분의 1 가격인 캐시를 지킵니다.

문샷이 같은 밤에 모델과 커널과 통신 라이브러리를 통째로 풀었습니다
7월 27일 문샷AI가 Kimi K3 가중치 파일 96개(1.56TB)와 기술 보고서, FlashKDA·MoonEP·AgentENV를 같은 날 MIT로 공개했습니다. 발표 때 주장이던 숫자가 파일에서 확인됐고, MoonEP 지원 목록에는 중국산 가속기 진우 PPU가 올라 있습니다.

가중치만으론 절반, 문샷AI가 Kimi K3에 커널·채점표까지 붙였습니다
문샷AI가 7월 27일 Kimi K3 가중치를 공개하며 FlashKDA·MoonEP·AgentENV를 함께 풀었고, 11분 뒤 서빙 업체 7곳의 검증 점수가 올라왔습니다. 지난해 K2는 vLLM에서 도구 호출 1,200여 건 중 218건만 제대로 처리될 만큼 흔들렸습니다.

함께 나오는 용어5
- 에이전트한 번 답하고 멈추지 않고, 스스로 계획하고 도구를 부르고 결과를 확인하며 여러 단계를 이어가는 AI입니다. 브라우저·터미널·앱을 대신 조작하는 것이 대표 예입니다.
- 추론학습이 끝난 모델을 실제로 돌려 답을 만드는 단계입니다. 비용·속도·지연 시간 이야기는 대부분 여기서 나옵니다.
- 토큰모델이 텍스트 등을 나누어 처리하는 단위입니다. 단어 전체, 단어의 일부, 문자나 기호가 토큰으로 나뉠 수 있으며, 같은 문장도 토크나이저와 언어에 따라 개수가 달라집니다. 글자 수와 고정된 비율로 대응하지 않습니다. 입력·출력 토큰 수는 컨텍스트 한도와 API 과금의 기준으로 쓰입니다.
- LLM수천억 개 단어를 학습해 다음 토큰을 예측하는 모델입니다. 질문에 답하고 글을 쓰고 코드를 짜는 일이 모두 '다음에 올 말 맞히기'에서 나옵니다.
- 오케스트레이션여러 모델과 에이전트, 도구의 실행 순서를 정하고 결과를 합치는 계층입니다. 비싼 모델이 계획하고 값싼 모델이 실행하는 분업이 여기서 짜입니다.
어려운 말은 풀어서, 매주 한 통
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
