추측 디코딩
speculative decoding · 투기적 디코딩
작은 모델이 다음 토큰 후보를 먼저 만들고 큰 모델이 한꺼번에 검증해 출력 속도를 올리는 기법입니다. 출력 결과를 바꾸지 않고 디코딩만 빠르게 한다는 점이 특징입니다.
‘추측 디코딩’ 이 나오는 글3
아티클AI
AI가 AI를 고치는 속도, 커널은 며칠인데 송전선은 4~8년입니다
GPT-5.6 Sol은 자기 커널을 다시 써 서빙 비용을 20% 줄였고, AlphaEvolve는 1969년의 행렬 곱셈 기록을 깼습니다. IEA는 데이터센터 전력이 2030년 약 945TWh로 두 배를 넘고, 선진국에서 송전선 하나를 새로 놓는 데 4~8년이 걸린다고 봤습니다.

13분
아티클AI
GPT-5.6이 자기 GPU 코드를 고쳐 오픈AI 서빙 비용이 20% 줄었습니다
GPT-5.6 Sol이 다시 쓴 커널로 종단 서빙 비용이 20% 줄고, 스스로 개선한 초안 모델로 토큰 생성 효율이 15% 넘게 올랐습니다. 하네스는 도구 출력을 기본 1만 토큰에서 자르고 기록을 뒤에만 덧붙여, 일반 입력의 10분의 1 가격인 캐시를 지킵니다.

11분
소식AI
작은 고추가 맵다, 118B Laguna가 1.6조 딥시크를 코딩에서 앞섰습니다
Poolside가 7월 21일 공개한 Laguna S 2.1은 DeepSWE에서 40.4%를 받아 13배 큰 딥시크 V4-Pro-Max(9.0%)를 크게 앞섰습니다. DGX Spark 한 대에서 추측 디코딩 없이 초당 13~14토큰, 붙이면 최대 24토큰이 나옵니다.

13분
함께 나오는 용어5
- 에이전트한 번 답하고 멈추지 않고, 스스로 계획하고 도구를 부르고 결과를 확인하며 여러 단계를 이어가는 AI입니다. 브라우저·터미널·앱을 대신 조작하는 것이 대표 예입니다.
- 토큰모델이 텍스트 등을 나누어 처리하는 단위입니다. 단어 전체, 단어의 일부, 문자나 기호가 토큰으로 나뉠 수 있으며, 같은 문장도 토크나이저와 언어에 따라 개수가 달라집니다. 글자 수와 고정된 비율로 대응하지 않습니다. 입력·출력 토큰 수는 컨텍스트 한도와 API 과금의 기준으로 쓰입니다.
- 오케스트레이션여러 모델과 에이전트, 도구의 실행 순서를 정하고 결과를 합치는 계층입니다. 비싼 모델이 계획하고 값싼 모델이 실행하는 분업이 여기서 짜입니다.
- 하네스모델을 감싸 실제 작업을 시키는 바깥 장치입니다. 프롬프트·도구·재시도·검증 규칙이 여기 들어가서, 같은 모델도 하네스에 따라 결과가 크게 다릅니다.
- 커널GPU 한 장 안에서 실제 계산을 돌리는 작은 프로그램입니다. 같은 모델이라도 커널을 그 칩에 맞게 다시 쓰면 처리량이 몇 배 갈립니다. 다룰 줄 아는 사람이 회사마다 몇 명뿐인 층입니다.
어려운 말은 풀어서, 매주 한 통
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
