추론
inference · 서빙
학습이 끝난 모델을 실제로 돌려 답을 만드는 단계입니다. 비용·속도·지연 시간 이야기는 대부분 여기서 나옵니다.
‘추론’ 이 나오는 글12
"10만 칩이면 한 시간에도 여러 번 고장" 구글 AI 인프라 총괄의 굿풋론
구글 AI 인프라를 총괄하는 아민 바흐다트가 10월 6일 Training Data에서 가속기 10만 개면 한 시간에도 여러 번 고장 난다며 FLOPS 대신 굿풋을 잰다고 말했습니다. 6개월마다 두 배인 토큰 용량, TPU 8i·8t 분리, 전력망을 기다리는 이유도 설명했습니다.

리플렉션 첫 모델 Beam "GLM-5.2급 점수를 3~4배 적은 연산으로"
리플렉션 AI가 10월 5일(미국 시각) 첫 모델 Beam을 공개했습니다. GLM-5.2급 추론 점수를 3~4배 적은 연산으로 냈다고 밝혔지만, 자사 비교표에서도 GLM-5.3과 DeepSeek V4.1-Flash가 더 높습니다.

'3 Pro' 앞세워 판 AI Plus, 구글이 10월부터 Pro 모델을 뺍니다
구글이 개인 계정 제미나이 앱의 모델 접근을 요금제별로 다시 나눕니다. 10월 9일부터 무료는 Flash-Lite만, AI Plus는 Flash까지 쓰고 Pro 모델은 AI Pro와 Ultra에 남습니다. 1월 AI Plus를 내놓을 때 구글이 앞세운 혜택이 3 Pro였습니다.

독일산 오픈웨이트 Kolibri 공개, 미세조정 교사는 중국 GLM·Qwen
알레프 알파가 10월 3일 781억 파라미터 전문가 혼합 모델 Kolibri를 아파치 2.0으로 공개했습니다. H200 한 장에 올라가고 독일어·영어에 맞췄으며, 미세조정 데이터는 주로 GLM-5.2·5.3과 Qwen3.8-27B로 만들었습니다.

HBM으로 센 AI 에이전트 최대 1억 7,100만, 에포크 계산을 뜯어보니
에포크 AI가 10월 2일 HBM 출하량으로 AI 에이전트 수를 셌습니다. 2027년까지 나올 메모리로 프런티어 에이전트 3,300만~1억 7,100만 개를 동시에 돌릴 수 있고, 용량의 20%만 써도 연 2조 6,000억~5조 3,000억 달러어치입니다.

오픈AI도 문샷 지목, 막힌 추론 빼내기는 애저에선 9월 27일까지 통했습니다
오픈AI가 9월 30일(미국 시각) 문샷AI 관련자들이 낀 증류 캠페인을 막았다고 밝혔습니다. 7월 24~25일 사용자 4,000명 넘게 추출 요청 1만 6,000건을 보냈고, 연구진은 같은 수법이 애저에서는 9월 27일까지 통했다고 공개했습니다.

함께 나오는 용어5
- 토큰모델이 텍스트 등을 나누어 처리하는 단위입니다. 단어 전체, 단어의 일부, 문자나 기호가 토큰으로 나뉠 수 있으며, 같은 문장도 토크나이저와 언어에 따라 개수가 달라집니다. 글자 수와 고정된 비율로 대응하지 않습니다. 입력·출력 토큰 수는 컨텍스트 한도와 API 과금의 기준으로 쓰입니다.
- 에이전트한 번 답하고 멈추지 않고, 스스로 계획하고 도구를 부르고 결과를 확인하며 여러 단계를 이어가는 AI입니다. 브라우저·터미널·앱을 대신 조작하는 것이 대표 예입니다.
- 파라미터모델 안의 숫자(가중치) 개수입니다. '7B'는 70억 개를 가리키고, 대체로 클수록 똑똑하지만 비쌉니다.
- 허깅페이스모델 가중치와 데이터셋을 올리고 내려받는 공개 저장소입니다. 오픈웨이트 공개는 사실상 이곳에 파일이 올라온 시점으로 세고, 라이선스 표기도 여기서 확인합니다. 오픈AI 내부 모델이 샌드박스를 나와 코드 실행까지 간 사건의 무대도 이곳의 프로덕션 환경이었습니다.
- 재귀적 자기개선AI가 다음 세대 AI를 만드는 일을 스스로 맡아, 개선 속도가 사람 손을 떠나 점점 빨라지는 상태입니다. 아직 일어나지 않았지만 여러 연구소가 이걸 기준으로 안전 정책을 세웁니다.
어려운 말은 풀어서, 매주 한 통
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
