토크나이저
tokenizer · 토큰화 · 어휘 사전
글을 모델이 읽는 토큰 단위로 쪼개는 규칙과 어휘 사전입니다. 같은 문장이라도 토크나이저에 따라 토큰 수가 달라져서 요금과 컨텍스트 소모가 함께 바뀝니다. 제작사를 숨긴 익명 모델의 정체를 어휘 일치 검사로 밝혀내는 데 쓰이기도 합니다.
‘토크나이저’ 이 나오는 글2
아티클AI
GPT-5.6이 자기 GPU 코드를 고쳐 오픈AI 서빙 비용이 20% 줄었습니다
GPT-5.6 Sol이 다시 쓴 커널로 종단 서빙 비용이 20% 줄고, 스스로 개선한 초안 모델로 토큰 생성 효율이 15% 넘게 올랐습니다. 하네스는 도구 출력을 기본 1만 토큰에서 자르고 기록을 뒤에만 덧붙여, 일반 입력의 10분의 1 가격인 캐시를 지킵니다.

11분
아티클AI
문샷이 같은 밤에 모델과 커널과 통신 라이브러리를 통째로 풀었습니다
7월 27일 문샷AI가 Kimi K3 가중치 파일 96개(1.56TB)와 기술 보고서, FlashKDA·MoonEP·AgentENV를 같은 날 MIT로 공개했습니다. 발표 때 주장이던 숫자가 파일에서 확인됐고, MoonEP 지원 목록에는 중국산 가속기 진우 PPU가 올라 있습니다.

12분
함께 나오는 용어5
- 에이전트한 번 답하고 멈추지 않고, 스스로 계획하고 도구를 부르고 결과를 확인하며 여러 단계를 이어가는 AI입니다. 브라우저·터미널·앱을 대신 조작하는 것이 대표 예입니다.
- 커널GPU 한 장 안에서 실제 계산을 돌리는 작은 프로그램입니다. 같은 모델이라도 커널을 그 칩에 맞게 다시 쓰면 처리량이 몇 배 갈립니다. 다룰 줄 아는 사람이 회사마다 몇 명뿐인 층입니다.
- 추론학습이 끝난 모델을 실제로 돌려 답을 만드는 단계입니다. 비용·속도·지연 시간 이야기는 대부분 여기서 나옵니다.
- 오케스트레이션여러 모델과 에이전트, 도구의 실행 순서를 정하고 결과를 합치는 계층입니다. 비싼 모델이 계획하고 값싼 모델이 실행하는 분업이 여기서 짜입니다.
- 모델 라우팅요청의 종류, 필요한 품질, 비용과 지연 조건에 맞춰 사용할 모델을 선택하는 방식입니다. 규칙이나 별도 분류기를 쓸 수 있고, 실패하면 다른 모델로 넘기는 경로도 포함할 수 있습니다. 재시도와 검증 비용이 생기므로 작은 모델을 먼저 쓰는 구성이 언제나 더 저렴한 것은 아닙니다.
어려운 말은 풀어서, 매주 한 통
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
