트랜스포머
Transformer · 트랜스포머 구조
2017년에 나온 언어모델의 기본 설계로, 어텐션 층을 쌓아 입력 전체를 한 번에 참고합니다. 지금 이름이 알려진 모델은 거의 전부 이 구조의 변형이고, 연산 비용을 줄이려는 최근 시도도 트랜스포머 안에서 일부 층을 갈아 끼우는 방식으로 이뤄집니다.
‘트랜스포머’ 이 나오는 글6
버리던 첫 바퀴 답을 살리자, 애플 루프 모델 수학 정답률 11%포인트 올랐습니다
애플 연구진이 10월 1일 공개한 LoopCD는 루프 모델이 버리던 첫 바퀴 예측을 기준점 삼아 마지막 예측을 한 번 더 밉니다. 추가 학습 없이 AIME 2024 정답률이 61.88%에서 73.33%로 올랐고, 연산 22.5~48.2% 절감은 객관식 실험에서 쟀습니다.

"지능 말고 쓰임새를 규제하라" AI 연구를 AI에 맡긴 리처드 소처
Recursive 창업자 리처드 소처가 9월 14일 Latent Space에서 AI 연구를 AI에 맡기는 계획을 설명했습니다. 지능 대신 쓰임새를 규제하라고 했고, 6월에 낸 세 기록은 40일 뒤 텐센트 Hyra가 다시 넘었습니다.

설계도만 팔던 Arm이 칩을 판다, 르네 하스 "공급 제약 3~5년"
Arm CEO 르네 하스가 9월 3일 No Priors에서 첫 자체 칩 AGI CPU를 낸 이유를 설명했습니다. Arm 엔지니어 80~90%가 매일 AI를 쓴다고 했고, 트랜스포머가 AI의 기본 단위로 남는 한 공급 제약이 적어도 3~5년 간다고 봤습니다.

튜링상 야오 이름 올린 바이트댄스 논문, '읽으며 배우는' 기억을 다시 짰습니다
8월 27일 arXiv에 올라온 Falcon은 선형 어텐션의 기억 갱신을 작은 예측기의 실시간 학습으로 보고 규칙 여섯 개를 내놨습니다. 32자리까지 배운 덧셈을 33~48자리로 늘린 시험에서 87.2%로 트랜스포머(65.8%)를 앞섰습니다.

"2025년 AGI를 믿었다" 오픈AI 추론 이끈 트워렉, 트랜스포머 대체에 나서
오픈AI 추론 팀을 이끈 제리 트워렉과 제미나이 사전학습을 이끈 로한 아닐이 7월 29일 세쿼이아 팟캐스트에 나왔습니다. 트랜스포머로는 배포 뒤에도 계속 배우는 모델을 만들 수 없다며, 연구를 자동화해 대체 구조를 찾겠다고 했습니다.

사람이 놓은 블록은 그대로 두는 마인크래프트 AI, 사카나가 공개했습니다
사카나 AI와 뉴욕대가 7월 29일 마인크래프트 생성 모델 Dream-Cubed와 청크 200만 개 넘는 데이터셋을 공개했습니다. 두 확산 방식의 평균 FID는 59.26과 59.29로 같았고, 5×5 월드 하나에 H100으로 한 시간 넘게 걸립니다.

함께 나오는 용어5
- 파라미터모델 안의 숫자(가중치) 개수입니다. '7B'는 70억 개를 가리키고, 대체로 클수록 똑똑하지만 비쌉니다.
- 토큰모델이 텍스트 등을 나누어 처리하는 단위입니다. 단어 전체, 단어의 일부, 문자나 기호가 토큰으로 나뉠 수 있으며, 같은 문장도 토크나이저와 언어에 따라 개수가 달라집니다. 글자 수와 고정된 비율로 대응하지 않습니다. 입력·출력 토큰 수는 컨텍스트 한도와 API 과금의 기준으로 쓰입니다.
- AGI사람이 하는 지적 작업 대부분을 사람 수준 이상으로 해내는 AI를 가리킵니다. 정의가 기관마다 달라서 같은 단어로 다른 시점을 말하는 경우가 많고, 이 뉴스레터에서는 특정 벤치마크 통과 시점보다 자동화된 연구 능력을 기준으로 다룹니다.
- 추론학습이 끝난 모델을 실제로 돌려 답을 만드는 단계입니다. 비용·속도·지연 시간 이야기는 대부분 여기서 나옵니다.
- 지식 벤치마크객관식과 단답으로 모델의 지식과 계산 실력을 재는 시험지 계열입니다. MMLU와 GPQA, AIME가 대표인데 상위 모델이 몰려 변별력이 떨어졌고, 최근 점수 도약은 명령을 실행하고 결과를 받는 에이전트 과제 쪽에서 나옵니다.
어려운 말은 풀어서, 매주 한 통
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
