선형 어텐션
linear attention · 하이브리드 어텐션 · Gated DeltaNet
입력이 길어져도 계산량이 제곱으로 늘지 않도록 고친 어텐션 계열입니다. 전체 어텐션 층과 섞어 쓰는 하이브리드 구성이 표준이 됐고, Qwen3.8은 층 대부분을 Gated DeltaNet으로 두고 16개 층만 전체 어텐션으로 남겨 멀리 떨어진 정보를 다시 연결합니다.
‘선형 어텐션’ 이 나오는 글4
GLM이 자기를 돌릴 시스템을 짰다, 13일 만에 처리량 3.22배
첫 구동 13일 뒤 처리량은 처음의 3.22배가 됐습니다. 파이썬 GIL 하나 때문에 20% 넘게 벌어지던 성능 차이를 1% 아래로 줄였고, 에이전트가 찾은 정밀도 문제의 수정은 오픈소스 라이브러리 Flash Linear Attention에 병합됐습니다.

튜링상 야오 이름 올린 바이트댄스 논문, '읽으며 배우는' 기억을 다시 짰습니다
8월 27일 arXiv에 올라온 Falcon은 선형 어텐션의 기억 갱신을 작은 예측기의 실시간 학습으로 보고 규칙 여섯 개를 내놨습니다. 32자리까지 배운 덧셈을 33~48자리로 늘린 시험에서 87.2%로 트랜스포머(65.8%)를 앞섰습니다.

같은 날 같은 값에 나온 Qwen과 GLM, 알리바바만 사업 조건을 붙였습니다
8월 26일 같은 날 공개된 Qwen3.8-Flash-Next와 GLM-5.3-Flash는 설계와 API 가격까지 닮았지만 라이선스가 갈렸습니다. GLM은 조건 없는 MIT로 풀렸고, Qwen에는 모델 API나 AI 도구 사업이면 별도 계약을 받으라는 조항이 붙었습니다.

조 단위 경쟁 대신 사내 서버, 업스테이지 250B Solar Open 2 공개
업스테이지가 7월 22일 독파모 2차 모델 Solar Open 2를 오픈웨이트로 공개했습니다. 하이브리드 어텐션으로 100만 토큰을 받고, 노타AI의 양자화판은 117.8GB로 줄어 H100 두 장에 올라갑니다. 기록을 밖으로 보낼 수 없는 조직을 겨냥했습니다.

함께 나오는 용어5
- 어텐션입력의 어느 부분을 얼마나 참고할지 정하는 트랜스포머의 계산 구조입니다. 길이가 늘수록 비용이 빠르게 커져서, 긴 컨텍스트 처리 비용의 대부분이 여기서 나옵니다.
- 에이전트한 번 답하고 멈추지 않고, 스스로 계획하고 도구를 부르고 결과를 확인하며 여러 단계를 이어가는 AI입니다. 브라우저·터미널·앱을 대신 조작하는 것이 대표 예입니다.
- 허깅페이스모델 가중치와 데이터셋을 올리고 내려받는 공개 저장소입니다. 오픈웨이트 공개는 사실상 이곳에 파일이 올라온 시점으로 세고, 라이선스 표기도 여기서 확인합니다. 오픈AI 내부 모델이 샌드박스를 나와 코드 실행까지 간 사건의 무대도 이곳의 프로덕션 환경이었습니다.
- 토큰모델이 텍스트 등을 나누어 처리하는 단위입니다. 단어 전체, 단어의 일부, 문자나 기호가 토큰으로 나뉠 수 있으며, 같은 문장도 토크나이저와 언어에 따라 개수가 달라집니다. 글자 수와 고정된 비율로 대응하지 않습니다. 입력·출력 토큰 수는 컨텍스트 한도와 API 과금의 기준으로 쓰입니다.
- 재귀적 자기개선AI가 다음 세대 AI를 만드는 일을 스스로 맡아, 개선 속도가 사람 손을 떠나 점점 빨라지는 상태입니다. 아직 일어나지 않았지만 여러 연구소가 이걸 기준으로 안전 정책을 세웁니다.
어려운 말은 풀어서, 매주 한 통
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
