추론 엔진
vLLM · SGLang · TensorRT · 서빙 엔진
공개된 가중치를 실제 장비에서 돌려 주는 서빙 소프트웨어입니다. vLLM과 SGLang이 대표이고, 새 오픈 모델이 나오는 날 이들이 실행 경로를 함께 여는지가 실사용 시점을 정합니다. Z.ai는 SGLang을 바탕으로 자체 엔진을 올려 같은 하드웨어에서 종단 성능을 3배 높였다고 밝혔습니다.
‘추론 엔진’ 이 나오는 글4
나노바나나급 Qwen-Image-2.1 공개, 이번엔 상업 이용을 막았습니다
알리바바 Qwen 팀이 9월 20일 생성부 7B의 이미지 생성·편집 모델 Qwen-Image-2.1 가중치를 공개했습니다. 자체 채점표 29개 모델 가운데 7위로 Nano Banana 2.0보다 0.46점 높았고, 상업 이용에는 별도 라이선스가 필요합니다.

24GB 그래픽카드에 들어가는 'Opus급', 알리바바 Qwen3.8-27B
알리바바가 8월 14일 Qwen3.8-27B 가중치를 Apache 2.0으로 공개했습니다. 파라미터 수와 구조가 4월 Qwen3.6-27B와 똑같은데 DeepSWE는 13.3에서 42.2로 올랐고, 4비트 판은 24GB 그래픽카드에 들어갑니다.
함께 나오는 용어5
- 파라미터모델 안의 숫자(가중치) 개수입니다. '7B'는 70억 개를 가리키고, 대체로 클수록 똑똑하지만 비쌉니다.
- 허깅페이스모델 가중치와 데이터셋을 올리고 내려받는 공개 저장소입니다. 오픈웨이트 공개는 사실상 이곳에 파일이 올라온 시점으로 세고, 라이선스 표기도 여기서 확인합니다. 오픈AI 내부 모델이 샌드박스를 나와 코드 실행까지 간 사건의 무대도 이곳의 프로덕션 환경이었습니다.
- 오픈소스 라이선스공개된 가중치를 누가 어떤 조건으로 쓸 수 있는지 정하는 약관입니다. MIT와 아파치 2.0은 조건 없이 고치고 팔 수 있게 열어 두는 반면, 사용 지역이나 상업 이용에 제한을 붙인 자체 라이선스도 흔합니다. 텐센트 커뮤니티 라이선스는 EU와 영국, 한국을 사용 가능 지역에서 빼 두었다가 아파치 2.0 전환으로 그 조항을 없앴습니다.
- 추론학습이 끝난 모델을 실제로 돌려 답을 만드는 단계입니다. 비용·속도·지연 시간 이야기는 대부분 여기서 나옵니다.
- 체크포인트중단 후 이어 가거나 이전 상태를 비교하기 위해 특정 시점의 상태를 저장한 것입니다. 모델 학습에서는 가중치·옵티마이저 상태 등을, 에이전트 업무에서는 중간 결과·진행 단계 등을 저장할 수 있습니다. 외부 결제나 발송까지 중복 없이 복구하려면 별도의 멱등성 설계가 필요합니다.


