멀티모달
multimodal
글에 더해 이미지·음성·영상을 함께 이해하거나 만들어내는 모델입니다.
‘멀티모달’ 이 나오는 글9
중국 밖 오픈 모델 1위, 미스트랄 1조 파라미터 Large 4가 나왔습니다
미스트랄이 10월 6일 1조 파라미터 Mistral Large 4 프리뷰를 공개했습니다. 아티피셜애널리시스 지수 38점으로 중국 밖 오픈 모델 1위이고, 사이버 방어를 앞세워 가중치는 레드팀 시험 뒤 10월 말 풉니다.
Jev보다 싸고 이미지도 읽는 퍼플렉시티 결정 모델, 종합 1위의 셈법
퍼플렉시티가 10월 2일 결정 모델 pplx-decider-v1-27b의 가중치를 풀고 입력 100만 토큰당 0.04달러 API를 열었습니다. 종합 정확도 85.71%로 Jev를 앞섰지만 시험 11개 단순 평균은 Jev가 0.21%포인트 높았습니다.
딥시크 "V4.1-Flash가 V4-Pro 앞서"… MIT 공개하고 요금 인하
딥시크가 9월 10일 552B MoE 모델 V4.1-Flash를 MIT 라이선스로 공개했습니다. 토큰당 KV 캐시는 V4-Flash의 약 4분의 1이고, 오프피크 요금은 캐시 적중 입력 0.003달러, 출력 0.6달러로 8월보다 내렸습니다.

복면 벗은 1위 모델 Ox Alpha, 정체는 Z.ai GLM-5.3-Flash
Ox Alpha는 OpenRouter에서 6일 동안 토큰 23조 2,000억 개를 처리해 2위의 2.3배를 기록했습니다. 정체를 밝힌 GLM-5.3-Flash는 과제당 0.09달러로 같은 57점 모델보다 4.4~5.7배 싸고, Z.ai는 이를 모두 중국산 칩으로 처리했다고 밝혔습니다.

스테이블 디퓨전 만든 팀의 FLUX 3, 영상·소리에 공장 로봇까지 한 모델로
Black Forest Labs가 7월 23일 이미지·영상·오디오를 한 모델로 학습한 FLUX 3를 공개했습니다. 소리가 붙은 영상을 한 번에 최대 20초 만들고, 같은 모델을 뼈대로 한 FLUX-mimic은 연질 부품 키팅 과제에서 성공률 95%를 냈습니다.

코딩은 밀리고 컴퓨터 조작은 1위, 구글 제미나이 3.6 Flash 공개
구글이 7월 21일 제미나이 3.6 Flash와 3.5 Flash-Lite, 3.5 Flash Cyber를 공개했습니다. 3.6 Flash는 DeepSWE 과제당 출력 토큰을 27만 6,000개에서 9만 7,000개로 줄였고, 출력 단가는 100만 토큰당 7.5달러로 내렸습니다.

함께 나오는 용어5
- 토큰모델이 텍스트 등을 나누어 처리하는 단위입니다. 단어 전체, 단어의 일부, 문자나 기호가 토큰으로 나뉠 수 있으며, 같은 문장도 토크나이저와 언어에 따라 개수가 달라집니다. 글자 수와 고정된 비율로 대응하지 않습니다. 입력·출력 토큰 수는 컨텍스트 한도와 API 과금의 기준으로 쓰입니다.
- 파라미터모델 안의 숫자(가중치) 개수입니다. '7B'는 70억 개를 가리키고, 대체로 클수록 똑똑하지만 비쌉니다.
- 오픈소스 라이선스공개된 가중치를 누가 어떤 조건으로 쓸 수 있는지 정하는 약관입니다. MIT와 아파치 2.0은 조건 없이 고치고 팔 수 있게 열어 두는 반면, 사용 지역이나 상업 이용에 제한을 붙인 자체 라이선스도 흔합니다. 텐센트 커뮤니티 라이선스는 EU와 영국, 한국을 사용 가능 지역에서 빼 두었다가 아파치 2.0 전환으로 그 조항을 없앴습니다.
- 에이전트한 번 답하고 멈추지 않고, 스스로 계획하고 도구를 부르고 결과를 확인하며 여러 단계를 이어가는 AI입니다. 브라우저·터미널·앱을 대신 조작하는 것이 대표 예입니다.
- MoEMixture of Experts. 큰 모델 안에 여러 '전문가' 조각을 두고 토큰마다 일부만 켜는 구조입니다. 파라미터는 많지만 계산은 적게 듭니다.
어려운 말은 풀어서, 매주 한 통
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
