

Pruna-Qwen-Image-2.1은 40단계였던 생성 과정을 5~8단계로 줄입니다.
5단계는 속도에, 8단계는 속도와 품질의 균형에 맞췄고, 1K 이미지 생성과 편집에 참고 이미지를 최대 3장까지 씁니다.
기존 Qwen-Image-2.1 위에 LoRA만 얹으면 되고 Diffusers에서도 쓸 수 있습니다.
Choi
확산 모델은 노이즈를 걷어 내는 단계마다 모델을 한 번씩 돌리기 때문에, 40단계를 5~8단계로 줄이면 계산 횟수가 그만큼 줄어 최대 6.3배 속도가 나옵니다.
소식AI

Mobile Planner Agent가 계획을, Mobile-Use Agent가 앱 실행을, Mobile Creative Agent가 콘텐츠 제작을 나눠 맡는 에이전트 세 개로 구성됩니다.
복잡한 요청을 단계별로 계획하고 여러 앱을 직접 조작한 뒤 필요한 결과물까지 만듭니다.
Qwen은 MobileWorld 82.1, AndroidDaily 97.2를 기록했고 전체 작업 완료율은 90%라고 밝혔습니다.
Choi
Mobile-Use Agent는 API로 처리할 수 있는 일은 API로 먼저 하고, 안 되는 경우에만 화면을 직접 누르는 GUI 조작으로 넘어갑니다.
7B 이미지 생성·편집 모델인 Qwen-Image-2.1을 12GB VRAM 그래픽카드에서 로컬로 실행할 수 있습니다.
Dynamic FP8과 오프로딩을 쓰면 6GB VRAM에서도 돌아간다고 밝혔습니다.
Unsloth는 이 모델의 성능이 Nano Banana 2.0과 비슷하다고 설명했습니다.
Choi
GGUF는 양자화한 가중치를 담는 파일 형식이라 같은 모델을 더 작은 그래픽 메모리에 올릴 수 있고, Qwen-Image-2.1은 Qwen Research License라 상업 이용에는 별도 허가가 붙습니다.
ASR, TTS, Realtime을 개선하고 ASR-Next와 TTS-Next를 더해 모델 5개로 구성했습니다.
받아쓰기, 음성 이해, 목소리 생성, 실시간 대화, 효과음이 섞인 오디오 생성을 모델마다 나눠 맡습니다.
가격은 기존보다 TTS가 약 70%, Realtime이 약 85%, ASR이 최대 95% 내려갔습니다.
Choi
ASR 가격이 최대 95% 내려가면 같은 예산으로 받아쓸 수 있는 음성 시간이 최대 20배로 늘어납니다.
Qwen4-Max, Qwen4-Plus, Qwen4-Flash, Qwen4-27B를 준비 중이며 Qwen4는 지금 학습 단계입니다.
그다음 Qwen4.5와 Qwen5는 5~10조 파라미터까지 키울 계획입니다.
차세대 영상 생성 모델도 11월 공개를 예고했고, 긴 영상의 일관성과 인물·카메라 제어, 이야기 흐름 이해를 개발 방향으로 밝혔습니다.
Choi
이번 발표는 학습 중인 모델의 이름과 규모 계획이고, 네 모델의 출시일과 가격은 나오지 않았습니다.
60개 언어의 음성을 텍스트로 통역할 수 있고, 한국어를 포함한 29개 언어는 번역된 음성까지 바로 생성합니다.
평균 통역 지연시간(LAAL)은 이전 세대 2.8초에서 2.3초로 줄었습니다.
여러 명이 대화해도 화자를 실시간으로 구분하고, 번역 음성에서도 각 화자의 목소리를 유지합니다.
원문과 번역문을 동시에 표시하며 이전 대화까지 참고해 사람 이름이나 전문 용어도 일관되게 번역할 수 있습니다.
Choi
지연이 2.3초로 줄고 화자마다 목소리를 유지하면 여러 사람이 참여하는 회의에도 쓸 수 있습니다. 한국어는 번역 음성까지 바로 생성하는 29개 언어에 들어갑니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.