


리퀴드 AI가 한국 시각 10월 8일 새벽 2시께 결정 모델 d1-3B와 실험판 d1-omni-600M의 가중치를 허깅페이스에 공개했습니다.
결정 모델은 글을 생성하지 않고 한 번의 계산으로 선택지나 확률을 내놓는 모델로, d1-3B는 텍스트와 이미지를, d1-omni-600M은 텍스트와 함께 이미지나 음성을 받습니다.
d1-3B는 공개 데이터셋 7개 평균 82.9점으로 Decider 4B(81.1점)를 앞섰고, Decision Index 0.2.1에서는 48.57점으로 매개변수 100억 개 미만 결정 모델 가운데 가장 높았습니다.
Choi
엔비디아와 함께 잰 속도에서 d1-3B는 질문 하나에 젯슨 AGX 토르에서 16밀리초, RTX 4090에서 8밀리초가 걸렸습니다. 리퀴드 AI는 d1-omni-600M을 아직 개발 중인 연구용 공개판으로 소개했고, 음성 판단을 재는 공개 평가가 없어 이미지·음성 점수는 내지 않았습니다.
구글 딥마인드가 한국 시각 10월 7일 새벽 1시 온디바이스용 멀티모달 임베딩 모델 EmbeddingGemma 2를 아파치 2.0 라이선스로 공개했습니다.
매개변수 7억 4,000만 개 모델로 텍스트와 코드, 이미지, 음성, 영상을 같은 768차원 벡터로 바꾸고, 문맥 길이는 8K 토큰으로 1세대의 4배입니다.
양자화하면 픽셀 11 프로에서 텍스트 전용은 약 191MB, 멀티모달 전체는 약 567MB 메모리로 돌아갑니다.
Choi
임베딩(글이나 그림을 비교할 수 있는 숫자 벡터로 바꾼 값)은 검색과 추천의 기본 재료라, 휴대폰 안에서 사진과 녹음, 문서를 함께 찾는 기능을 서버 없이 만들 수 있습니다. 1세대는 다운로드 2,000만 회를 넘겼고, 2세대는 코드 검색 평가 MTEB Code 점수를 68.76에서 78.68로 올렸습니다.
블리핑컴퓨터는 한국 시각 10월 4일 저녁, 앤트로픽이 Claude의 음성 기능을 쓰는 사용자에게 음성 데이터를 AI 모델 개선에 써도 되는지 묻는 안내를 띄우기 시작했다고 보도했습니다.
사용자는 「허용」이나 「나중에」를 고를 수 있고, 설정의 개인정보 메뉴에 음성 데이터 사용을 켜고 끄는 항목이 따로 생겼습니다.
이 항목은 기존의 채팅·코딩 기록 학습 동의와 별개로 작동합니다.
Choi
블리핑컴퓨터가 확인한 화면에서는 음성 학습 항목이 기본으로 꺼져 있었고, 앤트로픽은 나중에 설정에서 끄거나 음성 데이터를 지울 수 있다고 안내했습니다.
마이크로소프트 AI가 한국 시각 10월 2일 새벽 1시 MAI-Transcribe-2-Streaming과 음성 합성 모델 MAI-Voice-2.1, MAI-Voice-2.1-Flash를 공개했습니다.
받아쓰기 모델은 60개 언어를 자동으로 가려내며, 소리를 받은 지 100밀리초 남짓에 첫 가안을 내고 문맥이 쌓이는 대로 고칩니다.
Artificial Analysis의 확정·중간 받아쓰기 정확도에서 모두 1위에 올랐고, 연말까지 소개 가격은 오디오 1시간당 0.54달러입니다.
Choi
음성 에이전트는 듣기부터 말하기까지를 사람이 대화로 느끼는 짧은 시간 안에 끝내는 것이 관건이라, 받아쓰기가 빨라진 만큼 추론과 도구 호출에 쓸 시간이 늘어납니다. 함께 나온 MAI-Voice-2.1-Flash는 45초 분량 음성을 종단 지연 150밀리초로 만들고 100만 자당 15달러를 받습니다.
큐타이가 스마트폰이나 PC에서 직접 돌아가는 1억(100M) 파라미터 음성 합성 모델 PocketTTS의 새 학습 방법을 공개했습니다.
단어 오류율(WER) 1% 미만에 음성 복제를 지원하고, 코드도 공개돼 있습니다.
Deng 등이 제안한 Drifting을 적용해 한 번의 연산으로 다음 음성 표현을 만들도록 학습했고, 큐타이는 음성 모델과 자기회귀 모델에 Drifting을 쓴 첫 사례라고 밝혔습니다.
Choi
큐타이는 9월 28일 블로그에서 PocketTTS의 샘플러 헤드를 플로 매칭 대신 Drifting으로 학습해 한 단계 만에 같은 품질을 냈다고 설명했습니다.
인셉션이 음성 AI 에이전트용 확산 언어모델(dLLM) Mercury Voice를 기업 고객에게 정식 출시했습니다.
음성 대화는 상대가 말을 마친 뒤 약 500밀리초 안에 답해야 어색한 침묵이 생기지 않습니다.
인셉션은 답변 첫 토큰까지 걸린 시간이 중앙값 320밀리초로 다음으로 빠른 모델의 절반이었고, τ³-bench 등 평가에서 GPT-6 Luna와 Gemma 4 31B보다 성능이 높았다고 밝혔습니다.
Choi
가격은 입력 100만 토큰당 0.40달러, 출력 1.50달러이고 출시 기념으로 절반 가격에 제공합니다. 추론 강도는 낮음·중간·높음 세 단계에서 고릅니다.
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.