클라우드플레어가 10월 2일 새벽 공개한 결정 모델 가운데 작은 Clef-flash는 응답 지연 중앙값이 38.8밀리초로, 타입세이프의 Jev(524.1밀리초)보다 약 13배 빨랐습니다.
결정 모델은 글을 생성하지 않고 주어진 선택지 가운데 답을 골라 확률과 함께 돌려주며, Clef는 텍스트와 함께 이미지도 보고 판단합니다.
두 모델은 Jev API와 호환되고 가중치는 아파치 2.0 라이선스로 공개됐습니다.
Choi
Clef는 큐원3.8-27B, Clef-flash는 큐원3.5-9B를 고정해 바탕으로 썼고, 강화학습 미세조정은 지금은 클라우드플레어 엔지니어가 함께하는 서비스로 제공하며 셀프서비스 플랫폼은 나중에 내놓습니다.


Ollama 0.35에 새 /v1/systemone API가 들어가, Jev처럼 정해진 선택지 가운데 하나를 빠르게 고르는 결정 모델을 로컬에서 실행할 수 있습니다.
긴 답을 만드는 대신 선택지를 고르는 방식이라 문의 분류와 AI 모델 라우팅, 콘텐츠 검수 같은 작업에 씁니다.
Nimble과 Tev1 4B, Tev1 0.8B를 지원하며 ollama pull nimble로 내려받아 실행합니다.
Choi
Ollama 블로그 기준으로 Nimble 9B는 M5 Max 맥북 프로에서 판단 한 번에 평균 91밀리초가 걸렸습니다. Nimble은 Bespoke Labs가, Tev1은 투게더 AI가 만든 모델입니다.
jevgrep은 Jev를 쓰는 탐색 단계가 코드베이스를 훑어 필요한 파일과 원문 일부만 추려 코딩 에이전트에 넘깁니다.
처음 공개한 SWE-bench 과제 10개 비교에서는 비용이 약 40% 줄었지만 푼 과제가 7개로 기준선보다 1개 적었습니다.
다시 잰 결과는 기준선과 같은 8개를 풀면서 Sol 비용이 7.62달러에서 5.44달러로 28.6% 줄었습니다.
Choi
jevgrep은 Python, TypeScript·JavaScript, Go, Rust의 선언을 파싱해 관련 파일 위치와 원문 발췌를 한 번의 출력으로 돌려주고, 구현과 테스트는 호출한 코딩 에이전트가 맡습니다.
Google Gemma는 Cloud Run에서 명령 하나로 Jev API와 호환되는 서버를 띄우는 방법을 공개했습니다.
요청 1건은 약 35~60ms가 걸리고, 32건을 동시에 처리하면 초당 약 100~123건을 소화합니다.
RTX PRO 6000을 쓰며 요금은 실행 중일 때 시간당 약 3.19달러, 쓰지 않을 때는 0달러입니다.
Choi
Cloud Run은 요청이 없으면 인스턴스를 0대로 줄이는 서버리스 방식이라, 실험 단계에서는 켜 둔 시간만큼만 돈이 나갑니다.
Gemma 4 12B를 바탕으로 텍스트와 이미지, 음성, 영상을 보고 선택지마다 확률을 매기는 의사결정 모델이며 개인 프로젝트로 만들었습니다.
H200에서 텍스트는 약 83ms, 이미지는 26ms, 13초 음성은 31ms에 처리하고, Apache 2.0으로 공개됐습니다.
개발자는 아직 Jev보다 성능이 낮다고 밝혔습니다.
Choi
Jev류 모델은 문장을 생성하지 않고 주어진 선택지에 확률만 매기기 때문에, 한 번의 판단이 수십 밀리초 안에 끝납니다.
이 조합의 모델 비용은 GPT-6 Astra의 컴퓨터 제어 방식보다 약 112배, 스크린샷 기반 방식보다 약 245배 낮았습니다.
Jev만 브라우저를 직접 조작했을 때는 49개 중 25개만 성공했지만, WebMCP를 붙이자 49개 모두 성공했습니다.
화면을 보고 버튼 위치를 찾아 하나씩 클릭하는 대신, 웹사이트가 ‘상품 검색’, ‘예약’ 같은 기능을 AI에게 도구로 직접 제공하는 방식입니다.
에이전트 경쟁에서 모델 성능만큼 웹사이트와 연결하는 방식이 중요해질 것 같습니다.
Choi
웹사이트가 기능을 도구로 내주면 화면을 찍어 읽고 클릭 위치를 찾는 과정이 빠집니다. 같은 Jev가 브라우저 직접 조작으로는 25개, WebMCP로는 49개를 풀었습니다.



매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.