


텍스트 성능은 기존 V4-Flash와 같습니다.
에이전트, 추론, 지식 전부 그대로인데 이미지를 읽는 능력이 붙었고, 멀티모달 에이전트 벤치마크에서는 Opus 4.8 턱밑까지 올라왔다고 밝혔습니다.
일부 에이전트 평가에서는 비전을 달고도 오히려 점수가 올라, 애초에 비전까지 학습해두고 눈만 가려둔 모델이었다는 평가가 나옵니다.
가격은 이미지를 장당 최대 384토큰으로 환산해 기존 Flash 요금 그대로 받고, 한 번 올린 이미지를 재사용하는 Files API는 무료입니다.
스크린샷을 읽고 화면을 이해하는 에이전트 작업까지 이 가격대로 내려와, 저렴한 에이전트를 쓸 수 있는 작업이 늘었습니다.
가중치 공개는 아직인데, 지난달 가중치를 풀었던 전례를 보면 이번에도 시간문제일 가능성이 높습니다.
Choi
이미지를 장당 최대 384토큰으로 환산해 텍스트와 같은 요금을 받으므로, 스크린샷을 여러 장 읽는 에이전트 작업도 기존 V4-Flash 단가로 계산됩니다.
텍스트와 이미지를 함께 검사하며, 고정된 유해성 분류표 대신 자연어로 정책을 입력하면 해당 기준에 맞춰 안전 점수를 반환합니다.
정책이 바뀌어도 재학습할 필요가 없습니다.
16GB GPU 한 장에서 돌아가고, 최대 7배 큰 모델과 맞먹는 성능을 냈습니다.
“검열 모델”이라는 조롱도 많았지만, 필터링 기준을 API 기업 대신 사용자가 정하게 됐습니다.
기업이 자체 장비에서 정책을 직접 정하고 감사할 수 있습니다.
Choi
안전 기준을 자연어로 적어 넣는 방식은 정책 자체를 버전 관리 대상으로 만듭니다. 재학습 없이 기준만 고치는 운영이 가능해집니다.
FLUX 3는 이미지, 영상, 오디오를 하나의 모델에서 처리하며, 앞으로 로봇의 동작 예측까지 지원하는 것이 특징입니다.
현재는 영상과 오디오를 함께 생성하는 FLUX 3 Video가 얼리 액세스로 제공되고 있으며, 이후 이미지 생성·편집과 오픈 웨이트 모델도 순차적으로 공개될 예정입니다.
특히 mimic과 함께 개발한 FLUX-mimic은 Audi의 로봇에도 적용되고 있습니다.
Choi
이미지·영상·오디오를 생성하는 모델이 로봇 동작 예측까지 맡아, 콘텐츠 생성과 로봇 제어가 같은 기반 모델을 씁니다. 오픈 웨이트 모델은 이미지 생성·편집에 이어 순차적으로 공개됩니다.
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.