
모델이 화면을 보고 마우스·키보드를 직접 움직여 앱과 브라우저를 다루는 기능입니다. API가 없는 프로그램까지 자동화할 수 있지만, 잘못 눌렀을 때 되돌리기 어렵습니다.
용어 자세히 보기


개발자는 소프트웨어를 직접 조작해 일을 끝내는 에이전트를 만들 수 있고, Codex의 다중 에이전트 기능과 도구 검색, 도구 호출, 문맥 압축도 앱에 가져올 수 있습니다.
API와 Pro 500·Enterprise의 Codex와 ChatGPT Work에서 쓸 수 있습니다.
아마존과 함께 만든 Bedrock Managed Agents로는 오픈AI 에이전트를 전부 AWS 안에서 돌릴 수 있습니다.
Choi
실행 인프라를 오픈AI가 운영해, 개발자는 에이전트를 돌릴 서버를 직접 꾸리지 않고 앱 개발에 집중합니다.
저는 이번 Gemini 3.6 Flash의 벤치마크를 보면서 구글이 전략을 아예 바꾼 것처럼 느꼈습니다.
순수 코딩 점수는 GPT-5.6 Luna나 Grok 4.5, 클로드 소네트 5에 밀리지만, 컴퓨터 사용(OSWorld), 복잡한 차트 해석, 롱컨텍스트에선 전부 1등이고, 특히 롱컨은 100만 토큰 구간에서 3.5 Flash보다 두 배 넘게 뛰었습니다.
저는 구글이 뒤처졌다는 의미보다는 계산된 선택이라고 봅니다.
인지 작업에 필요한 성능은 이미 웬만큼 넘어섰고, 이제 승부는 실제 업무를 얼마나 잘 수행하느냐가 중요해지고 있습니다.
실제로 밖에 나가 보면 현장 사무에서 가장 많이 쓰이는 모델은 Gemini입니다.
강한 비전과 문서 처리, 워크스페이스에 붙은 접근성 덕분입니다.
개발자들은 구글이 코딩에서 밀려 멀어진다고 보지만, 저는 해자 없는 리더보드 1등을 좇는 대신, 이미 이기고 있는 실무 현장을 싸고 빠른 모델로 굳히려는 쪽으로 방향을 튼 것이라고 생각합니다.
Choi
Gemini 3.6 Flash는 순수 코딩에서 GPT-5.6 Luna·Grok 4.5·소네트 5에 밀렸지만 OSWorld와 100만 토큰 롱컨텍스트에서 앞섰습니다. 현장 사무에서 많이 쓰는 비전·문서 처리 쪽 점수입니다.
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.