이 글 어땠어요?
결과가 나오면 맞았는지 그대로 적어요.
AI 모델이 발전할수록 로봇의 작업 능력도 함께 좋아질 수 있다
HomeBody는 VLM을 바꿔 끼울 수 있게 설계됐지만, 다른 모델로 같은 과제를 돌린 결과는 아직 없습니다.
새로 학습시킨 행동 모델은 없습니다. GPT-6 Astra가 이동·집기·놓기·서랍 열기·서랍에서 집기 다섯 기술을 골라 부르고, 균형은 미리 학습된 AMO 제어기가 맡으며, 그 주방을 위한 추가 학습 데이터도 쓰지 않았습니다.
공개되지 않았습니다. 프로젝트 페이지에는 과제 두 개의 시연만 있고, 기술 영상은 빠르게 돌린 데다 서랍 열기와 집기 영상에는 재시도 과정이 들어 있다고 연구진이 밝혔습니다.
GitHub 저장소는 9월 26일 만들어졌지만 「Code coming soon」이라는 README와 그림만 있고 라이선스 파일도 없습니다. 논문도 곧 공개로 표시돼 있습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
뉴욕시의회가 10월 5일 AI 4사 정책 책임자를 선서시키고 에이전트가 안전장치를 늘 지키느냐고 물었지만 보장한 회사는 없었습니다. 회사를 떠난 연구자 3명도 증언했고, 의회는 제3자 검증·신고 보상 법안 10건을 심사했습니다.

엔비디아가 9월 28일 Open Agent Safety Platform을 공개했습니다. 자체 실험에서 AI 심사관은 416번 결정 가운데 한 번 속았지만 바깥의 집행 장치가 막았고, 정책 증명기는 아직 MCP·GraphQL 규칙을 검사하지 못합니다.
앤트로픽이 10월 1일 공개한 로봇 노출 지수에서 로봇은 미국 물리 과업의 74%, 전체 노동시간의 34%를 해낼 수 있었습니다. 사람보다 싼 일은 0.3%였고, 로봇 가격이 지금 추세로 내리면 10%까지 40년이 걸립니다.

뉴욕시의회가 10월 5일 AI 4사 정책 책임자를 선서시키고 에이전트가 안전장치를 늘 지키느냐고 물었지만 보장한 회사는 없었습니다. 회사를 떠난 연구자 3명도 증언했고, 의회는 제3자 검증·신고 보상 법안 10건을 심사했습니다.

엔비디아가 9월 28일 Open Agent Safety Platform을 공개했습니다. 자체 실험에서 AI 심사관은 416번 결정 가운데 한 번 속았지만 바깥의 집행 장치가 막았고, 정책 증명기는 아직 MCP·GraphQL 규칙을 검사하지 못합니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
@giohuh_X 게시물 · 원문 보기
제1저자인 칼텍 학부 연구원 지오 허(Gio Huh)가 X에 올린 52초짜리 시연 영상입니다. 영상은 처음 보는 주방에 G1을 데려가 GPT-6 Astra에게 조종을 맡겼다는 자막으로 시작하고, 글에는 방을 가로질러 정리하는 일부터 모호한 요청을 받아 기억해 둔 물건을 가져오는 일까지 해냈다고 적었습니다. 프로젝트 페이지는 모델 이름을 GPT Astra로 적었습니다.
Astra에게 휴머노이드의 몸을 주면 무엇을 할 수 있는지 알아보려고 HomeBody를 만들었습니다.— 지오 허, HomeBody 제1저자
첫 과제는 주방 정리입니다. 연구진은 「커피 봉지를 모두 가운데로 모으고, 상한 우유 팩과 오렌지주스 팩은 전부 버려 달라」고 지시했고, HomeBody는 방 이곳저곳을 여러 번 오가며 커피 봉지를 아일랜드 식탁 위로 옮기고 지정된 팩을 쓰레기통에 넣었습니다. 로봇이 움직일 때마다 카메라에 보이는 화면이 달라지기 때문에, 무엇을 끝냈고 무엇이 남았는지는 기억과 동작 결과로 따라갑니다.
두 번째 과제는 「약을 깜빡했는데 가져다줄래? 가는 김에 상한 팩도 버려 줘」라는 지시였습니다. 약은 처음에 로봇의 시야 밖, 닫힌 서랍 안에 있었습니다. HomeBody는 탐색 때 저장한 화면으로 서랍 위치를 찾아 그 앞까지 걸어가 오른손으로 손잡이를 잡아 서랍을 열고, 약을 꺼내 사람에게 건넨 뒤, 왼손으로 상한 팩을 집어 버렸습니다. 지시문에는 약이 어디 있는지, 어느 손을 쓸지가 적혀 있지 않았습니다.

휴머노이드를 움직일 때 널리 쓰이는 구조는 세 단계로 나뉩니다. 시각 언어 모델(VLM)이 화면과 지시를 이해하는 시스템 2, 그 판단을 동작 명령으로 바꾸도록 학습시킨 시각·언어·행동 모델(VLA)이 시스템 1, 온몸의 균형과 관절을 제어하는 시스템 0입니다. 구글 딥마인드가 7월에 공개한 Gemini Robotics ER 2도 판단 모델이 로봇 쪽 VLA에 지시를 내리는 방식이었습니다.
Astra 같은 최전선 VLM이 강해질수록, 고수준 추론과 로봇의 기술 사이에 학습된 VLA가 여전히 필요한지 묻게 됩니다.— HomeBody 연구진, 프로젝트 페이지
HomeBody는 가운데의 VLA를 빼고, 연구진이 미리 만들어 둔 기술 목록에서 Astra가 하나를 골라 대상과 함께 넘기게 했습니다. 기술은 이동, 집기, 놓기, 서랍 열기, 서랍에서 집기 다섯 가지이고, 모두 같은 형식으로 목표를 받고 실행 결과를 돌려줍니다. 학습된 정책이든 고전적인 알고리즘이든 같은 형식만 맞추면 기술을 더 붙일 수 있다고 연구진은 적었습니다.

| 기술 | 하는 일 | Astra가 넘기는 값 |
|---|---|---|
| 이동 | 재구성한 지도 위 경로를 따라 걷기 | 지도 좌표(미터)의 목표점과 바라볼 지점 |
| 집기 | 카메라 화면에서 고른 물체를 잡아 들기 | 0~1000으로 정규화한 화면 좌표, 쓸 손 |
| 놓기 | 든 물체를 정한 지점에 내려놓기 | 쓸 손, 몸통 기준 3차원 목표, 놓는 거리 |
| 서랍 열기 | 손잡이에 맞춰 걸고 뒤로 걸어 열기 | 프로젝트 페이지에 표기 없음 |
| 서랍에서 집기 | 열린 서랍 안의 물체를 가장자리 위로 들어 올리기 | 프로젝트 페이지에 표기 없음 |
집기 하나에도 여러 도구가 맞물립니다. Astra가 화면의 한 점을 찍으면 분할 모델 SAM이 물체를 오려 내고, Fast-FoundationStereo가 인텔 리얼센스 D435i 카메라의 스테레오 영상에서 깊이를 계산하고, 3차원으로 옮긴 물체 모양에서 잡을 자세를 계산합니다. 팔은 최소 저크 시간표의 스플라인 경로와 역기구학으로 움직이고, 지나가는 길에 부딪힐 것이 없는지도 확인합니다. Astra는 이 저수준 구현을 몰라도 됩니다.
Astra가 기술을 고를 때 보는 것은 지금의 카메라 화면과 지도 맥락, 손에 무엇을 쥐었는지, 꺼내 본 과거 화면, 직전 기술의 결과이고, 고른 기술과 대상은 구조화된 도구 호출(tool call)로 넘깁니다. 올트먼은 9월 인터뷰에서 Astra가 컴퓨터를 쓰는 능력은 사람 수준이라고 말했고, HomeBody는 같은 도구 호출 형식으로 로봇의 기술을 부릅니다.
실수는 기술 안에서 먼저 고칩니다. 다가가는 동안 화면 속 물체 위치가 움직이면 SAM 2.1과 SAMURAI로 물체를 추적해 자세를 맞추고, 손을 오므렸는데 아무것도 잡히지 않으면 다른 잡기 후보를 시도하거나 선 위치를 고쳐 다시 계획합니다. 이 재시도는 횟수가 정해져 있고, 다 써도 안 되면 실패 이유를 Astra에게 돌려보내 다른 대상이나 다른 계획을 고르게 합니다. 하체는 미리 학습된 AMO 제어기가 팔의 목표를 반영해 균형을 잡고, 팔과 손 명령은 초당 250번, AMO 정책은 초당 50번 갱신됩니다.
연구진은 방 전체를 오가며 일하려면 눈에 보이는 물체와 기억해 둔 위치를 잇는 내부 공간 모델이 있어야 하고, 이 모델이 모호한 요청을 푸는 데도 쓰인다고 설명했습니다. 그래서 일을 맡기기 전에 로봇이 먼저 방을 돌아다닙니다. 「너는 주방 로봇이야, 공간을 탐색해 봐!」라는 지시를 받은 Astra가 다음에 갈 지점을 고르고, 그동안 0.5배 광각 아이폰 영상과 D435i 카메라 화면, SLAM(위치를 추정하며 지도를 그리는 기술)으로 만든 라이다 지도, 관절 자세가 쌓입니다. 이어 Astra가 이 자료로 엔비디아 Isaac Sim 안에 주방의 디지털 트윈을 만듭니다. 사람이 찍은 영상만 주면 방의 크기를 겉모습으로 어림해야 하지만, HomeBody는 SLAM으로 잰 실제 기하 정보를 함께 넣어 크기를 맞춥니다.
현장에서 일할 때는 위치 추정 기술 Super Odometry로 G1의 위치를 잡고, SLAM 지도와 재구성한 시뮬레이션을 ICP 정합으로 같은 좌표계에 맞춥니다. 로봇이 본 화면은 이 좌표계 안에 설명과 함께 저장되고, Astra는 필요할 때 그 화면을 꺼내 보거나 기록된 위치로 돌아갑니다. 프로젝트 페이지의 구조도에는 약 서랍, 우유 팩 위치, 카운터 앞의 사람이 저장된 화면 세 장으로 떠 있고, 현재 진행 상황은 「약 가져오기, 사람에게 건네기」를 마친 뒤 「팩 버리기」를 하는 중으로 표시됩니다.

블랙 포레스트 랩스가 9월 23일 공개한 로봇 모델 FLUX 3 Action은 지금의 카메라 화면과 지시를 받아 앞으로 2초 동안의 동작 32개를 내놓는 모델이고, 공책이 상자를 덮어 40%만 보이는 상황도 시험했습니다. HomeBody의 약은 처음에 닫힌 서랍 안에 있어 화면에 보이지 않았고, 로봇은 저장해 둔 화면으로 서랍을 찾아갔습니다. 저는 스레드에서 이 연구를 로봇마다 모든 행동을 새로 학습시키는 대신 범용 AI의 추론과 기억을 로봇의 몸에 연결하는 방식으로 소개했습니다.
9월 넷째 주에는 로봇을 움직이는 방식을 달리한 발표가 잇따랐습니다. FLUX 3 Action은 70억 파라미터 모델로 화면과 동작을 함께 예측하고, 로봇 팔 데이터 DROID로 파인튜닝해 RoboLab-120 벤치마크에서 42.92%를 기록해 160억 파라미터 Cosmos3-Nano-Policy(36.8%)를 앞섰습니다. 저가 로봇 팔 SO-101용 정책은 원격 조종 시연 약 200회로 맞췄고, 가중치는 FLUX Kommunity 라이선스 v1.0으로 공개했습니다. 같은 날 Skild AI는 로봇 기반 모델 S1이 시뮬레이션에서 최근 버전의 자신과 140년 분량의 축구 경기를 치르며 익힌 정책을 실제 휴머노이드로 옮겼다고 발표했고, 같은 방식을 가상의 건설 현장과 공장, 가정에서 훨씬 오래 돌리는 방향을 예고했습니다.
| 발표 | 로봇을 움직이는 방식 | 공개한 성공률 |
|---|---|---|
| Gemini Robotics ER 2(구글 딥마인드, 7월) | 판단 모델이 로봇의 VLA에 지시 | 실제 로봇 60.0%, 사람이 원격으로 수행하면 74.0% |
| FLUX 3 Action(블랙 포레스트 랩스, 9월 23일) | 화면과 동작을 함께 예측하는 7B 모델 | RoboLab-120 42.92% |
| Skild AI 물리 자가 대결(9월 23일) | 시뮬레이션 140년 자가 대결 뒤 실제 휴머노이드로 이전 | 없음(시합 영상) |
| HomeBody(스탠퍼드·칼텍, 9월 26일) | GPT-6 Astra가 기술 5개와 공간 기억을 호출 | 없음 |
구글과 블랙 포레스트 랩스는 성공률을 숫자로 냈고, 범용 모델에 기술을 붙인 HomeBody는 과제 두 개의 시연을 내놓았습니다. GPT-6 Astra가 9월 3일 나온 뒤에는 Astra가 설계한 로봇 개를 시뮬레이션에서 걷게 한 사례가 나왔는데, 그때는 실제 기체로 옮기기 전이었고 성공률도 없었습니다.
프로젝트 페이지에는 과제가 몇 번 중 몇 번 성공했는지, 사람이 몇 번 개입했는지가 없습니다. 과제 목록 끝에는 「곧 더 공개합니다(More coming soon)」라고 적혀 있고, 논문 버튼은 「곧 공개」, GitHub 저장소는 9월 26일 만들어진 뒤 「코드는 곧 공개(Code coming soon)」라는 README와 그림만 있으며 라이선스 파일도 없습니다.
공개한 영상에도 단서가 붙어 있습니다. 기술 미리보기 영상은 대부분 7~10초 안팎으로 빠르게 돌렸고(집기·놓기는 1.25배, 서랍에서 집기는 14배에서 4배), 서랍 열기와 집기 영상에는 다시 시도한 과정이 기록돼 있다고 연구진이 밝혔습니다. 서랍에서 집기 영상은 서랍이 열린 상태에서 시작하고, 재시도 과정을 이어 붙인 뒤 마지막 성공 동작만 속도를 늦췄습니다. 시연 영상 첫 화면의 G1은 주황색 크레인 고리에 연결된 끈을 몸에 단 채 서 있습니다.
연구진이 직접 꼽은 한계도 있습니다. 디지털 트윈을 만드는 데 준비 시간과 API 비용이 들고, 작업 길이는 로봇 팔이 닿는 범위와 손의 조작 능력, 장시간 작동 때 손가락 서보가 과열되는 하드웨어 내구성에 묶입니다. GPT-6 Astra의 추론 지연 때문에 기술과 기술 사이에 멈춤이 생기고, 현재 구성은 RTX 4090 노트북 GPU가 있어야 돌아갑니다. 실험 공간인 주방은 스탠퍼드 로보틱스 센터가 내줬고, Astra를 부르는 API 크레딧은 TML이 댔습니다.
HomeBody를 돌리는 장비는 로봇과 노트북, 원격 모델 셋입니다. 기술과 인식, 동작 계획은 RTX 4090을 단 레이저 블레이드 노트북 한 대에서 돌고, GPT-6 Astra는 원격으로 기술 요청과 목표를 보내고 실행 결과를 받습니다. 유니트리 공식 페이지의 G1 시작가는 1만 3,500달러(세금·배송비 제외, 8월 23일 보관본 기준)이고, 연구진이 쓴 G1 구성의 가격은 따로 밝히지 않았습니다. 연구진은 Astra를 다른 VLM으로 바꿔 끼울 수 있다고 적었지만, 다른 모델로 같은 과제를 돌린 결과는 아직 내놓지 않았습니다.
로봇을 새로 학습시키지 않고 범용 모델의 판단에 기술 목록과 공간 기억을 붙이는 방식이 실제 가정에서 얼마나 자주 통하는지는 성공률과 재현 결과가 나와야 셀 수 있습니다. 연구진은 논문과 코드, 추가 과제를 모두 「곧 공개」로 걸어 두었습니다.
읽어 주셔서 고맙습니다.
초이 드림