이 글 어땠어요?
SK텔레콤 70.6점, 업스테이지 69.9점, LG AI연구원 69.0점, 모티프테크놀로지스 65.8점입니다. 과기정통부는 8월 27일 모티프의 요청과 다른 팀의 동의를 받아 세부 점수를 공개했습니다.
3위 LG AI연구원과 견주면 AAII에서 4.1점 앞섰지만 전문가 평가에서 2.4점, 전문 사용자 평가에서 2.9점, 국민 평가에서 1.9점 뒤졌습니다.
전문 사용자 49명과 국민 185명이 각 팀의 웹사이트에서 모델을 쓰고 1~5점을 절대평가로 매겼고, 평균을 15점과 10점 만점으로 환산했습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
뉴욕시의회가 10월 5일 AI 4사 정책 책임자를 선서시키고 에이전트가 안전장치를 늘 지키느냐고 물었지만 보장한 회사는 없었습니다. 회사를 떠난 연구자 3명도 증언했고, 의회는 제3자 검증·신고 보상 법안 10건을 심사했습니다.

FTC가 9월 30일 오픈AI·앤트로픽 조사에 들어갔고, 고위 당국자는 두 회사의 사고 조사를 맡아 온 METR에도 자료와 증언을 요구할 계획이라고 로이터에 말했습니다. 하루 전 6개사는 외부 감사를 약속한 백악관 합의에 서명했습니다.
최태원 SK그룹 회장은 샌프란시스코 AI 서밋 무대에서 젠슨 황은 만날 때마다 칩을 더 달라 하고, 샘 올트먼은 다른 곳에 주지 말고 오픈AI에 직접 달라고 했다고 전했습니다. 같은 무대에서 올트먼은 한국 없이는 AI 혁명이 불가능했다고 말했습니다.

뉴욕시의회가 10월 5일 AI 4사 정책 책임자를 선서시키고 에이전트가 안전장치를 늘 지키느냐고 물었지만 보장한 회사는 없었습니다. 회사를 떠난 연구자 3명도 증언했고, 의회는 제3자 검증·신고 보상 법안 10건을 심사했습니다.

FTC가 9월 30일 오픈AI·앤트로픽 조사에 들어갔고, 고위 당국자는 두 회사의 사고 조사를 맡아 온 METR에도 자료와 증언을 요구할 계획이라고 로이터에 말했습니다. 하루 전 6개사는 외부 감사를 약속한 백악관 합의에 서명했습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
@motif_techX 게시물 · 원문 보기
모티프는 입장문을 낸 27일 새벽 공식 X 계정에 Motif 3를 다시 소개했습니다. 아티피셜 애널리시스 지능 지수(AAII) 47점으로 모든 오픈웨이트 모델 가운데 5위이고, 중국 밖에서 만든 모델 가운데 가장 높다는 내용입니다. 과기정통부는 8월 18일 발표에서 같은 점수를 오픈웨이트 6위로 적었습니다. 모티프는 새로 설계한 어텐션 구조로 처음부터 만들었고 B200 768장으로 약 5개월 만에 학습했다고 덧붙였습니다. 8월 18일 탈락 발표 직후에는 결과를 받아들였던 모티프가 9일 만에 공식 이의 제기로 돌아섰습니다.
8월 18일 과기정통부 발표에는 영역별 네 팀 평균과 1위·4위 격차만 실렸습니다. 그 뒤로 공개 범위를 두고 공방이 이어졌고, 모티프가 공식 이의를 낸 날 모든 점수가 나왔습니다.
| 날짜 | 있었던 일 |
|---|---|
| 8월 18일 | 2차 결과 발표. 업스테이지·SK텔레콤·LG AI연구원 통과, 모티프 탈락. 팀별 점수 비공개 |
| 8월 19일 | 이데일리·조선일보 등이 세부 점수와 평가 기준 공개 필요성을 보도 |
| 8월 20일 | 과기정통부 보도설명. 5개 세부 항목의 1위 팀과 점수, 네 팀 평균 공개 |
| 8월 25일 | 아티피셜 애널리시스가 이번 평가의 공식 평가 파트너였다고 공개 |
| 8월 27일 | 모티프 입장문과 이의 제기. 과기정통부가 네 팀 동의를 받아 세부 점수 전부 공개 |
탈락 발표 뒤에는 과기정통부 관계자를 인용해 모티프 3가 벤치마크 점수만 높았을 뿐 전문가 평가와 사용자 평가에 문제가 있었고, 추론 성능과 사용성이 떨어졌다는 보도가 나왔습니다. 벤치마크 신뢰성을 이유로 3차에서는 벤치마크 비중을 낮추겠다는 방향도 거론됐습니다. 모티프는 입장문에서 항목별 상세 점수와 벤치마크 배점 산정 근거, 사용자 평가 방법론, 전문가 평가 기준을 공개하고 재심의해 달라고 했고, 결과와 관계없이 3차에는 참여하지 않겠다고 밝혔습니다. 입장문에는 8월 25일 국무회의 대통령 보고에 독파모 성과로 47점과 글로벌 3강이 올라갔다는 대목도 있습니다. 성과로 보고된 47점이 탈락한 모티프 3의 점수입니다.
@ArtificialAnlysX 게시물 · 원문 보기
아티피셜 애널리시스는 8월 25일 한국 정부(정보통신산업진흥원)의 공식 평가 파트너로서 네 팀 모델을 독립적으로 쟀다고 밝혔습니다. AAII가 전체 평가에서 가장 큰 단일 항목(25%)이었다고 적었고, 통과한 팀이 6개월 동안 B200 약 1,000장, 팀당 약 400억 원어치를 지원받으며 다음 평가는 2027년 초에 두 팀으로 줄이는 계획이라고 소개했습니다.
과기정통부가 8월 18일 항목별 1위조차 밝히지 않은 이유는 8월 20일 보도설명자료에 나옵니다. 1차 평가 때 항목별 1위 기업을 발표했더니 점수 이상으로 1위 기업은 부각되고 나머지 기업에는 낙인이 찍힌다는 지적이 있어 이번에는 공개하지 않기로 했다는 설명입니다. 언론이 투명성 문제를 제기하자 과기정통부는 이틀 만에 1차 때와 같은 수준으로 항목별 1위와 점수를 공개했습니다.
| 세부 항목 (배점) | 1위 | 1위 점수 | 네 팀 평균 |
|---|---|---|---|
| AAII 벤치마크 (25) | 모티프 | 11.9 | 9.48 |
| NIA 벤치마크 (15) | SK텔레콤 | 13.4 | 13.05 |
| 전문가 평가 (35) | LG AI연구원 | 29.5 | 28.75 |
| AI 전문 사용자 평가 (15) | SK텔레콤 | 11.6 | 10.53 |
| 일반 국민 평가 (10) | LG AI연구원 | 7.6 | 7.03 |
과기정통부는 8월 27일 자료에서 평가 기준과 방식은 네 팀과 여러 차례 협의해 만들었고, 평가 전에 최종안을 공식 안내했을 때 이견이 없었다고 밝혔습니다. 독파모는 6개월마다 개발 목표를 새로 잡는 사업이라 평가 기준도 차수마다 팀들과 협의해 정한다는 설명입니다.
| 항목 (배점) | 업스테이지 | SK텔레콤 | LG AI연구원 | 모티프 |
|---|---|---|---|---|
| AAII 벤치마크 (25) | 9.4 | 8.8 | 7.8 | 11.9 |
| NIA 벤치마크 (15) | 13.3 | 13.4 | 12.8 | 12.7 |
| 전문가 평가 (35) | 29.1 | 29.3 | 29.5 | 27.1 |
| AI 전문 사용자 평가 (15) | 10.8 | 11.6 | 11.3 | 8.4 |
| 일반 국민 평가 (10) | 7.3 | 7.5 | 7.6 | 5.7 |
| 총점 (100) | 69.9 | 70.6 | 69.0 | 65.8 |
1위 SK텔레콤과 4위 모티프의 총점 차이는 4.8점, 통과선이 된 3위 LG AI연구원과 모티프의 차이는 3.2점입니다. 모티프와 LG를 항목별로 견주면 모티프는 AAII에서 4.1점 앞섰고 NIA에서 0.1점 뒤졌습니다. 전문가 평가에서 2.4점, 전문 사용자 평가에서 2.9점, 국민 평가에서 1.9점 뒤졌습니다. 벤치마크에서 번 4.0점보다 두 사용자 평가에서 잃은 4.8점이 컸고, 전문가 평가의 2.4점이 더해졌습니다. 8월 18일 발표가 사용자 평가의 1위·4위 격차를 5.0점으로 적었을 때 짐작된 방향과 같습니다.
K-엑사원 2.0을 낸 LG AI연구원은 AAII에서 7.8점으로 가장 낮았지만 전문가 평가와 국민 평가에서 1위를 해 3위로 통과했습니다. 네 팀 가운데 벤치마크와 사람 평가의 순위가 가장 크게 엇갈린 두 팀이 LG와 모티프였습니다.
AAII 점수는 아티피셜 애널리시스가 6월 말 공표한 기준으로 직접 재서 넘겼고, 과기정통부는 이 점수에 25/100을 곱해 넣었습니다. 9개 평가에는 가중치가 붙어 있어 에이전트 평가 GDPval-AA v2가 20%로 가장 크고, 터미널 작업 평가 Terminal-Bench v2.1이 16%, 은행 업무 도구 사용 평가 τ³-Banking이 14%입니다.
| AAII 구성 평가 (가중치) | 업스테이지 | SK텔레콤 | LG AI연구원 | 모티프 |
|---|---|---|---|---|
| GDPval-AA v2 (20%) | 31.0 | 30.5 | 24.0 | 38.7 |
| τ³-Banking (14%) | 21.6 | 16.1 | 11.5 | 35.3 |
| Terminal-Bench v2.1 (16%) | 44.2 | 39.0 | 40.4 | 74.9 |
| SciCode (8%) | 45.6 | 38.5 | 41.0 | 40.6 |
| AA-LCR (6%) | 68.3 | 66.0 | 57.7 | 72.3 |
| AA-Omniscience 정확도 (12%) | 18.8 | 18.6 | 13.1 | 30.1 |
| AA-Omniscience 환각률 (낮을수록 좋음) | 25.4 | 33.0 | 22.6 | 28.4 |
| 인류의 마지막 시험 (12%) | 28.5 | 29.6 | 18.6 | 37.0 |
| GPQA Diamond (6%) | 85.7 | 85.7 | 82.9 | 83.4 |
| CritPt (6%) | 5.7 | 8.9 | 0.9 | 6.6 |
| AAII 합계 | 37.4 | 35.0 | 31.0 | 47.4 |
| 25점 환산 | 9.4 | 8.8 | 7.8 | 11.9 |
모티프는 가중치가 큰 에이전트·코딩 평가에서 크게 앞섰습니다. Terminal-Bench v2.1에서는 74.9점으로 나머지 세 팀(39.0~44.2점)의 두 배 가까이 됐습니다. 그런데 100점 만점에서 16.4점이던 1위·4위 차이는 25점 만점으로 옮겨지며 4.1점이 됐습니다. 한국어와 안전성, 신뢰성을 보는 NIA 벤치마크는 네 팀이 12.7점에서 13.4점 사이에 붙어 0.7점밖에 벌어지지 않았습니다. 모티프는 NIA 세부 분야 가운데 신뢰성(85.9점)과 지식(74.4점)에서 SK텔레콤(95.3점, 83.1점)에 뒤졌습니다.
사용자 평가는 두 평가단이 따로 매겼습니다. AI 스타트업 대표 등 전문 사용자 49명과 성별·연령별로 뽑은 국민 185명이 각 팀의 웹사이트에서 모델을 쓰고 1~5점을 줬습니다. 과기정통부는 평가자에게 화면 디자인보다 모델이 만든 내용을 보라고 안내하고, 사이트에서 팀별 모델 순서를 무작위로 섞고, 최소 3분 이상 쓰게 했다고 밝혔습니다.
| 평가단 | 업스테이지 | SK텔레콤 | LG AI연구원 | 모티프 |
|---|---|---|---|---|
| 전문 사용자 49명 평균 (5점 만점) | 3.59 | 3.86 | 3.76 | 2.80 |
| 국민 185명 평균 (5점 만점) | 3.65 | 3.77 | 3.79 | 2.85 |
| 전문 사용자 가운데 1~2점 준 비율 | 16.3% | 6.1% | 16.3% | 36.7% |
| 국민 가운데 1~2점 준 비율 | 10.8% | 7.6% | 13.5% | 35.7% |
과기정통부가 공개한 개인별 점수로 계산하면, 모티프는 두 평가단에서 모두 5점 만점에 2.8점대를 받았고 나머지 세 팀은 3.6~3.9점이었습니다. 전문 사용자 49명 가운데 10명이 모티프에 1점을 줬고, 5점을 준 사람은 2명이었습니다. 따로 모인 두 집단이 거의 같은 폭으로 낮게 줬다는 점에서, 이 격차는 평가자 몇 명의 취향으로 설명하기 어렵습니다.
다만 무엇이 낮은 점수를 만들었는지는 이 숫자로 알 수 없습니다. 평가자가 던진 질문과 모델의 답, 응답 속도 같은 기록이 공개되지 않아서, 추론 품질 때문인지 답의 형식이나 서비스 환경 때문인지 가를 방법이 없습니다. 사람의 선호가 답의 말투와 서식에 크게 움직인다는 사례도 있습니다. 2025년 4월 메타는 사람이 두 답 중 나은 쪽에 투표하는 순위표 LMArena에 대화용으로 손본 실험판을 올려 1417점을 받았는데, 공개판을 다시 올리자 순위가 30계단 넘게 내려갔습니다. 같은 달 나온 논문 「리더보드 착시(The Leaderboard Illusion)」는 메타가 라마 4 출시 전에 이 순위표에서 비공개 변형 27개를 시험했다고 분석했습니다.
전문가 평가는 산업계 3명, 학계 5명, 연구계 2명의 외부 위원 10명이 약 5일 동안 서면평가와 질의응답으로 매겼습니다. 팀 점수는 위원별 점수에서 최고점과 최저점을 뺀 8명의 평균입니다. 위원 10명 가운데 6명이 모티프에 네 팀 중 가장 낮은 점수를 줬고, 2명은 가장 높은 점수(한 명은 공동 1위)를 줬습니다.
| 위원 | 업스테이지 | SK텔레콤 | LG AI연구원 | 모티프 |
|---|---|---|---|---|
| 위원 1~5 | 27·26·32·32·34 | 28·25·30·30·31 | 29·25·31·29·33 | 24·29·26·32·29 |
| 위원 6~10 | 31·30·26·29·26 | 32·20·30·30·30 | 31·24·28·33·30 | 31·17·22·28·28 |
| 최고·최저 뺀 평균 | 29.1 | 29.3 | 29.5 | 27.1 |
모티프가 받은 최저점은 위원 7의 17점이고, 최고·최저를 빼는 규칙에 따라 계산에서 제외됐습니다. 세부 항목을 위원 10명 평균으로 보면 모티프는 개발전략·기술(7.9점), 개발성과·계획(7.4점), 파급효과·기여계획(11.3점) 세 항목 모두에서 다른 세 팀(각각 8.1~8.6점, 8.0~8.4점, 12.3~12.6점)보다 낮았습니다. 8월 18일 발표에서 위원회가 아키텍처부터 커널까지 자체 개발했다고 호평한 모티프가 개발전략·기술 항목에서도 가장 낮은 평균을 받았습니다.
과기정통부는 뒤늦게 합류한 모티프를 위해 파급효과 평가를 넓혀 잡았다고 밝혔습니다. 기존 세 팀은 새 독자 모델과 파생 모델의 현장 확산 실적을 평가받았고, 모티프는 네 팀의 합의에 따라 이전에 만든 모델의 확산 실적과 계획까지 포함해 평가받았습니다. 그래도 파급효과 항목에서 모티프의 평균은 다른 세 팀보다 1.0~1.3점 낮았습니다.
평가 기준을 두고는 양쪽 말이 엇갈립니다. 과기정통부는 기준을 미리 합의했고 이견이 없었다고 말하고, 모티프는 사용자 평가 방법론과 전문가 평가 기준을 공개하라고 요구합니다. 이번에 공개된 것은 점수이고, 평가자가 무엇을 묻고 어떤 답에 몇 점을 줬는지는 여전히 공개되지 않았습니다.
3차에서 벤치마크 비중을 줄이는 방안은 이번 점수표와 방향이 어긋납니다. 이번 평가에서 팀 사이를 가장 크게 가른 객관 지표는 해외 민간 기관이 만든 AAII 하나였고, 국내에서 만든 NIA 벤치마크는 0.7점만 벌렸습니다. 3차에서 벤치마크 비중을 줄이면 사람의 평가가 순위를 정하는 폭이 그만큼 커집니다.
사업 목적과 평가 방식의 거리도 이번 점수표에서 드러납니다. 1월 발표문은 이 사업의 정책 목표를 국방과 국가 기반 시설에서 외산 모델에 기대지 않을 역량으로 적었습니다. 저는 그 목적이라면 국방에 쓸 모델은 국방 시나리오로, 법무에 쓸 모델은 법률 문서 처리로 재는 평가가 필요하다고 봅니다. 범용 웹사이트에서 1~5점을 매기는 사용자 평가가 25점을 차지하고, 그 25점이 이번 순위를 가장 크게 움직였습니다.

과기정통부는 8월 27일 자료 끝에 기업들이 점수나 순위로만 평가받지 않고 국내외 AI 생태계에 기여하기를 기대한다고 적었습니다. 통과한 세 팀에는 B200 지원이 하반기 1,000장 수준으로 늘어나고, 3차 평가 기준은 이번에도 팀들과의 협의로 정해집니다. 모티프는 이의 결과와 관계없이 3차에 참여하지 않겠다고 밝혔습니다.
이번 2차에서 점수 공개 범위는 9일 동안 세 단계로 넓어졌습니다. 18일에는 평균과 격차만, 20일에는 항목별 1위와 평균을, 27일에는 위원별·평가자별 점수까지 공개했습니다. 공개 기준을 평가 전에 정해 두지 않으면 다음 평가에서도 같은 공방이 되풀이될 수 있습니다. 3차에서 사용자 평가의 질문과 답까지 공개할지가 다음 확인 대상입니다.
읽어 주셔서 고맙습니다.
초이 드림