- 터미널에서 여러 단계를 이어 수행하는 긴 작업을 재는 평가입니다. 단발 코드 생성과 달리 도구 사용과 오류 복구까지 포함해서, 에이전트 성능을 비교할 때 자주 인용됩니다.
- 연구 수학자급 문제로 채운 수학 평가로, Tier 4가 가장 어려운 묶음입니다. GPT-5.6 Sol 83%, Fable 5 87.8%였던 Tier 4를 Astra가 97.6%로 끌어올려 사실상 포화시켰고, 소수 간격 증명 두 건도 함께 공개됐습니다.
- 여러 프로세스가 가진 값을 합계 같은 연산으로 결합하고, 같은 결과를 참여한 모든 프로세스가 받는 집단 통신 연산입니다. 분산 학습에서는 GPU별로 계산한 기울기를 합치는 데 쓰입니다. 많은 데이터를 전달하는 능력뿐 아니라 통신 지연과 느린 참여자도 전체 시간에 영향을 줍니다.
- 모델이 일을 수행할 때 볼 지침·자료·대화·도구 결과를 고르고 구성하는 작업입니다. 검색, 요약, 압축, 도구 선택과 캐시 배치가 포함될 수 있습니다. 단순히 입력을 줄이는 것이 목적은 아니며, 필요한 근거와 제약을 보존하면서 비용과 정확도를 함께 평가해야 합니다.
- 모델을 다시 학습시키지 않고 답을 만드는 단계에서 더 많은 계산을 쓰는 접근입니다. 여러 시도, 탐색, 검증 등을 통해 일부 과제의 성능을 높일 수 있지만 항상 개선되는 것은 아닙니다. 추가 비용·시간과 실제 정답률을 같은 조건에서 비교해야 합니다.
- 에이전트가 실행하기 전에 사람이 계획이나 행동을 승인하게 하는 구성입니다. 메타 Muse의 /plan 명령은 받은 작업을 사람이 승인해야 넘어가는 계획으로 바꿉니다. 야간에 에이전트가 검사하고 아침에 사람이 승인하는 운영이 기업 배치의 기본형이 됐습니다.
- 공개된 가중치를 누가 어떤 조건으로 쓸 수 있는지 정하는 약관입니다. MIT와 아파치 2.0은 조건 없이 고치고 팔 수 있게 열어 두는 반면, 사용 지역이나 상업 이용에 제한을 붙인 자체 라이선스도 흔합니다. 텐센트 커뮤니티 라이선스는 EU와 영국, 한국을 사용 가능 지역에서 빼 두었다가 아파치 2.0 전환으로 그 조항을 없앴습니다.
- 실제 깃허브 이슈를 모델이 패치로 해결하는지 재는 코딩 평가입니다. 오픈AI 감사에서 공개 과제의 약 30%가 깨진 문제로 확인되면서 점수 해석에 주의가 필요해졌습니다.
- 에이전트가 이후 단계나 다음 세션에 활용할 정보를 보관하고 다시 찾는 장치입니다. 파일·데이터베이스·요약 등으로 구현할 수 있습니다. CLAUDE.md·AGENTS.md 같은 지침 파일은 작업 규칙을 전달하는 한 형태이지 모든 메모리를 뜻하지 않습니다. 기억의 출처·시점·수정·삭제와 자료 속 지시의 권한을 구분해야 합니다.
- 모델이 직접 코드를 짜서 돌리고 그 결과를 받아 다음 행동을 정하는 도구입니다. 계산과 데이터 처리 정확도를 올리는 기본 수단이면서, 같은 능력이 보안 평가에서는 공격 역량으로 측정됩니다. 오픈AI Astra는 크롬 취약점 41건 전부에서 임의 코드 실행까지 성공했습니다.
- 모델이 한 번에 읽고 기억할 수 있는 토큰 수입니다. 이걸 넘으면 앞부분을 잊거나 잘라야 해서, 긴 문서·긴 작업의 병목이 됩니다.
- 사용자나 프로그램에 현재 업무에 필요한 대상·행동·기간만 허용하는 설계 원칙입니다. 조회 작업에는 쓰기 권한을 주지 않는 것이 한 예입니다. 프롬프트로 조심하라고 말하는 것과 달리 도구·계정·네트워크에서 실제로 제한해야 합니다.
- 한 가닥 안에 빛이 지나가는 코어를 여러 개 넣은 광섬유입니다. 서로의 신호 간섭을 제어하면서 전송 통로를 늘릴 수 있습니다. 신호를 나누고 합치는 장치와 증폭 구성도 맞아야 하며, 통로 수가 늘어도 거리에서 생기는 전파 지연이 사라지지는 않습니다.
- 질문이나 선택지 비교를 통해 사용자가 실제로 원하는 조건과 우선순위를 파악하는 과정입니다. 행동 기록에서 취향을 추정하는 것만으로 끝나지 않습니다. 가격 외에 취소 가능성·시간·위험 허용 수준 같은 제약도 확인할 수 있습니다.
- 모델이 입력을 한꺼번에 계산하는 프리필 단계와 답을 한 토큰씩 만드는 디코드 단계입니다. 프리필은 연산 성능에, 디코드는 메모리 대역폭에 좌우돼서 두 단계를 서로 다른 칩 풀에 나눠 맡기는 운영이 늘었습니다. AMD와 세레브라스 제휴는 프리필을 AMD 랙이, 디코드를 웨이퍼 스케일 엔진이 받는 구성입니다.
- 웹페이지나 파일에 심어 둔 문장이 모델에게 명령처럼 작동하는 공격입니다. 에이전트가 외부 문서를 읽고 도구를 쓰기 시작하면서 실제 피해로 이어지는 경로가 됐습니다.
- AI가 다음 세대 AI를 만드는 일을 스스로 맡아, 개선 속도가 사람 손을 떠나 점점 빨라지는 상태입니다. 아직 일어나지 않았지만 여러 연구소가 이걸 기준으로 안전 정책을 세웁니다.
- 모델 내부 활성값을 사람이 이름 붙일 수 있는 특징들로 분해하는 장치입니다. 해석가능성 연구에서 특정 개념이 어느 좌표에 모여 있는지 찾는 데 쓰입니다.
- 민감한 데이터와 계산을 서버의 다른 소프트웨어로부터 분리해 보호하려는 실행 구역입니다. 구체적인 보호 범위는 하드웨어와 소프트웨어 설계에 따라 다릅니다. 저장 암호화, 사용자 기기의 안전성, 결과 공유 권한과는 별도로 검토해야 합니다.
- 대화가 시작되기 전에 모델에게 주어지는 역할과 규칙 문서입니다. 규칙을 촘촘히 쌓을수록 토큰 비용이 늘고, 앤트로픽 실험에서는 80% 이상을 덜어내도 코딩 평가 손실이 측정되지 않았습니다.
- 이미지나 영상과 텍스트를 함께 입력받아 내용을 설명하거나 질문에 답하는 모델입니다. 무엇이 보이는지 해석할 수 있다는 사실이 물리적 행동의 안전이나 세밀한 영상 판정의 정확성을 보장하지는 않습니다.
- MoE 같은 모델이 특정 토큰을 처리할 때 실제 계산에 사용하는 파라미터의 규모입니다. 총 파라미터보다 적을 수 있어 계산량을 줄이는 데 도움이 됩니다. 실제 서빙 비용은 전체 가중치의 저장·메모리 이동, 라우팅, 배치, KV 캐시, 하드웨어와 이용률에도 영향을 받으므로 이 숫자만으로 결정되지 않습니다.
- 계획하고 도구를 쓰고 결과를 확인해 다시 계획하는 반복 구조입니다. 이 루프를 몇 칸까지 사람 확인 없이 돌리느냐가 위임 수준을 정합니다.
- 에이전트가 필요할 때 읽어 들이는 절차 문서와 스크립트 묶음입니다. 모델을 다시 학습시키지 않고 능력을 얹는 방법이라, 하네스를 고쳐 성능을 올리는 작업의 기본 단위가 됐습니다.
- 같은 작업을 여러 에이전트가 동시에 시도하고 결과를 골라 쓰는 구성입니다. 통과율은 올라가는데 비용 편차가 커서, 모델 조합에 따라 같은 결과물의 값이 여덟 배까지 갈렸습니다.
- 각국 정부가 프런티어 모델의 위험 능력을 직접 재려고 세운 기관입니다. 영국 AISI는 오픈과 폐쇄 모델의 사이버 역량 거리를 처음 공개 측정했고, 미국 CAISI는 앤트로픽 사이버 분류기 검증에 참여했습니다. 회사가 낸 수치를 밖에서 다시 재 보는 자리를 맡습니다.
- 처음 보는 규칙을 몇 개 예시만으로 알아내는 능력을 재는 평가입니다. 학습 데이터 암기로는 풀리지 않도록 설계돼서, 일반화 능력을 논할 때 기준으로 쓰입니다.
- 평가 문제와 답이 학습 데이터에 섞여 들어가 점수가 부풀려지는 현상입니다. 공개 벤치마크가 오래될수록 심해져서, 최근 평가는 비공개 세트를 함께 운영합니다.
- 저장소를 읽고 명령을 실행하며 코드를 끝까지 고치는 에이전트입니다. 최근 모델 도약이 지식 문답 대신 이쪽에 몰려서, 딥시크 V4-Pro는 코딩 에이전트 평가 DeepSWE에서 12.8점이 62.7점이 됐습니다. 같은 모델도 어떤 하네스에 올리느냐에 따라 점수가 크게 달라집니다.
- 대화가 길어질 때 앞부분을 요약해 자리를 비우는 처리입니다. 무엇을 남기고 무엇을 버리는지에 따라 점수가 크게 달라져서, 창 크기를 늘리는 쪽보다 효과가 큰 경우가 있습니다.
- 그 시점에 공개된 모델 가운데 능력이 가장 앞선 등급을 가리킵니다. 각국 안전연구소의 평가 대상과 수출통제 논의가 이 등급을 기준으로 짜입니다.
- 객관식과 단답으로 모델의 지식과 계산 실력을 재는 시험지 계열입니다. MMLU와 GPQA, AIME가 대표인데 상위 모델이 몰려 변별력이 떨어졌고, 최근 점수 도약은 명령을 실행하고 결과를 받는 에이전트 과제 쪽에서 나옵니다.
- 여러 모델과 에이전트, 도구의 실행 순서를 정하고 결과를 합치는 계층입니다. 비싼 모델이 계획하고 값싼 모델이 실행하는 분업이 여기서 짜입니다.
- 사전학습을 마친 모델에 지도 미세조정과 강화학습, 도구 사용 훈련을 얹는 단계입니다. 2026년에는 아키텍처와 크기를 그대로 두고 이 단계만 바꿔 에이전트 점수를 몇 배로 올린 사례가 여러 건 나왔습니다.
- 정밀도는 찾은 항목 중 실제 정답인 비율이고 재현율은 전체 정답 중 찾아낸 비율입니다. 누락과 잘못 포함한 항목을 다른 방향에서 측정하며, 전체 정답 집합을 모르는 웹 조사에서는 재현율을 확정하기 어렵습니다.
- 반복되는 프롬프트 앞부분의 계산을 저장해 이후 요청에서 재사용하는 기능입니다. 시스템 지침이나 도구 설명처럼 바뀌지 않는 입력이 대상이 될 수 있습니다. 최종 답변 자체의 재사용과는 다르며, 일치 조건·유효 시간·쓰기와 읽기 요금은 제공자와 모델에 따라 확인해야 합니다.
- 모델이 맡은 일을 몰래 망칠 수 있는지, 감시하는 모델이 그것을 잡아내는지 함께 시험하는 평가입니다. 능력 평가와 달리 숨기는 행동을 대상으로 삼습니다.
- 전체 작업의 일부만 빨라질 때 전체 속도 향상이 나머지 부분에 의해 제한된다는 원리입니다. 전체 시간의 비율 p인 부분이 s배 빨라지고 나머지가 같다면 전체 속도 향상은 1 / ((1-p) + p/s)입니다. 예를 들어 80%가 10배 빨라져도 전체는 약 3.57배입니다.
- 모델이 화면을 보고 마우스·키보드를 직접 움직여 앱과 브라우저를 다루는 기능입니다. API가 없는 프로그램까지 자동화할 수 있지만, 잘못 눌렀을 때 되돌리기 어렵습니다.
- 모델이 취약점을 찾아 실제로 작동하는 공격 코드까지 만들어 내는 능력입니다. 영국 AI안전연구소 측정에서 오픈웨이트와 폐쇄형 프런티어의 거리가 6~10개월에서 4~7개월로 좁혀졌고, 그 거리가 방어자에게 남은 준비 시간이 됩니다.
- 실제 공간이나 장치의 구조·상태를 디지털로 표현해 관찰과 분석, 시뮬레이션에 활용하는 모델입니다. 현실의 변화가 자동으로 모두 반영되는 것은 아니므로 관측 시점과 모델의 정확도를 따로 관리해야 합니다.
- 유럽연합이 위험 수준별로 AI 시스템의 의무를 정한 규제입니다. 규제 부담을 피하려고 오픈 모델 라이선스에서 특정 지역을 빼는 회사가 나올 만큼 배포 조건에 직접 영향을 줍니다. 한국 AI 기본법은 1월 22일 시행돼 세계 두 번째 포괄 규제가 됐고, 초점은 표시와 사전 고지에 있습니다.
- 같은 과제를 사람이 하면 얼마나 걸리고 어느 정도 맞히는지 미리 재 둔 수치입니다. 모델 점수를 이 수치와 나란히 놓아야 뜻이 생기는데, 영국 AI안전연구소 사이버레인지의 32단계 기업망 장악 시나리오는 인간 전문가면 약 20시간짜리로 잡혀 있습니다.
- 입력이 길어져도 계산량이 제곱으로 늘지 않도록 고친 어텐션 계열입니다. 전체 어텐션 층과 섞어 쓰는 하이브리드 구성이 표준이 됐고, Qwen3.8은 층 대부분을 Gated DeltaNet으로 두고 16개 층만 전체 어텐션으로 남겨 멀리 떨어진 정보를 다시 연결합니다.
- 요청의 종류, 필요한 품질, 비용과 지연 조건에 맞춰 사용할 모델을 선택하는 방식입니다. 규칙이나 별도 분류기를 쓸 수 있고, 실패하면 다른 모델로 넘기는 경로도 포함할 수 있습니다. 재시도와 검증 비용이 생기므로 작은 모델을 먼저 쓰는 구성이 언제나 더 저렴한 것은 아닙니다.
- GPU 임대에 특화한 신생 클라우드 사업자입니다. 매출보다 설비 투자가 큰 구조라서 자금 조달 조건이 실적보다 먼저 움직입니다.
- 가중치와 계산을 몇 비트로 표현할지 정하는 숫자 형식입니다. BF16에서 FP8, FP4로 내려갈수록 메모리와 전력이 줄어드는 대신 오차가 커집니다. 엔비디아가 미는 NVFP4처럼 특정 하드웨어에 묶인 포맷도 있어서, 공개 모델이 어떤 포맷으로 배포되는지가 실행 장비 선택으로 이어집니다.
- 학습된 가중치 파일을 공개해 누구나 내려받아 돌릴 수 있는 모델입니다. 학습 데이터·코드까지 다 여는 '오픈 소스'와는 구분합니다.
- 데이터센터가 전기를 받기 위해 송전망에 연결되는 절차와 그 대기 시간입니다. 칩은 분기 단위로 사 올 수 있는 반면 계통 접속은 몇 년씩 걸려서, 발전기를 데이터센터 옆에 직접 세우는 회사까지 나왔습니다. 젠슨 황이 땅과 전력, 건물을 묶어 부르는 LPS도 같은 병목을 가리킵니다.
- 새 변경으로 기존에 동작하던 기능이 깨지지 않았는지 확인하는 테스트입니다. 방금 고친 실패뿐 아니라 기존 성공 사례도 검사하며, 테스트 통과가 모든 실제 환경의 정상 동작을 보장하는 것은 아닙니다.
- 사람의 대화형 로그인 대신 프로그램이나 자동 작업의 권한을 나타내는 계정입니다. 소유 책임자, 접근 대상, 허용 행동, 키 만료·회수 절차를 관리해야 합니다. 서비스 계정이라는 이름 자체가 최소 권한이나 안전성을 보장하지 않습니다.
- 국가가 자국 안에서 데이터와 컴퓨트, 모델을 직접 갖추려는 정책 흐름입니다. 국가 예산으로 학습한 모델이 오픈 라이선스로 공개되는 사례가 늘었습니다.
- 작은 모델이 다음 토큰 후보를 먼저 만들고 큰 모델이 한꺼번에 검증해 출력 속도를 올리는 기법입니다. 출력 결과를 바꾸지 않고 디코딩만 빠르게 한다는 점이 특징입니다.
- 주 에이전트가 일부 작업을 떼어 맡기는 별도 에이전트입니다. 중간 과정의 잡음을 본 대화에서 분리할 수 있지만, 각자 문맥을 따로 들고 돌아서 토큰은 더 씁니다.
- 모델을 내놓을 때 함께 공개하는 문서입니다. 무엇을 평가했고 어떤 위험이 남았으며 어떤 제한을 걸었는지 적습니다. 발표 자료보다 여기에 실제 조건이 들어 있습니다.
- 코드를 직접 읽고 고치는 대신 자연어로 원하는 결과를 말하고 모델이 짠 것을 받아 쓰는 작업 방식입니다. 속도는 빠르지만 리뷰와 책임 소재가 새 문제로 남습니다.
- 업무의 단계와 다음 단계로 이동하는 조건을 노드와 연결로 표현한 구조입니다. AI가 판단하는 단계와 규칙·승인·중단·복구 단계를 함께 배치할 수 있습니다. 그래프를 그렸다는 사실만으로 권한 통제나 실행의 정확성이 보장되지는 않습니다.
- 새 방법의 이익을 비교하기 위한 기준 방법이나 기존 시스템입니다. 간단한 방법도 기준선이 될 수 있으며, 데이터와 계산 조건을 맞추지 않으면 복잡한 방법이 정말 나아졌는지 판단하기 어렵습니다.
- 여러 요청을 한 번에 묶어 처리해 GPU를 놀리지 않게 하는 방식입니다. 처리량은 올라가지만 먼저 온 요청이 뒤에 온 요청을 기다리게 되어 지연이 늘 수 있습니다.
- 요청에 쓸 수 있는 데이터나 계산 결과를 캐시에서 찾아 재사용한 경우입니다. 언어 모델의 프롬프트 캐시에서는 반복되는 입력 앞부분의 계산을 재사용하며, 이전 최종 답변을 그대로 돌려준다는 뜻은 아닙니다. 시간과 비용의 절감 폭은 캐시 종류, 재사용 범위와 서비스의 과금 조건에 따라 다릅니다.
- 모델이 답을 내기 전에 중간 단계를 글로 풀어 놓는 구간입니다. 이 기록을 감시에 쓰면 의도를 미리 읽을 수 있는데, 암호로 감추거나 버리는 설계가 늘면서 감시 가능성이 함께 줄었습니다.
- 중단 후 이어 가거나 이전 상태를 비교하기 위해 특정 시점의 상태를 저장한 것입니다. 모델 학습에서는 가중치·옵티마이저 상태 등을, 에이전트 업무에서는 중간 결과·진행 단계 등을 저장할 수 있습니다. 외부 결제나 발송까지 중복 없이 복구하려면 별도의 멱등성 설계가 필요합니다.
- 한 통신 채널의 신호가 다른 채널에 새어 들어가 간섭을 일으키는 현상입니다. 여러 코어를 넣은 광섬유에서는 코어 사이의 간섭을 충분히 낮춰야 각 경로를 안정적으로 사용할 수 있습니다. 코어 수를 늘리는 것과 실제 사용 가능한 통신 용량을 늘리는 것은 같은 문제가 아닙니다.
- 모델을 학습하고 서빙하는 GPU와 전력, 냉각 설비를 묶은 건물입니다. 요즘은 규모를 칩 개수 대신 기가와트로 말하는데, 부지 허가와 송전망 연결이 칩 조달보다 훨씬 느리게 움직이기 때문입니다. 뉴멕시코와 와이오밍에서는 건설 지출의 60%가 데이터센터에서 나왔습니다.
- 노이즈에서 조금씩 걷어내며 결과를 만드는 생성 방식입니다. 이미지에서 유명해졌고, 최근엔 토큰을 순서 없이 채우는 확산 언어모델(dLLM)도 연구됩니다.
- 에이전트가 낸 개선을 사람이 같은 개선을 내는 데 드는 임금으로 환산한 값입니다. METR이 자기개선 속도를 재려고 만든 눈금이고, 시간 대신 돈으로 환산한다는 점에서 시간 지평과 짝을 이룹니다.
- 정밀도와 재현율의 조화평균으로, 두 값을 P와 R이라 할 때 2PR/(P+R)로 계산합니다. 탐지 오류를 함께 요약하지만 실제 운영의 오탐과 미탐 비용이 같다는 뜻은 아닙니다. 데이터 구성과 평균 방식이 다르면 점수를 그대로 비교할 수 없습니다.
- 듣기와 말하기를 동시에 처리하는 음성 모델 구조입니다. 한쪽이 말을 끝내야 다음이 말하는 턴제와 달리 말이 겹쳐도 되고, 말할지 들을지를 1초에 수십 번 판단합니다.
- 모델 가중치와 데이터셋을 올리고 내려받는 공개 저장소입니다. 오픈웨이트 공개는 사실상 이곳에 파일이 올라온 시점으로 세고, 라이선스 표기도 여기서 확인합니다. 오픈AI 내부 모델이 샌드박스를 나와 코드 실행까지 간 사건의 무대도 이곳의 프로덕션 환경이었습니다.
- 사람 모양으로 만들어 사람이 쓰던 환경을 그대로 쓰게 하는 로봇입니다. 중국에서는 멀리뛰기와 복싱, 체조까지 종목을 나눈 휴머노이드 종합 경기가 열릴 만큼 균형과 접촉 제어가 올라왔습니다.
- 공개된 가중치를 실제 장비에서 돌려 주는 서빙 소프트웨어입니다. vLLM과 SGLang이 대표이고, 새 오픈 모델이 나오는 날 이들이 실행 경로를 함께 여는지가 실사용 시점을 정합니다. Z.ai는 SGLang을 바탕으로 자체 엔진을 올려 같은 하드웨어에서 종단 성능을 3배 높였다고 밝혔습니다.
- AI가 자기 연구를 대신하면서 능력 향상이 스스로 가속되는 국면입니다. 재귀적 자기개선과 같은 자리를 가리키고, 시간 지평이나 지출 지평 같은 눈금이 그 속도를 실제로 재려는 시도입니다. 량원펑은 지속학습이 되는 순간 이 국면에 닿는다고 봤습니다.
- 모델 내부의 계산을 사람이 읽을 수 있는 단위로 분해하는 연구 분야입니다. 출력만 보고는 알 수 없는 의도와 중간 상태를 확인하려는 목적으로 감시 설계와 직접 이어집니다.
- 이미 읽은 토큰의 계산 결과를 저장해 두는 메모리입니다. 긴 대화에서 속도를 지켜주지만, 길어질수록 메모리를 많이 먹습니다.
- 서버를 거치지 않고 노트북이나 휴대폰에서 모델을 직접 돌리는 방식입니다. 양자화와 소형 MoE가 발전하면서 24GB 메모리에서 도는 에이전트급 모델이 나왔습니다.
- 학습이 끝난 모델의 가중치 파일을 내려받아 직접 돌릴 수 있게 푼 것입니다. 소스 전체를 여는 오픈소스와 다르고, 내려받을 수 있다는 말과 상업적으로 써도 된다는 말도 다릅니다. 라이선스를 따로 봐야 합니다.
- 여러 회사의 모델을 하나의 API로 중계하고 사용량 순위를 공개하는 서비스입니다. 제작사 표기 없이 익명 모델을 먼저 올려 반응을 보는 통로로도 쓰여서, GLM-5.3-Flash는 공개 전 Ox Alpha라는 이름으로 이곳에 올라와 있었습니다.
- 모델이 과제에 얼마나 많은 계산과 검증을 쓰도록 할지 조절하는 설정입니다. 높은 값은 토큰 사용량과 실행 시간을 늘릴 수 있지만 정답을 보장하지 않습니다. 지원 단계와 적용 범위는 모델·제품별로 다릅니다.
- 답을 내기 전에 중간 과정을 길게 생각하도록 학습한 모델입니다. 어려운 문제에서 정확도가 오르는 대신 응답이 느리고 토큰을 많이 씁니다.
- 멀리 있는 실행 환경이 약속된 하드웨어·소프트웨어 상태로 동작하는지 증거를 확인하는 절차입니다. 서버 운영자의 설명만 믿는 대신 검증 가능한 측정값과 서명을 활용합니다. 실행하는 모델의 답변이 참이거나 모든 공격에 안전하다는 증명은 아닙니다.
- RNA를 주형으로 DNA를 합성하는 효소입니다. 특정 역전사효소와 주변 유전자·반복 배열을 함께 발견했다는 사실만으로 그 시스템의 정확한 생물학적 기능이나 의학적 효용을 확정할 수는 없습니다.
- 모델이 '실제로 잘하기' 대신 점수만 높이는 꼼수를 찾는 현상입니다. 채점기의 허점을 파고들기 때문에 평가와 안전 연구의 단골 주제입니다.
- 프런티어 랩이 모델의 위험 능력을 단계로 나눠 매기는 자체 눈금입니다. 등급이 올라가면 배포 조건과 보호 조치가 함께 강해져서, 오픈AI는 Astra의 사이버 능력을 최고 등급 Critical로 확정하고 거부율과 정렬, 감시를 세 겹으로 채운 뒤 내놓았습니다. 검사를 받는 쪽은 폐쇄형 모델이어서 같은 급의 오픈웨이트는 제동 없이 돕니다.
- 말을 알아듣는 인식과 소리를 만드는 합성을 맡는 모델입니다. 받아쓰기가 운영체제 기본 기능으로 들어갔고, 20명이 동시에 말해도 화자를 가려내는 서비스가 시간당 0.18달러 선에서 나왔습니다.
- 응답 시간 분포에서 유난히 느린 일부 요청의 지연입니다. p95가 2초라면 측정한 요청의 95%가 2초 이내였다는 뜻입니다. 여러 구성요소의 완료를 함께 기다리는 시스템에서는 평균이 빨라도 느린 일부가 전체 작업을 늦출 수 있습니다.
- 모델이 50% 확률로 끝낼 수 있는 작업의 사람 기준 소요 시간입니다. METR이 제안한 눈금으로, 능력 향상을 점수 대신 처리 가능한 작업 길이로 나타냅니다.
- 기업이 모델 API에 쓰는 돈과 그 바탕이 되는 토큰 사용량입니다. a16z 집계에서 기업 사이의 토큰 지출 격차는 600배까지 벌어졌습니다. 사용량 자체는 불이 켜져 있다는 표시일 뿐이어서, 사업 성과와 잇는 작업은 따로 남습니다.
- 글을 모델이 읽는 토큰 단위로 쪼개는 규칙과 어휘 사전입니다. 같은 문장이라도 토크나이저에 따라 토큰 수가 달라져서 요금과 컨텍스트 소모가 함께 바뀝니다. 제작사를 숨긴 익명 모델의 정체를 어휘 일치 검사로 밝혀내는 데 쓰이기도 합니다.
- 2017년에 나온 언어모델의 기본 설계로, 어텐션 층을 쌓아 입력 전체를 한 번에 참고합니다. 지금 이름이 알려진 모델은 거의 전부 이 구조의 변형이고, 연산 비용을 줄이려는 최근 시도도 트랜스포머 안에서 일부 층을 갈아 끼우는 방식으로 이뤄집니다.
- 회사에 매겨진 가격으로, 보통 앞으로 벌어들일 현금 대비 몇 배인지로 따집니다. 상장 소프트웨어의 향후 12개월 잉여현금흐름 대비 밸류에이션은 2014년 수준까지 내려온 반면, 비상장 AI 회사에는 500억 달러 프리머니 같은 숫자가 붙습니다.
- 다음 화면과 물리 반응을 직접 예측해 가상 환경을 생성하는 모델입니다. 게임 플레이를 실시간으로 만들어 내거나 로봇 학습용 환경을 대신 제공하는 용도로 쓰입니다.
- 한 번 답하고 멈추지 않고, 스스로 계획하고 도구를 부르고 결과를 확인하며 여러 단계를 이어가는 AI입니다. 브라우저·터미널·앱을 대신 조작하는 것이 대표 예입니다.
- 모델 실력을 재는 표준 시험입니다. 수학(GSM8K·MATH), 코딩(HumanEval·SWE-bench) 같은 문제집 점수로 모델을 비교합니다.
- 데이터센터와 GPU처럼 오래 쓰는 설비에 미리 들이는 돈입니다. 매출보다 이 숫자가 먼저 커지는 구조여서, CoreWeave는 분기 매출 26억 달러에 자본지출 71억 달러를 썼습니다. 메타는 올해 설비투자를 1,250억에서 1,450억 달러로 잡았습니다.
- 화학과 생물, 방사능, 핵 관련 위험을 묶어 부르는 약자입니다. 모델이 생물무기 제작을 실질적으로 도울 수 있는지가 가장 앞선 검사 항목이고, 앤트로픽은 이 우려로 ASL-3 보호 조치를 적용했습니다.
- 엔비디아 GPU에서 연산 코드를 짜고 돌리는 소프트웨어 층입니다. 학습과 서빙 도구가 전부 이 위에 쌓여 있어서 다른 칩으로 옮기는 비용이 크고, 세미애널리시스는 이 잠금 효과를 엔비디아의 해자로 부릅니다.
- 검색을 수십 번 반복해 출처가 붙은 보고서를 만드는 에이전트 기능입니다. 조사 절차를 하네스로 짜던 방식에서 그 절차 자체를 모델에 학습시키는 방식으로 옮겨 갔습니다. 퍼플렉시티 WANDR 평가에서는 대상을 빠짐없이 찾는 과제를 통과한 곳이 일곱 곳 가운데 한 곳이었습니다.
- 미국이 첨단 칩과 모델의 해외 반출을 제한하는 규제입니다. 규제 판단이 곧바로 서비스 중단으로 이어지기도 해서, 앤트로픽 Fable 5는 6월에 2주간 전 세계에서 꺼졌다가 새 분류기를 붙이고 다시 열렸습니다.
- 이미 학습된 모델에 특정 데이터를 더 학습시켜 원하는 말투·작업에 맞추는 일입니다. 처음부터 학습하는 것보다 훨씬 쌉니다.
- 설계는 하지 않고 다른 회사의 칩을 대신 만들어 주는 반도체 제조 사업입니다. AI 가속기 공급 일정이 사실상 이 단계의 생산 능력으로 정해집니다.
- 데이터센터 규모를 재는 단위로 자리 잡은 전력 용량입니다. 원전 한 기가 약 1기가와트급이라, 칩 개수 대신 기가와트로 계획을 말하면 전력망과 부지 확보가 곧바로 협상 대상이 됩니다.
- 모델 바깥에 붙여 위험한 입력과 출력을 걸러 내는 규칙과 분류기입니다. 모델 내부 정렬과 별개로 작동해서, 하나가 뚫려도 다른 하나가 남도록 겹쳐 배치하는 구성이 표준이 됐습니다.
- 모델을 학습하거나 후보를 선택하는 동안 분리해 두고 성능 확인에 사용하는 데이터입니다. 같은 검증 데이터를 반복해 보며 선택하면 간접적으로 그 데이터에 맞출 수 있으므로, 최종 평가 자료의 독립성을 관리해야 합니다.
- 학습보다 서비스 단계의 연산에 맞춰 설계한 전용 칩입니다. 범용 GPU보다 전력당 처리량을 높이는 쪽에 초점이 있고, 모델 가중치를 회로에 새기는 극단적 설계까지 나왔습니다.
- 여러 모델의 점수를 같은 조건에서 줄 세워 공개하는 표입니다. 과제당 비용을 함께 적는 곳이 늘면서 성능과 가격을 한 줄에서 비교하게 됐습니다. Datacurve의 8월 26일 집계에서 Opus 5는 과제 하나에 평균 11.84달러, GPT-5.6 Sol은 73%에 6.46달러였습니다.
- 수학 증명을 기계가 검사할 수 있는 형태로 적는 언어이자 증명 보조 도구입니다. 사람이 읽어 판단하던 증명을 컴파일 통과 여부로 바꿔서, AI가 낸 증명의 진위를 자동으로 확인할 수 있게 합니다.
- 글에 더해 이미지·음성·영상을 함께 이해하거나 만들어내는 모델입니다.
- GPU 메모리에 다 올릴 수 없는 부분을 CPU 쪽 메모리로 내려 두고 필요할 때 가져오는 방식입니다. 더 작은 카드에서 큰 모델을 돌릴 수 있게 해 주지만 속도는 느려집니다.
- 모델 안의 숫자(가중치) 개수입니다. '7B'는 70억 개를 가리키고, 대체로 클수록 똑똑하지만 비쌉니다.
- 초당 페타비트 단위의 데이터 전송률입니다. 십진 단위로 1Pbps는 1,000Tbps이고, 8비트가 1바이트이므로 초당 125테라바이트에 해당합니다. 설계 용량과 사용자가 실제로 받는 파일 전송 속도는 통신 오버헤드·공유·병목 때문에 다를 수 있습니다.
- 대량의 글과 코드로 모델의 기본 능력을 만드는 첫 단계입니다. 여기서 든 연산량이 모델 크기와 비용의 바닥을 정하고, 이후 단계는 그 위에서 다듬는 일입니다.
- GPU 수십 장을 고속 인터커넥트로 묶어 한 대처럼 쓰는 단위입니다. 엔비디아 GB300 NVL72가 대표 구성이고, 큰 모델은 카드 한 장에 들어가지 않아 랙 단위로 사고파는 거래가 표준이 됐습니다. 엔비디아 네트워킹 매출이 전년 대비 199% 늘어난 배경입니다.
- 답을 내게 하고 점수(보상)를 매겨, 점수가 높은 쪽으로 모델을 조금씩 옮기는 학습입니다. RLHF 는 사람 선호를, GRPO 는 여러 답을 서로 비교한 상대 점수를 보상으로 씁니다.
- 모델이 도구를 쓰고 코드를 실행하도록 열어 주되 바깥 네트워크와 파일 시스템에서 끊어 놓은 격리 환경입니다. 프롬프트에 인터넷이 없다고 적어 두고 컨테이너는 인터넷에 붙어 있는 설정 불일치가 실제 침해 사고의 원인이 됐습니다.
- 들어온 요청 가운데 무엇을 먼저 돌릴지 정하는 일입니다. 배치·메모리 관리·통신과 함께 추론 인프라를 이루고, 이 층이 얼마나 잘 짜였는지가 작업 하나의 값을 정합니다.
- 함수가 값을 계산해 반환하는 것 외에 파일 저장, 이메일 발송, 결제처럼 바깥의 상태를 바꾸는 작용입니다. 오류 뒤에 작업을 재시도하면 같은 작용이 중복될 수 있습니다. 중간 상태를 저장하는 것만으로 중복 실행이 방지되지는 않으므로, 멱등성 키나 실행 기록 같은 별도 대책이 필요합니다.
- 모델이 검색·계산기·API 같은 외부 도구를 불러 쓰는 기능입니다. 에이전트가 실제 일을 하려면 꼭 필요합니다.
- 물리 컴퓨터 위에서 소프트웨어로 만든 독립적인 컴퓨터 환경입니다. 운영체제와 프로그램을 분리해 실행하는 데 쓰입니다. 에이전트의 실행 공간을 격리할 수 있지만, 그 안에 부여한 계정 권한이나 외부 도구의 접근 권한까지 자동으로 제한해 주는 것은 아닙니다.
- 모델이 생성한 글에 사람 눈에 보이지 않는 통계적 표시를 심어 출처를 확인하게 만드는 기법입니다. 심는 비용은 낮고 지우는 비용도 낮아서, 탐지 결과가 법적 증거로 쓰일 수 있는 범위가 좁습니다.
- 사람이 하는 지적 작업 대부분을 사람 수준 이상으로 해내는 AI를 가리킵니다. 정의가 기관마다 달라서 같은 단어로 다른 시점을 말하는 경우가 많고, 이 뉴스레터에서는 특정 벤치마크 통과 시점보다 자동화된 연구 능력을 기준으로 다룹니다.
- 사람이 두 모델의 답을 나란히 보고 고른 결과를 Elo 점수로 집계하는 순위표입니다. 사용자 선호를 직접 재는 지표라서 벤치마크 점수와 순위가 어긋나는 경우가 자주 나옵니다.
- 최근 매출을 1년치로 환산한 수치로, 성장 속도를 빠르게 비교할 때 씁니다. 공급이 막히면 수요가 있어도 숫자가 멈추는데, Kimi K3는 출시 이틀 만에 GPU 용량이 한계에 닿아 신규 구독을 잠근 채 6월 ARR 3억 달러를 기록했습니다.
- 입력의 어느 부분을 얼마나 참고할지 정하는 트랜스포머의 계산 구조입니다. 길이가 늘수록 비용이 빠르게 커져서, 긴 컨텍스트 처리 비용의 대부분이 여기서 나옵니다.
- 통신 경로가 일정 시간에 전달할 수 있는 데이터의 용량입니다. 보통 초당 비트 수로 표시합니다. 실제로 전달한 양인 처리량과 구분하며, 용량이 커져도 신호가 이동하는 거리와 왕복 지연이 같은 비율로 줄어들지는 않습니다.
- AI를 학습하고 돌리는 데 쓰는 연산 자원의 총량입니다. GPU 개수와 가동 시간, 전력을 합쳐 부르고, 최근에는 설비 구매 대신 자산 편입으로 회계 처리하는 사례가 늘었습니다. 컴퓨트를 얼마나 확보했는지가 모델 성능보다 먼저 결정되는 조건입니다.
- 뇌 안의 신경세포가 서로 어떻게 이어져 있는지를 통째로 그린 지도입니다. 초파리 뇌 16만 6천 뉴런의 커넥톰이 공개되면서 시뮬레이션과 실험이 가능해졌습니다.
- 사람이 읽는 도메인 이름을 서버의 IP 주소 등 접속에 필요한 정보로 찾는 분산 이름 시스템입니다. 일반 웹 접속과 DNS 질의는 서로 다른 통신 경로일 수 있으므로, 웹 접속을 차단했다는 사실만으로 모든 외부 통신이 막혔다고 판단할 수는 없습니다.
- 글·이미지를 숫자 벡터로 바꾼 것입니다. 뜻이 비슷하면 벡터도 가까워서, 검색과 추천의 기본 재료입니다.
- 모델을 감싸 실제 작업을 시키는 바깥 장치입니다. 프롬프트·도구·재시도·검증 규칙이 여기 들어가서, 같은 모델도 하네스에 따라 결과가 크게 다릅니다.
- 여러 층으로 쌓아 대역폭을 키운 메모리로, AI 가속기에 붙어 모델 가중치를 실어 나릅니다. GPU 원가와 공급 일정을 좌우해서 반도체 실적 기사에서 가장 자주 등장하는 부품입니다.
- 각 분야 전문가가 낸 어려운 문제만 모은 지식 평가입니다. 상위 모델끼리 몇 점 차이로 순위가 바뀌는 구간이어서 발표 자료에 자주 인용되고, 채점을 다시 검증한 HLE-Verified를 따로 적는 곳도 있습니다. GLM-5.3-Flash는 35.9점으로 Opus 4.6의 40.0점을 쫓았습니다.
- 같은 작업을 반복해도 외부에 남는 효과가 한 번 실행했을 때와 같도록 하는 성질입니다. 결제·주문 API에서는 같은 요청 식별자의 재시도를 중복 처리하지 않게 구현할 수 있습니다. 단순 재시도나 대화 기록 보존만으로 자동 보장되지는 않습니다.
- 수천억 개 단어를 학습해 다음 토큰을 예측하는 모델입니다. 질문에 답하고 글을 쓰고 코드를 짜는 일이 모두 '다음에 올 말 맞히기'에서 나옵니다.
- AI 애플리케이션과 외부 서버가 도구·자료·프롬프트 같은 맥락을 교환하는 규약입니다. 지원하는 기능을 발견하고 일정한 형식으로 호출하도록 돕습니다. 연결 규약이므로 조직의 승인 정책, 모델의 판단, 장기 업무의 중단·복구까지 대신 정해 주지는 않습니다.
- Mixture of Experts. 큰 모델 안에 여러 '전문가' 조각을 두고 토큰마다 일부만 켜는 구조입니다. 파라미터는 많지만 계산은 적게 듭니다.
- 모델이 답을 만들기 전에 입력 전체를 한 번 읽어 들이는 구간입니다. 입력이 길수록 이 구간의 값이 커지고, 도구가 뱉은 출력을 그대로 다시 넣으면 여기서 값이 붙습니다.
- 가중치 숫자의 정밀도를 낮춰(예: 16비트→4비트) 모델을 작고 빠르게 만드는 기술입니다. 노트북에서 큰 모델을 돌릴 때 필수입니다.
- Retrieval-Augmented Generation. 답하기 전에 관련 문서를 먼저 찾아 모델에게 함께 주는 방식입니다. 최신 정보와 내부 문서를 다룰 때 씁니다.
- 모델을 공격자 입장에서 시험해 취약점을 찾아내는 작업입니다. 사람이 하던 일을 자동 레드팀 AI가 대신하기 시작하면서, 가장 강한 공격 도구를 공개할지가 별도의 판단 대상이 됐습니다.
- Supervised Fine-Tuning. '질문→모범 답' 쌍을 보여주며 그대로 따라 하게 가르치는 파인튜닝입니다.
- AI가 스스로를 개선하는 속도가 사람의 개입 속도를 넘어서 변화가 예측 불가능해지는 시점을 가리킵니다. 날짜를 맞추는 문제로 다뤄져 왔는데, 최근 논의는 여러 되먹임 고리의 기울기를 각각 재는 쪽으로 옮겨 왔습니다.
- 모든 분야에서 인간 최고 수준을 넘어서는 지능을 가리킵니다. 메타가 조직 이름에 쓰면서 제품 용어로도 자리 잡았고, 통제 가능성을 두고 연구자 사이에서 가장 의견이 갈리는 개념입니다.
- 일정 시간에 처리하거나 전달한 작업·데이터의 양입니다. 초당 요청 수, 토큰 수, 비트 수처럼 대상과 단위를 함께 표시합니다. 와트당 처리량은 전력까지 나눈 별도의 효율 지표입니다. 많이 처리했다는 사실만으로 결과의 품질이나 장애 뒤에도 남는 유효한 진척이 보장되지는 않습니다.
- 구글이 브로드컴과 함께 설계한 자체 AI 가속기입니다. 엔비디아 GPU를 사지 않고도 학습과 서빙을 돌릴 수 있어서, 구글은 7세대까지 이어 가며 2031년까지 공급 계약을 연장했습니다. 하이퍼스케일러가 자체 칩으로 옮겨 가는 흐름에서 가장 오래된 사례입니다.
- 모델이 낸 답이 맞는지 자동으로 판정하는 구성 요소입니다. 수학과 코드처럼 기계로 정답을 확인할 수 있는 영역에서 강화학습의 보상을 만들고, 답을 여러 개 뽑아 고르는 추론 시간 스케일링에서도 고르는 쪽을 맡습니다. 검증기가 허술하면 모델이 점수만 올리는 보상 해킹으로 빠집니다.
- 어떤 결과가 맞는지 기계가 스스로 셀 수 있게 해 주는 장치입니다. Lean 형식 검증, 테스트 통과 여부, 소인수의 곱셈이 그 예입니다. 판정기가 있는 문제에서만 탐색을 대량으로 돌리는 방식이 통합니다.
- 화면과 말을 함께 받아 로봇의 동작까지 직접 내놓는 모델입니다. 로봇마다 제어기를 새로 짜던 작업을 공통 모델로 옮기는 흐름이고, 구글은 몸체를 만들지 않고 판단층만 표준으로 내놓는 방식을 택했습니다. 기종이 다른 로봇 두 대가 한 작업을 나눠 처리하는 구성까지 시연됐습니다.
- 모델의 행동을 사람이 의도한 목표·가치에 맞추는 일입니다. 유해한 답 거부, 지시 따르기, 속이지 않기가 모두 정렬 문제입니다.
- 모델이 사실과 다른 말을 하거나 자기 목표를 숨기는 행동입니다. 능력 평가로는 드러나지 않아서 함정 시험과 사보타주 평가처럼 숨기는 행동을 겨냥한 검사를 따로 만듭니다. 오픈AI는 Astra 출시 조건에서 함정 시험 접촉 0건을 근거로 제시했습니다.
- 큰 모델의 출력을 교본 삼아 작은 모델을 가르치는 방법입니다. 성능을 상당히 물려받으면서 크기와 추론 비용을 줄일 수 있습니다.
- 전체 처리량 중 목적과 품질 기준을 만족해 유효한 결과로 남은 양입니다. 네트워크에서는 실제 유용한 데이터 전송량, AI 운영에서는 실패·재작업 등을 구분한 성과를 볼 수 있습니다. 무엇을 유효하게 셀지와 시간 단위를 함께 정해야 합니다.
- GPU 한 장 안에서 실제 계산을 돌리는 작은 프로그램입니다. 같은 모델이라도 커널을 그 칩에 맞게 다시 쓰면 처리량이 몇 배 갈립니다. 다룰 줄 아는 사람이 회사마다 몇 명뿐인 층입니다.
- 모델이 그럴듯하지만 사실이 아닌 내용을 자신 있게 말하는 현상입니다. 출처 확인이 필요한 이유입니다.
- 학습이 끝난 모델을 실제로 돌려 답을 만드는 단계입니다. 비용·속도·지연 시간 이야기는 대부분 여기서 나옵니다.
- 모델이 거절하도록 학습된 답을 우회해서 끌어내는 시도입니다. 역할극, 인코딩, 긴 우회 대화가 대표 수법이고, 방어는 대개 사후 대응이 됩니다.
- 어떤 시작점부터 정한 결과가 나타날 때까지의 지연 시간입니다. 네트워크의 편도·왕복 시간, 모델의 첫 토큰 시간, 답변 전체 완료 시간은 서로 다릅니다. 비교할 때는 시작과 끝의 기준, 캐시와 부하 조건을 맞추고 평균뿐 아니라 오래 걸린 요청의 분포도 확인해야 합니다.
- 모델이 텍스트 등을 나누어 처리하는 단위입니다. 단어 전체, 단어의 일부, 문자나 기호가 토큰으로 나뉠 수 있으며, 같은 문장도 토크나이저와 언어에 따라 개수가 달라집니다. 글자 수와 고정된 비율로 대응하지 않습니다. 입력·출력 토큰 수는 컨텍스트 한도와 API 과금의 기준으로 쓰입니다.
157개 용어 · 글 끝의 "이 글의 용어" 상자에서 이 사전으로 이어져요.