지연
latency · 레이턴시 · 응답 지연
어떤 시작점부터 정한 결과가 나타날 때까지의 지연 시간입니다. 네트워크의 편도·왕복 시간, 모델의 첫 토큰 시간, 답변 전체 완료 시간은 서로 다릅니다. 비교할 때는 시작과 끝의 기준, 캐시와 부하 조건을 맞추고 평균뿐 아니라 오래 걸린 요청의 분포도 확인해야 합니다.
‘지연’ 이 나오는 글9
추론하고도 0.32초, 인셉션이 전화 상담용 Mercury Voice를 내놨습니다
인셉션이 9월 29일(미국 시각) 음성 에이전트용 Mercury Voice를 정식 출시했습니다. 추론을 마치고 첫 답변 토큰까지 중앙값 320밀리초(회사 측정)이고, 값은 100만 토큰당 입력 0.40·출력 1.50달러에 출시 할인 50%입니다.

함께 나오는 용어5
- 에이전트한 번 답하고 멈추지 않고, 스스로 계획하고 도구를 부르고 결과를 확인하며 여러 단계를 이어가는 AI입니다. 브라우저·터미널·앱을 대신 조작하는 것이 대표 예입니다.
- 추론학습이 끝난 모델을 실제로 돌려 답을 만드는 단계입니다. 비용·속도·지연 시간 이야기는 대부분 여기서 나옵니다.
- 토큰모델이 텍스트 등을 나누어 처리하는 단위입니다. 단어 전체, 단어의 일부, 문자나 기호가 토큰으로 나뉠 수 있으며, 같은 문장도 토크나이저와 언어에 따라 개수가 달라집니다. 글자 수와 고정된 비율로 대응하지 않습니다. 입력·출력 토큰 수는 컨텍스트 한도와 API 과금의 기준으로 쓰입니다.
- 음성 모델말을 알아듣는 인식과 소리를 만드는 합성을 맡는 모델입니다. 받아쓰기가 운영체제 기본 기능으로 들어갔고, 20명이 동시에 말해도 화자를 가려내는 서비스가 시간당 0.18달러 선에서 나왔습니다.
- 툴 호출모델이 검색·계산기·API 같은 외부 도구를 불러 쓰는 기능입니다. 에이전트가 실제 일을 하려면 꼭 필요합니다.





