꼬리 지연
tail latency · p95 지연 · p99 지연
응답 시간 분포에서 유난히 느린 일부 요청의 지연입니다. p95가 2초라면 측정한 요청의 95%가 2초 이내였다는 뜻입니다. 여러 구성요소의 완료를 함께 기다리는 시스템에서는 평균이 빨라도 느린 일부가 전체 작업을 늦출 수 있습니다.
‘꼬리 지연’ 이 나오는 글1
아티클AI
GPU보다 대기열이 먼저 찼다, 오픈AI GPT-Live 6개월 제작기
오픈AI가 8월 3일 GPT-Live 실시간 시스템을 6개월 동안 만든 과정을 공개했습니다. 미디어 경로와 추론 로직을 Python에서 Go로 다시 써 새 시스템의 p95 지연이 옛 시스템 p50 수준으로 내려왔고, 연결 준비 왕복은 6번에서 1번으로 줄었습니다.

10분
함께 나오는 용어4
- 음성 모델말을 알아듣는 인식과 소리를 만드는 합성을 맡는 모델입니다. 받아쓰기가 운영체제 기본 기능으로 들어갔고, 20명이 동시에 말해도 화자를 가려내는 서비스가 시간당 0.18달러 선에서 나왔습니다.
- 툴 호출모델이 검색·계산기·API 같은 외부 도구를 불러 쓰는 기능입니다. 에이전트가 실제 일을 하려면 꼭 필요합니다.
- 추론학습이 끝난 모델을 실제로 돌려 답을 만드는 단계입니다. 비용·속도·지연 시간 이야기는 대부분 여기서 나옵니다.
- 지연어떤 시작점부터 정한 결과가 나타날 때까지의 지연 시간입니다. 네트워크의 편도·왕복 시간, 모델의 첫 토큰 시간, 답변 전체 완료 시간은 서로 다릅니다. 비교할 때는 시작과 끝의 기준, 캐시와 부하 조건을 맞추고 평균뿐 아니라 오래 걸린 요청의 분포도 확인해야 합니다.
