F1 점수
F1 · F1 score · F1-score
정밀도와 재현율의 조화평균으로, 두 값을 P와 R이라 할 때 2PR/(P+R)로 계산합니다. 탐지 오류를 함께 요약하지만 실제 운영의 오탐과 미탐 비용이 같다는 뜻은 아닙니다. 데이터 구성과 평균 방식이 다르면 점수를 그대로 비교할 수 없습니다.
‘F1 점수’ 이 나오는 글2
아티클AI
행동 판정만 하는 Span-01, 100만 토큰 0.02달러에 F1 0.843
Respan이 9월 24일 행동 판정 전용 모델 Span-01과 공개 평가 자료를 냈습니다. 입력 100만 토큰당 0.02달러에 전체 F1 0.843이고, 평가의 라벨은 프런티어 모델 두 개의 합의로 만들어졌습니다.

11분
논문AI
직접 만든 리서치 시험에서 1위, 퍼플렉시티도 7개 중 1개만 완벽했습니다
퍼플렉시티가 7월 14일 리서치 에이전트 벤치마크 WANDR를 공개했습니다. 상용 시스템 6개 가운데 1위인 자사 Search as Code도 hard F1 0.133으로, 대상 7개 중 1개 정도만 근거까지 완전한 점수를 받았습니다.

14분
함께 나오는 용어5
- 에이전트한 번 답하고 멈추지 않고, 스스로 계획하고 도구를 부르고 결과를 확인하며 여러 단계를 이어가는 AI입니다. 브라우저·터미널·앱을 대신 조작하는 것이 대표 예입니다.
- 프런티어 모델그 시점에 공개된 모델 가운데 능력이 가장 앞선 등급을 가리킵니다. 각국 안전연구소의 평가 대상과 수출통제 논의가 이 등급을 기준으로 짜입니다.
- 토큰모델이 텍스트 등을 나누어 처리하는 단위입니다. 단어 전체, 단어의 일부, 문자나 기호가 토큰으로 나뉠 수 있으며, 같은 문장도 토크나이저와 언어에 따라 개수가 달라집니다. 글자 수와 고정된 비율로 대응하지 않습니다. 입력·출력 토큰 수는 컨텍스트 한도와 API 과금의 기준으로 쓰입니다.
- 벤치마크모델 실력을 재는 표준 시험입니다. 수학(GSM8K·MATH), 코딩(HumanEval·SWE-bench) 같은 문제집 점수로 모델을 비교합니다.
- 딥리서치검색을 수십 번 반복해 출처가 붙은 보고서를 만드는 에이전트 기능입니다. 조사 절차를 하네스로 짜던 방식에서 그 절차 자체를 모델에 학습시키는 방식으로 옮겨 갔습니다. 퍼플렉시티 WANDR 평가에서는 대상을 빠짐없이 찾는 과제를 통과한 곳이 일곱 곳 가운데 한 곳이었습니다.
어려운 말은 풀어서, 매주 한 통
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
