이 글 어땠어요?
결과가 나오면 맞았는지 그대로 적어요.
넓고 깊은 리서치는 더 큰 모델보다 검색을 프로그램으로 짜는 설계에서 먼저 풀린다
7월 기준 근거는 같은 GPT-5.5가 감싼 틀에 따라 soft F1 0.363과 0.121을 받은 WANDR 표입니다.
과제 500개와 채점 도구가 GitHub에 아파치 2.0 라이선스로 올라 있습니다. 다만 풀이와 페이지 수집, 판정에 유료 API가 들어가고, README는 여섯 회사 시스템을 전체 과제에 돌리는 설정이 매우 비쌀 수 있다고 적었습니다.
soft는 덜 채운 대상에도 부분 점수를 주고, hard는 대상 하나에 필요한 가지가 전부 맞아야 점수를 줍니다. 1위 퍼플렉시티는 soft F1 0.363, hard F1 0.133이었습니다.
알 수 없습니다. 7월 16일 판 과제 지시문 500개는 모두 영어이고, 한국이 나오는 과제는 여러 나라를 함께 묻는 4개뿐입니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
머코어가 한국 시각 10월 2일 새벽에 공개한 실험에서 Claude Opus 5는 간소화한 월말 결산 과제 20번을 모두 만점으로 10분 안에 풀었습니다. AI 없이 푼 회계사 12명의 평균은 약 37%였고, 함께 푼 24건은 약 15배 오래 걸렸습니다.

9개 기관 연구진 33명이 75쪽 논문에서 자기개선 연구 491편을 다섯 단계로 나눴습니다. 개선 절차까지 고쳐 물려주는 L5는 29편이었고, 그 절차가 다음 세대를 더 잘 만든다는 효과는 아직 통계로 확인되지 않았습니다.
7월 2일 공개된 EdgeBench의 12시간 점수는 Claude Opus 4.8 51.3점, GPT-5.5 48.4점이었습니다. 기록을 이어 가며 12시간을 쓴 Opus 4.8은 43.0점, 2시간마다 새로 시작하면 36.1점이었습니다.

머코어가 한국 시각 10월 2일 새벽에 공개한 실험에서 Claude Opus 5는 간소화한 월말 결산 과제 20번을 모두 만점으로 10분 안에 풀었습니다. AI 없이 푼 회계사 12명의 평균은 약 37%였고, 함께 푼 24건은 약 15배 오래 걸렸습니다.

9개 기관 연구진 33명이 75쪽 논문에서 자기개선 연구 491편을 다섯 단계로 나눴습니다. 개선 절차까지 고쳐 물려주는 L5는 29편이었고, 그 절차가 다음 세대를 더 잘 만든다는 효과는 아직 통계로 확인되지 않았습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
@perplexity_aiX 게시물 · 원문 보기
퍼플렉시티는 WANDR를 자사 에이전트 제품 Computer의 리서치 능력을 키울 때 쓰던 내부 벤치마크라고 소개했습니다. 이름은 Wide ANd Deep Research에서 따왔습니다. 조건에 맞는 대상을 넓게 빠짐없이 찾는지, 찾은 대상마다 요구한 사실을 출처로 깊게 증명하는지를 한 번에 봅니다.
아라빈드 스리니바스 CEO는 같은 날 Computer에 들어간 퍼플렉시티의 리서치 하네스가 비용과 성능 모두에서 가장 좋고, 그 이유 가운데 하나가 탄탄한 내부 평가라고 적었습니다. 하네스는 모델에 검색 도구와 작업 순서를 붙여 일을 시키는 실행 틀입니다. 함께 올린 도표에는 퍼플렉시티가 과제당 비용 5달러 언저리에서 가장 높은 점수로 찍혀 있습니다.
@AravSrinivasX 게시물 · 원문 보기
WANDR라는 이름은 공개 5일 전부터 퍼플렉시티 발표에 나왔습니다. 7월 9일 퍼플렉시티는 GLM 5.2를 Computer에 맞춰 추가 학습한 오케스트레이터(작업을 나눠 하위 에이전트에 맡기는 지휘 모델)를 연구 미리보기로 냈습니다. 필요할 때 더 강한 모델을 부르는 어드바이저 도구를 붙인 이 모델의 WANDR 과제당 비용은 GLM 5.2 단독의 2.1배로, Opus의 6.1배보다 훨씬 낮았다고 밝혔습니다. 전체 벤치마크 결과는 몇 주 안에 공개하겠다고 덧붙였습니다.
7월 10일에는 Cursor와 함께 학습한 Grok 4.5를 오케스트레이터로 추가하며, WANDR에서 다른 구성 5개보다 높은 점수를 Opus 4.8의 절반 정도 비용으로 냈다고 발표했습니다. Grok 공식 계정이 이 결과를 받아 Perplexity Computer 평가에서 최고점을 받았다고 알렸고, 일론 머스크도 같은 게시물을 인용해 퍼플렉시티에서 Grok 4.5를 써 보라고 적었습니다.
@perplexity_aiX 게시물 · 원문 보기
이때까지 WANDR의 과제와 채점 방식은 공개된 적이 없었습니다. SpaceXAI 쪽이 그 점수를 받아 쓴 지 4일 만인 7월 14일, 퍼플렉시티는 과제 500개와 채점 도구를 아파치 2.0 라이선스로 풀었습니다. 저장소에는 과제별 지시문과 채점기, 실행 설정이 함께 들어 있어 다른 회사도 같은 시험지로 자기 시스템을 돌려 볼 수 있습니다.
WANDR는 과제를 트리로 적습니다. 회사(n곳) → 직원(m명) → 근거 페이지(k개)라고 적으면, 조건에 맞는 회사 n곳을 찾고 회사마다 직원 m명을, 직원마다 근거 페이지 k개를 대라는 과제가 됩니다. 필요한 기록은 n×m×k개이고, 트리의 끝까지 이어진 경로 하나하나를 따로 채점합니다. 평면 목록과 중첩 검색, 여러 출처의 교차 확인, 행렬형 비교가 모두 같은 틀로 표현됩니다.

공개된 예시는 2026년 3월 1일부터 4월 30일 사이에 CEO나 CFO 선임을 처음 발표한 미국 본사 회사를 70곳 이상 찾는 과제입니다. 회사마다 회사명과 선임자, 직책, 발표일이 모두 나온 공신력 있는 페이지(회사 발표, 공시, 뉴스와이어, 직접 취재한 경제 기사)를 하나씩 대고, 그 회사가 미국 증권거래소 상장사이거나 SEC 보고 의무가 있는 회사라는 증빙도 따로 대야 합니다. 선임 기록 70개와 상장 기록 70개를 합쳐 140개입니다. 선임 페이지를 찾았어도 상장 증빙이 빠지면 그 회사는 미완성으로 처리됩니다.
저장소의 과제 설정 파일을 열어 보면 이 과제의 난이도 등급은 「낮음」입니다. WANDR는 과거 풀이 기록으로 난이도를 매겨 과제 500개를 낮음 167개, 중간 166개, 높음 167개로 나눴습니다. 과제 하나가 요구하는 대상 수의 중앙값은 50개, 대상 하나에 붙는 기록은 4개, 기록 수의 중앙값은 245개이고, 500개를 다 합치면 출처가 붙은 기록 17만 495개가 필요합니다.

과제의 뼈대는 실제 사용 기록에서 왔습니다. 퍼플렉시티는 개인 정보를 지운 제품 요청 가운데 목록이나 표를 만들어 달라는 요청을 씨앗으로 골랐고, 작성 에이전트와 비평 에이전트가 번갈아 과제를 다듬게 했습니다. 요구한 양을 실제로 채울 수 있는지는 작성 과정에서 나온 풀이 10~12개를 합쳐 확인했고, 사람은 정답을 채우는 대신 품질 검토를 맡았습니다. 이렇게 만든 과제의 주제는 경쟁사 조사, 실사, 문헌 조사, 시장 분석, 제품 비교, 인재 발굴에 걸쳐 있습니다. 45쪽짜리 기술 보고서는 퍼플렉시티 연구진 10명이 썼습니다.
채점 방식이 WANDR에서 가장 새로운 부분입니다. 에이전트가 내는 기록 하나에는 대상, 출처 URL, 페이지에서 뽑은 발췌, 답이 들어갑니다. 채점기는 그 URL을 다시 가져와 페이지가 근거로 쓸 만한지, 주장이 분명하고 과제 범위 안인지, 발췌가 실제로 그 페이지에 있는지, 페이지와 발췌가 요구 조건을 전부 증명하는지를 차례로 봅니다. 하나라도 걸리면 그 기록은 0점입니다.

퍼플렉시티는 정답표를 버린 이유로 세 가지를 들었습니다. 만들기 비싸고, 금방 낡고, 시간이 지나면 답이 바뀌는 질문에 맞지 않는다는 겁니다. 그 대신 판정은 LLM이 합니다. 논문에 따르면 채점에는 오픈AI GPT-5.4를 고정된 설정으로 썼고, 사람 검토자가 자동 판정을 보기 전에 표본 기록을 따로 다시 매겨, 자동 판정의 오류율이 10% 안팎을 넘는 과제는 탈락시켰습니다.
판정은 트리를 따라 위로 모여 점수가 됩니다. 정밀도는 제출한 대상 가운데 맞은 비율이고, 재현율은 과제가 요구한 수를 분모로 둔 완성도라서 모자란 만큼 0점으로 채워집니다. F1은 두 값을 조화평균으로 묶어 한쪽만 높은 시스템이 좋은 점수를 받지 못하게 합니다. soft 점수는 덜 채운 대상에도 부분 점수를 주고, hard 점수는 대상 하나에 필요한 가지가 전부 맞아야 그 대상을 인정합니다.
비교 대상은 퍼플렉시티 Search as Code, 앤트로픽 Managed Agents, 오픈AI Responses API(웹 검색과 코드 실행 포함), 구글 Gemini Deep Research, 그리고 검색 API 회사 Exa와 Parallel의 에이전트 제품입니다. 시스템마다 과제 500개를 한 번씩 풀게 하고 같은 채점기로 매겼습니다. 아래 표는 기술 보고서의 표 3·4·5에서 옮겼습니다.
| 시스템 | 풀이 모델·설정 | soft F1 | hard F1 | 과제당 비용 | 풀이 시간(중앙값) |
|---|---|---|---|---|---|
| 퍼플렉시티 Search as Code | GPT-5.5 / high | 0.363 | 0.133 | 5.20달러 | 14.9분 |
| 앤트로픽 Managed Agents | Opus 4.8 / high | 0.249 | 0.072 | 46.43달러 | 73.7분 |
| 오픈AI Responses API | GPT-5.5 / high | 0.121 | 0.035 | 0.50달러 | 8.6분 |
| Exa Agent | high | 0.070 | 0.020 | 0.50달러 | 5.3분 |
| Parallel Tasks | ultra4x | 0.069 | 0.019 | 1.19달러 | 30.0분 |
| Gemini Deep Research | speed | 0.055 | 0.009 | 15.24달러 | 22.3분 |
hard 기준 최고 정밀도는 0.150, 최고 재현율은 0.134입니다. 1위 시스템도 제출한 대상 7개 중 1개, 과제가 요구한 대상 7개 중 1개 정도만 근거까지 완전한 점수를 받았습니다. soft에서 hard로 넘어가며 퍼플렉시티는 0.363에서 0.133으로, 앤트로픽은 0.249에서 0.072로 떨어졌습니다. 부분 점수를 받을 만큼은 채우지만, 대상 하나에 필요한 가지를 끝까지 다 채우는 경우는 적었습니다.
여섯 시스템 모두 soft 재현율이 soft 정밀도보다 낮았습니다. 논문은 이를 요구한 전체 양이 분모에 들어가는 순간 성적이 떨어진다는 신호로 봤습니다. 퍼플렉시티는 정밀도 0.389에서 재현율 0.357로 차이가 가장 작았고, 앤트로픽은 0.354에서 0.222로 크게 벌어졌습니다.
노력 설정을 올리면 점수도 올랐지만 절반에는 못 미쳤습니다. 과제 45개로 줄인 추가 실험에서 퍼플렉시티는 가장 높은 xhigh 설정으로 soft 0.447, hard 0.224를 받았습니다. 오픈AI는 high에서 가장 높았고 xhigh에서는 오히려 내려갔습니다. 같은 실험에서 과제당 비용은 Exa low의 0.03달러부터 Gemini max의 324.83달러까지 1만 배 넘게 벌어졌습니다. 노력 단계를 올릴 때 토큰이 어떻게 불어나는지는 Claude Code의 모델과 노력 설정을 풀어 쓴 글에 정리했습니다.
표의 첫 줄과 셋째 줄은 풀이 모델이 같습니다. 퍼플렉시티 Search as Code와 오픈AI Responses API 모두 GPT-5.5를 high 설정으로 돌렸는데, soft F1은 0.363과 0.121로 세 배 차이가 났습니다. 못 쓰는 페이지를 낸 비율은 3.2%와 23.1%, 페이지에 없는 문장을 발췌로 낸 비율은 19.3%와 69.8%였습니다.
두 시스템은 모델이 같고, 검색 인프라와 모델을 감싼 실행 방식이 다릅니다. 퍼플렉시티 쪽 실행 방식인 Search as Code는 검색, 걸러내기, 여러 갈래로 나눠 찾기, 결과 합치기, 중복 제거, 멈출 시점까지 모델이 프로그램 하나로 짜고, 반복 작업은 모델 문맥 밖에서 같은 입력에 늘 같은 결과를 내는 일반 코드가 처리하는 구조입니다. 퍼플렉시티 개발자 계정은 이 구조 덕분에 모델이 리서치를 한 번 설계한 뒤 문맥이 넘치지 않은 채 대규모로 실행할 수 있다고 설명했습니다. 대상 수백 개를 모델이 대화 속에서 하나씩 붙들고 있는 대신 프로그램이 목록을 들고 도는 방식입니다.
앤트로픽은 다른 방향을 보여 줬습니다. Opus 4.8로 2위에 올랐고, 페이지가 요구 조건을 놓친 비율은 33.6%로 여섯 시스템 가운데 가장 낮았습니다. 대신 과제 하나에 46.43달러와 73.7분, 입력 토큰 5,175만 개를 썼습니다. 퍼플렉시티와 비교하면 비용은 8.9배, 시간은 5배 가까이 들었습니다.
한데 논문은 이 순위로 어느 부품이 점수를 만들었는지는 가릴 수 없다고 적었습니다. 시스템마다 모델과 검색 인프라, 에이전트 하네스, 도구 인터페이스가 한꺼번에 다르기 때문입니다. 같은 모델이 감싼 틀에 따라 다른 결과를 낸 사례는 앤트로픽이 모델 대신 하네스를 고쳐 긴 작업을 끝낸 실험에도 있습니다.
퍼플렉시티 개발자 계정은 공개 당일 좁은 검색은 사실상 풀렸고, 다음 과제는 조건에 맞는 결과를 전부 찾아 하나하나 증거를 대는 넓은 리서치라고 적었습니다. WANDR 숫자도 페이지에 닿는 단계까지는 그 말과 맞습니다. 채점 전 제출량만 세면 요구한 대상을 찾아낸 비율이 0.611~0.951이었고, 대상을 찾은 뒤 마지막 근거 항목을 채운 비율은 0.979~0.994였습니다. 쓸 수 없는 페이지를 낸 비율도 다섯 시스템은 3.2~8.9%였고, 오픈AI만 23.1%로 튀었습니다.

점수를 깎은 것은 그다음 두 단계입니다. 제출된 페이지의 33.6~68.3%가 과제 요구 조건을 하나 이상 놓쳤고, 발췌의 57.5~86.6%가 기록이 주장하는 내용을 전부 증명하지 못했습니다. 1위 퍼플렉시티도 각각 41.4%와 57.5%였습니다. 페이지가 조건을 만족하는지만 보는 느슨한 판정에서 퍼플렉시티의 soft F1은 0.531이었는데, 발췌까지 따지는 전체 판정에서는 0.363으로 내려갔습니다. hard F1도 0.245에서 0.133이 됐습니다.
실패의 모양도 논문에 나옵니다. 발췌가 페이지에 실제로 있는 문장일 때, 그 발췌가 요구 조건을 하나라도 증명하는 비율은 96.9~99.4%였지만 전부 증명하는 비율은 55.6~80.4%에 그쳤습니다. 연구진이 직접 들여다본 사례에는 순위 페이지에서 날짜를 빼먹은 발췌, 긴 리뷰 페이지에서 개별 리뷰를 놓친 발췌가 있었습니다. 페이지가 길수록 조건을 다 담은 발췌가 줄어드는 경향은 여섯 시스템 가운데 다섯에서 보였습니다.
규모와 깊이가 커지면 hard 점수는 더 빨리 떨어졌습니다. 요구 기록 수가 가장 적은 구간에서 가장 많은 구간으로 가면 퍼플렉시티의 hard 정밀도는 0.235에서 0.096으로, hard 재현율은 0.219에서 0.079로 내려갔습니다. 트리의 중간 단계(회사와 근거 페이지 사이에 끼는 직원 같은 단계)가 없는 과제와 3단계 이상인 과제를 견주면 차이는 더 벌어집니다.
| 중간 단계 0개 → 3개 이상 | hard 정밀도 | hard 재현율 |
|---|---|---|
| 퍼플렉시티 | 0.392 → 0.019 | 0.378 → 0.017 |
| 앤트로픽 | 0.311 → 0.049 | 0.229 → 0.022 |
| 오픈AI | 0.136 → 0.012 | 0.120 → 0.011 |
hard 점수는 대상 하나의 하위 트리가 전부 맞아야 주는 점수라, 가지가 하나 늘 때마다 그 대상을 놓칠 곳도 하나씩 늘어납니다. 본 과제와 하위 과제가 함께 있는 과제는 두 점수를 곱해 대상 점수를 내기 때문에, CEO 과제처럼 선임 증빙과 상장 증빙을 모두 요구하면 한쪽의 약점이 그대로 전체를 깎습니다. 다만 중간 단계가 3개 이상인 과제는 500개 가운데 6.6%이고, 논문은 규모와 깊이, 주제가 함께 움직여 원인을 하나로 가를 수는 없다고 덧붙였습니다.

공개 당일 믹스패널 창업자 수하일 도시는 퍼플렉시티가 이런 벤치마크를 잘 만든다며, 깊이 들여다볼 때마다 그 분야에서 가장 탄탄했고 앞서 낸 DRACO도 그랬다고 적었습니다. DRACO는 에이전트가 쓴 긴 리서치 보고서의 정확성·완결성·객관성을 재는 퍼플렉시티의 벤치마크이고, WANDR는 그 넓은 쪽 짝으로 나왔습니다.
@SuhailX 게시물 · 원문 보기
한데 시험지를 만든 회사가 1위를 한 데서 생길 수 있는 문제는 논문이 스스로 한계 절에 적었습니다. 채점기는 인용된 페이지를 먼저 에이전트용 페이지 수집 기능으로 가져오는데, 이 기능은 퍼플렉시티 풀이 시스템도 쓸 수 있습니다. 퍼플렉시티 시스템이 찾은 페이지일수록 채점 단계에서도 잘 열릴 수 있습니다. 이 기능을 끄고 브라우저로만 수집한 내부 실험에서는 모든 시스템의 점수가 내려갔고, 순위는 대체로 그대로였다고 합니다.
과제를 고르는 과정에도 퍼플렉시티 시스템이 들어갔습니다. 작성 단계에서는 단순한 내부 기준 시스템이 이미 풀어 버리는 과제를 걸러 내고, 강한 내부 풀이가 약한 내부 풀이보다 뚜렷이 높은 점수를 내는 과제만 남겼습니다. 여섯 시스템의 본 평가는 과제를 확정한 뒤에 했지만, 시스템마다 한 번씩만 돌려서 실행할 때마다 점수가 얼마나 흔들리는지는 재지 않았습니다.
자사 모델이 1위를 한 시험은 오픈AI에도 있었습니다. 오픈AI가 7월 1일 낸 생물학 분석 시험 GeneBench-Pro에서 가장 높은 점수는 자사 GPT-5.6 Sol의 28.7%였습니다. 오픈AI는 합성 데이터로 정답을 미리 정해 두고 기계적으로 채점하는 방식을 골랐습니다. WANDR는 바뀌는 웹의 사실을 다루려고 정답표를 버렸고, 그만큼 LLM 심판과 페이지 수집 경로가 점수에 끼어듭니다.
퍼플렉시티는 WANDR를 공개하며 과제를 만드는 파이프라인이 학습 데이터를 찍어 내는 반자동 공장 역할도 한다고 적었습니다. 최종 점수 하나 대신 기록과 가지 단위의 판정으로 부분 보상을 줄 수 있고, 요구하는 대상 수를 조금씩 늘려 쉬운 과제에서 어려운 과제로 가는 커리큘럼을 짤 수 있다는 설명입니다. 논문은 강화학습에 쓸 때 공개된 500개 대신 새로 만든 과제로 학습하고, 대상을 부풀려 내거나 증거를 틀에 찍어 내는 보상 해킹을 따로 점검하라는 조건을 붙였습니다.
이 시험지는 이미 퍼플렉시티의 모델 개발에 들어가 있었습니다. 7월 9일 Computer용으로 추가 학습한 GLM 5.2 오케스트레이터의 비용을 잰 것도 WANDR였습니다. 공개 당일에는 퍼플렉시티 개발자 계정이 Agent API에 넓은 리서치용 프리셋(미리 짜 둔 설정)을 내놓았고, 예시 코드의 요청문은 WANDR의 CEO·CFO 과제였습니다. 다음 날인 7월 15일에는 에이전트가 코드를 돌리는 실행 환경 SPACE를 공개했습니다.
@perplexitydevsX 게시물 · 원문 보기
WANDR는 아파치 2.0 라이선스라 국내 기업도 내려받아 자사 에이전트를 돌려 볼 수 있습니다. 다만 풀이와 페이지 수집, 판정에 모두 유료 API가 들어가고, README는 여섯 회사의 시스템을 전체 과제에 돌리는 설정이 매우 비쌀 수 있으며 실행 도구가 지출 한도를 걸어 주지 않는다고 적었습니다. 퍼플렉시티 한 곳의 풀이 비용만 따져도 과제당 5.20달러, 500개면 2,600달러입니다.
과제 구성도 국내 쓰임과 거리가 있습니다. 7월 16일 판 저장소의 과제 지시문 500개는 모두 영어입니다. 지시문에 한국이 조사 대상이나 예시로 나오는 과제는 G20 19개국의 대표 기관, 30개국의 차량 선팅 규정, 동아시아를 포함한 6개 시장의 대학 지원 수수료, 세포·유전자 치료제용 냉동 보관 백의 유통사 찾기까지 4개였고, 모두 여러 나라 가운데 하나로 들어 있었습니다. 한국어 공시와 보도자료, 채용 공고를 근거로 대야 하는 과제에서 같은 순위가 나오는지는 이 시험으로 알 수 없습니다.
실사나 경쟁사 조사를 에이전트에 맡기는 팀에게 WANDR가 보여 준 실패는 구체적입니다. 아예 쓸 수 없는 페이지를 가져오는 경우는 다섯 시스템에서 한 자릿수 퍼센트였고, 가장 많이 틀린 곳은 페이지에서 조건 일부만 담은 문장을 떼어 온 발췌였습니다. 표 한 줄에 날짜와 직책과 상장 여부가 모두 걸려 있다면, 붙은 발췌가 그 셋을 다 증명하는지 대조하는 일이 WANDR 채점기가 하는 일과 같습니다.
저는 이 문제가 더 큰 모델보다 검색을 프로그램으로 짜는 설계에서 먼저 풀린다고 봅니다. 같은 GPT-5.5가 감싼 틀에 따라 0.363과 0.121을 받았고, 가장 높은 노력 설정으로도 hard 점수는 0.224였습니다. 논문은 WANDR로 에이전트를 강화학습시키는 실험을 다음 단계로 적었고, 퍼플렉시티는 GLM 5.2 오케스트레이터의 전체 벤치마크를 몇 주 안에 내겠다고 밝혔습니다.
읽어 주셔서 고맙습니다.
초이 드림