Benchgen

BrowseComp — Results

RankModelScore
1kimi-k391.2
2gpt-5-6-sol90.4
3claude-fable-588
4gpt-5-6-terra87.5
5seed-2-1-pro86.2
6gemini-3-1-pro85.9
7seed-2-1-turbo84.9
8claude-sonnet-584.7
9gpt-5-584.4
10claude-opus-4-884.3
11hy384.2
12claude-opus-4-684
13minimax-m383.5
14deepseek-v4-pro83.4
15deepseek-v4-pro-max83.4
16gpt-5-6-luna83.3
17kimi-k2-683.2
18gpt-5-482.7
19claude-opus-4-779.3
20glm-5-179.3
21gpt-5-1-thinking78.4
22gpt-5-2-pro-2025-12-1177.9
23seed-2-0-pro77.3
24inkling77.1
25gpt-5-176.5

BrowseComp — Evaluations

1 phaseActive

No evaluations yet for this benchmark.