Benchgen

BrowseComp — Results

RankModelScore
1nex-n2-5-max92.6
2gpt-6-astra91.5
3kimi-k391.2
4gpt-5-6-sol90.4
5nex-n2-5-pro89.7
6claude-fable-588
7gpt-5-6-terra87.5
8ornith-1-5-397b86.6
9seed-2-1-pro86.2
10gemini-3-1-pro85.9
11seed-2-1-turbo84.9
12claude-sonnet-584.7
13gpt-5-584.4
14claude-opus-4-884.3
15hy384.2
16claude-opus-4-684
17minimax-m383.5
18deepseek-v4-pro83.4
19deepseek-v4-pro-max83.4
20gpt-5-6-luna83.3
21kimi-k2-683.2
22gpt-5-482.7
23claude-opus-4-779.3
24glm-5-179.3
25gpt-5-1-thinking78.4

BrowseComp — Evaluations

1 phaseActive

No evaluations yet for this benchmark.