Benchgen

MMLU-Redux — Results

RankModelScore
1qwen3-7-max0.95
2qwen3-5-397b-a17b0.949
3qwen3-6-plus0.945
4qwen3-7-plus0.945
5kimi-k2-thinking-09050.944
6qwen3-5-122b-a10b0.94
7qwen3-235b-a22b-thinking-25070.938
8qwen3-vl-235b-a22b-thinking0.937
9qwen3-6-27b0.935
10deepseek-r1-05280.934
11qwen3-5-35b-a3b0.933
12qwen3-6-35b-a3b0.933
13qwen3-5-27b0.932
14qwen3-235b-a22b-instruct-25070.931
15kimi-k2-instruct-09050.927
16kimi-k2-instruct0.927
17qwen3-next-80b-a3b-thinking0.925
18qwen3-vl-235b-a22b-instruct0.922
19qwen3-vl-32b-thinking0.919
20deepseek-v3-10.918
21qwen3-5-9b0.911
22qwen3-next-80b-a3b-instruct0.909
23qwen3-vl-30b-a3b-thinking0.909
24qwen3-vl-32b-instruct0.898
25longcat-flash-thinking0.893
M

MMLU-Redux — Evaluations

1 phaseActive

No evaluations yet for this benchmark.