Benchgen

AIME 2024 — Results

RankModelScore
1grok-3-mini0.958
2o4-mini0.934
3gemini-2-5-pro0.92
4o30.916
5deepseek-r1-05280.914
6glm-4-50.91
7glm-4-5-air0.894
8gemini-2-5-flash0.88
9o3-mini0.873
10qwen3-235b-a22b0.857
11qwen3-32b0.814
12phi-4-reasoning-plus0.813
13qwen3-30b-a3b0.804
14qwq-32b0.795
15kimi-k1-50.775
16phi-4-reasoning0.753
17o10.743
18kimi-k2-09050.72
19kimi-k2-instruct-09050.696
20kimi-k2-instruct0.696
21deepseek-v3-10.663
22deepseek-v3-03240.594
23gpt-4-1-mini0.496
24gpt-4-10.481
25deepseek-v30.392

AIME 2024 — Evaluations

1 phaseActive

No evaluations yet for this benchmark.