Benchgen

MATH — Results

RankModelScore
1gpt-5-198.8
2o3-mini97.9
3gemini-3-flash97.5
4gpt-5-297.5
5deepseek-r1-052897.3
6o396.7
7gpt-5-596.3
8gemini-2-5-pro96.2
9o194.8
10gemini-2-5-flash94.8
11phi-4-reasoning-plus93.3
12phi-4-reasoning92.7
13deepseek-v3-292.3
14qwq-32b90.6
15deepseek-v3-190.4
16ministral-3-14b-instruct-251290.4
17deepseek-v390.2
18gemini-2-0-flash89.7
19kimi-k2-090589.1
20gemma-3-27b89
21llama-3-3-70b-instruct87.8
22mistral-large-387.7
23ministral-3-8b-instruct-251287.6
24gemini-2-0-flash-lite86.8
25mimo-v2-5-pro86.2
M

MATH — Evaluations

1 phaseActive

No evaluations yet for this benchmark.