| Rank | Model | Score |
|---|---|---|
| 1 | gpt-5 | 92.5 |
| 2 | o1 | 91.8 |
| 3 | gpt-4-5 | 90.8 |
| 4 | o1-preview | 90.8 |
| 5 | sarvam-105b | 90.6 |
| 6 | claude-3-5-sonnet-v1 | 90.4 |
| 7 | kimi-k2-0905 | 90.2 |
| 8 | kimi-k2-instruct | 89.5 |
| 9 | mimo-v2-5-pro | 89.4 |
| 10 | claude-3-5-sonnet | 88.7 |
| 11 | gpt-4o | 88.7 |
| 12 | llama-3-1-405b-instruct | 88.6 |
| 13 | deepseek-v3 | 88.5 |
| 14 | kimi-k2-base | 87.8 |
| 15 | qwen3-235b-a22b | 87.8 |
| 16 | grok-2 | 87.5 |
| 17 | kimi-k1-5 | 87.4 |
| 18 | o3-mini | 86.9 |
| 19 | claude-3-opus | 86.8 |
| 20 | qwen2-5-72b-instruct | 86.8 |
| 21 | gpt-4-turbo | 86.4 |
| 22 | gpt-4-0613 | 86.4 |
| 23 | grok-2-mini | 86.2 |
| 24 | llama-3-1-70b-instruct | 86 |
| 25 | llama-3-2-90b-instruct | 86 |
1 phaseActive
No evaluations yet for this benchmark.