| Rank | Model | Score |
|---|---|---|
| 1 | mimo-v2-5-pro | 99.6 |
| 2 | gpt-5-1 | 98.7 |
| 3 | gpt-5 | 98.5 |
| 4 | gpt-5-2 | 98.1 |
| 5 | o3-mini | 97.8 |
| 6 | phi-4-reasoning-plus | 97.5 |
| 7 | o1 | 97.3 |
| 8 | kimi-k2-instruct | 97.3 |
| 9 | gpt-4o | 97.2 |
| 10 | phi-4-reasoning | 97.2 |
| 11 | gpt-4-turbo | 97 |
| 12 | gpt-4-5 | 97 |
| 13 | o3 | 97 |
| 14 | llama-3-1-405b-instruct | 96.8 |
| 15 | gemini-3-flash | 96.8 |
| 16 | gemini-2-5-pro | 96.7 |
| 17 | deepseek-v3 | 96.4 |
| 18 | claude-3-5-sonnet-v1 | 96.4 |
| 19 | phi-4 | 96.4 |
| 20 | deepseek-r1-0528 | 96.2 |
| 21 | claude-3-5-sonnet | 96 |
| 22 | gemma-3-27b | 95.9 |
| 23 | qwen2-5-32b-instruct | 95.9 |
| 24 | gpt-5-5 | 95.8 |
| 25 | qwen2-5-72b-instruct | 95.8 |
1 phaseActive
No evaluations yet for this benchmark.