| Rank | Model | Score |
|---|---|---|
| 1 | claude-sonnet-3-7 | 0.358 |
| 2 | deepseek-r1-0528 | 0.351 |
| 3 | deepseek-v3 | 0.345 |
| 4 | gemini-2-5-pro | 0.331 |
| 5 | gpt-4-1 | 0.328 |
| 6 | deepseek-v3-0324 | 0.318 |
| 7 | gpt-4-1-mini | 0.318 |
| 8 | gpt-4o | 0.311 |
| 9 | qwen2-5-coder-32b-instruct | 0.308 |
| 10 | claude-3-5-sonnet | 0.304 |
| 11 | claude-3-5-haiku | 0.301 |
| 12 | claude-3-5-sonnet-v1 | 0.294 |
| 13 | gemini-2-0-flash | 0.287 |
| 14 | llama-4-maverick | 0.284 |
| 15 | llama-3-3-70b-instruct | 0.284 |
| 16 | phi-4 | 0.274 |
| 17 | llama-3-1-405b-instruct | 0.264 |
| 18 | claude-3-opus | 0.26 |
| 19 | gemma-3-27b | 0.26 |
| 20 | gemini-1-5-pro | 0.254 |
| 21 | qwen2-5-72b-instruct | 0.254 |
| 22 | llama-3-1-70b-instruct | 0.254 |
| 23 | qwen2-5-32b-instruct | 0.246 |
| 24 | qwen2-5-14b-instruct | 0.209 |
| 25 | qwen2-72b-instruct | 0.206 |
1 phaseActive
No evaluations yet for this benchmark.