Benchgen

Arena Hard — Results

RankModelScore
1qwen3-235b-a22b0.956
2qwen3-32b0.938
3qwen3-30b-a3b0.91
4llama-3-3-nemotron-super-49b-v10.883
5mistral-small-3-24b-instruct0.876
6qwen2-5-72b-instruct0.812
7phi-4-reasoning-plus0.79
8deepseek-v2-50.762
9phi-40.754
10phi-4-reasoning0.733
11ministral-8b-instruct0.709
12jamba-1-5-large0.654
13mistral-small-40.583
14granite-3-3-8b-base0.576
15granite-3-3-8b-instruct0.576
16ministral-3-14b-instruct-25120.551
17mistral-large-30.551
18qwen2-5-7b-instruct0.52
19ministral-3-8b-instruct-25120.509
20jamba-1-5-mini0.461
21mistral-small-3-2-24b-instruct0.431
22phi-3-5-moe-instruct0.379
23phi-3-5-mini-instruct0.37
24phi-4-mini0.328
25ministral-3-3b-instruct-25120.305
A

Arena Hard — Evaluations

1 phaseActive

No evaluations yet for this benchmark.