Benchgen

LongBench v2 — Results

RankModelScore
1qwen3-5-397b-a17b0.632
2qwen3-6-plus0.62
3nemotron-3-ultra-550b-a55b0.619
4minimax-m1-80k0.615
5kimi-k2-50.61
6mai-thinking-10.61
7minimax-m1-40k0.61
8mimo-v2-flash0.606
9qwen3-5-27b0.606
10qwen3-5-122b-a10b0.602
11qwen3-5-35b-a3b0.59
12qwen3-5-9b0.552
13qwen3-5-4b0.5
14deepseek-v30.487
15qwen3-5-2b0.387
16qwen3-5-08b0.261

LongBench v2 — Evaluations

1 phaseActive

No evaluations yet for this benchmark.