Benchgen

LongBench v2 — Results

RankModelScore
1ling-3-0-flash-base52.62
2deepseek-v4-1-flash45.2
3ling-3-0-tiny-base43.85
4minicpm5-2b43.7
5qwen3-5-397b-a17b0.632
6qwen3-6-plus0.62
7nemotron-3-ultra-550b-a55b0.619
8minimax-m1-80k0.615
9kimi-k2-50.61
10mai-thinking-10.61
11minimax-m1-40k0.61
12mimo-v2-flash0.606
13qwen3-5-27b0.606
14qwen3-5-122b-a10b0.602
15qwen3-5-35b-a3b0.59
16qwen3-5-9b0.552
17qwen3-5-4b0.5
18deepseek-v30.487
19qwen3-5-2b0.387
20qwen3-5-08b0.261

LongBench v2 — Evaluations

1 phaseActive

No evaluations yet for this benchmark.