Benchgen

BigCodeBench — Results

RankModelScore
1claude-sonnet-3-70.358
2deepseek-r1-05280.351
3deepseek-v30.345
4gemini-2-5-pro0.331
5gpt-4-10.328
6deepseek-v3-03240.318
7gpt-4-1-mini0.318
8gpt-4o0.311
9qwen2-5-coder-32b-instruct0.308
10claude-3-5-sonnet0.304
11claude-3-5-haiku0.301
12claude-3-5-sonnet-v10.294
13gemini-2-0-flash0.287
14llama-4-maverick0.284
15llama-3-3-70b-instruct0.284
16phi-40.274
17llama-3-1-405b-instruct0.264
18claude-3-opus0.26
19gemma-3-27b0.26
20gemini-1-5-pro0.254
21qwen2-5-72b-instruct0.254
22llama-3-1-70b-instruct0.254
23qwen2-5-32b-instruct0.246
24qwen2-5-14b-instruct0.209
25qwen2-72b-instruct0.206
B

BigCodeBench — Phases

1 phaseActive

Phase 1·

BigCodeBench

Jul 21, 2026
Current