Benchgen

HumanEval — Results

RankModelScore
1deepseek-v4-1-flash79.4
2minicpm-sala0.951
3kimi-k2-09050.945
4gpt-5-10.94
5claude-3-5-sonnet0.937
6gpt-5-20.936
7gpt-50.934
8gpt-50.934
9kimi-k2-instruct0.933
10kimi-k2-instruct0.933
11qwen2-5-coder-32b-instruct0.927
12qwen2-5-coder-32b-instruct0.926
13sarvam-30b0.921
14claude-3-5-sonnet-v10.92
15mistral-large-20.92
16deepseek-v3-20.92
17qwen2-5-vl-32b-instruct0.915
18gpt-4o0.902
19gemini-2-5-pro0.9
20deepseek-v3-10.898
21granite-3-3-8b-base0.897
22granite-3-3-8b-instruct0.897
23nova-2-pro0.89
24llama-3-1-405b-instruct0.89
25deepseek-v2-50.89
H

HumanEval — Leaderboard

1 phaseActive

HumanEval Leaderboard

No self-reported entries.