Benchgen

HumanEval — Results

RankModelScore
1minicpm-sala0.951
2kimi-k2-09050.945
3gpt-5-10.94
4claude-3-5-sonnet0.937
5gpt-5-20.936
6gpt-50.934
7gpt-50.934
8kimi-k2-instruct0.933
9kimi-k2-instruct0.933
10qwen2-5-coder-32b-instruct0.927
11qwen2-5-coder-32b-instruct0.926
12sarvam-30b0.921
13claude-3-5-sonnet-v10.92
14mistral-large-20.92
15deepseek-v3-20.92
16qwen2-5-vl-32b-instruct0.915
17gpt-4o0.902
18gemini-2-5-pro0.9
19deepseek-v3-10.898
20granite-3-3-8b-base0.897
21granite-3-3-8b-instruct0.897
22nova-2-pro0.89
23llama-3-1-405b-instruct0.89
24deepseek-v2-50.89
25nova-pro0.89
H

HumanEval — Evaluations

1 phaseActive

No evaluations yet for this benchmark.