Benchgen

HumanEval+ — Results

RankModelScore
1o1-mini89
2o1-preview89
3gpt-4o87.2
4qwen2-5-coder-32b-instruct87.2
5deepseek-v386.6
6gpt-4-turbo86.6
7deepseek-v2-583.5
8gpt-4o-mini83.5
9claude-3-5-sonnet81.7
10k2-horizon-0-9b79.9
11gemini-1-5-pro79.3
12claude-3-opus77.4
13gemini-1-5-flash75.6
14gpt-3-5-turbo70.7
15claude-3-haiku68.9
16claude-3-sonnet64
17llama-3-1-8b-instruct62.8
18command-r-plus56.7
19gemini-pro55.5

HumanEval+ — Evaluations

1 phaseActive

No evaluations yet for this benchmark.