Benchgen

HumanEval+ — Results

RankModelScore
1o1-mini89
2o1-preview89
3gpt-4o87.2
4qwen2-5-coder-32b-instruct87.2
5deepseek-v386.6
6gpt-4-turbo86.6
7deepseek-v2-583.5
8gpt-4o-mini83.5
9claude-3-5-sonnet81.7
10gemini-1-5-pro79.3
11claude-3-opus77.4
12gemini-1-5-flash75.6
13gpt-3-5-turbo70.7
14claude-3-haiku68.9
15claude-3-sonnet64
16llama-3-1-8b-instruct62.8
17command-r-plus56.7
18gemini-pro55.5

HumanEval+ — Evaluations

1 phaseActive

No evaluations yet for this benchmark.