Benchgen

ACEBench — Results

RankModelScore
1gpt-4o0.896
2qwen2-5-coder-32b-instruct0.853
3qwen2-5-32b-instruct0.799
4qwen2-5-72b-instruct0.793
5kimi-k2-instruct-09050.765
6kimi-k2-instruct0.765
7claude-3-5-sonnet0.756
8gemini-1-5-pro0.728
9qwen2-5-14b-instruct0.64
10llama-3-1-70b-instruct0.629
11qwen2-5-7b-instruct0.578
12qwen2-5-coder-7b-instruct0.496
13llama-3-1-8b-instruct0.338
14phi-3-5-mini-instruct0.295
A

ACEBench — Evaluations

1 phaseActive

No evaluations yet for this benchmark.