Benchgen

C-Eval — Results

RankModelScore
1qwen3-6-plus0.933
2qwen3-5-397b-a17b0.93
3kimi-k2-base0.925
4qwen3-5-122b-a10b0.919
5mimo-v2-5-pro0.915
6qwen3-6-27b0.914
7qwen3-5-27b0.905
8qwen3-5-35b-a3b0.902
9qwen3-6-35b-a3b0.9
10kimi-k1-50.883
11qwen3-5-9b0.882
12deepseek-v30.865
13qwen3-5-4b0.851
14qwen2-72b-instruct0.838
15qwen2-7b-instruct0.772
16qwen3-5-2b0.732
17qwen3-5-0-8b0.505
18ernie-4-50.407
C

C-Eval

1 phaseActive

Comprehensive Chinese evaluation suite with 13,948 MCQs across 52 disciplines at four difficulty levels: middle school, high school, college, and professional.

Overview

C-Eval

Category Metric Tasks Saturation Language

Paper GitHub Dataset

Quick answer: C-Eval (Huang et al., 2023) is a comprehensive Chinese evaluation suite with 13,948 multiple-choice questions across 52 disciplines at four difficulty levels. It assesses advanced Chinese knowledge and reasoning across humanities, science, and engineering.

Benchmark Details

PropertyValue
Tasks13,948 multiple-choice questions
Disciplines52 (humanities, science, engineering)
Difficulty levelsMiddle school, high school, college, professional
LanguageChinese
MetricAccuracy
SubsetC-Eval Hard (very challenging subjects)

Source: Huang et al. 2023. Last updated 2026-07-24.