Benchgen

C-Eval — Results

RankModelScore
1deepseek-v4-1-flash92.1
2ling-3-0-flash-base89.76
3ling-3-0-tiny-base80.59
4qwen3-6-plus0.933
5qwen3-5-397b-a17b0.93
6kimi-k2-base0.925
7qwen3-5-122b-a10b0.919
8mimo-v2-5-pro0.915
9qwen3-6-27b0.914
10qwen3-5-27b0.905
11qwen3-5-35b-a3b0.902
12qwen3-6-35b-a3b0.9
13kimi-k1-50.883
14qwen3-5-9b0.882
15deepseek-v30.865
16qwen3-5-4b0.851
17qwen2-72b-instruct0.838
18qwen2-7b-instruct0.772
19qwen3-5-2b0.732
20qwen3-5-0-8b0.505
21ernie-4-50.407
C

C-Eval

1 phaseActive

Comprehensive Chinese evaluation suite with 13,948 MCQs across 52 disciplines at four difficulty levels: middle school, high school, college, and professional.

Overview

C-Eval

Category Metric Tasks Saturation Language

Paper GitHub Dataset

Quick answer: C-Eval (Huang et al., 2023) is a comprehensive Chinese evaluation suite with 13,948 multiple-choice questions across 52 disciplines at four difficulty levels. It assesses advanced Chinese knowledge and reasoning across humanities, science, and engineering.

Benchmark Details

PropertyValue
Tasks13,948 multiple-choice questions
Disciplines52 (humanities, science, engineering)
Difficulty levelsMiddle school, high school, college, professional
LanguageChinese
MetricAccuracy
SubsetC-Eval Hard (very challenging subjects)

Source: Huang et al. 2023. Last updated 2026-07-24.