Benchgen

BigCodeBench-Hard — Results

RankModelScore
1qwen2-5-coder-32b-instruct0.27
B

BigCodeBench-Hard

1 phaseActive

Challenging subset of 148 BigCodeBench tasks requiring complex multi-library function calls across 7 domains.

Overview

BigCodeBench-Hard

Category Metric Tasks Saturation

Paper GitHub Dataset

Quick answer: BigCodeBench-Hard (Zhuo et al., 2024) is a subset of 148 challenging programming tasks requiring diverse function calls from multiple libraries, testing compositional reasoning on complex software engineering problems.

Benchmark Details

PropertyValue
Tasks148 challenging programming tasks
Libraries139 Python libraries (avg 2.8 per task)
Domains7 (networking, data analysis, visualization, etc.)
MetricPass rate (test execution)

Source: Zhuo et al. 2024. Last updated 2026-07-24.