B
enchgen
Browse
Chat
Agents
New Chat
My Agents
Eval
New Evaluation
Evaluations
Results
Train
New Training
Jobs
Training Loops
Datasets
Models
Recents
Website
Docs
Sign In
Toggle Sidebar
Overview
Leaderboard
Evaluations
Phases
BIG-Bench Hard — Results
Rank
Model
Score
1
deepseek-v4-1-flash
86.1
2
claude-3-5-sonnet
0.931
3
gemini-1-5-pro
0.892
4
claude-3-opus
0.868
5
gemini-1-5-flash
0.855
6
phi-3-5-moe-instruct
0.791
7
phi-4-mini
0.704
8
phi-3-5-mini-instruct
0.69
BIG-Bench Hard — Phases
1 phase
Active
Evaluate
Overview
Leaderboard
Evaluations
Evaluate
Overview
Leaderboard
Evaluations
Evaluate
Phase 1
·
BIG-Bench Hard
Aug 3, 2026
Current
Evaluate
Evaluate