Benchgen

BIG-Bench Hard — Results

RankModelScore
1deepseek-v4-1-flash86.1
2claude-3-5-sonnet0.931
3gemini-1-5-pro0.892
4claude-3-opus0.868
5gemini-1-5-flash0.855
6phi-3-5-moe-instruct0.791
7phi-4-mini0.704
8phi-3-5-mini-instruct0.69

BIG-Bench Hard — Evaluations

1 phaseActive

No evaluations yet for this benchmark.