Benchgen

BIG-Bench Hard — Results

RankModelScore
1claude-3-5-sonnet0.931
2gemini-1-5-pro0.892
3claude-3-opus0.868
4gemini-1-5-flash0.855
5phi-3-5-moe-instruct0.791
6phi-4-mini0.704
7phi-3-5-mini-instruct0.69

BIG-Bench Hard — Evaluations

1 phaseActive

No evaluations yet for this benchmark.