Benchgen

AI2 Reasoning Challenge (ARC) — Results

RankModelScore
1deepseek-r1-05280.981
2qwen2-5-72b-instruct0.979
3gpt-4-10.971
4llama-3-1-405b-instruct0.969
5claude-3-5-sonnet0.967
6claude-3-opus0.964
7r10.964
8gpt-4-06130.963
9gpt-4o0.963
10phi-40.96
11llama-3-3-70b-instruct0.96
12o4-mini0.959
13llama-3-1-70b-instruct0.948
14llama-4-maverick0.938
15gemini-1-5-pro0.914
16llama-4-scout0.907
A

AI2 Reasoning Challenge (ARC) — Leaderboard

1 phaseActive

AI2 Reasoning Challenge (ARC) Leaderboard

No self-reported entries.