Benchgen

TruthfulQA — Results

RankModelScore
1mai-thinking-10.88
2phi-3-5-moe-instruct0.775
3granite-3-3-8b-instruct0.669
4phi-4-mini0.664
5phi-3-5-mini-instruct0.64
6hermes-3-70b0.633
7llama-3-1-nemotron-70b-instruct0.586
8qwen2-5-14b-instruct0.584
9jamba-1-5-large0.583
10granite-4-0-tiny-preview0.581
11qwen2-5-32b-instruct0.578
12command-r-plus0.563
13qwen2-72b-instruct0.548
14qwen2-5-coder-32b-instruct0.542
15jamba-1-5-mini0.541
16granite-3-3-8b-base0.521
17qwen2-5-coder-7b-instruct0.506
18mistral-nemo-instruct0.503

TruthfulQA — Leaderboard

1 phaseActive

TruthfulQA Leaderboard

No self-reported entries.