Benchgen

DROP — Results

RankModelScore
1deepseek-v4-1-flash87.9
2deepseek-v30.916
3claude-3-5-sonnet0.871
4gpt-4-turbo0.86
5llama-3-1-405b-instruct0.848
6gpt-4o0.834
7claude-3-5-haiku0.831
8claude-3-opus0.831
9gpt-4-06130.809
10gpt-4o-mini0.797
11llama-3-1-70b-instruct0.796
12phi-40.755
13gemini-1-5-pro0.749
14llama-3-1-8b-instruct0.595

DROP — Evaluations

1 phaseActive

No evaluations yet for this benchmark.