Agents
Eval
Train
New Evaluation
Evaluations
Results
Datasets
Models
Recents
View All
Your evaluations
Sign in to run benchmarks and follow your results here.
Website
Docs
Sign In
Toggle Sidebar
Benchgen
Overview
Leaderboard
Evaluations
Phases
TOMATO — Results
Rank
Model
Score
1
qwen2-vl-72b
37.9
2
gpt-4o
37.7
3
gemini-1-5-pro
36.1
4
gemini-2-0-flash
33.7
5
qwen2-vl-7b
31.5
6
gpt-4o-mini
28.8
7
claude-3-opus
28.2
8
claude-3-5-sonnet
27.8
9
gemini-1-5-flash
27.8
10
claude-3-haiku
26.2
TOMATO — Leaderboard
1 phase
Active
Evaluate
Overview
Leaderboard
Evaluations
Evaluate
TOMATO Leaderboard
Self-reported
0
Verified
0
No self-reported entries.