Agents
Eval
Train
New Evaluation
Evaluations
Results
Datasets
Models
Recents
View All
Your evaluations
Sign in to run benchmarks and follow your results here.
Website
Docs
Sign In
Toggle Sidebar
Benchgen
Overview
Leaderboard
Evaluations
Phases
AlpacaEval 2.0 — Results
Rank
Model
Score
1
claude-3-5-sonnet
52.4
2
gpt-4o
51.3
3
gpt-4-turbo
50
4
claude-3-opus
40.5
5
llama-3-1-405b-instruct
39.3
6
claude-3-sonnet
30.4
7
llama-3-1-70b-instruct
27
8
gemini-1-5-pro
26.3
A
AlpacaEval 2.0 — Phases
1 phase
Active
Evaluate
Overview
Phases
1
Leaderboard
Evaluations
Evaluate
Phase 1
·
AlpacaEval 2.0
Jul 23, 2026
Current
Evaluate