Agents
Eval
Train
New Evaluation
Evaluations
Results
Datasets
Models
Recents
View All
Your evaluations
Sign in to run benchmarks and follow your results here.
Website
Docs
Sign In
Toggle Sidebar
Benchgen
Yirmi Soru Oyunu Kıyaslaması
GSM8K-TR - Turkish Math Reasoning Benchmark
FinArena — Banking Fraud Agent Benchmark
SWE-bench Verified
MMLU-Pro
SWE-bench Pro
TerminalBench 2.1
LiveCodeBench
LiveCodeBench Pro
Humanity's Last Exam
CharXiv Reasoning
GPQA Diamond
SciCode
τ³ Banking
Long Context Reasoning
MRCRv2
EnterpriseClawBench
QCalEval
Nilüfer Belediyesi - Benchmark
TBB - Soru Cevap Benchmark
TBB - Çoktan Seçmeli Benchmark
SHADE-Arena
CyberGym
Agentic Commerce TAP Benchmark
Türkçe Toksisite & Güvenlik Sınıflandırma
Türkçe Genel Kültür Benchmark
Long-Horizon Terminal-Bench (LHTB)
QCalEval
Global-MMLU-Lite
IFBench
SimpleQA
AIME 2026
BrowseComp
MMMU-Pro
MCP-Atlas
GDPVal-AA v2
StrongREJECT
FORTRESS
CharXiv Reasoning (No Tools)
VoiceBench
MMAU
AA-Omniscience
Arena-Hard-v2
BFCL-v3
BigCodeBench
HumanEval
ACEBench
AetherCode
Agent Startup Bench
Agents' Last Exam
AI2 Reasoning Challenge (ARC)
ARC-AGI
EnterpriseClawBench
SHADE-Arena
GSM8K
MATH
HellaSwag
MMLU
MT-Bench
AlpacaEval 2.0
ARC-AGI v2
ARC-C
ARC-E
Aider
ARC-AGI-3
VLoc Bench
Arena Hard
BFCL
BFCL v2
BFCL v3 MultiTurn
Big Bench Audio
BigCodeBench-Full
BigCodeBench-Hard
Bird-SQL (dev)
BixBench
BrowseComp Long Context 128k
BrowseComp Long Context 256k
BrowseComp-zh
C-Eval
OSWorld-Verified
OSWorld 2.0
Video-MME
MMVU
OmniDocBench
MathVision
ZeroBench
DeepSWE
ProgramBench
APEX-Agents
SWE-Marathon
FrontierSWE
PostTrainBench
AA-Briefcase
PerceptionBench
CritPt
MLS-Bench-Lite
Kimi Code Bench 2.0
DeepSearchQA
ResearchRubrics
Toolathlon-Verified
MCPMark-Verified
AutomationBench
JobBench
OfficeQA Pro
SpreadsheetBench 2
SaaS-Bench
Harvey Lab-AA
CorpFin v2
Finance Agent v2
Legal Research Bench
WorldVQA ForceAnswer
BabyVision
AA-LCR
AIME 2025
AIME 2024
IFEval
MBPP
SuperGPQA
MATH-500
MGSM
DROP
MMLU-Redux
BIG-Bench Hard
LiveCodeBench v6
HMMT 2025
Legora BAR
Harness-Bench
HAL (Holistic Agent Leaderboard)
Artificial Analysis Coding Agent Index
SkillsBench
StaminaBench
Claw-Eval
ClawBench
ClawMark
AgentLens
MultiChallenge
TruthfulQA
HealthBench
LongBench v2
DocVQA
ChartQA
AI2D
RealWorldQA
Winogrande
FrontierMath
TAU-bench Retail
TAU-bench Airline
Tau2 Telecom
MMMU
LingoQA
Multi-IF
ToolSandbox
BFCL-v4
Tau2 Airline
Tau2 Retail
MathVista
CodeForces
PaperBench
TriviaQA
Natural Questions
HallusionBench
JFBench
HMMT 2026
GAIA2
WildClawBench
ScreenSpot-Pro
Mind2Web
PinchBench
CursorBench
FrontierCode
APEX-SWE
Terminal-Bench 3.0
ScreenSpot-v2
RefCOCO
BLINK
MuirBench
MMBench
MMStar
GQA
Multilingual MMBench
MMMB
InfoVQA
OCRBench
OCRBench v2
CharXiv Descriptive
CountBench
WildGuardTest (Prompt)
WildGuardTest (Response)
WildGuardTest (Refusal)
ToxicChat
Aegis v2 (Prompt)
Aegis v2 (Response)
HarmBench (Prompt)
HarmBench (Response)
OpenAI Moderation
BeaverTails
XSTest (Harm)
XSTest (Refusal)
Qwen3GuardTest
PolyGuard Prompt
AI Benchmarks
Loading benchmarks...