Benchgen

TAU-bench Retail — Results

RankModelScore
1claude-sonnet-4-50.862
2claude-opus-4-10.824
3claude-opus-40.814
4claude-sonnet-40.805
5glm-4-50.797
6glm-4-5-air0.779
7qwen3-coder-480b-a35b0.775
8o4-mini0.718
9o10.708
10qwen3-next-80b-a3b-thinking0.696
11claude-3-5-sonnet0.692
12gpt-4-50.684
13gpt-4-10.68
14minimax-m1-40k0.678
15qwen3-235b-a22b-thinking-25070.678
16minimax-m1-80k0.635
17qwen3-next-80b-a3b-instruct0.609
18gpt-4o0.603
19o3-mini0.576
20gpt-4-1-mini0.558
21claude-3-5-haiku0.51

TAU-bench Retail — Evaluations

1 phaseActive

No evaluations yet for this benchmark.