Benchgen

CharXiv Reasoning — Results

RankModelScore
1kimi-k391.3
2qwen3-8-flash-next90.6
3qwen3-8-27b90.2
4fugu-ultra86.6
5fugu85.1
6inkling82
7muse-glimmer78.8
8kimi-k30.913
9claude-opus-4-70.91
10claude-opus-4-80.899
11muse-spark0.884
12claude-sonnet-50.883
13kimi-k2-60.867
14seed-2-1-pro0.864
15qwen3-7-plus0.859
16seed-2-1-turbo0.836
17gpt-5-20.821
18gpt-5-50.816
19qwen3-6-plus0.815
20gemini-3-pro0.814
21gpt-50.811
22gemini-3-flash0.803
23qwen3-5-27b0.795
24o30.786
25qwen3-6-27b0.784

CharXiv Reasoning

1 phaseActive

Scientific chart reasoning benchmark from arXiv figures — tests AI models on complex visual data interpretation. Reasoning sub-task metric: % correct.

Overview

CharXiv Reasoning

Category Metric Saturation Created

Paper GitHub Dataset

Quick answer: CharXiv Reasoning is the complex reasoning sub-task of the CharXiv benchmark (Wang et al., 2024), which evaluates AI models on scientific chart understanding using figures extracted from real arXiv papers. The Reasoning sub-task asks multi-step analytical questions that require integrating visual data with scientific reasoning. Fugu Ultra scores 86.6% and Fugu scores 85.1% as of June 2026.

At a Glance

What it tests: Complex, multi-step reasoning about scientific charts and figures drawn from real arXiv papers — including extracting quantitative data, comparing trends, and drawing analytical conclusions.

Why it matters: Real-world AI assistants for scientific research must interpret figures and charts, not just text. CharXiv Reasoning provides a rigorous, contamination-resistant measure of this capability using actual research figures.

Known limitations: Scientific figures from arXiv may be niche and domain-specific; performance likely varies by scientific domain. Requires vision capability — text-only models cannot be evaluated.

What CharXiv Reasoning Measures

CharXiv extracts figures from recent arXiv preprints and generates two types of questions: descriptive (simple data reading) and reasoning (multi-step analytical). The Reasoning sub-task focuses on the harder analytical questions — for example, calculating percentage differences between trend lines, identifying crossover points, or drawing conclusions that require combining information from multiple chart elements.

By sourcing from recent arXiv preprints after model training cutoffs, CharXiv avoids contamination from training data. The reasoning sub-task is specifically challenging because it requires both accurate visual parsing and the ability to perform arithmetic or logical reasoning on extracted values.

Benchmark Specifications

FieldValue
Task categoryReasoning / scientific figure understanding
Metric% correct (accuracy)
Data sourceFigures extracted from arXiv preprints
Task typeComplex multi-step analytical reasoning about charts
SaturationLow
Created byWang et al. (Princeton NLP)
Source paperCharXiv: Charting Gaps in Realistic Chart Understanding in Multimodal LLMs (2024)
GitHubprinceton-nlp/CharXiv
DatasetHuggingFace — princeton-nlp/CharXiv

State-of-the-Art Results

RankModelScoreSourceDate
1Fugu Ultra86.6%Sakana Fugu technical report2026-06
2Fugu85.1%Sakana Fugu technical report2026-06
3Fable 5 / Mythos Preview (max)84.2%Sakana Fugu technical report2026-06

Scores sourced from Sakana AI's Fugu technical report, June 2026.