Benchgen

BrowseComp Long Context 256k — Results

RankModelScore
1gpt-5-2-pro-2025-12-110.898
2gpt-50.888
B

BrowseComp Long Context 256k

1 phaseActive

BrowseComp variant with 256K context window for evaluating agents finding hard-to-locate web information.

Overview

BrowseComp Long Context 256k

Category Metric Tasks Saturation

Paper

Quick answer: BrowseComp Long Context 256k evaluates web browsing agents on 1,266 questions requiring persistent internet navigation. Uses 256K context window, testing capacity for large-scale retrieval and reasoning.

Benchmark Details

PropertyValue
Tasks1,266 questions
Context256K tokens
MetricAnswer accuracy (short verifiable answers)
Parent benchmarkBrowseComp

Source: Wei et al. 2025. Last updated 2026-07-24.