Benchgen

BFCL v3 MultiTurn — Results

RankModelScore
1minimax-m2-50.768
2nemotron-nano-9b-v20.669
B

BFCL v3 MultiTurn

1 phaseActive

Multi-turn function calling benchmark using state-based evaluation to test sequential function calls and conversational context management.

Overview

BFCL v3 MultiTurn

Category Metric Saturation Created

Paper GitHub

Quick answer: BFCL v3 MultiTurn evaluates LLMs on multi-turn, multi-step function calling scenarios using state-based evaluation. Models must manage sequential function calls, handle conversational context across turns, and make dynamic decisions about when and how to invoke functions.

What is BFCL v3 MultiTurn?

BFCL V3 MultiTurn introduces complex agentic interactions requiring models to manage sequential function calls across multiple turns. State-based evaluation verifies actual API system state after function execution, providing realistic assessment of function calling in agentic applications.

Benchmark Details

PropertyValue
MetricState-based accuracy
EvaluationPost-execution API state verification
CategoriesTool calling, Reasoning, Multi-turn agent
ModalityText

Source: Yan et al. 2024. Last updated 2026-07-24.