Leaderboard

region iad1all timeupdated 9/14/202614 model configuration(s) rankedRe-weighting of old benchmarks · policy v5N=96,987 runs

14

Category leaders

Best all-rounder

83.7%

GPT-5.6 TerraMax

OpenAI

policy v5 · 4/4 categories · 7/7 active panels · 1,962 scored units

Best intelligence

95.8%

Google: Gemini 3.8 FlashHigh

OpenRouter

policy v5 · 1/1 active panels · 198 scored units · newest panel Jul 9, 2026

Best coding

84.4%

GPT-5.6 TerraMax

OpenAI

policy v5 · 2/2 active panels · 393 scored units · newest panel Aug 3, 2026

Best instruction

98.4%

GPT-5.6 SolMax

OpenAI

policy v5 · 2/2 active panels · 534 scored units · newest panel Jul 29, 2026

Best agentic

69.5%

Z.ai: GLM 5.3 FlashMax

OpenRouter

policy v5 · 2/2 active panels · 80 scored units · newest panel Sep 5, 2026

ModelActions
GPT-5.6 TerraMax

OpenAI

Current leaderboard requirements

Every active score-policy benchmark must meet its scored-run and score-unit coverage requirement in this window.

  • gpqa-diamondincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • ifevalincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

  • Passed:95.1% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

  • bfcl-liteincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

83.7%

Re-weighting of old benchmarks · policy v5

Activated Sep 6, 2026. Every category is required.

Open scoring policy
  • intelligence32.1%

    91.8% score × 35.0% weight = 32.1%

    1/1 benchmarks · 385 scored units

  • 94.8% score × 10.0% weight = 9.5%

    2/2 benchmarks · 1044 scored units

  • coding23.2%

    84.4% score × 27.5% weight = 23.2%

    2/2 benchmarks · 393 scored units

  • agentic18.9%

    68.6% score × 27.5% weight = 18.9%

    2/2 benchmarks · 140 scored units

91.8%

intelligence category

91.8%

Weighted sum of the benchmark contributions below.

91.8% category score × 35.0% all-rounder weight = 32.1%

  • gpqa-diamond91.8%

    91.8% score × 100% weight = 91.8%

    Mean verifier score · 2 full-panel executions averaged · 385/396 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 88.8%95.4% · generated Jul 9, 2026

    Open latest contributing execution
84.4%

coding category

84.4%

Weighted sum of the benchmark contributions below.

84.4% category score × 27.5% all-rounder weight = 23.2%

  • 93.7% score × 40.0% weight = 37.5%

    Mean verifier score · 2 full-panel executions averaged · 324/328 scored units · 95.1% score-unit run coverage

    Panel v1 · 95% interval 93.8%99.1% · generated Jul 9, 2026

    Open latest contributing execution
  • 78.3% score × 60.0% weight = 47.0%

    Mean verifier score · 1 full-panel execution averaged · 69/69 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 68.1%87.0% · generated Aug 3, 2026

    Open latest contributing execution
94.8%

instruction category

94.8%

Weighted sum of the benchmark contributions below.

94.8% category score × 10.0% all-rounder weight = 9.5%

  • ifeval27.8%

    92.5% score × 30.0% weight = 27.8%

    Mean verifier score · 2 full-panel executions averaged · 1020/1020 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 92.5%96.1% · generated Jul 9, 2026

    Open latest contributing execution
  • 95.8% score × 70.0% weight = 67.1%

    Strict function pass rate · 1 full-panel execution averaged · 24/24 scored units · 100% score-unit run coverage

    Panel v3 · 95% interval 87.5%100% · generated Jul 29, 2026

    Open latest contributing execution
68.6%

agentic category

68.6%

Weighted sum of the benchmark contributions below.

68.6% category score × 27.5% all-rounder weight = 18.9%

  • bfcl-lite23.1%

    76.9% score × 30.0% weight = 23.1%

    Mean verifier score · 2 full-panel executions averaged · 120/120 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 76.9%76.9% · generated Jul 9, 2026

    Open latest contributing execution
  • 65.0% score × 70.0% weight = 45.5%

    Mean task success · 1 full-panel execution averaged · 20/20 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 40.0%85.0% · generated Sep 5, 2026

    Open latest contributing execution
3.73s6.09s~342183.9s0.0%compare
Google: Gemini 3.8 FlashHigh

OpenRouter

Current leaderboard requirements

Every active score-policy benchmark must meet its scored-run and score-unit coverage requirement in this window.

  • gpqa-diamondincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • ifevalincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

  • Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

  • bfcl-liteincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

82.9%

Re-weighting of old benchmarks · policy v5

Activated Sep 6, 2026. Every category is required.

Open scoring policy
  • intelligence33.5%

    95.8% score × 35.0% weight = 33.5%

    1/1 benchmarks · 198 scored units

  • 93.1% score × 10.0% weight = 9.3%

    2/2 benchmarks · 534 scored units

  • coding22.7%

    82.5% score × 27.5% weight = 22.7%

    2/2 benchmarks · 233 scored units

  • agentic17.4%

    63.2% score × 27.5% weight = 17.4%

    2/2 benchmarks · 80 scored units

95.8%

intelligence category

95.8%

Weighted sum of the benchmark contributions below.

95.8% category score × 35.0% all-rounder weight = 33.5%

  • gpqa-diamond95.8%

    95.8% score × 100% weight = 95.8%

    Mean verifier score · 1 full-panel execution averaged · 198/198 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 92.9%98.1% · generated Jul 9, 2026

    Open latest contributing execution
82.5%

coding category

82.5%

Weighted sum of the benchmark contributions below.

82.5% category score × 27.5% all-rounder weight = 22.7%

  • 93.3% score × 40.0% weight = 37.3%

    Mean verifier score · 1 full-panel execution averaged · 164/164 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 89.6%96.7% · generated Jul 9, 2026

    Open latest contributing execution
  • 75.4% score × 60.0% weight = 45.2%

    Mean verifier score · 1 full-panel execution averaged · 69/69 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 65.2%85.5% · generated Aug 3, 2026

    Open latest contributing execution
93.1%

instruction category

93.1%

Weighted sum of the benchmark contributions below.

93.1% category score × 10.0% all-rounder weight = 9.3%

  • ifeval29.0%

    96.5% score × 30.0% weight = 29.0%

    Mean verifier score · 1 full-panel execution averaged · 510/510 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 94.9%97.8% · generated Jul 9, 2026

    Open latest contributing execution
  • 91.7% score × 70.0% weight = 64.2%

    Strict function pass rate · 1 full-panel execution averaged · 24/24 scored units · 100% score-unit run coverage

    Panel v3 · 95% interval 79.2%100% · generated Jul 29, 2026

    Open latest contributing execution
63.2%

agentic category

63.2%

Weighted sum of the benchmark contributions below.

63.2% category score × 27.5% all-rounder weight = 17.4%

  • bfcl-lite24.7%

    82.2% score × 30.0% weight = 24.7%

    Mean verifier score · 1 full-panel execution averaged · 60/60 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 71.7%90.6% · generated Jul 9, 2026

    Open latest contributing execution
  • 55.0% score × 70.0% weight = 38.5%

    Mean task success · 1 full-panel execution averaged · 20/20 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 30.0%75.0% · generated Sep 5, 2026

    Open latest contributing execution
1.52s8.11s~22191.0s0.0%compare
GPT-5.6 SolMax

OpenAI

Current leaderboard requirements

Every active score-policy benchmark must meet its scored-run and score-unit coverage requirement in this window.

  • gpqa-diamondincluded

    Passed:98.0% / 95.0% score-unit coverage at 3 scored runs per score unit

  • ifevalincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

  • Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

  • bfcl-liteincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

81.6%

Re-weighting of old benchmarks · policy v5

Activated Sep 6, 2026. Every category is required.

Open scoring policy
  • intelligence32.5%

    92.8% score × 35.0% weight = 32.5%

    1/1 benchmarks · 197 scored units

  • 98.4% score × 10.0% weight = 9.8%

    2/2 benchmarks · 534 scored units

  • coding23.1%

    83.9% score × 27.5% weight = 23.1%

    2/2 benchmarks · 233 scored units

  • agentic16.2%

    59.0% score × 27.5% weight = 16.2%

    2/2 benchmarks · 80 scored units

92.8%

intelligence category

92.8%

Weighted sum of the benchmark contributions below.

92.8% category score × 35.0% all-rounder weight = 32.5%

  • gpqa-diamond92.8%

    92.8% score × 100% weight = 92.8%

    Mean verifier score · 1 full-panel execution averaged · 197/198 scored units · 98.0% score-unit run coverage

    Panel v1 · 95% interval 92.8%92.8% · generated Jul 9, 2026

    Open latest contributing execution
83.9%

coding category

83.9%

Weighted sum of the benchmark contributions below.

83.9% category score × 27.5% all-rounder weight = 23.1%

  • 94.5% score × 40.0% weight = 37.8%

    Mean verifier score · 1 full-panel execution averaged · 164/164 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 94.5%94.5% · generated Jul 9, 2026

    Open latest contributing execution
  • 76.8% score × 60.0% weight = 46.1%

    Mean verifier score · 1 full-panel execution averaged · 69/69 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 66.7%87.0% · generated Aug 3, 2026

    Open latest contributing execution
98.4%

instruction category

98.4%

Weighted sum of the benchmark contributions below.

98.4% category score × 10.0% all-rounder weight = 9.8%

  • ifeval28.4%

    94.8% score × 30.0% weight = 28.4%

    Mean verifier score · 1 full-panel execution averaged · 510/510 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 94.8%94.8% · generated Jul 9, 2026

    Open latest contributing execution
  • 100% score × 70.0% weight = 70.0%

    Strict function pass rate · 1 full-panel execution averaged · 24/24 scored units · 100% score-unit run coverage

    Panel v3 · 95% interval 100%100% · generated Jul 29, 2026

    Open latest contributing execution
59.0%

agentic category

59.0%

Weighted sum of the benchmark contributions below.

59.0% category score × 27.5% all-rounder weight = 16.2%

  • bfcl-lite24.0%

    80.0% score × 30.0% weight = 24.0%

    Mean verifier score · 1 full-panel execution averaged · 60/60 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 80.0%80.0% · generated Jul 9, 2026

    Open latest contributing execution
  • 50.0% score × 70.0% weight = 35.0%

    Mean task success · 1 full-panel execution averaged · 20/20 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 30.0%75.0% · generated Sep 5, 2026

    Open latest contributing execution
4.47s5.22s~289598.5s0.5%compare
GPT-5.6 LunaMax

OpenAI

Current leaderboard requirements

Every active score-policy benchmark must meet its scored-run and score-unit coverage requirement in this window.

  • gpqa-diamondincluded

    Passed:96.0% / 95.0% score-unit coverage at 3 scored runs per score unit

  • ifevalincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

  • Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

  • bfcl-liteincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

77.7%

Re-weighting of old benchmarks · policy v5

Activated Sep 6, 2026. Every category is required.

Open scoring policy
  • intelligence30.1%

    86.0% score × 35.0% weight = 30.1%

    1/1 benchmarks · 196 scored units

  • 77.0% score × 10.0% weight = 7.7%

    2/2 benchmarks · 534 scored units

  • coding22.6%

    82.2% score × 27.5% weight = 22.6%

    2/2 benchmarks · 233 scored units

  • agentic17.2%

    62.7% score × 27.5% weight = 17.2%

    2/2 benchmarks · 80 scored units

86.0%

intelligence category

86.0%

Weighted sum of the benchmark contributions below.

86.0% category score × 35.0% all-rounder weight = 30.1%

  • gpqa-diamond86.0%

    86.0% score × 100% weight = 86.0%

    Mean verifier score · 1 full-panel execution averaged · 196/198 scored units · 96.0% score-unit run coverage

    Panel v1 · 95% interval 86.0%86.0% · generated Jul 9, 2026

    Open latest contributing execution
82.2%

coding category

82.2%

Weighted sum of the benchmark contributions below.

82.2% category score × 27.5% all-rounder weight = 22.6%

  • 92.6% score × 40.0% weight = 37.0%

    Mean verifier score · 1 full-panel execution averaged · 164/164 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 92.6%92.6% · generated Jul 9, 2026

    Open latest contributing execution
  • 75.4% score × 60.0% weight = 45.2%

    Mean verifier score · 1 full-panel execution averaged · 69/69 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 65.2%84.1% · generated Aug 3, 2026

    Open latest contributing execution
77.0%

instruction category

77.0%

Weighted sum of the benchmark contributions below.

77.0% category score × 10.0% all-rounder weight = 7.7%

  • ifeval27.4%

    91.3% score × 30.0% weight = 27.4%

    Mean verifier score · 1 full-panel execution averaged · 510/510 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 91.3%91.3% · generated Jul 9, 2026

    Open latest contributing execution
  • 70.8% score × 70.0% weight = 49.6%

    Strict function pass rate · 1 full-panel execution averaged · 24/24 scored units · 100% score-unit run coverage

    Panel v3 · 95% interval 54.2%87.5% · generated Jul 29, 2026

    Open latest contributing execution
62.7%

agentic category

62.7%

Weighted sum of the benchmark contributions below.

62.7% category score × 27.5% all-rounder weight = 17.2%

  • bfcl-lite24.2%

    80.7% score × 30.0% weight = 24.2%

    Mean verifier score · 1 full-panel execution averaged · 60/60 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 80.7%80.7% · generated Jul 9, 2026

    Open latest contributing execution
  • 55.0% score × 70.0% weight = 38.5%

    Mean task success · 1 full-panel execution averaged · 20/20 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 30.0%75.0% · generated Sep 5, 2026

    Open latest contributing execution
3.12s4.67s~649437.2s0.1%compare
Claude Opus 5Extra high

Anthropic

Current leaderboard requirements

Every active score-policy benchmark must meet its scored-run and score-unit coverage requirement in this window.

  • gpqa-diamondincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • ifevalincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

  • Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

  • bfcl-liteincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

73.2%

Re-weighting of old benchmarks · policy v5

Activated Sep 6, 2026. Every category is required.

Open scoring policy
  • intelligence32.5%

    92.8% score × 35.0% weight = 32.5%

    1/1 benchmarks · 198 scored units

  • 56.1% score × 10.0% weight = 5.6%

    2/2 benchmarks · 534 scored units

  • coding16.9%

    61.4% score × 27.5% weight = 16.9%

    2/2 benchmarks · 233 scored units

  • agentic18.2%

    66.2% score × 27.5% weight = 18.2%

    2/2 benchmarks · 80 scored units

92.8%

intelligence category

92.8%

Weighted sum of the benchmark contributions below.

92.8% category score × 35.0% all-rounder weight = 32.5%

  • gpqa-diamond92.8%

    92.8% score × 100% weight = 92.8%

    Mean verifier score · 1 full-panel execution averaged · 198/198 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 89.4%95.8% · generated Jul 9, 2026

    Open latest contributing execution
61.4%

coding category

61.4%

Weighted sum of the benchmark contributions below.

61.4% category score × 27.5% all-rounder weight = 16.9%

  • 94.7% score × 40.0% weight = 37.9%

    Mean verifier score · 1 full-panel execution averaged · 164/164 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 91.1%97.8% · generated Jul 9, 2026

    Open latest contributing execution
  • 39.1% score × 60.0% weight = 23.5%

    Mean verifier score · 1 full-panel execution averaged · 69/69 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 29.0%50.7% · generated Aug 3, 2026

    Open latest contributing execution
56.1%

instruction category

56.1%

Weighted sum of the benchmark contributions below.

56.1% category score × 10.0% all-rounder weight = 5.6%

  • ifeval27.0%

    89.9% score × 30.0% weight = 27.0%

    Mean verifier score · 1 full-panel execution averaged · 510/510 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 87.7%92.1% · generated Jul 9, 2026

    Open latest contributing execution
  • 41.7% score × 70.0% weight = 29.2%

    Strict function pass rate · 1 full-panel execution averaged · 24/24 scored units · 100% score-unit run coverage

    Panel v3 · 95% interval 25.0%62.5% · generated Jul 29, 2026

    Open latest contributing execution
66.2%

agentic category

66.2%

Weighted sum of the benchmark contributions below.

66.2% category score × 27.5% all-rounder weight = 18.2%

  • bfcl-lite24.2%

    80.6% score × 30.0% weight = 24.2%

    Mean verifier score · 1 full-panel execution averaged · 60/60 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 69.4%90.0% · generated Jul 9, 2026

    Open latest contributing execution
  • 60.0% score × 70.0% weight = 42.0%

    Mean task success · 1 full-panel execution averaged · 20/20 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 35.0%80.0% · generated Sep 5, 2026

    Open latest contributing execution
5.51s10.2s~50.5103.9s0.0%compare
DeepSeek: DeepSeek V4 Flash 0731Max

OpenRouter

Current leaderboard requirements

Every active score-policy benchmark must meet its scored-run and score-unit coverage requirement in this window.

  • gpqa-diamondincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • ifevalincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

  • Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

  • bfcl-liteincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

70.3%

Re-weighting of old benchmarks · policy v5

Activated Sep 6, 2026. Every category is required.

Open scoring policy
  • intelligence30.3%

    86.7% score × 35.0% weight = 30.3%

    1/1 benchmarks · 198 scored units

  • 57.0% score × 10.0% weight = 5.7%

    2/2 benchmarks · 534 scored units

  • coding16.1%

    58.6% score × 27.5% weight = 16.1%

    2/2 benchmarks · 233 scored units

  • agentic18.2%

    66.2% score × 27.5% weight = 18.2%

    2/2 benchmarks · 80 scored units

86.7%

intelligence category

86.7%

Weighted sum of the benchmark contributions below.

86.7% category score × 35.0% all-rounder weight = 30.3%

  • gpqa-diamond86.7%

    86.7% score × 100% weight = 86.7%

    Mean verifier score · 1 full-panel execution averaged · 198/198 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 82.8%90.6% · generated Jul 9, 2026

    Open latest contributing execution
58.6%

coding category

58.6%

Weighted sum of the benchmark contributions below.

58.6% category score × 27.5% all-rounder weight = 16.1%

  • 92.1% score × 40.0% weight = 36.8%

    Mean verifier score · 1 full-panel execution averaged · 164/164 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 88.8%95.3% · generated Jul 9, 2026

    Open latest contributing execution
  • 36.2% score × 60.0% weight = 21.7%

    Mean verifier score · 1 full-panel execution averaged · 69/69 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 24.6%47.8% · generated Aug 3, 2026

    Open latest contributing execution
57.0%

instruction category

57.0%

Weighted sum of the benchmark contributions below.

57.0% category score × 10.0% all-rounder weight = 5.7%

  • ifeval27.8%

    92.6% score × 30.0% weight = 27.8%

    Mean verifier score · 1 full-panel execution averaged · 510/510 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 91.0%94.3% · generated Jul 9, 2026

    Open latest contributing execution
  • 41.7% score × 70.0% weight = 29.2%

    Strict function pass rate · 1 full-panel execution averaged · 24/24 scored units · 100% score-unit run coverage

    Panel v3 · 95% interval 20.8%58.3% · generated Jul 29, 2026

    Open latest contributing execution
66.2%

agentic category

66.2%

Weighted sum of the benchmark contributions below.

66.2% category score × 27.5% all-rounder weight = 18.2%

  • bfcl-lite24.2%

    80.6% score × 30.0% weight = 24.2%

    Mean verifier score · 1 full-panel execution averaged · 60/60 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 68.9%90.0% · generated Jul 9, 2026

    Open latest contributing execution
  • 60.0% score × 70.0% weight = 42.0%

    Mean task success · 1 full-panel execution averaged · 20/20 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 40.0%80.0% · generated Sep 5, 2026

    Open latest contributing execution
865ms11.8s~61.7451.2s0.0%compare
Claude Sonnet 5Extra high

Anthropic

Current leaderboard requirements

Every active score-policy benchmark must meet its scored-run and score-unit coverage requirement in this window.

  • gpqa-diamondincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • ifevalincluded

    Passed:96.7% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

  • Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

  • bfcl-liteincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

69.8%

Re-weighting of old benchmarks · policy v5

Activated Sep 6, 2026. Every category is required.

Open scoring policy
  • intelligence31.5%

    89.9% score × 35.0% weight = 31.5%

    1/1 benchmarks · 363 scored units

  • 70.1% score × 10.0% weight = 7.0%

    2/2 benchmarks · 1036 scored units

  • coding15.0%

    54.5% score × 27.5% weight = 15.0%

    2/2 benchmarks · 397 scored units

  • agentic16.3%

    59.3% score × 27.5% weight = 16.3%

    2/2 benchmarks · 140 scored units

89.9%

intelligence category

89.9%

Weighted sum of the benchmark contributions below.

89.9% category score × 35.0% all-rounder weight = 31.5%

  • gpqa-diamond89.9%

    89.9% score × 100% weight = 89.9%

    Mean verifier score · 2 full-panel executions averaged · 363/396 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 85.8%94.1% · generated Jul 9, 2026

    Open latest contributing execution
54.5%

coding category

54.5%

Weighted sum of the benchmark contributions below.

54.5% category score × 27.5% all-rounder weight = 15.0%

  • 92.7% score × 40.0% weight = 37.1%

    Mean verifier score · 2 full-panel executions averaged · 328/328 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 88.1%95.7% · generated Jul 9, 2026

    Open latest contributing execution
  • 29.0% score × 60.0% weight = 17.4%

    Mean verifier score · 1 full-panel execution averaged · 69/69 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 18.8%40.6% · generated Aug 3, 2026

    Open latest contributing execution
70.1%

instruction category

70.1%

Weighted sum of the benchmark contributions below.

70.1% category score × 10.0% all-rounder weight = 7.0%

  • ifeval26.4%

    87.9% score × 30.0% weight = 26.4%

    Mean verifier score · 2 full-panel executions averaged · 1012/1020 scored units · 96.7% score-unit run coverage

    Panel v1 · 95% interval 86.0%91.3% · generated Jul 9, 2026

    Open latest contributing execution
  • 62.5% score × 70.0% weight = 43.8%

    Strict function pass rate · 1 full-panel execution averaged · 24/24 scored units · 100% score-unit run coverage

    Panel v3 · 95% interval 41.7%83.3% · generated Jul 29, 2026

    Open latest contributing execution
59.3%

agentic category

59.3%

Weighted sum of the benchmark contributions below.

59.3% category score × 27.5% all-rounder weight = 16.3%

  • bfcl-lite24.3%

    80.8% score × 30.0% weight = 24.3%

    Mean verifier score · 2 full-panel executions averaged · 120/120 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 70.0%90.0% · generated Jul 9, 2026

    Open latest contributing execution
  • 50.0% score × 70.0% weight = 35.0%

    Mean task success · 1 full-panel execution averaged · 20/20 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 25.0%70.0% · generated Sep 5, 2026

    Open latest contributing execution
3.00s3.76s~106137.3s0.0%compare
Kimi K3Max

OpenRouter

Current leaderboard requirements

Every active score-policy benchmark must meet its scored-run and score-unit coverage requirement in this window.

  • gpqa-diamondincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • ifevalincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

  • Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

  • bfcl-liteincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

69.6%

Re-weighting of old benchmarks · policy v5

Activated Sep 6, 2026. Every category is required.

Open scoring policy
  • intelligence31.6%

    90.4% score × 35.0% weight = 31.6%

    1/1 benchmarks · 198 scored units

  • 77.5% score × 10.0% weight = 7.8%

    2/2 benchmarks · 534 scored units

  • coding12.2%

    44.2% score × 27.5% weight = 12.2%

    2/2 benchmarks · 233 scored units

  • agentic18.1%

    65.7% score × 27.5% weight = 18.1%

    2/2 benchmarks · 80 scored units

90.4%

intelligence category

90.4%

Weighted sum of the benchmark contributions below.

90.4% category score × 35.0% all-rounder weight = 31.6%

  • gpqa-diamond90.4%

    90.4% score × 100% weight = 90.4%

    Mean verifier score · 1 full-panel execution averaged · 198/198 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 87.2%93.6% · generated Jul 9, 2026

    Open latest contributing execution
44.2%

coding category

44.2%

Weighted sum of the benchmark contributions below.

44.2% category score × 27.5% all-rounder weight = 12.2%

  • 95.3% score × 40.0% weight = 38.1%

    Mean verifier score · 1 full-panel execution averaged · 164/164 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 92.5%98.0% · generated Jul 9, 2026

    Open latest contributing execution
  • 10.1% score × 60.0% weight = 6.1%

    Mean verifier score · 1 full-panel execution averaged · 69/69 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 2.9%17.4% · generated Aug 3, 2026

    Open latest contributing execution
77.5%

instruction category

77.5%

Weighted sum of the benchmark contributions below.

77.5% category score × 10.0% all-rounder weight = 7.8%

  • ifeval27.9%

    93.1% score × 30.0% weight = 27.9%

    Mean verifier score · 1 full-panel execution averaged · 510/510 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 91.2%95.0% · generated Jul 9, 2026

    Open latest contributing execution
  • 70.8% score × 70.0% weight = 49.6%

    Strict function pass rate · 1 full-panel execution averaged · 24/24 scored units · 100% score-unit run coverage

    Panel v3 · 95% interval 50.0%87.5% · generated Jul 29, 2026

    Open latest contributing execution
65.7%

agentic category

65.7%

Weighted sum of the benchmark contributions below.

65.7% category score × 27.5% all-rounder weight = 18.1%

  • bfcl-lite23.7%

    78.9% score × 30.0% weight = 23.7%

    Mean verifier score · 1 full-panel execution averaged · 60/60 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 67.2%88.3% · generated Jul 9, 2026

    Open latest contributing execution
  • 60.0% score × 70.0% weight = 42.0%

    Mean task success · 1 full-panel execution averaged · 20/20 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 35.0%80.0% · generated Sep 5, 2026

    Open latest contributing execution
2.20s19.6s~40.3271.0s0.0%compare
DeepSeek: DeepSeek V4 Pro 0813Max

OpenRouter

Current leaderboard requirements

Every active score-policy benchmark must meet its scored-run and score-unit coverage requirement in this window.

  • gpqa-diamondincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • ifevalincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

  • Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

  • bfcl-liteincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

68.6%

Re-weighting of old benchmarks · policy v5

Activated Sep 6, 2026. Every category is required.

Open scoring policy
  • intelligence31.2%

    89.2% score × 35.0% weight = 31.2%

    1/1 benchmarks · 198 scored units

  • 34.0% score × 10.0% weight = 3.4%

    2/2 benchmarks · 534 scored units

  • coding18.8%

    68.5% score × 27.5% weight = 18.8%

    2/2 benchmarks · 233 scored units

  • agentic15.1%

    55.0% score × 27.5% weight = 15.1%

    2/2 benchmarks · 80 scored units

89.2%

intelligence category

89.2%

Weighted sum of the benchmark contributions below.

89.2% category score × 35.0% all-rounder weight = 31.2%

  • gpqa-diamond89.2%

    89.2% score × 100% weight = 89.2%

    Mean verifier score · 1 full-panel execution averaged · 198/198 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 85.5%92.9% · generated Jul 9, 2026

    Open latest contributing execution
68.5%

coding category

68.5%

Weighted sum of the benchmark contributions below.

68.5% category score × 27.5% all-rounder weight = 18.8%

  • 92.9% score × 40.0% weight = 37.2%

    Mean verifier score · 1 full-panel execution averaged · 164/164 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 89.6%95.7% · generated Jul 9, 2026

    Open latest contributing execution
  • 52.2% score × 60.0% weight = 31.3%

    Mean verifier score · 1 full-panel execution averaged · 69/69 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 40.6%63.8% · generated Aug 3, 2026

    Open latest contributing execution
34.0%

instruction category

34.0%

Weighted sum of the benchmark contributions below.

34.0% category score × 10.0% all-rounder weight = 3.4%

  • ifeval28.1%

    93.7% score × 30.0% weight = 28.1%

    Mean verifier score · 1 full-panel execution averaged · 510/510 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 92.1%95.3% · generated Jul 9, 2026

    Open latest contributing execution
  • 8.3% score × 70.0% weight = 5.8%

    Strict function pass rate · 1 full-panel execution averaged · 24/24 scored units · 100% score-unit run coverage

    Panel v3 · 95% interval 0.0%20.8% · generated Jul 29, 2026

    Open latest contributing execution
55.0%

agentic category

55.0%

Weighted sum of the benchmark contributions below.

55.0% category score × 27.5% all-rounder weight = 15.1%

  • bfcl-lite23.5%

    78.3% score × 30.0% weight = 23.5%

    Mean verifier score · 1 full-panel execution averaged · 60/60 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 66.7%87.8% · generated Jul 9, 2026

    Open latest contributing execution
  • 45.0% score × 70.0% weight = 31.5%

    Mean task success · 1 full-panel execution averaged · 20/20 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 25.0%65.0% · generated Sep 5, 2026

    Open latest contributing execution
1.14s17.6s~97.0424.5s0.0%compare
Z.ai: GLM 5.3 FlashMax

OpenRouter

Current leaderboard requirements

Every active score-policy benchmark must meet its scored-run and score-unit coverage requirement in this window.

  • gpqa-diamondincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • ifevalincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

  • Passed:98.8% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

  • bfcl-liteincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

68.1%

Re-weighting of old benchmarks · policy v5

Activated Sep 6, 2026. Every category is required.

Open scoring policy
  • intelligence31.3%

    89.4% score × 35.0% weight = 31.3%

    1/1 benchmarks · 198 scored units

  • 58.8% score × 10.0% weight = 5.9%

    2/2 benchmarks · 534 scored units

  • coding11.8%

    43.0% score × 27.5% weight = 11.8%

    2/2 benchmarks · 233 scored units

  • agentic19.1%

    69.5% score × 27.5% weight = 19.1%

    2/2 benchmarks · 80 scored units

89.4%

intelligence category

89.4%

Weighted sum of the benchmark contributions below.

89.4% category score × 35.0% all-rounder weight = 31.3%

  • gpqa-diamond89.4%

    89.4% score × 100% weight = 89.4%

    Mean verifier score · 1 full-panel execution averaged · 198/198 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 85.7%93.3% · generated Jul 9, 2026

    Open latest contributing execution
43.0%

coding category

43.0%

Weighted sum of the benchmark contributions below.

43.0% category score × 27.5% all-rounder weight = 11.8%

  • 94.5% score × 40.0% weight = 37.8%

    Mean verifier score · 1 full-panel execution averaged · 164/164 scored units · 98.8% score-unit run coverage

    Panel v1 · 95% interval 91.5%97.2% · generated Jul 9, 2026

    Open latest contributing execution
  • 8.7% score × 60.0% weight = 5.2%

    Mean verifier score · 1 full-panel execution averaged · 69/69 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 2.9%15.9% · generated Aug 3, 2026

    Open latest contributing execution
58.8%

instruction category

58.8%

Weighted sum of the benchmark contributions below.

58.8% category score × 10.0% all-rounder weight = 5.9%

  • ifeval26.7%

    89.1% score × 30.0% weight = 26.7%

    Mean verifier score · 1 full-panel execution averaged · 510/510 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 86.9%91.3% · generated Jul 9, 2026

    Open latest contributing execution
  • 45.8% score × 70.0% weight = 32.1%

    Strict function pass rate · 1 full-panel execution averaged · 24/24 scored units · 100% score-unit run coverage

    Panel v3 · 95% interval 25.0%66.7% · generated Jul 29, 2026

    Open latest contributing execution
69.5%

agentic category

69.5%

Weighted sum of the benchmark contributions below.

69.5% category score × 27.5% all-rounder weight = 19.1%

  • bfcl-lite24.0%

    80.0% score × 30.0% weight = 24.0%

    Mean verifier score · 1 full-panel execution averaged · 60/60 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 68.3%88.9% · generated Jul 9, 2026

    Open latest contributing execution
  • 65.0% score × 70.0% weight = 45.5%

    Mean task success · 1 full-panel execution averaged · 20/20 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 45.0%85.0% · generated Sep 5, 2026

    Open latest contributing execution
1.32s25.0s~70.5537.8s0.6%compare
Ling-3.0-flashAdaptive

OpenRouter

Current leaderboard requirements

Every active score-policy benchmark must meet its scored-run and score-unit coverage requirement in this window.

  • gpqa-diamondincluded

    Passed:98.0% / 95.0% score-unit coverage at 3 scored runs per score unit

  • ifevalincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

  • Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

  • bfcl-liteincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

50.4%

Re-weighting of old benchmarks · policy v5

Activated Sep 6, 2026. Every category is required.

Open scoring policy
  • intelligence24.5%

    70.0% score × 35.0% weight = 24.5%

    1/1 benchmarks · 198 scored units

  • 28.2% score × 10.0% weight = 2.8%

    2/2 benchmarks · 534 scored units

  • coding10.6%

    38.7% score × 27.5% weight = 10.6%

    2/2 benchmarks · 233 scored units

  • agentic12.5%

    45.3% score × 27.5% weight = 12.5%

    2/2 benchmarks · 80 scored units

70.0%

intelligence category

70.0%

Weighted sum of the benchmark contributions below.

70.0% category score × 35.0% all-rounder weight = 24.5%

  • gpqa-diamond70.0%

    70.0% score × 100% weight = 70.0%

    Mean verifier score · 1 full-panel execution averaged · 198/198 scored units · 98.0% score-unit run coverage

    Panel v1 · 95% interval 64.5%75.4% · generated Jul 9, 2026

    Open latest contributing execution
38.7%

coding category

38.7%

Weighted sum of the benchmark contributions below.

38.7% category score × 27.5% all-rounder weight = 10.6%

  • 94.5% score × 40.0% weight = 37.8%

    Mean verifier score · 1 full-panel execution averaged · 164/164 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 91.7%97.4% · generated Jul 9, 2026

    Open latest contributing execution
  • 1.4% score × 60.0% weight = 0.9%

    Mean verifier score · 1 full-panel execution averaged · 69/69 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 0.0%4.3% · generated Aug 3, 2026

    Open latest contributing execution
28.2%

instruction category

28.2%

Weighted sum of the benchmark contributions below.

28.2% category score × 10.0% all-rounder weight = 2.8%

  • ifeval28.2%

    94.0% score × 30.0% weight = 28.2%

    Mean verifier score · 1 full-panel execution averaged · 510/510 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 92.3%95.5% · generated Jul 9, 2026

    Open latest contributing execution
  • 0.0% score × 70.0% weight = 0.0%

    Strict function pass rate · 1 full-panel execution averaged · 24/24 scored units · 100% score-unit run coverage

    Panel v3 · 95% interval 0.0%0.0% · generated Jul 29, 2026

    Open latest contributing execution
45.3%

agentic category

45.3%

Weighted sum of the benchmark contributions below.

45.3% category score × 27.5% all-rounder weight = 12.5%

  • bfcl-lite24.3%

    81.1% score × 30.0% weight = 24.3%

    Mean verifier score · 1 full-panel execution averaged · 60/60 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 69.4%90.0% · generated Jul 9, 2026

    Open latest contributing execution
  • 30.0% score × 70.0% weight = 21.0%

    Mean task success · 1 full-panel execution averaged · 20/20 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 10.0%50.0% · generated Sep 5, 2026

    Open latest contributing execution
745ms4.81s~442102.7s0.0%compare
Claude Haiku 4.5Max

Anthropic

Current leaderboard requirements

Every active score-policy benchmark must meet its scored-run and score-unit coverage requirement in this window.

  • gpqa-diamondincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • ifevalincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

  • Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

  • bfcl-liteincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

45.1%

Re-weighting of old benchmarks · policy v5

Activated Sep 6, 2026. Every category is required.

Open scoring policy
  • intelligence23.8%

    67.9% score × 35.0% weight = 23.8%

    1/1 benchmarks · 395 scored units

  • 34.5% score × 10.0% weight = 3.5%

    2/2 benchmarks · 1044 scored units

  • coding11.1%

    40.2% score × 27.5% weight = 11.1%

    2/2 benchmarks · 397 scored units

  • agentic6.8%

    24.8% score × 27.5% weight = 6.8%

    2/2 benchmarks · 200 scored units

67.9%

intelligence category

67.9%

Weighted sum of the benchmark contributions below.

67.9% category score × 35.0% all-rounder weight = 23.8%

  • gpqa-diamond67.9%

    67.9% score × 100% weight = 67.9%

    Mean verifier score · 2 full-panel executions averaged · 395/396 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 66.0%78.7% · generated Jul 9, 2026

    Open latest contributing execution
40.2%

coding category

40.2%

Weighted sum of the benchmark contributions below.

40.2% category score × 27.5% all-rounder weight = 11.1%

  • 91.9% score × 40.0% weight = 36.8%

    Mean verifier score · 2 full-panel executions averaged · 328/328 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 89.0%97.0% · generated Jul 9, 2026

    Open latest contributing execution
  • 5.8% score × 60.0% weight = 3.5%

    Mean verifier score · 1 full-panel execution averaged · 69/69 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 1.4%11.6% · generated Aug 3, 2026

    Open latest contributing execution
34.5%

instruction category

34.5%

Weighted sum of the benchmark contributions below.

34.5% category score × 10.0% all-rounder weight = 3.5%

  • ifeval25.8%

    86.0% score × 30.0% weight = 25.8%

    Mean verifier score · 2 full-panel executions averaged · 1020/1020 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 84.9%90.6% · generated Jul 9, 2026

    Open latest contributing execution
  • 12.5% score × 70.0% weight = 8.8%

    Strict function pass rate · 1 full-panel execution averaged · 24/24 scored units · 100% score-unit run coverage

    Panel v3 · 95% interval 0.0%25.0% · generated Jul 29, 2026

    Open latest contributing execution
24.8%

agentic category

24.8%

Weighted sum of the benchmark contributions below.

24.8% category score × 27.5% all-rounder weight = 6.8%

  • bfcl-lite24.8%

    82.8% score × 30.0% weight = 24.8%

    Mean verifier score · 3 full-panel executions averaged · 180/180 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 70.0%90.0% · generated Jul 9, 2026

    Open latest contributing execution
  • 0.0% score × 70.0% weight = 0.0%

    Mean task success · 1 full-panel execution averaged · 20/20 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 0.0%0.0% · generated Sep 5, 2026

    Open latest contributing execution
555ms7.77s~342149.1s0.5%compare
gpt-6-astraMax

OpenAI

Current leaderboard requirements

Every active score-policy benchmark must meet its scored-run and score-unit coverage requirement in this window.

  • gpqa-diamondnot included

    Failed:0.0% / 95.0% score-unit coverage at 3 scored runs per score unit

    Needs 95.0% of score units with at least 3 scored runs. Open the model runs to retry availability failures.

  • ifevalnot included

    Failed:0.0% / 95.0% score-unit coverage at 3 scored runs per score unit

    Needs 95.0% of score units with at least 3 scored runs. Open the model runs to retry availability failures.

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

  • humaneval-plusnot included

    Failed:0.0% / 95.0% score-unit coverage at 3 scored runs per score unit

    Needs 95.0% of score units with at least 3 scored runs. Open the model runs to retry availability failures.

  • Failed:no evidence / 100% score-unit coverage at 1 scored runs per score unit

    Needs 100% of score units with at least 1 scored runs. Open the model runs to retry availability failures.

  • bfcl-litenot included

    Failed:0.0% / 95.0% score-unit coverage at 3 scored runs per score unit

    Needs 95.0% of score units with at least 3 scored runs. Open the model runs to retry availability failures.

  • thinkingbox-benchnot included

    Failed:no evidence / 100% score-unit coverage at 1 scored runs per score unit

    Needs 100% of score units with at least 1 scored runs. Open the model runs to retry availability failures.

unqualified

Re-weighting of old benchmarks · policy v5

Activated Sep 6, 2026. Every category is required.

Open scoring policy
  • intelligenceincomplete

    Missing required benchmark evidence; no contribution is assigned.

    0/1 benchmarks · 0 scored units

  • instructionincomplete

    Missing required benchmark evidence; no contribution is assigned.

    1/2 benchmarks · 24 scored units

  • codingincomplete

    Missing required benchmark evidence; no contribution is assigned.

    0/2 benchmarks · 0 scored units

  • agenticincomplete

    Missing required benchmark evidence; no contribution is assigned.

    0/2 benchmarks · 0 scored units

unqualified

Missing 1 weighted intelligence benchmark on its active panel. Every positive-weight benchmark is required for a category score.

intelligence category

unqualified

Weighted sum of the benchmark contributions below.

  • Not qualified: 0.0%/95.0% of score units have at least 3 scored runs. Weight: 100%.

unqualified

Missing 2 weighted coding benchmarks on its active panel. Every positive-weight benchmark is required for a category score.

coding category

unqualified

Weighted sum of the benchmark contributions below.

  • Not qualified: 0.0%/95.0% of score units have at least 3 scored runs. Weight: 40.0%.

  • No full-panel evidence exists in this window. Weight: 60.0%.

unqualified

Missing 1 weighted instruction benchmark on its active panel. Every positive-weight benchmark is required for a category score.

instruction category

unqualified

Weighted sum of the benchmark contributions below.

  • ifevalmissing

    Not qualified: 0.0%/95.0% of score units have at least 3 scored runs. Weight: 30.0%.

  • 100% score × 70.0% weight = 70.0%

    Strict function pass rate · 1 full-panel execution averaged · 24/24 scored units · 100% score-unit run coverage

    Panel v3 · 95% interval 100%100% · generated Jul 29, 2026

    Open latest contributing execution
unqualified

Missing 2 weighted agentic benchmarks on its active panel. Every positive-weight benchmark is required for a category score.

agentic category

unqualified

Weighted sum of the benchmark contributions below.

  • bfcl-litemissing

    Not qualified: 0.0%/95.0% of score units have at least 3 scored runs. Weight: 30.0%.

  • No full-panel evidence exists in this window. Weight: 70.0%.

7.31s18.9s124114.4s0.0%compare
Meta: Muse Spark 1.3Max

OpenRouter

Current leaderboard requirements

Every active score-policy benchmark must meet its scored-run and score-unit coverage requirement in this window.

  • gpqa-diamondnot included

    Failed:no evidence / 95.0% score-unit coverage at 3 scored runs per score unit

    Needs 95.0% of score units with at least 3 scored runs. Open the model runs to retry availability failures.

  • ifevalnot included

    Failed:no evidence / 95.0% score-unit coverage at 3 scored runs per score unit

    Needs 95.0% of score units with at least 3 scored runs. Open the model runs to retry availability failures.

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

  • humaneval-plusnot included

    Failed:no evidence / 95.0% score-unit coverage at 3 scored runs per score unit

    Needs 95.0% of score units with at least 3 scored runs. Open the model runs to retry availability failures.

  • Failed:no evidence / 100% score-unit coverage at 1 scored runs per score unit

    Needs 100% of score units with at least 1 scored runs. Open the model runs to retry availability failures.

  • bfcl-liteincluded

    Passed:100% / 95.0% score-unit coverage at 3 scored runs per score unit

  • Passed:100% / 100% score-unit coverage at 1 scored runs per score unit

unqualified

Re-weighting of old benchmarks · policy v5

Activated Sep 6, 2026. Every category is required.

Open scoring policy
  • intelligenceincomplete

    Missing required benchmark evidence; no contribution is assigned.

    0/1 benchmarks · 0 scored units

  • instructionincomplete

    Missing required benchmark evidence; no contribution is assigned.

    1/2 benchmarks · 24 scored units

  • codingincomplete

    Missing required benchmark evidence; no contribution is assigned.

    0/2 benchmarks · 0 scored units

  • agentic6.7%

    24.3% score × 27.5% weight = 6.7%

    2/2 benchmarks · 80 scored units

unqualified

Missing 1 weighted intelligence benchmark on its active panel. Every positive-weight benchmark is required for a category score.

intelligence category

unqualified

Weighted sum of the benchmark contributions below.

  • No full-panel evidence exists in this window. Weight: 100%.

unqualified

Missing 2 weighted coding benchmarks on its active panel. Every positive-weight benchmark is required for a category score.

coding category

unqualified

Weighted sum of the benchmark contributions below.

unqualified

Missing 1 weighted instruction benchmark on its active panel. Every positive-weight benchmark is required for a category score.

instruction category

unqualified

Weighted sum of the benchmark contributions below.

  • ifevalmissing

    No full-panel evidence exists in this window. Weight: 30.0%.

  • 91.7% score × 70.0% weight = 64.2%

    Strict function pass rate · 1 full-panel execution averaged · 24/24 scored units · 100% score-unit run coverage

    Panel v3 · 95% interval 79.2%100% · generated Jul 29, 2026

    Open latest contributing execution
24.3%

agentic category

24.3%

Weighted sum of the benchmark contributions below.

24.3% category score × 27.5% all-rounder weight = 6.7%

  • bfcl-lite24.3%

    81.1% score × 30.0% weight = 24.3%

    Mean verifier score · 1 full-panel execution averaged · 60/60 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 70.6%90.0% · generated Jul 9, 2026

    Open latest contributing execution
  • 0.0% score × 70.0% weight = 0.0%

    Mean task success · 1 full-panel execution averaged · 20/20 scored units · 100% score-unit run coverage

    Panel v1 · 95% interval 0.0%0.0% · generated Sep 5, 2026

    Open latest contributing execution
2.11s3.26s~52212.1s0.0%compare