GPT-5.6 Terra Max OpenAI
Leaderboard 7/7Current leaderboard requirements
Every active score-policy benchmark must meet its scored-run and score-unit coverage requirement in this window.
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
Passed: 95.1% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
83.7%†
4/4 categories. Show all-rounder score calculation Re-weighting of old benchmarks · policy v5
Activated Sep 6, 2026. Every category is required.
Open scoring policy 91.8%† score × 35.0% weight = 32.1%
1/1 benchmarks · 385 scored units
94.8%† score × 10.0% weight = 9.5%
2/2 benchmarks · 1044 scored units
84.4%† score × 27.5% weight = 23.2%
2/2 benchmarks · 393 scored units
68.6%† score × 27.5% weight = 18.9%
2/2 benchmarks · 140 scored units
91.8%†
1/1 panels. Show intelligence evidence intelligence category
91.8%† Weighted sum of the benchmark contributions below.
91.8%† category score × 35.0% all-rounder weight = 32.1%
91.8%† score × 100% weight = 91.8%
Mean verifier score · 2 full-panel executions averaged · 385/396 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 88.8%–95.4% · generated Jul 9, 2026
Open latest contributing execution 84.4%†
2/2 panels. Show coding evidence Weighted sum of the benchmark contributions below.
84.4%† category score × 27.5% all-rounder weight = 23.2%
93.7%† score × 40.0% weight = 37.5%
Mean verifier score · 2 full-panel executions averaged · 324/328 scored units · 95.1% score-unit run coverage
Panel v1 · 95% interval 93.8%–99.1% · generated Jul 9, 2026
Open latest contributing execution 78.3% score × 60.0% weight = 47.0%
Mean verifier score · 1 full-panel execution averaged · 69/69 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 68.1%–87.0% · generated Aug 3, 2026
Open latest contributing execution 94.8%†
2/2 panels. Show instruction evidence instruction category
94.8%† Weighted sum of the benchmark contributions below.
94.8%† category score × 10.0% all-rounder weight = 9.5%
92.5%† score × 30.0% weight = 27.8%
Mean verifier score · 2 full-panel executions averaged · 1020/1020 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 92.5%–96.1% · generated Jul 9, 2026
Open latest contributing execution 95.8% score × 70.0% weight = 67.1%
Strict function pass rate · 1 full-panel execution averaged · 24/24 scored units · 100% score-unit run coverage
Panel v3 · 95% interval 87.5%–100% · generated Jul 29, 2026
Open latest contributing execution 68.6%†
2/2 panels. Show agentic evidence Weighted sum of the benchmark contributions below.
68.6%† category score × 27.5% all-rounder weight = 18.9%
76.9%† score × 30.0% weight = 23.1%
Mean verifier score · 2 full-panel executions averaged · 120/120 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 76.9%–76.9% · generated Jul 9, 2026
Open latest contributing execution 65.0% score × 70.0% weight = 45.5%
Mean task success · 1 full-panel execution averaged · 20/20 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 40.0%–85.0% · generated Sep 5, 2026
Open latest contributing execution 3.73s 6.09s ~342 0.1% of this model's runs used estimated token counts. 183.9s 0.0% compare Google: Gemini 3.8 Flash High OpenRouter
Leaderboard 7/7Current leaderboard requirements
Every active score-policy benchmark must meet its scored-run and score-unit coverage requirement in this window.
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
82.9%†
4/4 categories. Show all-rounder score calculation Re-weighting of old benchmarks · policy v5
Activated Sep 6, 2026. Every category is required.
Open scoring policy 95.8%† score × 35.0% weight = 33.5%
1/1 benchmarks · 198 scored units
93.1%† score × 10.0% weight = 9.3%
2/2 benchmarks · 534 scored units
82.5%† score × 27.5% weight = 22.7%
2/2 benchmarks · 233 scored units
63.2%† score × 27.5% weight = 17.4%
2/2 benchmarks · 80 scored units
95.8%†
1/1 panels. Show intelligence evidence intelligence category
95.8%† Weighted sum of the benchmark contributions below.
95.8%† category score × 35.0% all-rounder weight = 33.5%
95.8%† score × 100% weight = 95.8%
Mean verifier score · 1 full-panel execution averaged · 198/198 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 92.9%–98.1% · generated Jul 9, 2026
Open latest contributing execution 82.5%†
2/2 panels. Show coding evidence Weighted sum of the benchmark contributions below.
82.5%† category score × 27.5% all-rounder weight = 22.7%
93.3%† score × 40.0% weight = 37.3%
Mean verifier score · 1 full-panel execution averaged · 164/164 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 89.6%–96.7% · generated Jul 9, 2026
Open latest contributing execution 75.4% score × 60.0% weight = 45.2%
Mean verifier score · 1 full-panel execution averaged · 69/69 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 65.2%–85.5% · generated Aug 3, 2026
Open latest contributing execution 93.1%†
2/2 panels. Show instruction evidence instruction category
93.1%† Weighted sum of the benchmark contributions below.
93.1%† category score × 10.0% all-rounder weight = 9.3%
96.5%† score × 30.0% weight = 29.0%
Mean verifier score · 1 full-panel execution averaged · 510/510 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 94.9%–97.8% · generated Jul 9, 2026
Open latest contributing execution 91.7% score × 70.0% weight = 64.2%
Strict function pass rate · 1 full-panel execution averaged · 24/24 scored units · 100% score-unit run coverage
Panel v3 · 95% interval 79.2%–100% · generated Jul 29, 2026
Open latest contributing execution 63.2%†
2/2 panels. Show agentic evidence Weighted sum of the benchmark contributions below.
63.2%† category score × 27.5% all-rounder weight = 17.4%
82.2%† score × 30.0% weight = 24.7%
Mean verifier score · 1 full-panel execution averaged · 60/60 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 71.7%–90.6% · generated Jul 9, 2026
Open latest contributing execution 55.0% score × 70.0% weight = 38.5%
Mean task success · 1 full-panel execution averaged · 20/20 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 30.0%–75.0% · generated Sep 5, 2026
Open latest contributing execution 1.52s 8.11s ~221 100% of this model's runs used estimated token counts. 91.0s 0.0% compare GPT-5.6 Sol Max OpenAI
Leaderboard 7/7Current leaderboard requirements
Every active score-policy benchmark must meet its scored-run and score-unit coverage requirement in this window.
Passed: 98.0% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
81.6%†
4/4 categories. Show all-rounder score calculation Re-weighting of old benchmarks · policy v5
Activated Sep 6, 2026. Every category is required.
Open scoring policy 92.8%† score × 35.0% weight = 32.5%
1/1 benchmarks · 197 scored units
98.4%† score × 10.0% weight = 9.8%
2/2 benchmarks · 534 scored units
83.9%† score × 27.5% weight = 23.1%
2/2 benchmarks · 233 scored units
59.0%† score × 27.5% weight = 16.2%
2/2 benchmarks · 80 scored units
92.8%†
1/1 panels. Show intelligence evidence intelligence category
92.8%† Weighted sum of the benchmark contributions below.
92.8%† category score × 35.0% all-rounder weight = 32.5%
92.8%† score × 100% weight = 92.8%
Mean verifier score · 1 full-panel execution averaged · 197/198 scored units · 98.0% score-unit run coverage
Panel v1 · 95% interval 92.8%–92.8% · generated Jul 9, 2026
Open latest contributing execution 83.9%†
2/2 panels. Show coding evidence Weighted sum of the benchmark contributions below.
83.9%† category score × 27.5% all-rounder weight = 23.1%
94.5%† score × 40.0% weight = 37.8%
Mean verifier score · 1 full-panel execution averaged · 164/164 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 94.5%–94.5% · generated Jul 9, 2026
Open latest contributing execution 76.8% score × 60.0% weight = 46.1%
Mean verifier score · 1 full-panel execution averaged · 69/69 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 66.7%–87.0% · generated Aug 3, 2026
Open latest contributing execution 98.4%†
2/2 panels. Show instruction evidence instruction category
98.4%† Weighted sum of the benchmark contributions below.
98.4%† category score × 10.0% all-rounder weight = 9.8%
94.8%† score × 30.0% weight = 28.4%
Mean verifier score · 1 full-panel execution averaged · 510/510 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 94.8%–94.8% · generated Jul 9, 2026
Open latest contributing execution 100% score × 70.0% weight = 70.0%
Strict function pass rate · 1 full-panel execution averaged · 24/24 scored units · 100% score-unit run coverage
Panel v3 · 95% interval 100%–100% · generated Jul 29, 2026
Open latest contributing execution 59.0%†
2/2 panels. Show agentic evidence Weighted sum of the benchmark contributions below.
59.0%† category score × 27.5% all-rounder weight = 16.2%
80.0%† score × 30.0% weight = 24.0%
Mean verifier score · 1 full-panel execution averaged · 60/60 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 80.0%–80.0% · generated Jul 9, 2026
Open latest contributing execution 50.0% score × 70.0% weight = 35.0%
Mean task success · 1 full-panel execution averaged · 20/20 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 30.0%–75.0% · generated Sep 5, 2026
Open latest contributing execution 4.47s 5.22s ~289 0.8% of this model's runs used estimated token counts. 598.5s 0.5% compare GPT-5.6 Luna Max OpenAI
Leaderboard 7/7Current leaderboard requirements
Every active score-policy benchmark must meet its scored-run and score-unit coverage requirement in this window.
Passed: 96.0% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
77.7%†
4/4 categories. Show all-rounder score calculation Re-weighting of old benchmarks · policy v5
Activated Sep 6, 2026. Every category is required.
Open scoring policy 86.0%† score × 35.0% weight = 30.1%
1/1 benchmarks · 196 scored units
77.0%† score × 10.0% weight = 7.7%
2/2 benchmarks · 534 scored units
82.2%† score × 27.5% weight = 22.6%
2/2 benchmarks · 233 scored units
62.7%† score × 27.5% weight = 17.2%
2/2 benchmarks · 80 scored units
86.0%†
1/1 panels. Show intelligence evidence intelligence category
86.0%† Weighted sum of the benchmark contributions below.
86.0%† category score × 35.0% all-rounder weight = 30.1%
86.0%† score × 100% weight = 86.0%
Mean verifier score · 1 full-panel execution averaged · 196/198 scored units · 96.0% score-unit run coverage
Panel v1 · 95% interval 86.0%–86.0% · generated Jul 9, 2026
Open latest contributing execution 82.2%†
2/2 panels. Show coding evidence Weighted sum of the benchmark contributions below.
82.2%† category score × 27.5% all-rounder weight = 22.6%
92.6%† score × 40.0% weight = 37.0%
Mean verifier score · 1 full-panel execution averaged · 164/164 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 92.6%–92.6% · generated Jul 9, 2026
Open latest contributing execution 75.4% score × 60.0% weight = 45.2%
Mean verifier score · 1 full-panel execution averaged · 69/69 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 65.2%–84.1% · generated Aug 3, 2026
Open latest contributing execution 77.0%†
2/2 panels. Show instruction evidence instruction category
77.0%† Weighted sum of the benchmark contributions below.
77.0%† category score × 10.0% all-rounder weight = 7.7%
91.3%† score × 30.0% weight = 27.4%
Mean verifier score · 1 full-panel execution averaged · 510/510 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 91.3%–91.3% · generated Jul 9, 2026
Open latest contributing execution 70.8% score × 70.0% weight = 49.6%
Strict function pass rate · 1 full-panel execution averaged · 24/24 scored units · 100% score-unit run coverage
Panel v3 · 95% interval 54.2%–87.5% · generated Jul 29, 2026
Open latest contributing execution 62.7%†
2/2 panels. Show agentic evidence Weighted sum of the benchmark contributions below.
62.7%† category score × 27.5% all-rounder weight = 17.2%
80.7%† score × 30.0% weight = 24.2%
Mean verifier score · 1 full-panel execution averaged · 60/60 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 80.7%–80.7% · generated Jul 9, 2026
Open latest contributing execution 55.0% score × 70.0% weight = 38.5%
Mean task success · 1 full-panel execution averaged · 20/20 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 30.0%–75.0% · generated Sep 5, 2026
Open latest contributing execution 3.12s 4.67s ~649 0.2% of this model's runs used estimated token counts. 437.2s 0.1% compare Claude Opus 5 Extra high Anthropic
Leaderboard 7/7Current leaderboard requirements
Every active score-policy benchmark must meet its scored-run and score-unit coverage requirement in this window.
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
73.2%†
4/4 categories. Show all-rounder score calculation Re-weighting of old benchmarks · policy v5
Activated Sep 6, 2026. Every category is required.
Open scoring policy 92.8%† score × 35.0% weight = 32.5%
1/1 benchmarks · 198 scored units
56.1%† score × 10.0% weight = 5.6%
2/2 benchmarks · 534 scored units
61.4%† score × 27.5% weight = 16.9%
2/2 benchmarks · 233 scored units
66.2%† score × 27.5% weight = 18.2%
2/2 benchmarks · 80 scored units
92.8%†
1/1 panels. Show intelligence evidence intelligence category
92.8%† Weighted sum of the benchmark contributions below.
92.8%† category score × 35.0% all-rounder weight = 32.5%
92.8%† score × 100% weight = 92.8%
Mean verifier score · 1 full-panel execution averaged · 198/198 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 89.4%–95.8% · generated Jul 9, 2026
Open latest contributing execution 61.4%†
2/2 panels. Show coding evidence Weighted sum of the benchmark contributions below.
61.4%† category score × 27.5% all-rounder weight = 16.9%
94.7%† score × 40.0% weight = 37.9%
Mean verifier score · 1 full-panel execution averaged · 164/164 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 91.1%–97.8% · generated Jul 9, 2026
Open latest contributing execution 39.1% score × 60.0% weight = 23.5%
Mean verifier score · 1 full-panel execution averaged · 69/69 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 29.0%–50.7% · generated Aug 3, 2026
Open latest contributing execution 56.1%†
2/2 panels. Show instruction evidence instruction category
56.1%† Weighted sum of the benchmark contributions below.
56.1%† category score × 10.0% all-rounder weight = 5.6%
89.9%† score × 30.0% weight = 27.0%
Mean verifier score · 1 full-panel execution averaged · 510/510 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 87.7%–92.1% · generated Jul 9, 2026
Open latest contributing execution 41.7% score × 70.0% weight = 29.2%
Strict function pass rate · 1 full-panel execution averaged · 24/24 scored units · 100% score-unit run coverage
Panel v3 · 95% interval 25.0%–62.5% · generated Jul 29, 2026
Open latest contributing execution 66.2%†
2/2 panels. Show agentic evidence Weighted sum of the benchmark contributions below.
66.2%† category score × 27.5% all-rounder weight = 18.2%
80.6%† score × 30.0% weight = 24.2%
Mean verifier score · 1 full-panel execution averaged · 60/60 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 69.4%–90.0% · generated Jul 9, 2026
Open latest contributing execution 60.0% score × 70.0% weight = 42.0%
Mean task success · 1 full-panel execution averaged · 20/20 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 35.0%–80.0% · generated Sep 5, 2026
Open latest contributing execution 5.51s 10.2s ~50.5 100% of this model's runs used estimated token counts. 103.9s 0.0% compare DeepSeek: DeepSeek V4 Flash 0731 Max OpenRouter
Leaderboard 7/7Current leaderboard requirements
Every active score-policy benchmark must meet its scored-run and score-unit coverage requirement in this window.
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
70.3%†
4/4 categories. Show all-rounder score calculation Re-weighting of old benchmarks · policy v5
Activated Sep 6, 2026. Every category is required.
Open scoring policy 86.7%† score × 35.0% weight = 30.3%
1/1 benchmarks · 198 scored units
57.0%† score × 10.0% weight = 5.7%
2/2 benchmarks · 534 scored units
58.6%† score × 27.5% weight = 16.1%
2/2 benchmarks · 233 scored units
66.2%† score × 27.5% weight = 18.2%
2/2 benchmarks · 80 scored units
86.7%†
1/1 panels. Show intelligence evidence intelligence category
86.7%† Weighted sum of the benchmark contributions below.
86.7%† category score × 35.0% all-rounder weight = 30.3%
86.7%† score × 100% weight = 86.7%
Mean verifier score · 1 full-panel execution averaged · 198/198 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 82.8%–90.6% · generated Jul 9, 2026
Open latest contributing execution 58.6%†
2/2 panels. Show coding evidence Weighted sum of the benchmark contributions below.
58.6%† category score × 27.5% all-rounder weight = 16.1%
92.1%† score × 40.0% weight = 36.8%
Mean verifier score · 1 full-panel execution averaged · 164/164 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 88.8%–95.3% · generated Jul 9, 2026
Open latest contributing execution 36.2% score × 60.0% weight = 21.7%
Mean verifier score · 1 full-panel execution averaged · 69/69 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 24.6%–47.8% · generated Aug 3, 2026
Open latest contributing execution 57.0%†
2/2 panels. Show instruction evidence instruction category
57.0%† Weighted sum of the benchmark contributions below.
57.0%† category score × 10.0% all-rounder weight = 5.7%
92.6%† score × 30.0% weight = 27.8%
Mean verifier score · 1 full-panel execution averaged · 510/510 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 91.0%–94.3% · generated Jul 9, 2026
Open latest contributing execution 41.7% score × 70.0% weight = 29.2%
Strict function pass rate · 1 full-panel execution averaged · 24/24 scored units · 100% score-unit run coverage
Panel v3 · 95% interval 20.8%–58.3% · generated Jul 29, 2026
Open latest contributing execution 66.2%†
2/2 panels. Show agentic evidence Weighted sum of the benchmark contributions below.
66.2%† category score × 27.5% all-rounder weight = 18.2%
80.6%† score × 30.0% weight = 24.2%
Mean verifier score · 1 full-panel execution averaged · 60/60 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 68.9%–90.0% · generated Jul 9, 2026
Open latest contributing execution 60.0% score × 70.0% weight = 42.0%
Mean task success · 1 full-panel execution averaged · 20/20 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 40.0%–80.0% · generated Sep 5, 2026
Open latest contributing execution 865ms 11.8s ~61.7 100% of this model's runs used estimated token counts. 451.2s 0.0% compare Claude Sonnet 5 Extra high Anthropic
Leaderboard 7/7Current leaderboard requirements
Every active score-policy benchmark must meet its scored-run and score-unit coverage requirement in this window.
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 96.7% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
69.8%†
4/4 categories. Show all-rounder score calculation Re-weighting of old benchmarks · policy v5
Activated Sep 6, 2026. Every category is required.
Open scoring policy 89.9%† score × 35.0% weight = 31.5%
1/1 benchmarks · 363 scored units
70.1%† score × 10.0% weight = 7.0%
2/2 benchmarks · 1036 scored units
54.5%† score × 27.5% weight = 15.0%
2/2 benchmarks · 397 scored units
59.3%† score × 27.5% weight = 16.3%
2/2 benchmarks · 140 scored units
89.9%†
1/1 panels. Show intelligence evidence intelligence category
89.9%† Weighted sum of the benchmark contributions below.
89.9%† category score × 35.0% all-rounder weight = 31.5%
89.9%† score × 100% weight = 89.9%
Mean verifier score · 2 full-panel executions averaged · 363/396 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 85.8%–94.1% · generated Jul 9, 2026
Open latest contributing execution 54.5%†
2/2 panels. Show coding evidence Weighted sum of the benchmark contributions below.
54.5%† category score × 27.5% all-rounder weight = 15.0%
92.7%† score × 40.0% weight = 37.1%
Mean verifier score · 2 full-panel executions averaged · 328/328 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 88.1%–95.7% · generated Jul 9, 2026
Open latest contributing execution 29.0% score × 60.0% weight = 17.4%
Mean verifier score · 1 full-panel execution averaged · 69/69 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 18.8%–40.6% · generated Aug 3, 2026
Open latest contributing execution 70.1%†
2/2 panels. Show instruction evidence instruction category
70.1%† Weighted sum of the benchmark contributions below.
70.1%† category score × 10.0% all-rounder weight = 7.0%
87.9%† score × 30.0% weight = 26.4%
Mean verifier score · 2 full-panel executions averaged · 1012/1020 scored units · 96.7% score-unit run coverage
Panel v1 · 95% interval 86.0%–91.3% · generated Jul 9, 2026
Open latest contributing execution 62.5% score × 70.0% weight = 43.8%
Strict function pass rate · 1 full-panel execution averaged · 24/24 scored units · 100% score-unit run coverage
Panel v3 · 95% interval 41.7%–83.3% · generated Jul 29, 2026
Open latest contributing execution 59.3%†
2/2 panels. Show agentic evidence Weighted sum of the benchmark contributions below.
59.3%† category score × 27.5% all-rounder weight = 16.3%
80.8%† score × 30.0% weight = 24.3%
Mean verifier score · 2 full-panel executions averaged · 120/120 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 70.0%–90.0% · generated Jul 9, 2026
Open latest contributing execution 50.0% score × 70.0% weight = 35.0%
Mean task success · 1 full-panel execution averaged · 20/20 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 25.0%–70.0% · generated Sep 5, 2026
Open latest contributing execution 3.00s 3.76s ~106 96.3% of this model's runs used estimated token counts. 137.3s 0.0% compare Kimi K3 Max OpenRouter
Leaderboard 7/7Current leaderboard requirements
Every active score-policy benchmark must meet its scored-run and score-unit coverage requirement in this window.
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
69.6%†
4/4 categories. Show all-rounder score calculation Re-weighting of old benchmarks · policy v5
Activated Sep 6, 2026. Every category is required.
Open scoring policy 90.4%† score × 35.0% weight = 31.6%
1/1 benchmarks · 198 scored units
77.5%† score × 10.0% weight = 7.8%
2/2 benchmarks · 534 scored units
44.2%† score × 27.5% weight = 12.2%
2/2 benchmarks · 233 scored units
65.7%† score × 27.5% weight = 18.1%
2/2 benchmarks · 80 scored units
90.4%†
1/1 panels. Show intelligence evidence intelligence category
90.4%† Weighted sum of the benchmark contributions below.
90.4%† category score × 35.0% all-rounder weight = 31.6%
90.4%† score × 100% weight = 90.4%
Mean verifier score · 1 full-panel execution averaged · 198/198 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 87.2%–93.6% · generated Jul 9, 2026
Open latest contributing execution 44.2%†
2/2 panels. Show coding evidence Weighted sum of the benchmark contributions below.
44.2%† category score × 27.5% all-rounder weight = 12.2%
95.3%† score × 40.0% weight = 38.1%
Mean verifier score · 1 full-panel execution averaged · 164/164 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 92.5%–98.0% · generated Jul 9, 2026
Open latest contributing execution 10.1% score × 60.0% weight = 6.1%
Mean verifier score · 1 full-panel execution averaged · 69/69 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 2.9%–17.4% · generated Aug 3, 2026
Open latest contributing execution 77.5%†
2/2 panels. Show instruction evidence instruction category
77.5%† Weighted sum of the benchmark contributions below.
77.5%† category score × 10.0% all-rounder weight = 7.8%
93.1%† score × 30.0% weight = 27.9%
Mean verifier score · 1 full-panel execution averaged · 510/510 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 91.2%–95.0% · generated Jul 9, 2026
Open latest contributing execution 70.8% score × 70.0% weight = 49.6%
Strict function pass rate · 1 full-panel execution averaged · 24/24 scored units · 100% score-unit run coverage
Panel v3 · 95% interval 50.0%–87.5% · generated Jul 29, 2026
Open latest contributing execution 65.7%†
2/2 panels. Show agentic evidence Weighted sum of the benchmark contributions below.
65.7%† category score × 27.5% all-rounder weight = 18.1%
78.9%† score × 30.0% weight = 23.7%
Mean verifier score · 1 full-panel execution averaged · 60/60 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 67.2%–88.3% · generated Jul 9, 2026
Open latest contributing execution 60.0% score × 70.0% weight = 42.0%
Mean task success · 1 full-panel execution averaged · 20/20 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 35.0%–80.0% · generated Sep 5, 2026
Open latest contributing execution 2.20s 19.6s ~40.3 100% of this model's runs used estimated token counts. 271.0s 0.0% compare DeepSeek: DeepSeek V4 Pro 0813 Max OpenRouter
Leaderboard 7/7Current leaderboard requirements
Every active score-policy benchmark must meet its scored-run and score-unit coverage requirement in this window.
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
68.6%†
4/4 categories. Show all-rounder score calculation Re-weighting of old benchmarks · policy v5
Activated Sep 6, 2026. Every category is required.
Open scoring policy 89.2%† score × 35.0% weight = 31.2%
1/1 benchmarks · 198 scored units
34.0%† score × 10.0% weight = 3.4%
2/2 benchmarks · 534 scored units
68.5%† score × 27.5% weight = 18.8%
2/2 benchmarks · 233 scored units
55.0%† score × 27.5% weight = 15.1%
2/2 benchmarks · 80 scored units
89.2%†
1/1 panels. Show intelligence evidence intelligence category
89.2%† Weighted sum of the benchmark contributions below.
89.2%† category score × 35.0% all-rounder weight = 31.2%
89.2%† score × 100% weight = 89.2%
Mean verifier score · 1 full-panel execution averaged · 198/198 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 85.5%–92.9% · generated Jul 9, 2026
Open latest contributing execution 68.5%†
2/2 panels. Show coding evidence Weighted sum of the benchmark contributions below.
68.5%† category score × 27.5% all-rounder weight = 18.8%
92.9%† score × 40.0% weight = 37.2%
Mean verifier score · 1 full-panel execution averaged · 164/164 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 89.6%–95.7% · generated Jul 9, 2026
Open latest contributing execution 52.2% score × 60.0% weight = 31.3%
Mean verifier score · 1 full-panel execution averaged · 69/69 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 40.6%–63.8% · generated Aug 3, 2026
Open latest contributing execution 34.0%†
2/2 panels. Show instruction evidence instruction category
34.0%† Weighted sum of the benchmark contributions below.
34.0%† category score × 10.0% all-rounder weight = 3.4%
93.7%† score × 30.0% weight = 28.1%
Mean verifier score · 1 full-panel execution averaged · 510/510 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 92.1%–95.3% · generated Jul 9, 2026
Open latest contributing execution 8.3% score × 70.0% weight = 5.8%
Strict function pass rate · 1 full-panel execution averaged · 24/24 scored units · 100% score-unit run coverage
Panel v3 · 95% interval 0.0%–20.8% · generated Jul 29, 2026
Open latest contributing execution 55.0%†
2/2 panels. Show agentic evidence Weighted sum of the benchmark contributions below.
55.0%† category score × 27.5% all-rounder weight = 15.1%
78.3%† score × 30.0% weight = 23.5%
Mean verifier score · 1 full-panel execution averaged · 60/60 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 66.7%–87.8% · generated Jul 9, 2026
Open latest contributing execution 45.0% score × 70.0% weight = 31.5%
Mean task success · 1 full-panel execution averaged · 20/20 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 25.0%–65.0% · generated Sep 5, 2026
Open latest contributing execution 1.14s 17.6s ~97.0 100% of this model's runs used estimated token counts. 424.5s 0.0% compare Z.ai: GLM 5.3 Flash Max OpenRouter
Leaderboard 7/7Current leaderboard requirements
Every active score-policy benchmark must meet its scored-run and score-unit coverage requirement in this window.
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
Passed: 98.8% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
68.1%†
4/4 categories. Show all-rounder score calculation Re-weighting of old benchmarks · policy v5
Activated Sep 6, 2026. Every category is required.
Open scoring policy 89.4%† score × 35.0% weight = 31.3%
1/1 benchmarks · 198 scored units
58.8%† score × 10.0% weight = 5.9%
2/2 benchmarks · 534 scored units
43.0%† score × 27.5% weight = 11.8%
2/2 benchmarks · 233 scored units
69.5%† score × 27.5% weight = 19.1%
2/2 benchmarks · 80 scored units
89.4%†
1/1 panels. Show intelligence evidence intelligence category
89.4%† Weighted sum of the benchmark contributions below.
89.4%† category score × 35.0% all-rounder weight = 31.3%
89.4%† score × 100% weight = 89.4%
Mean verifier score · 1 full-panel execution averaged · 198/198 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 85.7%–93.3% · generated Jul 9, 2026
Open latest contributing execution 43.0%†
2/2 panels. Show coding evidence Weighted sum of the benchmark contributions below.
43.0%† category score × 27.5% all-rounder weight = 11.8%
94.5%† score × 40.0% weight = 37.8%
Mean verifier score · 1 full-panel execution averaged · 164/164 scored units · 98.8% score-unit run coverage
Panel v1 · 95% interval 91.5%–97.2% · generated Jul 9, 2026
Open latest contributing execution 8.7% score × 60.0% weight = 5.2%
Mean verifier score · 1 full-panel execution averaged · 69/69 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 2.9%–15.9% · generated Aug 3, 2026
Open latest contributing execution 58.8%†
2/2 panels. Show instruction evidence instruction category
58.8%† Weighted sum of the benchmark contributions below.
58.8%† category score × 10.0% all-rounder weight = 5.9%
89.1%† score × 30.0% weight = 26.7%
Mean verifier score · 1 full-panel execution averaged · 510/510 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 86.9%–91.3% · generated Jul 9, 2026
Open latest contributing execution 45.8% score × 70.0% weight = 32.1%
Strict function pass rate · 1 full-panel execution averaged · 24/24 scored units · 100% score-unit run coverage
Panel v3 · 95% interval 25.0%–66.7% · generated Jul 29, 2026
Open latest contributing execution 69.5%†
2/2 panels. Show agentic evidence Weighted sum of the benchmark contributions below.
69.5%† category score × 27.5% all-rounder weight = 19.1%
80.0%† score × 30.0% weight = 24.0%
Mean verifier score · 1 full-panel execution averaged · 60/60 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 68.3%–88.9% · generated Jul 9, 2026
Open latest contributing execution 65.0% score × 70.0% weight = 45.5%
Mean task success · 1 full-panel execution averaged · 20/20 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 45.0%–85.0% · generated Sep 5, 2026
Open latest contributing execution 1.32s 25.0s ~70.5 99.4% of this model's runs used estimated token counts. 537.8s 0.6% compare Ling-3.0-flash Adaptive OpenRouter
Leaderboard 7/7Current leaderboard requirements
Every active score-policy benchmark must meet its scored-run and score-unit coverage requirement in this window.
Passed: 98.0% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
50.4%†
4/4 categories. Show all-rounder score calculation Re-weighting of old benchmarks · policy v5
Activated Sep 6, 2026. Every category is required.
Open scoring policy 70.0%† score × 35.0% weight = 24.5%
1/1 benchmarks · 198 scored units
28.2%† score × 10.0% weight = 2.8%
2/2 benchmarks · 534 scored units
38.7%† score × 27.5% weight = 10.6%
2/2 benchmarks · 233 scored units
45.3%† score × 27.5% weight = 12.5%
2/2 benchmarks · 80 scored units
70.0%†
1/1 panels. Show intelligence evidence intelligence category
70.0%† Weighted sum of the benchmark contributions below.
70.0%† category score × 35.0% all-rounder weight = 24.5%
70.0%† score × 100% weight = 70.0%
Mean verifier score · 1 full-panel execution averaged · 198/198 scored units · 98.0% score-unit run coverage
Panel v1 · 95% interval 64.5%–75.4% · generated Jul 9, 2026
Open latest contributing execution 38.7%†
2/2 panels. Show coding evidence Weighted sum of the benchmark contributions below.
38.7%† category score × 27.5% all-rounder weight = 10.6%
94.5%† score × 40.0% weight = 37.8%
Mean verifier score · 1 full-panel execution averaged · 164/164 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 91.7%–97.4% · generated Jul 9, 2026
Open latest contributing execution 1.4% score × 60.0% weight = 0.9%
Mean verifier score · 1 full-panel execution averaged · 69/69 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 0.0%–4.3% · generated Aug 3, 2026
Open latest contributing execution 28.2%†
2/2 panels. Show instruction evidence instruction category
28.2%† Weighted sum of the benchmark contributions below.
28.2%† category score × 10.0% all-rounder weight = 2.8%
94.0%† score × 30.0% weight = 28.2%
Mean verifier score · 1 full-panel execution averaged · 510/510 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 92.3%–95.5% · generated Jul 9, 2026
Open latest contributing execution 0.0% score × 70.0% weight = 0.0%
Strict function pass rate · 1 full-panel execution averaged · 24/24 scored units · 100% score-unit run coverage
Panel v3 · 95% interval 0.0%–0.0% · generated Jul 29, 2026
Open latest contributing execution 45.3%†
2/2 panels. Show agentic evidence Weighted sum of the benchmark contributions below.
45.3%† category score × 27.5% all-rounder weight = 12.5%
81.1%† score × 30.0% weight = 24.3%
Mean verifier score · 1 full-panel execution averaged · 60/60 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 69.4%–90.0% · generated Jul 9, 2026
Open latest contributing execution 30.0% score × 70.0% weight = 21.0%
Mean task success · 1 full-panel execution averaged · 20/20 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 10.0%–50.0% · generated Sep 5, 2026
Open latest contributing execution 745ms 4.81s ~442 100% of this model's runs used estimated token counts. 102.7s 0.0% compare Claude Haiku 4.5 Max Anthropic
Leaderboard 7/7Current leaderboard requirements
Every active score-policy benchmark must meet its scored-run and score-unit coverage requirement in this window.
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
45.1%†
4/4 categories. Show all-rounder score calculation Re-weighting of old benchmarks · policy v5
Activated Sep 6, 2026. Every category is required.
Open scoring policy 67.9%† score × 35.0% weight = 23.8%
1/1 benchmarks · 395 scored units
34.5%† score × 10.0% weight = 3.5%
2/2 benchmarks · 1044 scored units
40.2%† score × 27.5% weight = 11.1%
2/2 benchmarks · 397 scored units
24.8%† score × 27.5% weight = 6.8%
2/2 benchmarks · 200 scored units
67.9%†
1/1 panels. Show intelligence evidence intelligence category
67.9%† Weighted sum of the benchmark contributions below.
67.9%† category score × 35.0% all-rounder weight = 23.8%
67.9%† score × 100% weight = 67.9%
Mean verifier score · 2 full-panel executions averaged · 395/396 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 66.0%–78.7% · generated Jul 9, 2026
Open latest contributing execution 40.2%†
2/2 panels. Show coding evidence Weighted sum of the benchmark contributions below.
40.2%† category score × 27.5% all-rounder weight = 11.1%
91.9%† score × 40.0% weight = 36.8%
Mean verifier score · 2 full-panel executions averaged · 328/328 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 89.0%–97.0% · generated Jul 9, 2026
Open latest contributing execution 5.8% score × 60.0% weight = 3.5%
Mean verifier score · 1 full-panel execution averaged · 69/69 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 1.4%–11.6% · generated Aug 3, 2026
Open latest contributing execution 34.5%†
2/2 panels. Show instruction evidence instruction category
34.5%† Weighted sum of the benchmark contributions below.
34.5%† category score × 10.0% all-rounder weight = 3.5%
86.0%† score × 30.0% weight = 25.8%
Mean verifier score · 2 full-panel executions averaged · 1020/1020 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 84.9%–90.6% · generated Jul 9, 2026
Open latest contributing execution 12.5% score × 70.0% weight = 8.8%
Strict function pass rate · 1 full-panel execution averaged · 24/24 scored units · 100% score-unit run coverage
Panel v3 · 95% interval 0.0%–25.0% · generated Jul 29, 2026
Open latest contributing execution 24.8%†
2/2 panels. Show agentic evidence Weighted sum of the benchmark contributions below.
24.8%† category score × 27.5% all-rounder weight = 6.8%
82.8%† score × 30.0% weight = 24.8%
Mean verifier score · 3 full-panel executions averaged · 180/180 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 70.0%–90.0% · generated Jul 9, 2026
Open latest contributing execution 0.0% score × 70.0% weight = 0.0%
Mean task success · 1 full-panel execution averaged · 20/20 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 0.0%–0.0% · generated Sep 5, 2026
Open latest contributing execution 555ms 7.77s ~342 94.1% of this model's runs used estimated token counts. 149.1s 0.5% compare gpt-6-astra Max OpenAI
Leaderboard 1/7Current leaderboard requirements
Every active score-policy benchmark must meet its scored-run and score-unit coverage requirement in this window.
Failed: 0.0% / 95.0% score-unit coverage at 3 scored runs per score unit
Needs 95.0% of score units with at least 3 scored runs. Open the model runs to retry availability failures.
Failed: 0.0% / 95.0% score-unit coverage at 3 scored runs per score unit
Needs 95.0% of score units with at least 3 scored runs. Open the model runs to retry availability failures.
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
Failed: 0.0% / 95.0% score-unit coverage at 3 scored runs per score unit
Needs 95.0% of score units with at least 3 scored runs. Open the model runs to retry availability failures.
Failed: no evidence / 100% score-unit coverage at 1 scored runs per score unit
Needs 100% of score units with at least 1 scored runs. Open the model runs to retry availability failures.
Failed: 0.0% / 95.0% score-unit coverage at 3 scored runs per score unit
Needs 95.0% of score units with at least 3 scored runs. Open the model runs to retry availability failures.
Failed: no evidence / 100% score-unit coverage at 1 scored runs per score unit
Needs 100% of score units with at least 1 scored runs. Open the model runs to retry availability failures.
unqualified
0/4 categories. Show all-rounder score calculation Re-weighting of old benchmarks · policy v5
Activated Sep 6, 2026. Every category is required.
Open scoring policy Missing required benchmark evidence; no contribution is assigned.
0/1 benchmarks · 0 scored units
Missing required benchmark evidence; no contribution is assigned.
1/2 benchmarks · 24 scored units
Missing required benchmark evidence; no contribution is assigned.
0/2 benchmarks · 0 scored units
Missing required benchmark evidence; no contribution is assigned.
0/2 benchmarks · 0 scored units
unqualified
0/1 panels. Show intelligence evidence Missing 1 weighted intelligence benchmark on its active panel. Every positive-weight benchmark is required for a category score.
intelligence category
unqualified Weighted sum of the benchmark contributions below.
unqualified
0/2 panels. Show coding evidence Missing 2 weighted coding benchmarks on its active panel. Every positive-weight benchmark is required for a category score.
coding category
unqualified Weighted sum of the benchmark contributions below.
unqualified
1/2 panels. Show instruction evidence Missing 1 weighted instruction benchmark on its active panel. Every positive-weight benchmark is required for a category score.
instruction category
unqualified Weighted sum of the benchmark contributions below.
Not qualified: 0.0%/95.0% of score units have at least 3 scored runs. Weight: 30.0%.
100% score × 70.0% weight = 70.0%
Strict function pass rate · 1 full-panel execution averaged · 24/24 scored units · 100% score-unit run coverage
Panel v3 · 95% interval 100%–100% · generated Jul 29, 2026
Open latest contributing execution unqualified
0/2 panels. Show agentic evidence Missing 2 weighted agentic benchmarks on its active panel. Every positive-weight benchmark is required for a category score.
agentic category
unqualified Weighted sum of the benchmark contributions below.
7.31s 18.9s 124 114.4s 0.0% compare Meta: Muse Spark 1.3 Max OpenRouter
Leaderboard 3/7Current leaderboard requirements
Every active score-policy benchmark must meet its scored-run and score-unit coverage requirement in this window.
Failed: no evidence / 95.0% score-unit coverage at 3 scored runs per score unit
Needs 95.0% of score units with at least 3 scored runs. Open the model runs to retry availability failures.
Failed: no evidence / 95.0% score-unit coverage at 3 scored runs per score unit
Needs 95.0% of score units with at least 3 scored runs. Open the model runs to retry availability failures.
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
Failed: no evidence / 95.0% score-unit coverage at 3 scored runs per score unit
Needs 95.0% of score units with at least 3 scored runs. Open the model runs to retry availability failures.
Failed: no evidence / 100% score-unit coverage at 1 scored runs per score unit
Needs 100% of score units with at least 1 scored runs. Open the model runs to retry availability failures.
Passed: 100% / 95.0% score-unit coverage at 3 scored runs per score unit
Passed: 100% / 100% score-unit coverage at 1 scored runs per score unit
unqualified
1/4 categories. Show all-rounder score calculation Re-weighting of old benchmarks · policy v5
Activated Sep 6, 2026. Every category is required.
Open scoring policy Missing required benchmark evidence; no contribution is assigned.
0/1 benchmarks · 0 scored units
Missing required benchmark evidence; no contribution is assigned.
1/2 benchmarks · 24 scored units
Missing required benchmark evidence; no contribution is assigned.
0/2 benchmarks · 0 scored units
24.3%† score × 27.5% weight = 6.7%
2/2 benchmarks · 80 scored units
unqualified
0/1 panels. Show intelligence evidence Missing 1 weighted intelligence benchmark on its active panel. Every positive-weight benchmark is required for a category score.
intelligence category
unqualified Weighted sum of the benchmark contributions below.
unqualified
0/2 panels. Show coding evidence Missing 2 weighted coding benchmarks on its active panel. Every positive-weight benchmark is required for a category score.
coding category
unqualified Weighted sum of the benchmark contributions below.
unqualified
1/2 panels. Show instruction evidence Missing 1 weighted instruction benchmark on its active panel. Every positive-weight benchmark is required for a category score.
instruction category
unqualified Weighted sum of the benchmark contributions below.
No full-panel evidence exists in this window. Weight: 30.0%.
91.7% score × 70.0% weight = 64.2%
Strict function pass rate · 1 full-panel execution averaged · 24/24 scored units · 100% score-unit run coverage
Panel v3 · 95% interval 79.2%–100% · generated Jul 29, 2026
Open latest contributing execution 24.3%†
2/2 panels. Show agentic evidence Weighted sum of the benchmark contributions below.
24.3%† category score × 27.5% all-rounder weight = 6.7%
81.1%† score × 30.0% weight = 24.3%
Mean verifier score · 1 full-panel execution averaged · 60/60 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 70.6%–90.0% · generated Jul 9, 2026
Open latest contributing execution 0.0% score × 70.0% weight = 0.0%
Mean task success · 1 full-panel execution averaged · 20/20 scored units · 100% score-unit run coverage
Panel v1 · 95% interval 0.0%–0.0% · generated Sep 5, 2026
Open latest contributing execution 2.11s 3.26s ~522 100% of this model's runs used estimated token counts. 12.1s 0.0% compare