Back to CAD-Bench

Parametric CAD Bench V2 Leaderboard

Current

Held-out results on the corrected v2 task and verifier stack. Score is the mean continuous task reward; failed or unscored trials count as zero.

RankModelAgentEffortScore (95% CI)ScoredPerfectAvg secTokensKnown costDateRun
1
Claude Fable 5.1Claude Code 2.1.251max84.81% ± 4.13100/10046/10041534.06M$198.582026-09-05View run
2
GPT-6 AstraCodex 0.153.4max84.78% ± 4.17100/10045/10022743.02M$135.622026-09-05View run
3
Grok 4.6Grok Build 1.0.5xhigh82.21% ± 4.77100/10047/10045277.27M$75.022026-09-05View run
4
Claude Opus 5Claude Code 2.1.248max79.52% ± 5.69100/10049/10037647.72M$102.022026-09-04View run
5
Kimi K3mini-swe-agent 2.4.3max76.18% ± 6.39100/10046/10053832.73M$42.982026-09-07View run
6
Claude Sonnet 5Claude Code 2.1.251max70.52% ± 7.58100/10049/1001222461.42M$227.552026-09-06View run
7
GPT-5.6-SolCodex 0.150.0max70.34% ± 7.01100/10043/10022673.57M$73.672026-09-04View run
8
GPT-5.6 TerraCodex 0.153.4max68.66% ± 7.19100/10047/100327137.55M$64.532026-09-06View run
9
Muse Spark 1.3mini-swe-agent 2.4.3max65.46% ± 8.03100/10047/100972176.25M$75.682026-09-07View run
10
GLM-5.3mini-swe-agent 2.4.3max64.04% ± 8.6199/10051/10087850.36M$28.152026-09-07View run

© 2025 gNucleus AI. All rights reserved.