MMODELYST
Capabilities/Reasoning
CAP

Reasoning

League table — best at reasoning · 30
mean percentile across this capability's benchmarks
#ModelLeagueCoverage$/1Mtok/s
1Claude Opus 599.82/5$1044
2Claude Fable 599.82/5$2058
3GPT-5.6 Sol (max)99.72/5$11.2574
4Gemini 3.1 Pro Preview99.42/5$4.5132
5Claude Opus 4.899.32/5$1063
6GPT-5.6 Sol99.12/5$11.2564
7GPT-5.599.12/5$11.25
8Kimi K399.02/5$633
9Muse Spark 1.198.82/5$2124
10GPT-5.6 Terra (max)98.62/5$5.63128
11GPT-5.498.42/5$5.63
12Grok 4.598.42/5$356
13Gemini 3.5 Flash98.42/5$3.38250
14GPT-5.6 Terra97.72/5$5.63120
15GPT-5.3 Codex97.72/5$4.81126
16GLM-5.2 (max)97.62/5$2.15157
17Claude Opus 4.797.52/5$10
18Gemini 3.6 Flash97.52/5$3219
19Claude Sonnet 597.32/5$483
20Qwen3.7 Max97.22/5$3.75200
21Muse Spark97.12/5
22MiniMax-M396.92/5$0.52587
23Gemini 3 Pro Preview96.82/5$4.5
24GPT-5.6 Luna (max)96.72/5$2.25171
25Kimi K2.696.32/5$1.71
26Claude Opus 4.696.22/5$10
27Motif 3 (Beta)96.22/5
28Grok Build 0.1 061696.02/5$1.25
29o3-pro95.91/5$35
30GPT-5.295.82/5$4.81

League = a model's mean percentile across the 5 benchmarksin this capability (best score per benchmark; partial coverage shown). Price & speed via Artificial Analysis.

Benchmarks in this capability (5)
ARC-AGI0 scores
BIG-Bench Hard1480 scores
GPQA Diamond1919 scores
MuSR1480 scores