MMODELYST
Evals/AA Long-Context Reasoning
EVL

AA Long-Context Reasoning

benchmarkLong Contextaccuracy %
Leaderboard · 100 models
accuracy % — higher is better
1GPT-5.2 Codex
75.7
2GPT-5
75.6
3GPT-5.1
75
4Kimi K3
74.7
5GPT-5.5
74.3
6Claude Opus 4.5
74
7GPT-5.4
74
8KAT-Coder-Pro V1
74
9MiniMax-M3
74
10GPT-5.3 Codex
74
11GPT-5.6 Luna (max)
74
12GPT-5.6 Terra (max)
74
13GPT-5.6 Sol (max)
73.7
14MiMo-V2.5-Pro
73.3
15GPT-5.2
72.7
16Gemini 3.1 Pro Preview
72.7
17GLM-5.2 (max)
71.3
18GPT-5.6 Terra
71.3
19GPT-5.6 Sol
71
20Claude Opus 4.6
70.7
21Gemini 3 Pro Preview
70.7
22Claude Sonnet 4.6
70.7
23Claude Sonnet 5
70.7
24Claude Opus 4.7
70.3
25Claude 4.5 Haiku
70.3
26Claude Opus 5
70
27Claude Fable 5
70
28Qwen3.6 Max Preview
69.7
29Qwen3.6 Plus
69.7
30Kimi K2.6
69.7
31Gemini 3.6 Flash
69.7
32Muse Spark
69.7
33GPT-5.6 Luna
69.7
34GPT-5.4 mini
69.3
35Gemini 3.5 Flash
69.3
36o3
69.3
37DeepSeek V3.2 Exp
69
38GPT-5 Codex
69
39Qwen3.7 Max
69
40MiniMax-M2.7
68.7
41Qwen3.6 27B
68.7
42Grok 4
68
43Grok 4.1 Fast
68
44Nex-N2-Pro
67.7
45Grok 4.5
67.7
46Claude Opus 4.8
67.7
47Qwen3.5 27B
67.3
48GPT-5.1 Codex
67.3
49Qwen3 235B A22B 2507
67
50Nemotron 3 Ultra 550B A55B
67
51Qwen3.5 122B A10B
66.7
52Hy3
66.7
53MiMo-V2-Omni
66.7
54Kimi K2 Thinking
66.3
55Claude 4.1 Opus
66.3
56Gemini 3 Flash Preview
66.3
57Kimi K2.7 Code
66.3
58DeepSeek V4 Pro
66.3
59Qwen3 Max Thinking
66
60MiniMax-M2.5
66
61GPT-5 mini
66
62GPT-5.4 nano
66
63KAT Coder Pro V2
66
64Gemini 2.5 Pro
66
65Claude 4.5 Sonnet
65.7
66Qwen3.5 397B A17B
65.7
67Kimi K2.5
65.3
68Doubao Seed Code
65.3
69Gemini 3.1 Flash-Lite
65.3
70DeepSeek V3.2
65
71DeepSeek V3.1 Terminus
65
72Qwen3.7 Plus
65
73Grok Build 0.1 0616
64.7
74Grok 4 Fast
64.7
75Claude 4 Sonnet
64.7
76Gemini 2.5 Flash Preview (Sep '25)
64.3
77Ring-2.6-1T
64.3
78MiMo-V2-Flash (Feb 2026)
64.3
79Grok 4.3
64.3
80GLM-4.7
64
81GPT-5.5 Instant (May 2026)
64
82GPT-5 (ChatGPT)
63.7
83Agnes 2.5 Pro Alpha
63.7
84Qwen3.6 35B A3B
63.7
85MiMo-V2-Omni-0327
63.7
86Step 3.7 Flash
63.7
87GLM-5
63.3
88Inkling
63.3
89Muse Spark 1.1
63.3
90MiMo-V2-Flash
63
91DeepSeek V4 Flash
63
92GPT-5.1 Codex mini
62.7
93Qwen3.5 35B A3B
62.7
94MiMo-V2.5
62.7
95GLM-5.1
62.3
96Gemini 3.5 Flash-Lite
62
97Gemma 4 31B
62
98Gemini 2.5 Flash
61.7
99Motif 3 (Beta)
61.3
100GLM 5V Turbo
61
Benchmark health
active

Discriminating but climbing — the frontier is moving up this benchmark.

74.5
top-10 mean
75.7
best
100
models
Recent changes
Gemini 3.6 Flash+69.7yesterday
Claude Opus 5+70yesterday
Motif 3 (Beta)+61.3yesterday
G9v3-3B+34.7yesterday
What improves this score

Datasets & environments shown to raise it.

No data yet.