MMODELYST
Evals/SciCode
EVL

SciCode

benchmarkCodeaccuracy %
Leaderboard · 100 models
accuracy % — higher is better
1Claude Fable 5
60.2
2Gemini 3.1 Pro Preview
58.9
3Kimi K3
58.7
4Muse Spark 1.1
58.2
5GPT-5.4
56.6
6Gemini 3 Pro Preview
56.1
7GPT-5.5
56.1
8GPT-5.6 Sol (max)
56.1
9GPT-5.6 Sol
56
10Claude Opus 5
55.7
11GPT-5.2 Codex
54.6
12Claude Opus 4.7
54.5
13Grok 4.5
54.1
14GPT-5.6 Terra (max)
53.9
15Claude Sonnet 5
53.6
16Kimi K2.6
53.5
17Claude Opus 4.8
53.5
18GPT-5.3 Codex
53.2
19Gemini 3.5 Flash
53.1
20Gemini 3.6 Flash
52.7
21GPT-5.6 Luna (max)
52.5
22GPT-5.2
52.1
23Claude Opus 4.6
51.9
24GPT-5.6 Terra
51.6
25Muse Spark
51.5
26Gemini 3 Flash Preview
50.6
27GLM-5.2 (max)
50.5
28GPT-5.5 Instant (May 2026)
50.3
29Grok Build 0.1 0616
50.2
30MiMo-V2.5-Pro
50.2
31DeepSeek V4 Pro
50
32GPT-5.6 Luna
50
33GPT-5.4 mini
49.9
34Claude Opus 4.5
49.5
35Kimi K2.5
49
36Qwen3.7 Max
48.8
37GPT-5.5 Instant (May 2026)
48.6
38Hy3
47.6
39Kimi K2.7 Code
47.5
40Grok 4.3
47.3
41MiniMax-M2.7
47
42Qwen3.6 Max Preview
46.9
43GPT-5.4 nano
46.9
44Claude Sonnet 4.6
46.8
45o4-mini
46.5
46GLM-5
46.2
47Inkling
46.1
48Grok 4
45.7
49Grok 4.20 0309 v2
45.6
50Qwen3.7 Plus
45.5
51MiniMax-M3
45.4
52GLM-4.7
45.1
53DeepSeek V4 Flash
44.9
54Grok 4.20 0309
44.7
55Claude 4.5 Sonnet
44.7
56Motif 3 (Beta)
44.3
57Grok 4 Fast
44.2
58Grok 4.1 Fast
44.2
59DeepSeek V3.2 Speciale
44
60GLM-5.1
43.8
61GLM-5-Turbo
43.6
62GLM 5V Turbo
43.5
63Gemma 4 31B
43.4
64GPT-5.1
43.3
65Claude 4.5 Haiku
43.3
66Qwen3 Max Thinking
43.1
67MiMo-V2.5
43.1
68GPT-5
42.9
69Gemini 2.5 Pro
42.8
70Nova 2.0 Pro Preview
42.7
71MiniMax-M2.5
42.6
72GPT-5.1 Codex mini
42.6
73MiMo-V2-Pro
42.5
74Qwen3 235B A22B 2507
42.4
75Kimi K2 Thinking
42.4
76Ring-2.6-1T
42.4
77Agnes 2.5 Pro Alpha
42.2
78Qwen3.5 122B A10B
42
79Qwen3.5 397B A17B
42
80Gemini 3.1 Flash-Lite
41.9
81Nex-N2-Pro
41.8
82Gemini 2.5 Pro Preview (May' 25)
41.6
83Hy3-preview
41.2
84GPT-5 mini
41
85Cogito v2.1
41
86o3
41
87Claude 4.1 Opus
40.9
88GPT-5 Codex
40.9
89Gemini 3.5 Flash-Lite
40.9
90MiniMax-M2.1
40.7
91Doubao Seed Code
40.7
92Qwen3.6 Plus
40.7
93Grok 3 mini Reasoning
40.6
94DeepSeek V3.1 Terminus
40.6
95Gemini 2.5 Flash Preview (Sep '25)
40.5
96Qwen3.5 Omni Plus
40.5
97Step 3.5 Flash
40.4
98GPT-4.1 mini
40.4
99DeepSeek R1 0528 (May '25)
40.3
100Claude 3.7 Sonnet
40.3
Benchmark health
headroom

Plenty of room at the top — this benchmark still separates frontier models clearly.

57.3
top-10 mean
60.2
best
100
models
Recent changes
Gemini 3.6 Flash+52.7yesterday
Gemini 3.5 Flash-Lite+40.9yesterday
Claude Opus 5+55.7yesterday
Motif 3 (Beta)+44.3yesterday
G9v3-3B+17.7yesterday
What improves this score

Datasets & environments shown to raise it.

No data yet.