MMODELYST
The score ledger

Changes

Every benchmark score on Modelyst is tracked in an append-only ledger. When a number moves between refreshes — a re-evaluation, a silent endpoint update, a harness change upstream — it lands here, with the old value, the new value, and the date. Last refresh: Jul 27, 2026.

Jul 27, 2026

35 changes · 34 first observations
Qwen3.5 2BGPQA Diamond45.632.5 13.1
Qwen3.5 4BGPQA Diamond77.168 9.1
Ministral 3 3BGPQA Diamond35.830.1 5.7
Gemma 4 E4BGPQA Diamond57.652.2 5.4
LFM2.5-8B-A1BGPQA Diamond51.346.6 4.7
Gemma 4 E4BIFBench44.240.6 3.6
Granite 4.0 350MGPQA Diamond20.323.7 3.4
Granite 4.0 MicroGPQA Diamond33.630.3 3.3
Granite 4.0 350MMATH11.214 2.8
LFM2.5-1.2B-InstructIFBench43.841 2.8
Gemma 4 E2BGPQA Diamond43.340.5 2.8
Granite 4.0 MicroIFBench24.822.1 2.7
Ministral 3 3BIFBench26.824.1 2.7
LFM2.5-8B-A1BIFBench55.653.3 2.3
LFM2 2.6BGPQA Diamond29.231.5 2.3
Gemma 4 E2BIFBench3836 2.0
Llama 3.2 Instruct 3BMATH48.947 1.9
Qwen3.5 0.8BMATH11.19.3 1.8
Qwen3.5 4BIFBench5250.2 1.8
Granite 4.0 350MIFBench16.815.1 1.7
Granite 4.0 H 1BGPQA Diamond26.324.6 1.7
LFM2 2.6BMATH76.875.3 1.5
Qwen3.5 2BIFBench31.530.4 1.1
Llama 3.2 Instruct 1BMATH26.627.7 1.1
Granite 4.0 H 1BIFBench26.225.1 1.1
Llama 3.2 Instruct 3BIFBench26.225.2 1.0
Llama 3.2 Instruct 1BIFBench22.723.5 0.8
LFM2 2.6BIFBench26.525.7 0.8
Qwen3.5 0.8BIFBench21.620.9 0.7
Qwen3.5 0.8BGPQA Diamond11.412 0.6
Granite 4.0 H 350MIFBench17.617.1 0.5

Jul 20, 2026

10 changes · 19 first observations
Llama 3.2 Instruct 1BMATH1426.6 12.6
LFM2 2.6BIFBench19.526.5 7.0
Granite 4.0 350MGPQA Diamond26.120.3 5.8
LFM2 2.6BGPQA Diamond30.629.2 1.4
Granite 4.0 350MIFBench15.916.8 0.9
Qwen3.5 0.8BGPQA Diamond11.111.4 0.3
Llama 3.2 Instruct 1BIFBench22.822.7 0.1
Qwen3.5 0.8BIFBench21.521.6 0.1

Jul 6, 2026

14 changes · 16 first observations
GPT-5 miniLiveCodeBench83.869.2 14.6
GPT-5 miniAIME90.785 5.7
GPT-5 miniHumanity's Last Exam19.714.6 5.1
GPT-5 miniTerminal-Bench Hard33.328.8 4.5
GPT-5 miniIFBench75.471.2 4.2
GPT-5 miniτ²-bench68.471.1 2.7
GPT-5 miniGPQA Diamond82.880.3 2.5
GPT-5 miniSciCode39.241 1.8
GPT-5 miniMMLU-Pro83.782.8 0.9

Jun 29, 2026

10 changes · 10 first observations
Nova 2.0 LiteAIME94.388.7 5.6
Nova 2.0 LiteLiveCodeBench71.166.3 4.8
Nova 2.0 LiteGPQA Diamond81.176.8 4.3
Nova 2.0 Liteτ²-bench72.875.7 2.9
Nova 2.0 LiteIFBench70.768.5 2.2
Nova 2.0 LiteMMLU-Pro81.881.3 0.5
Nova 2.0 LiteSciCode36.936.8 0.1

Source of each value: see the score's provenance on its model page. Scores via Artificial Analysis are medians across providers; changes can reflect re-evaluation, endpoint updates, or methodology changes upstream.