powered by
etapx

0%

AI Benchmarks

37

Frontier models

16

Labs tracked

9

Evals in the index

July 15, 2026

Snapshot

AnthropicOpenAIxAIZ AIMetaGoogleAlibabaMiniMaxDeepSeekKimiXiaomiNVIDIAMistralAmazonMBZUAI IFMUpstageAnthropicOpenAIxAIZ AIMetaGoogleAlibabaMiniMaxDeepSeekKimiXiaomiNVIDIAMistralAmazonMBZUAI IFMUpstage

The board is live below — every model, every lab, one table

Glsrm Benchmarks · July 15, 2026

Independent-style analysis of frontier AI models and the APIs that serve them, across the three numbers that decide every deployment: intelligence (higher is better), output speed in tokens per second (higher is better), and blended price per million tokens (lower is better).

37

Frontier models

16

Labs tracked

9

Evals in the index

July 15, 2026

Snapshot

Intelligence

Higher is better

Intelligence Index · best model per lab

  • 1Claude Fable 5 (with fallback)60
  • 2GPT-5.6 Sol (max)59
  • 3Grok 4.5 (high)54
  • 4GLM-5.2 (max)51
  • 5Muse Spark 1.1 (xhigh)51
  • 6Gemini 3.5 Flash50
  • 7Qwen3.7 Max46
  • 8MiniMax-M344
  • 9DeepSeek V4 Pro (max)44

Speed

Higher is better

Median output tokens per second · best per lab

  • 1Qwen3.7 Max200
  • 2Nemotron 3 Ultra196
  • 3Gemini 3.5 Flash162
  • 4GLM-5.2 (max)147
  • 5Nova 2.0 Pro Preview (medium)123
  • 6Grok 4.5 (high)118
  • 7Muse Spark 1.1 (xhigh)118
  • 8Mistral Medium 3.5109
  • 9MiniMax-M383

Price

Lower is better

USD per 1M tokens, 3:1 blended · cheapest per lab

  • 1MiniMax-M3$0.53
  • 2DeepSeek V4 Pro (max)$0.54
  • 3MiMo-V2.5-Pro$0.54
  • 4Nemotron 3 Ultra$1.18
  • 5Kimi K2.6$1.71
  • 6Muse Spark 1.1 (xhigh)$2.00
  • 7GLM-5.2 (max)$2.15
  • 8Grok 4.5 (high)$3.00
  • 9Mistral Medium 3.5$3.00

Model comparison summary

Every model we track, ranked by Intelligence Index.

#ModelCreatorReleasedContextIntelligenceCodingAgenticSpeed (t/s)Blended $/1MLatency
1Claude Fable 5 (with fallback)AnthropicJun 20261M60775366$20.00117s
2GPT-5.6 Sol (max)OpenAIJul 20261M59775457$11.25119s
3Claude Opus 4.8 (max)AnthropicMay 20261M56744754$10.0025s
4GPT-5.6 Terra (max)OpenAIJul 20261M557747137$5.63161s
5GPT-5.5 (xhigh)OpenAIApr 2026922k55754567$11.2591s
6Grok 4.5 (high)xAIJul 2026500k547246118$3.009.7s
7Claude Opus 4.7 (max)AnthropicApr 20261M54744447$10.0019s
8Claude Sonnet 5 (max)AnthropicJun 20261M53724771$4.00215s
9GPT-5.6 Luna (max)OpenAIJul 20261M517146220$2.25115s
10GLM-5.2 (max)OpenZ AIJun 20261M516943147$2.1515s
11Muse Spark 1.1 (xhigh)MetaJul 20261.0M517138118$2.0019s
12Gemini 3.5 FlashGoogleMay 20261M507037162$3.3827s
13Claude Sonnet 4.6 (max)AnthropicFeb 20261M47634149$6.00124s
14Gemini 3.1 Pro PreviewGoogleFeb 20261M476921117$4.5040s
15Qwen3.7 MaxAlibabaMay 20261M466631200$3.7515s
16MiniMax-M3OpenMiniMaxJun 20261M44593583$0.5326s
17GPT-5.3 Codex (xhigh)OpenAIFeb 2026400k4485$4.81124s
18DeepSeek V4 Pro (max)OpenDeepSeekApr 20261M44593662$0.5472s
19Kimi K2.6OpenKimiApr 2026256k44623043$1.71106s
20Muse SparkMetaApr 2026262k435929
21MiMo-V2.5-ProOpenXiaomiApr 20261M42602955$0.5440s
22DeepSeek V4 Flash (max)OpenDeepSeekApr 20261M405631103$0.1856s
23GLM-5.1OpenZ AIApr 2026200k40563074$2.1553s
24GPT-5.4 mini (xhigh)OpenAIMar 2026400k405630167$1.6912s
25Qwen3.7 PlusAlibabaJun 20261M39562153$0.7040s
26MiniMax-M2.7OpenMiniMaxMar 2026205k38532659$0.5344s
27Nemotron 3 UltraOpenNVIDIAJun 2026262k384927196$1.1813s
28Grok 4.3 (high)xAIApr 20261M384224112$1.5623s
29Qwen3.5 397B A17BOpenAlibabaFeb 2026262k34482060$1.3555s
30Mistral Medium 3.5OpenMistralApr 2026256k304719109$3.0020s
31Claude 4.5 HaikuAnthropicOct 2025200k30441691$2.0022s
32Gemma 4 31BOpenGoogleApr 2026256k2943143550s
33gpt-oss-120b (high)OpenOpenAIAug 2025131k243013271$0.268.2s
34Nova 2.0 Pro Preview (medium)AmazonNov 2025256k22347123$3.4429s
35K2 Think V2OpenMBZUAI IFMDec 2025262k17212
36Solar Pro 3UpstageApr 2026128k14163
GPT-5.5 Pro (xhigh)OpenAIApr 2026922k

Intelligence Index

Composite of 10 evaluations spanning reasoning, knowledge, math, coding, and agentic tool use. Higher is better.

010203040506060Claude Fable 5 (with fall…59GPT-5.6 Sol (max)56Claude Opus 4.8 (max)55GPT-5.6 Terra (max)55GPT-5.5 (xhigh)54Grok 4.5 (high)54Claude Opus 4.7 (max)53Claude Sonnet 5 (max)51GPT-5.6 Luna (max)51GLM-5.2 (max)51Muse Spark 1.1 (xhigh)50Gemini 3.5 Flash47Claude Sonnet 4.6 (max)47Gemini 3.1 Pro Preview46Qwen3.7 Max44MiniMax-M344GPT-5.3 Codex (xhigh)44DeepSeek V4 Pro (max)44Kimi K2.643Muse Spark42MiMo-V2.5-Pro40DeepSeek V4 Flash (max)40GLM-5.140GPT-5.4 mini (xhigh)39Qwen3.7 Plus38MiniMax-M2.738Nemotron 3 Ultra38Grok 4.3 (high)34Qwen3.5 397B A17B30Mistral Medium 3.530Claude 4.5 Haiku29Gemma 4 31B24gpt-oss-120b (high)22Nova 2.0 Pro Preview (med…17K2 Think V214Solar Pro 3

Incorporates GPQA Diamond, Humanity's Last Exam, AIME 2025, LiveCodeBench, SciCode, IFBench, Terminal-Bench Hard, τ²-Bench, and more.

Intelligence vs. Price

Intelligence Index against blended USD per 1M tokens (3:1 input:output, log scale).

0102030405060$0.2$0.5$1$2$5$10$20Price (USD per 1M tokens, blended 3:1, log scale)Intelligence Index↖ Most attractive quadrantClaude Fable 5 (with…GPT-5.6 Sol (max)Claude Opus 4.8 (max)GPT-5.6 Terra (max)GPT-5.5 (xhigh)Grok 4.5 (high)Claude Opus 4.7 (max)Claude Sonnet 5 (max)GPT-5.6 Luna (max)GLM-5.2 (max)Muse Spark 1.1 (xhigh)Gemini 3.5 FlashClaude Sonnet 4.6 (ma…Gemini 3.1 Pro PreviewQwen3.7 MaxMiniMax-M3GPT-5.3 Codex (xhigh)DeepSeek V4 Pro (max)Kimi K2.6MiMo-V2.5-ProDeepSeek V4 Flash (ma…GLM-5.1GPT-5.4 mini (xhigh)Qwen3.7 PlusMiniMax-M2.7Nemotron 3 UltraGrok 4.3 (high)Qwen3.5 397B A17BMistral Medium 3.5Claude 4.5 Haikugpt-oss-120b (high)Nova 2.0 Pro Preview…

Up and to the left wins: more intelligence per dollar. Models without public API pricing are excluded.

Intelligence vs. Output Speed

Intelligence Index against median output tokens per second.

0102030405060050100150200250Output speed (tokens per second)Intelligence IndexMost attractive quadrant ↗Claude Fable 5 (with…GPT-5.6 Sol (max)Claude Opus 4.8 (max)GPT-5.6 Terra (max)GPT-5.5 (xhigh)Grok 4.5 (high)Claude Opus 4.7 (max)Claude Sonnet 5 (max)GPT-5.6 Luna (max)GLM-5.2 (max)Muse Spark 1.1 (xhigh)Gemini 3.5 FlashClaude Sonnet 4.6 (ma…Gemini 3.1 Pro PreviewQwen3.7 MaxMiniMax-M3GPT-5.3 Codex (xhigh)DeepSeek V4 Pro (max)Kimi K2.6MiMo-V2.5-ProDeepSeek V4 Flash (ma…GLM-5.1GPT-5.4 mini (xhigh)Qwen3.7 PlusMiniMax-M2.7Nemotron 3 UltraGrok 4.3 (high)Qwen3.5 397B A17BMistral Medium 3.5Claude 4.5 HaikuGemma 4 31Bgpt-oss-120b (high)Nova 2.0 Pro Preview…

Up and to the right wins: smart and fast. Speed is the median across providers serving each model.

Frontier Intelligence Over Time

Intelligence Index by release date. The dashed line tracks the running frontier.

2030405060Aug 25Oct 25Dec 25Feb 26Apr 26Jun 26gpt-oss-120b (high)Claude 4.5 HaikuGPT-5.3 Codex (xhigh)Claude Sonnet 4.6 (max)Claude Opus 4.7 (max)GPT-5.5 (xhigh)Claude Opus 4.8 (max)Claude Fable 5 (with fa…Frontier

Claude Fable 5 set the current frontier on June 9, 2026 — 36 days before this snapshot.

Coding Index

Composite of coding evaluations (LiveCodeBench, SciCode, Terminal-Bench Hard). Higher is better.

02040608077GPT-5.6 Sol (max)77GPT-5.6 Terra (max)77Claude Fable 5 (with fall…75GPT-5.5 (xhigh)74Claude Opus 4.8 (max)74Claude Opus 4.7 (max)72Grok 4.5 (high)72Claude Sonnet 5 (max)71GPT-5.6 Luna (max)71Muse Spark 1.1 (xhigh)70Gemini 3.5 Flash69GLM-5.2 (max)69Gemini 3.1 Pro Preview66Qwen3.7 Max63Claude Sonnet 4.6 (max)62Kimi K2.660MiMo-V2.5-Pro59DeepSeek V4 Pro (max)59MiniMax-M359Muse Spark56DeepSeek V4 Flash (max)56GPT-5.4 mini (xhigh)56Qwen3.7 Plus56GLM-5.153MiniMax-M2.749Nemotron 3 Ultra48Qwen3.5 397B A17B47Mistral Medium 3.544Claude 4.5 Haiku43Gemma 4 31B42Grok 4.3 (high)34Nova 2.0 Pro Preview (med…30gpt-oss-120b (high)21K2 Think V216Solar Pro 3

Agentic Index

Tool calling and long-horizon agent tasks (τ²-Bench, Terminal-Bench). Higher is better.

0102030405054GPT-5.6 Sol (max)53Claude Fable 5 (with fall…47GPT-5.6 Terra (max)47Claude Opus 4.8 (max)47Claude Sonnet 5 (max)46Grok 4.5 (high)46GPT-5.6 Luna (max)45GPT-5.5 (xhigh)44Claude Opus 4.7 (max)43GLM-5.2 (max)41Claude Sonnet 4.6 (max)38Muse Spark 1.1 (xhigh)37Gemini 3.5 Flash36DeepSeek V4 Pro (max)35MiniMax-M331DeepSeek V4 Flash (max)31Qwen3.7 Max30Kimi K2.630GPT-5.4 mini (xhigh)30GLM-5.129MiMo-V2.5-Pro29Muse Spark27Nemotron 3 Ultra26MiniMax-M2.724Grok 4.3 (high)21Gemini 3.1 Pro Preview21Qwen3.7 Plus20Qwen3.5 397B A17B19Mistral Medium 3.516Claude 4.5 Haiku14Gemma 4 31B13gpt-oss-120b (high)7Nova 2.0 Pro Preview (med…3Solar Pro 32K2 Think V2

Intelligence Breakdown

Individual evaluation scores (0–100) behind the Intelligence Index. Darker is better, normalized per column.

ModelGPQA DiamondHumanity's Last ExamSciCodeIFBenchTerminal-Bench Hardτ²-Bench TelecomAA-LCR (Long Context)CritPtMMMU-Pro
Claude Fable 5 (with fallback)92.653.360.263.562.998.570.028.6
GPT-5.6 Sol (max)94.147.256.172.765.985.173.732.383.4
Claude Opus 4.8 (max)92.045.753.562.258.394.467.720.9
GPT-5.6 Terra (max)92.541.853.971.257.686.374.030.080.7
GPT-5.5 (xhigh)93.544.356.175.960.693.974.327.179.9
Grok 4.5 (high)93.140.354.167.715.480.4
Claude Opus 4.7 (max)91.439.654.558.651.588.670.312.078.8
Claude Sonnet 5 (max)91.139.653.670.716.977.3
GPT-5.6 Luna (max)91.137.252.574.020.678.6
GLM-5.2 (max)89.540.150.573.350.899.171.320.9
Muse Spark 1.1 (xhigh)89.845.158.263.315.1
Gemini 3.5 Flash92.241.053.176.340.995.369.313.184.3
Claude Sonnet 4.6 (max)87.530.046.856.653.075.770.73.173.3
Gemini 3.1 Pro Preview94.144.758.977.153.895.672.717.782.4
Qwen3.7 Max92.338.148.880.550.894.769.013.4
MiniMax-M392.937.145.482.942.488.974.03.778.6
GPT-5.3 Codex (xhigh)91.539.953.275.453.086.074.016.978.5
DeepSeek V4 Pro (max)88.835.950.076.546.296.266.312.9
Kimi K2.691.135.953.576.043.995.969.78.079.4
Muse Spark88.439.951.575.945.591.569.711.380.5
MiMo-V2.5-Pro86.633.850.279.943.294.273.34.0
DeepSeek V4 Flash (max)89.432.144.979.235.695.063.07.1
GLM-5.186.828.043.876.343.297.762.34.6
GPT-5.4 mini (xhigh)87.526.649.973.352.383.369.310.073.3
Qwen3.7 Plus90.033.445.578.047.093.065.09.180.5
MiniMax-M2.787.428.147.075.739.484.868.70.6
Nemotron 3 Ultra86.726.639.981.436.483.367.03.1
Grok 4.3 (high)90.135.047.381.337.997.764.38.078.1
Qwen3.5 397B A17B89.327.342.078.840.995.665.71.777.3
Mistral Medium 3.574.812.839.668.833.394.261.00.064.9
Claude 4.5 Haiku67.29.743.354.327.354.770.30.058.6
Gemma 4 31B85.722.743.475.636.459.962.01.473.4
gpt-oss-120b (high)78.218.538.969.023.565.850.71.1
Nova 2.0 Pro Preview (medium)78.58.942.779.024.292.754.30.064.5
K2 Think V271.39.533.062.86.825.452.70.0
Solar Pro 372.410.124.771.27.686.327.00.0
GPT-5.5 Pro (xhigh)30.6

AIME 2025 and LiveCodeBench are retired for newer models and excluded here; MMMU-Pro applies to multimodal-evaluated models only.

Omniscience Index

Knowledge reliability from -100 to 100: correct answers score positive, hallucinated ones negative.

-40-200204040Claude Fable 5 (with fall…33Gemini 3.1 Pro Preview27Claude Opus 4.8 (max)26Grok 4.5 (high)26Claude Opus 4.7 (max)23Gemini 3.5 Flash22GPT-5.6 Sol (max)20GPT-5.5 (xhigh)18Grok 4.3 (high)18Muse Spark 1.1 (xhigh)15Claude Sonnet 5 (max)14Qwen3.7 Max12Claude Sonnet 4.6 (max)10GPT-5.3 Codex (xhigh)6Kimi K2.64Muse Spark4GLM-5.2 (max)4MiMo-V2.5-Pro2Qwen3.7 Plus2GLM-5.11MiniMax-M31MiniMax-M2.70GPT-5.6 Terra (max)-1Nemotron 3 Ultra-4Claude 4.5 Haiku-10DeepSeek V4 Pro (max)-11GPT-5.6 Luna (max)-19GPT-5.4 mini (xhigh)-23DeepSeek V4 Flash (max)-30Qwen3.5 397B A17B-34K2 Think V2-36Mistral Medium 3.5-45Gemma 4 31B-48Nova 2.0 Pro Preview (med…-50gpt-oss-120b (high)-54Solar Pro 3

A negative score means the model hallucinates more than it knows. Declining to answer scores zero — most models would rather guess.

GDPval Elo — Real-World Work

Elo from blind pairwise comparisons on real economically valuable work tasks, with web and shell access.

0500100015001760Claude Fable 5 (with fall…1748GPT-5.6 Sol (max)1607Claude Sonnet 5 (max)1600Claude Opus 4.8 (max)1593GPT-5.6 Terra (max)1592GPT-5.6 Luna (max)1535Grok 4.5 (high)1514GLM-5.2 (max)1500Claude Opus 4.7 (max)1494GPT-5.5 (xhigh)1395MiniMax-M31377Claude Sonnet 4.6 (max)1374Muse Spark 1.1 (xhigh)1349Gemini 3.5 Flash1307DeepSeek V4 Pro (max)1273Qwen3.7 Max1265MiMo-V2.5-Pro1257GLM-5.11190Kimi K2.61189DeepSeek V4 Flash (max)1171GPT-5.4 mini (xhigh)1164Nemotron 3 Ultra1158MiniMax-M2.71144Muse Spark1085Grok 4.3 (high)962Gemini 3.1 Pro Preview962Qwen3.5 397B A17B936Qwen3.7 Plus929Mistral Medium 3.5907Claude 4.5 Haiku804Gemma 4 31B799gpt-oss-120b (high)676Nova 2.0 Pro Preview (med…493Solar Pro 3370K2 Think V2

Higher is better. Judged across occupations from software engineering to financial analysis.

ITBench — SRE Incident Analysis

Average precision at full recall diagnosing live Kubernetes incidents. Higher is better.

0.000.100.200.300.400.500.56GPT-5.6 Sol (max)0.51GPT-5.6 Terra (max)0.47Claude Opus 4.7 (max)0.46GPT-5.5 (xhigh)0.43GLM-5.2 (max)0.42Qwen3.7 Max0.40GPT-5.6 Luna (max)0.40Gemini 3.5 Flash0.40GLM-5.10.40Claude Sonnet 4.6 (max)0.38DeepSeek V4 Pro (max)0.38MiMo-V2.5-Pro0.37Gemma 4 31B0.35GPT-5.4 mini (xhigh)0.34Qwen3.5 397B A17B0.33Grok 4.3 (high)0.32DeepSeek V4 Flash (max)0.31Kimi K2.60.30Gemini 3.1 Pro Preview0.27Claude 4.5 Haiku0.27MiniMax-M2.70.06gpt-oss-120b (high)

Models investigate real cluster telemetry to find root causes. Even the frontier tops out below 0.5 — ops work is far from solved.

Output Tokens Used to Run the Intelligence Suite

Total tokens generated answering the full evaluation suite, split into answer and reasoning tokens.

Answer tokensReasoning tokens0M50M100M150M200M250M300M304MClaude Sonnet 5 (max)234MDeepSeek V4 Flash (max)216MGPT-5.4 mini (xhigh)197MClaude Sonnet 4.6 (max)185MDeepSeek V4 Pro (max)165MKimi K2.6141MGLM-5.2 (max)125MGPT-5.6 Luna (max)122MGLM-5.1122MSolar Pro 3117MClaude Opus 4.8 (max)114MQwen3.7 Plus108MNemotron 3 Ultra106MK2 Think V2103MQwen3.7 Max100MClaude Opus 4.7 (max)96MMiMo-V2.5-Pro96MGPT-5.6 Terra (max)94MMuse Spark 1.1 (xhigh)91MMistral Medium 3.589MMiniMax-M388MClaude 4.5 Haiku88MQwen3.5 397B A17B87Mgpt-oss-120b (high)87MClaude Fable 5 (with fall…85MMiniMax-M2.783MGrok 4.3 (high)75MGemini 3.5 Flash72MGPT-5.5 (xhigh)70MGPT-5.6 Sol (max)60MGrok 4.5 (high)57MMuse Spark56MGemini 3.1 Pro Preview38MGemma 4 31B35MNova 2.0 Pro Preview (med…

Reasoning-heavy models can burn 20–40× more tokens thinking than answering — which is exactly why blended price alone undersells true cost.

Cost to Run the Intelligence Suite

USD to complete every evaluation in the Intelligence Index, including reasoning tokens. Lower is better.

$0$1,000$2,000$3,000$4,000$5,000$5,631Claude Fable 5 (with fall…$4,010Claude Sonnet 5 (max)$3,753Claude Opus 4.8 (max)$3,738Claude Opus 4.7 (max)$3,356Claude Sonnet 4.6 (max)$2,824GPT-5.6 Sol (max)$2,778GPT-5.5 (xhigh)$1,754GPT-5.6 Terra (max)$1,559Qwen3.7 Max$1,483Mistral Medium 3.5$1,095GPT-5.4 mini (xhigh)$1,041Gemini 3.5 Flash$925GLM-5.2 (max)$870GPT-5.6 Luna (max)$815Gemini 3.1 Pro Preview$659GLM-5.1$603Grok 4.5 (high)$564Claude 4.5 Haiku$548Muse Spark 1.1 (xhigh)$528Qwen3.5 397B A17B$435Nemotron 3 Ultra$407Nova 2.0 Pro Preview (med…$303Qwen3.7 Plus$288Grok 4.3 (high)$204MiniMax-M3$176DeepSeek V4 Pro (max)$99MiMo-V2.5-Pro$96gpt-oss-120b (high)$74DeepSeek V4 Flash (max)

The spread is real: the same suite costs $19 on gpt-oss-20B and over $4,600 on the priciest frontier models.

Output Speed

Median output tokens per second across providers serving each model. Higher is better.

050100150200250271gpt-oss-120b (high)220GPT-5.6 Luna (max)200Qwen3.7 Max196Nemotron 3 Ultra167GPT-5.4 mini (xhigh)162Gemini 3.5 Flash147GLM-5.2 (max)137GPT-5.6 Terra (max)123Nova 2.0 Pro Preview (med…118Grok 4.5 (high)118Muse Spark 1.1 (xhigh)117Gemini 3.1 Pro Preview112Grok 4.3 (high)109Mistral Medium 3.5103DeepSeek V4 Flash (max)91Claude 4.5 Haiku85GPT-5.3 Codex (xhigh)83MiniMax-M374GLM-5.171Claude Sonnet 5 (max)67GPT-5.5 (xhigh)66Claude Fable 5 (with fall…62DeepSeek V4 Pro (max)60Qwen3.5 397B A17B59MiniMax-M2.757GPT-5.6 Sol (max)55MiMo-V2.5-Pro54Claude Opus 4.8 (max)53Qwen3.7 Plus49Claude Sonnet 4.6 (max)47Claude Opus 4.7 (max)43Kimi K2.635Gemma 4 31B

Latency — Time to First Answer Token

Seconds from request to first answer token, including reasoning time. Lower is better.

0.0s50s100s150s200s8.2sgpt-oss-120b (high)9.7sGrok 4.5 (high)12sGPT-5.4 mini (xhigh)13sNemotron 3 Ultra15sQwen3.7 Max15sGLM-5.2 (max)19sMuse Spark 1.1 (xhigh)19sClaude Opus 4.7 (max)20sMistral Medium 3.522sClaude 4.5 Haiku23sGrok 4.3 (high)25sClaude Opus 4.8 (max)26sMiniMax-M327sGemini 3.5 Flash29sNova 2.0 Pro Preview (med…40sMiMo-V2.5-Pro40sQwen3.7 Plus40sGemini 3.1 Pro Preview44sMiniMax-M2.750sGemma 4 31B53sGLM-5.155sQwen3.5 397B A17B56sDeepSeek V4 Flash (max)72sDeepSeek V4 Pro (max)91sGPT-5.5 (xhigh)106sKimi K2.6115sGPT-5.6 Luna (max)117sClaude Fable 5 (with fall…119sGPT-5.6 Sol (max)124sClaude Sonnet 4.6 (max)124sGPT-5.3 Codex (xhigh)161sGPT-5.6 Terra (max)215sClaude Sonnet 5 (max)

Max-effort reasoning modes pay for their scores in wait time: the smartest configurations routinely think for one to two minutes.

Pricing — Input and Output

USD per 1M tokens by direction. Lower is better.

Input priceOutput price$0.0$10$20$30$40$50$50Claude Fable 5 (with fall…$30GPT-5.6 Sol (max)$30GPT-5.5 (xhigh)$25Claude Opus 4.8 (max)$25Claude Opus 4.7 (max)$15Claude Sonnet 4.6 (max)$15GPT-5.6 Terra (max)$14GPT-5.3 Codex (xhigh)$12Gemini 3.1 Pro Preview$10Claude Sonnet 5 (max)$7.5Qwen3.7 Max$10Nova 2.0 Pro Preview (med…$9Gemini 3.5 Flash$6Grok 4.5 (high)$7.5Mistral Medium 3.5$6GPT-5.6 Luna (max)$4.4GLM-5.2 (max)$4.4GLM-5.1$4.25Muse Spark 1.1 (xhigh)$5Claude 4.5 Haiku$4Kimi K2.6$4.5GPT-5.4 mini (xhigh)$2.5Grok 4.3 (high)$3.6Qwen3.5 397B A17B$2.675Nemotron 3 Ultra$1.6Qwen3.7 Plus$0.87DeepSeek V4 Pro (max)$0.87MiMo-V2.5-Pro$1.2MiniMax-M3$1.2MiniMax-M2.7$0.6gpt-oss-120b (high)$0.28DeepSeek V4 Flash (max)

Output tokens typically cost 2–4× input. Reasoning tokens bill as output, so thinking models multiply effective price.

Context Window

Maximum input tokens per request.

0k200k400k600k800k1M1.0MMuse Spark 1.1 (xhigh)1MClaude Fable 5 (with fall…1MGPT-5.6 Sol (max)1MClaude Opus 4.8 (max)1MGPT-5.6 Terra (max)1MClaude Opus 4.7 (max)1MClaude Sonnet 5 (max)1MGPT-5.6 Luna (max)1MGLM-5.2 (max)1MGemini 3.5 Flash1MClaude Sonnet 4.6 (max)1MGemini 3.1 Pro Preview1MQwen3.7 Max1MMiniMax-M31MDeepSeek V4 Pro (max)1MMiMo-V2.5-Pro1MDeepSeek V4 Flash (max)1MQwen3.7 Plus1MGrok 4.3 (high)922kGPT-5.5 (xhigh)922kGPT-5.5 Pro (xhigh)500kGrok 4.5 (high)400kGPT-5.3 Codex (xhigh)400kGPT-5.4 mini (xhigh)262kMuse Spark262kNemotron 3 Ultra262kQwen3.5 397B A17B262kK2 Think V2256kKimi K2.6256kMistral Medium 3.5256kGemma 4 31B256kNova 2.0 Pro Preview (med…205kMiniMax-M2.7200kGLM-5.1200kClaude 4.5 Haiku131kgpt-oss-120b (high)128kSolar Pro 3

Openness Index

Weights availability plus transparency of methodology and training data, 0–100.

02040608089K2 Think V283Nemotron 3 Ultra50DeepSeek V4 Pro (max)50DeepSeek V4 Flash (max)44GLM-5.2 (max)44GLM-5.139MiMo-V2.5-Pro39Qwen3.5 397B A17B39Gemma 4 31B39gpt-oss-120b (high)33MiniMax-M333Kimi K2.633Mistral Medium 3.522MiniMax-M2.711Claude 4.5 Haiku

Only models with published openness scores shown. K2 Think V2 and Nemotron 3 Ultra lead; most frontier labs publish nothing.

Latest Insights

Reporting from the eval desk

Methodology: indices are composites of public evaluations run independently with standardized prompts; speed and latency are medians measured across API providers over the trailing 72 hours. Benchmark data: public model-evaluation snapshot, July 15, 2026. Prices are list API prices and change frequently. Company logos identify the respective model creators.