powered by
etapx

0%

Coding Agents · July 26, 2026

Glsrm Coding Agent Benchmarks

We measure real-world performance of coding agents on software engineering tasks, including cost, token usage, and execution time — across agents, models, and harnesses.

Configurations

52

Harnesses

7

Models

48

Snapshot

July 26, 2026

Highlights

Higher is better

Coding Agent Index

Equal-weight mean of the three suites · top configurations

  • 1Claude Code · Opus 5 (xhigh)66.7
  • 2Codex · GPT-5.6 Sol (max)66.6
  • 3Claude Code · Fable 5 (max) (with fallback)65.8
  • 4Claude Code · Opus 5 (max)65.5
  • 5Codex · GPT-5.6 Sol (xhigh)65.1
  • 6Grok Build · Grok 4.5 (high)64.4
  • 7Codex · GPT-5.6 Sol (high)64.1
  • 8Claude Code · Opus 5 (high)63.4
  • 9Codex · GPT-5.6 Terra (max)62.3

Lower is better

Cost per Task

Mean USD per completed task · cheapest configurations

  • 1Cursor CLI · Composer 2$0.04
  • 2Cursor CLI · Composer 2.5$0.08
  • 3Codex · GPT-5.6 Luna (low)$0.21
  • 4Claude Code · DeepSeek V4 Pro (high)$0.27
  • 5Codex · GPT-5.6 Luna (none)$0.35
  • 6Codex · GPT-5.6 Terra (none)$0.37
  • 7Codex · GPT-5.6 Luna (medium)$0.47
  • 8Codex · GPT-5.6 Terra (low)$0.48
  • 9Cursor CLI · Composer 2.5 Fast$0.55

Lower is better

Time per Task

Mean wall-clock minutes per task · fastest configurations

  • 1Codex · GPT-5.6 Terra (none)1.8m
  • 2Codex · GPT-5.6 Luna (low)1.9m
  • 3Codex · GPT-5.6 Luna (none)2.5m
  • 4Codex · GPT-5.6 Terra (low)2.8m
  • 5Codex · GPT-5.6 Sol (none)3.4m
  • 6Codex · GPT-5.6 Luna (medium)3.4m
  • 7Codex · GPT-5.6 Sol (low)3.7m
  • 8Codex · GPT-5.6 Terra (medium)4.3m
  • 9Codex · GPT-5.6 Sol (medium)5.2m

Coding agent comparison summary

Every harness × model configuration we track, ranked by Coding Agent Index.

#AgentModelLabIndexDeepSWETerm-BenchAtlas QnA$/TaskTokens/TaskTimeTurns
1Claude CodeAnthropicClaude Opus 5 (xhigh)Anthropic66.760.584.954.8$8.2321.7M23.6m153
2CodexOpenAIGPT-5.6 Sol (max)OpenAI66.668.787.743.3$7.0813.2M10.2m114
3Claude CodeAnthropicClaude Fable 5 (max) (with fallback)Anthropic65.866.182.548.9$11.7113.8M23.4m138
4Claude CodeAnthropicClaude Opus 5 (max)Anthropic65.563.184.548.9$8.9523.7M23.7m166
5CodexOpenAIGPT-5.6 Sol (xhigh)OpenAI65.167.086.142.2$5.249.9M7.4m96
6Grok BuildxAIGrok 4.5 (high)xAI64.459.985.348.1$2.593.6M16.5m61
7CodexOpenAIGPT-5.6 Sol (high)OpenAI64.164.982.544.9$4.148.1M6.3m86
8Claude CodeAnthropicClaude Opus 5 (high)Anthropic63.460.880.249.2$3.809.6M13.4m93
9CodexOpenAIGPT-5.6 Terra (max)OpenAI62.367.084.135.8$2.769.5M8.4m97
10Claude CodeAnthropicClaude Opus 5 (medium)Anthropic61.962.878.644.4$3.147.9M12.2m83
11CodexOpenAIGPT-5.5 (xhigh)OpenAI61.564.384.136.0$5.0712.3M10.1m106
12Kimi Code CLIMoonshot AIKimi K3Kimi61.363.783.736.6$3.1810.6M23.8m125
13CodexOpenAIGPT-5.6 Sol (medium)OpenAI60.664.077.840.1$2.995.8M5.2m72
14Claude CodeAnthropicClaude Opus 4.8 (max)Anthropic60.655.879.446.5$7.7017.7M23.1m166
15CodexOpenAIGPT-5.6 Luna (max)OpenAI58.763.479.832.8$1.5715.5M8m115
16Claude CodeAnthropicClaude Opus 4.8 (xhigh)Anthropic58.451.381.342.7$5.6713.6M17.6m136
17CodexOpenAIGPT-5.6 Terra (xhigh)OpenAI57.158.480.632.3$1.906.5M6.9m75
18Claude CodeAnthropicClaude Opus 5 (low)Anthropic56.856.974.239.2$2.185.1M9.5m64
19Claude CodeAnthropicClaude Opus 4.8 (high)Anthropic56.751.679.838.7$3.729.0M12.3m104
20CodexOpenAIGPT-5.6 Terra (high)OpenAI55.860.576.030.9$1.595.5M6.2m67
21CodexOpenAIGPT-5.6 Luna (xhigh)OpenAI54.756.676.231.2$1.2612.3M6.6m96
22CodexOpenAIGPT-5.5 (medium)OpenAI54.356.675.830.6$2.757.0M6.4m78
23CodexOpenAIGPT-5.6 Sol (low)OpenAI53.653.473.034.4$1.723.2M3.7m54
24Claude CodeAnthropicClaude Opus 4.8 (medium)Anthropic53.649.375.436.0$3.267.7M12.4m93
25OpencodeSSTMuse Spark 1.1 (xhigh)Meta53.554.373.033.3$1.4312.2M12.6m55
26CodexOpenAIGPT-5.6 Luna (high)OpenAI51.453.471.829.0$0.969.5M5.7m84
27Claude CodeAnthropicClaude Opus 4.7 (max)Anthropic50.340.173.837.1$5.6315.8M15.7m107
28OpencodeOpencodeClaude Opus 4.7 (medium)Anthropic49.939.575.434.9$2.937.5M12.2m54
29CodexOpenAIGPT-5.6 Terra (medium)OpenAI47.845.769.428.2$0.903.1M4.3m51
30Claude CodeAnthropicClaude Opus 4.8 (low)Anthropic47.441.073.028.2$2.155.1M8.5m67
31Claude CodeAnthropicClaude Opus 4.6 (medium)Anthropic46.470.622.3$1.284.4M8m34
32Cursor CLICursorGPT-5.5 (medium)OpenAI46.137.273.427.7$2.014.0M6.6m78
33Cursor CLICursorClaude Opus 4.7 (medium)Anthropic45.431.670.633.9$2.685.6M13.6m86
34CodexOpenAIGPT-5.6 Sol (none)OpenAI43.435.460.734.1$1.403.4M3.4m55
35Claude CodeAnthropicGLM-5.2Z AI43.228.671.929.0$6.516.5M25.1m127
36CodexOpenAIGPT-5.6 Luna (medium)OpenAI42.436.663.527.2$0.474.4M3.4m58
37Claude CodeAnthropicClaude Opus 4.7 (medium)Anthropic40.527.471.422.6$1.684.5M6.3m42
38CodexOpenAIGPT-5.4 (medium)OpenAI39.025.069.822.3$2.425.9M7.1m73
39Cursor CLICursorComposer 2.5 FastCursor38.215.967.531.2$0.554.2M6.8m117
40Cursor CLICursorComposer 2.5Cursor38.215.967.531.2$0.083.6M9.5m117
41Claude CodeAnthropicClaude Sonnet 4.6 (medium)Anthropic37.628.964.319.6$2.018.4M13.5m67
42Cursor CLICursorGPT-5.4 (medium)OpenAI36.816.765.528.2$1.554.0M8.1m26
43CodexOpenAIGPT-5.6 Terra (low)OpenAI36.729.857.522.8$0.481.5M2.8m37
44Claude CodeAnthropicGLM-5.1Z AI36.118.665.124.7$4.3325.9M19.6m174
45Claude CodeAnthropicQwen3.7 Plus (thinking)Alibaba36.019.265.123.7$6.238.7M10.6m146
46Claude CodeAnthropicKimi K2.6Kimi32.616.565.515.9$1.1911.5M41m131
47Claude CodeAnthropicDeepSeek V4 Pro (high)DeepSeek31.58.665.919.9$0.279.8M17.9m127
48Gemini CLIGoogleGemini 3.1 Pro (high)Google30.414.268.38.6$2.004.7M10.8m31
49Cursor CLICursorComposer 2Cursor27.50.064.717.7$0.042.9M8.6m28
50CodexOpenAIGPT-5.6 Luna (low)OpenAI25.110.349.615.3$0.211.5M1.9m35
51CodexOpenAIGPT-5.6 Terra (none)OpenAI23.713.339.318.5$0.371.1M1.8m34
52CodexOpenAIGPT-5.6 Luna (none)OpenAI20.46.537.317.5$0.353.6M2.5m56

Coding Agent Index

Equal-weight mean of three real-world suites: hard repository tasks, agentic terminal work, and codebase Q&A. Higher is better.

0.010.020.030.040.050.060.070.066.7Claude Code · Opus 5 (xhi…66.6Codex · GPT-5.6 Sol (max)65.8Claude Code · Fable 5 (ma…65.5Claude Code · Opus 5 (max)65.1Codex · GPT-5.6 Sol (xhig…64.4Grok Build · Grok 4.5 (hi…64.1Codex · GPT-5.6 Sol (high)63.4Claude Code · Opus 5 (hig…62.3Codex · GPT-5.6 Terra (ma…61.9Claude Code · Opus 5 (med…61.5Codex · GPT-5.5 (xhigh)61.3Kimi Code CLI · Kimi K360.6Codex · GPT-5.6 Sol (medi…60.6Claude Code · Opus 4.8 (m…58.7Codex · GPT-5.6 Luna (max)58.4Claude Code · Opus 4.8 (x…57.1Codex · GPT-5.6 Terra (xh…56.8Claude Code · Opus 5 (low)56.7Claude Code · Opus 4.8 (h…55.8Codex · GPT-5.6 Terra (hi…54.7Codex · GPT-5.6 Luna (xhi…54.3Codex · GPT-5.5 (medium)53.6Codex · GPT-5.6 Sol (low)53.6Claude Code · Opus 4.8 (m…53.5Opencode · Muse Spark 1.1…51.4Codex · GPT-5.6 Luna (hig…50.3Claude Code · Opus 4.7 (m…49.9Opencode · Opus 4.7 (medi…47.8Codex · GPT-5.6 Terra (me…47.4Claude Code · Opus 4.8 (l…46.4Claude Code · Opus 4.6 (m…46.1Cursor CLI · GPT-5.5 (med…45.4Cursor CLI · Opus 4.7 (me…43.4Codex · GPT-5.6 Sol (none)43.2Claude Code · GLM-5.242.4Codex · GPT-5.6 Luna (med…40.5Claude Code · Opus 4.7 (m…39.0Codex · GPT-5.4 (medium)38.2Cursor CLI · Composer 2.5…38.2Cursor CLI · Composer 2.537.6Claude Code · Sonnet 4.6…36.8Cursor CLI · GPT-5.4 (med…36.7Codex · GPT-5.6 Terra (lo…36.1Claude Code · GLM-5.136.0Claude Code · Qwen3.7 Plu…32.6Claude Code · Kimi K2.631.5Claude Code · DeepSeek V4…30.4Gemini CLI · Gemini 3.1 P…27.5Cursor CLI · Composer 225.1Codex · GPT-5.6 Luna (low)23.7Codex · GPT-5.6 Terra (no…20.4Codex · GPT-5.6 Luna (non…

Composed of DeepSWE (113 tasks), Terminal-Bench v2 (84 tasks), and SWE-Atlas-QnA (124 tasks). The agent is the unit of measurement — the same model lands differently in different harnesses.

DeepSWE

Solve rate on 113 real-world software engineering tasks in real repositories, %.

01020304050607069Codex · GPT-5.6 Sol (max)67Codex · GPT-5.6 Sol (xhig…67Codex · GPT-5.6 Terra (ma…66Claude Code · Fable 5 (ma…65Codex · GPT-5.6 Sol (high)64Codex · GPT-5.5 (xhigh)64Codex · GPT-5.6 Sol (medi…64Kimi Code CLI · Kimi K363Codex · GPT-5.6 Luna (max)63Claude Code · Opus 5 (max)63Claude Code · Opus 5 (med…61Claude Code · Opus 5 (hig…61Claude Code · Opus 5 (xhi…61Codex · GPT-5.6 Terra (hi…60Grok Build · Grok 4.5 (hi…58Codex · GPT-5.6 Terra (xh…57Claude Code · Opus 5 (low)57Codex · GPT-5.6 Luna (xhi…57Codex · GPT-5.5 (medium)56Claude Code · Opus 4.8 (m…54Opencode · Muse Spark 1.1…53Codex · GPT-5.6 Sol (low)53Codex · GPT-5.6 Luna (hig…52Claude Code · Opus 4.8 (h…51Claude Code · Opus 4.8 (x…49Claude Code · Opus 4.8 (m…46Codex · GPT-5.6 Terra (me…41Claude Code · Opus 4.8 (l…40Claude Code · Opus 4.7 (m…40Opencode · Opus 4.7 (medi…37Cursor CLI · GPT-5.5 (med…37Codex · GPT-5.6 Luna (med…35Codex · GPT-5.6 Sol (none)32Cursor CLI · Opus 4.7 (me…30Codex · GPT-5.6 Terra (lo…29Claude Code · Sonnet 4.6…29Claude Code · GLM-5.227Claude Code · Opus 4.7 (m…25Codex · GPT-5.4 (medium)19Claude Code · Qwen3.7 Plu…19Claude Code · GLM-5.117Cursor CLI · GPT-5.4 (med…17Claude Code · Kimi K2.616Cursor CLI · Composer 2.5…16Cursor CLI · Composer 2.514Gemini CLI · Gemini 3.1 P…13Codex · GPT-5.6 Terra (no…10Codex · GPT-5.6 Luna (low)9Claude Code · DeepSeek V4…7Codex · GPT-5.6 Luna (non…0Cursor CLI · Composer 2

Terminal-Bench v2

Solve rate on 84 agentic terminal tasks in a live shell, %.

02040608088Codex · GPT-5.6 Sol (max)86Codex · GPT-5.6 Sol (xhig…85Grok Build · Grok 4.5 (hi…85Claude Code · Opus 5 (xhi…85Claude Code · Opus 5 (max)84Codex · GPT-5.6 Terra (ma…84Codex · GPT-5.5 (xhigh)84Kimi Code CLI · Kimi K383Claude Code · Fable 5 (ma…83Codex · GPT-5.6 Sol (high)81Claude Code · Opus 4.8 (x…81Codex · GPT-5.6 Terra (xh…80Claude Code · Opus 5 (hig…80Codex · GPT-5.6 Luna (max)80Claude Code · Opus 4.8 (h…79Claude Code · Opus 4.8 (m…79Claude Code · Opus 5 (med…78Codex · GPT-5.6 Sol (medi…76Codex · GPT-5.6 Luna (xhi…76Codex · GPT-5.6 Terra (hi…76Codex · GPT-5.5 (medium)75Claude Code · Opus 4.8 (m…75Opencode · Opus 4.7 (medi…74Claude Code · Opus 5 (low)74Claude Code · Opus 4.7 (m…73Cursor CLI · GPT-5.5 (med…73Codex · GPT-5.6 Sol (low)73Opencode · Muse Spark 1.1…73Claude Code · Opus 4.8 (l…72Claude Code · GLM-5.272Codex · GPT-5.6 Luna (hig…71Claude Code · Opus 4.7 (m…71Claude Code · Opus 4.6 (m…71Cursor CLI · Opus 4.7 (me…70Codex · GPT-5.4 (medium)69Codex · GPT-5.6 Terra (me…68Gemini CLI · Gemini 3.1 P…68Cursor CLI · Composer 2.5…68Cursor CLI · Composer 2.566Claude Code · DeepSeek V4…66Cursor CLI · GPT-5.4 (med…66Claude Code · Kimi K2.665Claude Code · GLM-5.165Claude Code · Qwen3.7 Plu…65Cursor CLI · Composer 264Claude Code · Sonnet 4.6…64Codex · GPT-5.6 Luna (med…61Codex · GPT-5.6 Sol (none)58Codex · GPT-5.6 Terra (lo…50Codex · GPT-5.6 Luna (low)39Codex · GPT-5.6 Terra (no…37Codex · GPT-5.6 Luna (non…

SWE-Atlas-QnA

Rubric score on 124 codebase Q&A tasks, %.

0102030405055Claude Code · Opus 5 (xhi…49Claude Code · Opus 5 (hig…49Claude Code · Fable 5 (ma…49Claude Code · Opus 5 (max)48Grok Build · Grok 4.5 (hi…47Claude Code · Opus 4.8 (m…45Codex · GPT-5.6 Sol (high)44Claude Code · Opus 5 (med…43Codex · GPT-5.6 Sol (max)43Claude Code · Opus 4.8 (x…42Codex · GPT-5.6 Sol (xhig…40Codex · GPT-5.6 Sol (medi…39Claude Code · Opus 5 (low)39Claude Code · Opus 4.8 (h…37Claude Code · Opus 4.7 (m…37Kimi Code CLI · Kimi K336Codex · GPT-5.5 (xhigh)36Claude Code · Opus 4.8 (m…36Codex · GPT-5.6 Terra (ma…35Opencode · Opus 4.7 (medi…34Codex · GPT-5.6 Sol (low)34Codex · GPT-5.6 Sol (none)34Cursor CLI · Opus 4.7 (me…33Opencode · Muse Spark 1.1…33Codex · GPT-5.6 Luna (max)32Codex · GPT-5.6 Terra (xh…31Codex · GPT-5.6 Luna (xhi…31Cursor CLI · Composer 2.5…31Cursor CLI · Composer 2.531Codex · GPT-5.6 Terra (hi…31Codex · GPT-5.5 (medium)29Codex · GPT-5.6 Luna (hig…29Claude Code · GLM-5.228Codex · GPT-5.6 Terra (me…28Claude Code · Opus 4.8 (l…28Cursor CLI · GPT-5.4 (med…28Cursor CLI · GPT-5.5 (med…27Codex · GPT-5.6 Luna (med…25Claude Code · GLM-5.124Claude Code · Qwen3.7 Plu…23Codex · GPT-5.6 Terra (lo…23Claude Code · Opus 4.7 (m…22Claude Code · Opus 4.6 (m…22Codex · GPT-5.4 (medium)20Claude Code · DeepSeek V4…20Claude Code · Sonnet 4.6…19Codex · GPT-5.6 Terra (no…18Cursor CLI · Composer 218Codex · GPT-5.6 Luna (non…16Claude Code · Kimi K2.615Codex · GPT-5.6 Luna (low)9Gemini CLI · Gemini 3.1 P…

The Harness Effect — Claude Opus 4.7 (medium)

The same model, three harnesses. The scaffold alone moves the Coding Agent Index.

0.010.020.030.040.050.049.9Opencode45.4Cursor CLI40.5Claude Code

Identical model weights and settings; only the harness changes. Prompting, context management, and tooling are worth real points.

Points of Index

Harness Spread

Index points between a model's best and worst harness, for every model run in 2+ harnesses

  • 1Claude Opus 4.7 (medium) (3 harnesses)9.5
  • 2GPT-5.5 (medium) (2 harnesses)8.2
  • 3GPT-5.4 (medium) (2 harnesses)2.2

Cost per Task

Mean USD to complete one task, across all three suites. Lower is better.

$0.00$2.00$4.00$6.00$8.00$10.00$12.00$11.71Claude Code · Fable 5 (ma…$8.95Claude Code · Opus 5 (max)$8.23Claude Code · Opus 5 (xhi…$7.70Claude Code · Opus 4.8 (m…$7.08Codex · GPT-5.6 Sol (max)$6.51Claude Code · GLM-5.2$6.23Claude Code · Qwen3.7 Plu…$5.67Claude Code · Opus 4.8 (x…$5.63Claude Code · Opus 4.7 (m…$5.24Codex · GPT-5.6 Sol (xhig…$5.07Codex · GPT-5.5 (xhigh)$4.33Claude Code · GLM-5.1$4.14Codex · GPT-5.6 Sol (high)$3.80Claude Code · Opus 5 (hig…$3.72Claude Code · Opus 4.8 (h…$3.26Claude Code · Opus 4.8 (m…$3.18Kimi Code CLI · Kimi K3$3.14Claude Code · Opus 5 (med…$2.99Codex · GPT-5.6 Sol (medi…$2.93Opencode · Opus 4.7 (medi…$2.76Codex · GPT-5.6 Terra (ma…$2.75Codex · GPT-5.5 (medium)$2.68Cursor CLI · Opus 4.7 (me…$2.59Grok Build · Grok 4.5 (hi…$2.42Codex · GPT-5.4 (medium)$2.18Claude Code · Opus 5 (low)$2.15Claude Code · Opus 4.8 (l…$2.01Cursor CLI · GPT-5.5 (med…$2.01Claude Code · Sonnet 4.6…$2.00Gemini CLI · Gemini 3.1 P…$1.90Codex · GPT-5.6 Terra (xh…$1.72Codex · GPT-5.6 Sol (low)$1.68Claude Code · Opus 4.7 (m…$1.59Codex · GPT-5.6 Terra (hi…$1.57Codex · GPT-5.6 Luna (max)$1.55Cursor CLI · GPT-5.4 (med…$1.43Opencode · Muse Spark 1.1…$1.40Codex · GPT-5.6 Sol (none)$1.28Claude Code · Opus 4.6 (m…$1.26Codex · GPT-5.6 Luna (xhi…$1.19Claude Code · Kimi K2.6$0.96Codex · GPT-5.6 Luna (hig…$0.90Codex · GPT-5.6 Terra (me…$0.55Cursor CLI · Composer 2.5…$0.48Codex · GPT-5.6 Terra (lo…$0.47Codex · GPT-5.6 Luna (med…$0.37Codex · GPT-5.6 Terra (no…$0.35Codex · GPT-5.6 Luna (non…$0.27Claude Code · DeepSeek V4…$0.21Codex · GPT-5.6 Luna (low)$0.08Cursor CLI · Composer 2.5$0.04Cursor CLI · Composer 2

Measured mean spend per task at list API prices, cache discounts included. The spread is the story: the priciest configuration costs roughly 290× the cheapest.

Coding Agent Index vs. Cost per Task

Capability against mean USD per task (log scale).

010203040506070$0.05$0.10$0.20$0.50$1.00$2.00$5.00$10.00MedianCost per task (USD, log scale)Coding Agent Index↖ Most attractive quadrantCodex · GPT-5.6 Sol…Claude Code · Opus…Claude Code · Opus…Claude Code · Fable…

Up and to the left wins: more solved tasks per dollar. Open-weight models power most of the value corner.

Token Usage per Task

Mean tokens consumed per task, split into fresh input, cache reads, and output.

Fresh inputCache readsOutput0M5M10M15M20M25M25.9MClaude Code · GLM-5.123.7MClaude Code · Opus 5 (max)21.7MClaude Code · Opus 5 (xhi…17.7MClaude Code · Opus 4.8 (m…15.8MClaude Code · Opus 4.7 (m…15.5MCodex · GPT-5.6 Luna (max)13.8MClaude Code · Fable 5 (ma…13.6MClaude Code · Opus 4.8 (x…13.2MCodex · GPT-5.6 Sol (max)12.3MCodex · GPT-5.6 Luna (xhi…12.3MCodex · GPT-5.5 (xhigh)12.2MOpencode · Muse Spark 1.1…11.5MClaude Code · Kimi K2.610.6MKimi Code CLI · Kimi K39.9MCodex · GPT-5.6 Sol (xhig…9.8MClaude Code · DeepSeek V4…9.6MClaude Code · Opus 5 (hig…9.5MCodex · GPT-5.6 Luna (hig…9.5MCodex · GPT-5.6 Terra (ma…9.0MClaude Code · Opus 4.8 (h…8.7MClaude Code · Qwen3.7 Plu…8.4MClaude Code · Sonnet 4.6…8.1MCodex · GPT-5.6 Sol (high)7.9MClaude Code · Opus 5 (med…7.7MClaude Code · Opus 4.8 (m…7.5MOpencode · Opus 4.7 (medi…7.0MCodex · GPT-5.5 (medium)6.5MClaude Code · GLM-5.26.5MCodex · GPT-5.6 Terra (xh…5.9MCodex · GPT-5.4 (medium)5.8MCodex · GPT-5.6 Sol (medi…5.6MCursor CLI · Opus 4.7 (me…5.5MCodex · GPT-5.6 Terra (hi…5.1MClaude Code · Opus 4.8 (l…5.1MClaude Code · Opus 5 (low)4.7MGemini CLI · Gemini 3.1 P…4.5MClaude Code · Opus 4.7 (m…4.4MCodex · GPT-5.6 Luna (med…4.4MClaude Code · Opus 4.6 (m…4.2MCursor CLI · Composer 2.5…4.0MCursor CLI · GPT-5.4 (med…4.0MCursor CLI · GPT-5.5 (med…3.6MCursor CLI · Composer 2.53.6MGrok Build · Grok 4.5 (hi…3.6MCodex · GPT-5.6 Luna (non…3.4MCodex · GPT-5.6 Sol (none)3.2MCodex · GPT-5.6 Sol (low)3.1MCodex · GPT-5.6 Terra (me…2.9MCursor CLI · Composer 21.5MCodex · GPT-5.6 Terra (lo…1.5MCodex · GPT-5.6 Luna (low)1.1MCodex · GPT-5.6 Terra (no…

Agents read far more than they write — cache reads are the overwhelming majority of tokens everywhere. Output is the thin dark sliver on top.

Cache Hit Rate

Share of context reads served from prompt cache, %. Higher is better for cost.

0%10%20%30%40%50%50%Opencode · Opus 4.7 (medi…50%Claude Code · Opus 5 (max)50%Claude Code · Opus 5 (xhi…50%Claude Code · Opus 4.7 (m…50%Claude Code · Opus 4.8 (h…50%Claude Code · Opus 5 (hig…50%Claude Code · Opus 4.8 (x…50%Claude Code · Opus 5 (med…49%Claude Code · Opus 4.8 (l…49%Claude Code · Opus 4.8 (m…49%Claude Code · Opus 4.8 (m…49%Claude Code · Opus 5 (low)49%Claude Code · Fable 5 (ma…49%Claude Code · Opus 4.7 (m…49%Cursor CLI · Opus 4.7 (me…49%Claude Code · Kimi K2.649%Claude Code · Sonnet 4.6…49%Codex · GPT-5.5 (xhigh)49%Codex · GPT-5.5 (medium)49%Cursor CLI · Composer 2.5…49%Cursor CLI · Composer 2.549%Cursor CLI · Composer 249%Codex · GPT-5.4 (medium)49%Codex · GPT-5.6 Sol (none)49%Claude Code · GLM-5.149%Opencode · Muse Spark 1.1…49%Kimi Code CLI · Kimi K349%Codex · GPT-5.6 Luna (max)49%Claude Code · Opus 4.6 (m…49%Grok Build · Grok 4.5 (hi…48%Codex · GPT-5.6 Terra (ma…48%Codex · GPT-5.6 Luna (xhi…48%Codex · GPT-5.6 Terra (xh…48%Codex · GPT-5.6 Luna (hig…48%Codex · GPT-5.6 Terra (hi…48%Codex · GPT-5.6 Sol (high)48%Codex · GPT-5.6 Sol (xhig…48%Codex · GPT-5.6 Sol (max)48%Codex · GPT-5.6 Sol (medi…48%Cursor CLI · GPT-5.5 (med…48%Codex · GPT-5.6 Terra (me…48%Codex · GPT-5.6 Luna (non…48%Codex · GPT-5.6 Luna (med…48%Codex · GPT-5.6 Sol (low)48%Gemini CLI · Gemini 3.1 P…48%Codex · GPT-5.6 Terra (lo…47%Claude Code · DeepSeek V4…47%Codex · GPT-5.6 Terra (no…47%Cursor CLI · GPT-5.4 (med…47%Codex · GPT-5.6 Luna (low)46%Claude Code · Qwen3.7 Plu…16%Claude Code · GLM-5.2

Harnesses that keep context stable cache better. Every point of hit rate is money: cached reads bill at a tenth of the fresh-input price.

Coding Agent Index vs. Total Tokens

Capability against mean total tokens per task (millions).

0102030405060700M5M10M15M20M25MMedianTotal tokens per task (millions)Coding Agent Index↖ More capability per tokenCodex · GPT-5.6 Sol…Claude Code · Fable…Claude Code · Opus…Claude Code · Opus…Claude Code · GLM-5…

Reading more of the repo correlates with solving more of it — but the best harnesses get more index per token read.

Execution Time per Task

Mean wall-clock minutes from task start to the agent declaring done. Lower is better.

0m10m20m30m40m1.8mCodex · GPT-5.6 Terra (no…1.9mCodex · GPT-5.6 Luna (low)2.5mCodex · GPT-5.6 Luna (non…2.8mCodex · GPT-5.6 Terra (lo…3.4mCodex · GPT-5.6 Sol (none)3.4mCodex · GPT-5.6 Luna (med…3.7mCodex · GPT-5.6 Sol (low)4.3mCodex · GPT-5.6 Terra (me…5.2mCodex · GPT-5.6 Sol (medi…5.7mCodex · GPT-5.6 Luna (hig…6.2mCodex · GPT-5.6 Terra (hi…6.3mCodex · GPT-5.6 Sol (high)6.3mClaude Code · Opus 4.7 (m…6.4mCodex · GPT-5.5 (medium)6.6mCodex · GPT-5.6 Luna (xhi…6.6mCursor CLI · GPT-5.5 (med…6.8mCursor CLI · Composer 2.5…6.9mCodex · GPT-5.6 Terra (xh…7.1mCodex · GPT-5.4 (medium)7.4mCodex · GPT-5.6 Sol (xhig…8mCodex · GPT-5.6 Luna (max)8mClaude Code · Opus 4.6 (m…8.1mCursor CLI · GPT-5.4 (med…8.4mCodex · GPT-5.6 Terra (ma…8.5mClaude Code · Opus 4.8 (l…8.6mCursor CLI · Composer 29.5mClaude Code · Opus 5 (low)9.5mCursor CLI · Composer 2.510.1mCodex · GPT-5.5 (xhigh)10.2mCodex · GPT-5.6 Sol (max)10.6mClaude Code · Qwen3.7 Plu…10.8mGemini CLI · Gemini 3.1 P…12.2mClaude Code · Opus 5 (med…12.2mOpencode · Opus 4.7 (medi…12.3mClaude Code · Opus 4.8 (h…12.4mClaude Code · Opus 4.8 (m…12.6mOpencode · Muse Spark 1.1…13.4mClaude Code · Opus 5 (hig…13.5mClaude Code · Sonnet 4.6…13.6mCursor CLI · Opus 4.7 (me…15.7mClaude Code · Opus 4.7 (m…16.5mGrok Build · Grok 4.5 (hi…17.6mClaude Code · Opus 4.8 (x…17.9mClaude Code · DeepSeek V4…19.6mClaude Code · GLM-5.123.1mClaude Code · Opus 4.8 (m…23.4mClaude Code · Fable 5 (ma…23.6mClaude Code · Opus 5 (xhi…23.7mClaude Code · Opus 5 (max)23.8mKimi Code CLI · Kimi K325.1mClaude Code · GLM-5.241mClaude Code · Kimi K2.6

Includes model latency, tool calls, builds, and test runs. Fast models in lean harnesses finish in ~10 minutes; deliberate configurations take nearly three times as long.

Coding Agent Index vs. Execution Time

Capability against mean wall-clock minutes per task.

0102030405060700m10m20m30m40mMedianExecution time per task (minutes)Coding Agent Index↖ Capable and quickCodex · GPT-5.6 Sol…Claude Code · Fable…Claude Code · Opus…Claude Code · Opus…Kimi Code CLI · Kim…Claude Code · GLM-5…Claude Code · Kimi…

Up and to the left wins: capable and quick. Slow is only worth it if the index follows.

Turns per Task

Mean assistant turns (tool-call rounds) per task.

050100150174Claude Code · GLM-5.1166Claude Code · Opus 5 (max)166Claude Code · Opus 4.8 (m…153Claude Code · Opus 5 (xhi…146Claude Code · Qwen3.7 Plu…138Claude Code · Fable 5 (ma…136Claude Code · Opus 4.8 (x…131Claude Code · Kimi K2.6127Claude Code · GLM-5.2127Claude Code · DeepSeek V4…125Kimi Code CLI · Kimi K3117Cursor CLI · Composer 2.5…117Cursor CLI · Composer 2.5115Codex · GPT-5.6 Luna (max)114Codex · GPT-5.6 Sol (max)107Claude Code · Opus 4.7 (m…106Codex · GPT-5.5 (xhigh)104Claude Code · Opus 4.8 (h…97Codex · GPT-5.6 Terra (ma…96Codex · GPT-5.6 Sol (xhig…96Codex · GPT-5.6 Luna (xhi…93Claude Code · Opus 5 (hig…93Claude Code · Opus 4.8 (m…86Codex · GPT-5.6 Sol (high)86Cursor CLI · Opus 4.7 (me…84Codex · GPT-5.6 Luna (hig…83Claude Code · Opus 5 (med…78Codex · GPT-5.5 (medium)78Cursor CLI · GPT-5.5 (med…75Codex · GPT-5.6 Terra (xh…73Codex · GPT-5.4 (medium)72Codex · GPT-5.6 Sol (medi…67Codex · GPT-5.6 Terra (hi…67Claude Code · Opus 4.8 (l…67Claude Code · Sonnet 4.6…64Claude Code · Opus 5 (low)61Grok Build · Grok 4.5 (hi…58Codex · GPT-5.6 Luna (med…56Codex · GPT-5.6 Luna (non…55Opencode · Muse Spark 1.1…55Codex · GPT-5.6 Sol (none)54Codex · GPT-5.6 Sol (low)54Opencode · Opus 4.7 (medi…51Codex · GPT-5.6 Terra (me…42Claude Code · Opus 4.7 (m…37Codex · GPT-5.6 Terra (lo…35Codex · GPT-5.6 Luna (low)34Claude Code · Opus 4.6 (m…34Codex · GPT-5.6 Terra (no…31Gemini CLI · Gemini 3.1 P…28Cursor CLI · Composer 226Cursor CLI · GPT-5.4 (med…

More turns means more, smaller steps — not necessarily better results. Turn count tracks harness style more than capability.

Run Specifications

Every configuration runs the same way, so the numbers compare clean.

Environment
Fresh container per task, repo pinned to a fixed commit, network limited to package mirrors.
Attempts
One attempt per task (pass@1), no retries, no human nudges.
Configuration
Each harness runs at default settings with its recommended model configuration.
Budget
Hard cap of 60 minutes wall-clock per task; runs that exceed it score zero.
Cost accounting
List API prices at snapshot date; cache reads billed at 10% of the input rate.
Reporting
Cost, tokens, time, and turns are means across all completed tasks in the three suites.

Frequently Asked Questions

What is the Coding Agent Index?

The equal-weight mean of a configuration's scores on the three task suites. One number for how much real software work gets done — no extra weighting tricks, no style points.

What do the three suites actually test?

DeepSWE is 113 real-world software-engineering tasks in real repositories, graded end to end. Terminal-Bench v2 is 84 multi-step jobs in a live shell — builds, migrations, debugging, ops. SWE-Atlas-QnA is 124 questions that require navigating a large codebase and answering precisely.

How are tasks scored?

Implementation and terminal tasks are pass@1: one attempt, and the test suite either passes or it doesn't. Codebase Q&A earns partial credit against a rubric. Nothing is cherry-picked or re-run.

What counts as execution time?

Wall-clock from handing the agent a task to the agent declaring done — model latency, tool calls, builds, and test runs included. It's the number you actually wait.

Why track tokens at all?

Because agents read far more than they write. Cache reads dominate the bill at a 10×-discounted rate, so two agents with the same index can differ several-fold in cost. The token mix is the why behind the cost chart.

Why does the same model score differently across harnesses?

The harness decides what the model sees and which tools it gets — system prompts, context management, edit formats, test loops. Same engine, different car.

Latest Agent Insights

Reporting from the agents desk

Methodology: every configuration runs the same three suites — DeepSWE (113 tasks), Terminal-Bench v2 (84 tasks), and SWE-Atlas-QnA (124 tasks) — and the Coding Agent Index is their equal-weight mean. Suite design and metric definitions follow a standard public coding-agents methodology. Figures are Glsrm editorial estimates calibrated to our model benchmark table, not any external published results. Cost per task is derived from each run's mean token mix at list API prices, with cache reads billed at 10% of the input rate. Prices change frequently. Logos identify the respective model creators.