powered by
etapx

0%

Coding Agents

POWER IN AI AGENTSMEASURED FOR PEAK OUTPUTON REAL SOFTWARE WORK

THE PERFECT SETUPHARNESS AND MODEL PAIREDTO UNLOCK YOUR DRIVE

CRAFTED FROM REAL-WORLD AGENT DATA TO DELIVERRECOMMENDATIONS FOR OUR COMMUNITY

Real software-engineering tasks, run through complete agent stacks — harness plus model — and scored on what actually ships: solve rate across three task suites (higher is better), dollars per task, tokens consumed, and minutes on the clock (all lower is better).

43

Configurations

6

Harnesses

39

Models

July 15, 2026

Snapshot

Dive into the data ↓

Coding Agent Index

Higher is better

Equal-weight mean of the three suites · top configurations

  • 1Codex · GPT-5.6 Sol (max)80.0
  • 2Codex · GPT-5.6 Sol (xhigh)78.7
  • 3Codex · GPT-5.6 Terra (max)77.4
  • 4Claude Code · Fable 5 (max) (with fallback)77.2
  • 5Codex · GPT-5.6 Sol (high)77.1
  • 6Codex · GPT-5.5 (xhigh)76.4
  • 7Grok Build · Grok 4.5 (high)76.4
  • 8Codex · GPT-5.6 Sol (medium)74.6
  • 9Codex · GPT-5.6 Luna (max)74.6

Cost per Task

Lower is better

Mean USD per completed task · cheapest configurations

  • 1Cursor CLI · Composer 2$0.04
  • 2Cursor CLI · Composer 2.5$0.08
  • 3Codex · GPT-5.6 Luna (low)$0.21
  • 4Claude Code · DeepSeek V4 Pro (high)$0.27
  • 5Codex · GPT-5.6 Luna (none)$0.35
  • 6Codex · GPT-5.6 Terra (none)$0.37
  • 7Codex · GPT-5.6 Luna (medium)$0.47
  • 8Codex · GPT-5.6 Terra (low)$0.48
  • 9Cursor CLI · Composer 2.5 Fast$0.55

Time per Task

Lower is better

Mean wall-clock minutes per task · fastest configurations

  • 1Codex · GPT-5.6 Terra (none)1.8m
  • 2Codex · GPT-5.6 Luna (low)1.9m
  • 3Codex · GPT-5.6 Luna (none)2.5m
  • 4Codex · GPT-5.6 Terra (low)2.8m
  • 5Codex · GPT-5.6 Luna (medium)3.4m
  • 6Codex · GPT-5.6 Sol (none)3.4m
  • 7Codex · GPT-5.6 Sol (low)3.7m
  • 8Codex · GPT-5.6 Terra (medium)4.3m
  • 9Codex · GPT-5.6 Sol (medium)5.2m

Coding agent comparison summary

Every harness × model configuration we track, ranked by Coding Agent Index.

#AgentModelLabIndexDeepSWETerm-BenchAtlas QnA$/TaskTokens/TaskTimeTurns
1CodexOpenAIGPT-5.6 Sol (max)OpenAI80.068.787.783.6$7.0813.2M10.2m114
2CodexOpenAIGPT-5.6 Sol (xhigh)OpenAI78.767.086.182.99.9M7.4m96
3CodexOpenAIGPT-5.6 Terra (max)OpenAI77.467.084.181.1$2.769.5M8.4m97
4Claude CodeAnthropicClaude Fable 5 (max) (with fallback)Anthropic77.266.182.183.3$11.7513.9M23.5m138
5CodexOpenAIGPT-5.6 Sol (high)OpenAI77.164.982.583.88.1M6.3m86
6CodexOpenAIGPT-5.5 (xhigh)OpenAI76.464.384.180.8$5.0712.3M10.1m106
7Grok BuildxAIGrok 4.5 (high)xAI76.459.985.383.9$2.593.6M16.5m61
8CodexOpenAIGPT-5.6 Sol (medium)OpenAI74.664.077.882.05.8M5.2m72
9CodexOpenAIGPT-5.6 Luna (max)OpenAI74.663.479.880.6$1.5715.5M8m115
10CodexOpenAIGPT-5.6 Terra (xhigh)OpenAI73.258.480.680.6$1.906.5M6.9m75
11Claude CodeAnthropicClaude Opus 4.8 (max)Anthropic72.655.879.482.5$7.7017.8M23.1m166
12CodexOpenAIGPT-5.6 Terra (high)OpenAI71.860.576.078.8$1.595.5M6.2m67
13CodexOpenAIGPT-5.4 (medium)OpenAI71.169.872.4$2.275.7M7.1m71
14Claude CodeAnthropicClaude Opus 4.6 (medium)Anthropic71.170.271.9$1.264.4M8m34
15CodexOpenAIGPT-5.6 Luna (xhigh)OpenAI70.856.676.279.6$1.2612.3M6.6m96
16CodexOpenAIGPT-5.5 (medium)OpenAI70.556.675.879.1$2.757.0M6.4m78
17CodexOpenAIGPT-5.6 Sol (low)OpenAI69.053.473.080.73.2M3.7m54
18Cursor CLICursorGPT-5.4 (medium)OpenAI68.864.772.9$1.523.8M8.3m19
19OpencodeSSTMuse Spark 1.1 (xhigh)Meta68.654.373.078.4$1.4312.2M12.6m55
20CodexOpenAIGPT-5.6 Luna (high)OpenAI67.953.471.878.6$0.969.5M5.7m84
21Claude CodeAnthropicClaude Opus 4.8 (medium)Anthropic67.049.375.076.8$3.267.7M12.4m93
22Cursor CLICursorComposer 2Cursor66.864.768.9$0.042.9M8.6m26
23Claude CodeAnthropicClaude Opus 4.7 (max)Anthropic65.040.173.881.0$5.6415.8M15.8m107
24OpencodeOpencodeClaude Opus 4.7 (medium)Anthropic64.539.575.079.0$2.937.5M12.2m54
25CodexOpenAIGPT-5.6 Terra (medium)OpenAI64.245.769.477.4$0.903.1M4.3m51
26Cursor CLICursorGPT-5.5 (medium)OpenAI61.937.273.475.0$2.014.0M6.6m78
27Cursor CLICursorClaude Opus 4.7 (medium)Anthropic60.231.670.678.4$2.685.6M13.6m86
28CodexOpenAIGPT-5.6 Luna (medium)OpenAI58.836.663.576.2$0.474.4M3.4m58
29CodexOpenAIGPT-5.6 Sol (none)OpenAI58.435.460.779.1$1.403.4M3.4m55
30Claude CodeAnthropicGLM-5.2Z AI57.928.671.673.6$6.476.5M25.2m127
31Claude CodeAnthropicClaude Opus 4.7 (medium)Anthropic56.827.471.471.7$1.684.5M6.3m42
32Claude CodeAnthropicClaude Sonnet 4.6 (medium)Anthropic54.228.963.570.3$1.978.4M13.7m67
33CodexOpenAIGPT-5.6 Terra (low)OpenAI53.829.857.574.1$0.481.5M2.8m37
34Claude CodeAnthropicGLM-5.1Z AI52.318.665.173.2$4.3325.9M19.6m174
35Claude CodeAnthropicQwen3.7 Plus (thinking)Alibaba52.019.265.171.8$6.238.7M10.6m146
36Cursor CLICursorComposer 2.5 FastCursor51.815.966.972.5$0.554.3M6.8m117
37Cursor CLICursorComposer 2.5Cursor51.815.966.972.5$0.083.6M9.7m117
38Claude CodeAnthropicDeepSeek V4 Pro (high)DeepSeek47.38.665.567.8$0.279.8M17.9m127
39Claude CodeAnthropicKimi K2.6Kimi47.016.564.759.8$1.1811.4M41.2m130
40Gemini CLIGoogleGemini 3.1 Pro (high)Google42.714.268.345.6$2.004.7M10.8m31
41CodexOpenAIGPT-5.6 Luna (low)OpenAI42.410.349.667.4$0.211.5M1.9m35
42CodexOpenAIGPT-5.6 Terra (none)OpenAI40.313.339.368.4$0.371.1M1.8m34
43CodexOpenAIGPT-5.6 Luna (none)OpenAI37.36.537.368.0$0.353.6M2.5m56

Coding Agent Index

Equal-weight mean of three real-world suites: hard repository tasks, agentic terminal work, and codebase Q&A. Higher is better.

0.020.040.060.080.080.0Codex · GPT-5.6 Sol (max)78.7Codex · GPT-5.6 Sol (xhig…77.4Codex · GPT-5.6 Terra (ma…77.2Claude Code · Fable 5 (ma…77.1Codex · GPT-5.6 Sol (high)76.4Codex · GPT-5.5 (xhigh)76.4Grok Build · Grok 4.5 (hi…74.6Codex · GPT-5.6 Sol (medi…74.6Codex · GPT-5.6 Luna (max)73.2Codex · GPT-5.6 Terra (xh…72.6Claude Code · Opus 4.8 (m…71.8Codex · GPT-5.6 Terra (hi…71.1Codex · GPT-5.4 (medium)71.1Claude Code · Opus 4.6 (m…70.8Codex · GPT-5.6 Luna (xhi…70.5Codex · GPT-5.5 (medium)69.0Codex · GPT-5.6 Sol (low)68.8Cursor CLI · GPT-5.4 (med…68.6Opencode · Muse Spark 1.1…67.9Codex · GPT-5.6 Luna (hig…67.0Claude Code · Opus 4.8 (m…66.8Cursor CLI · Composer 265.0Claude Code · Opus 4.7 (m…64.5Opencode · Opus 4.7 (medi…64.2Codex · GPT-5.6 Terra (me…61.9Cursor CLI · GPT-5.5 (med…60.2Cursor CLI · Opus 4.7 (me…58.8Codex · GPT-5.6 Luna (med…58.4Codex · GPT-5.6 Sol (none)57.9Claude Code · GLM-5.256.8Claude Code · Opus 4.7 (m…54.2Claude Code · Sonnet 4.6…53.8Codex · GPT-5.6 Terra (lo…52.3Claude Code · GLM-5.152.0Claude Code · Qwen3.7 Plu…51.8Cursor CLI · Composer 2.5…51.8Cursor CLI · Composer 2.547.3Claude Code · DeepSeek V4…47.0Claude Code · Kimi K2.642.7Gemini CLI · Gemini 3.1 P…42.4Codex · GPT-5.6 Luna (low)40.3Codex · GPT-5.6 Terra (no…37.3Codex · GPT-5.6 Luna (non…

Composed of DeepSWE (113 tasks), Terminal-Bench v2 (84 tasks), and SWE-Atlas-QnA (124 tasks). The agent is the unit of measurement — the same model lands differently in different harnesses.

DeepSWE

Solve rate on 113 real-world software engineering tasks in real repositories, %.

01020304050607069Codex · GPT-5.6 Sol (max)67Codex · GPT-5.6 Sol (xhig…67Codex · GPT-5.6 Terra (ma…66Claude Code · Fable 5 (ma…65Codex · GPT-5.6 Sol (high)64Codex · GPT-5.5 (xhigh)64Codex · GPT-5.6 Sol (medi…63Codex · GPT-5.6 Luna (max)61Codex · GPT-5.6 Terra (hi…60Grok Build · Grok 4.5 (hi…58Codex · GPT-5.6 Terra (xh…57Codex · GPT-5.6 Luna (xhi…57Codex · GPT-5.5 (medium)56Claude Code · Opus 4.8 (m…54Opencode · Muse Spark 1.1…53Codex · GPT-5.6 Sol (low)53Codex · GPT-5.6 Luna (hig…49Claude Code · Opus 4.8 (m…46Codex · GPT-5.6 Terra (me…40Claude Code · Opus 4.7 (m…40Opencode · Opus 4.7 (medi…37Cursor CLI · GPT-5.5 (med…37Codex · GPT-5.6 Luna (med…35Codex · GPT-5.6 Sol (none)32Cursor CLI · Opus 4.7 (me…30Codex · GPT-5.6 Terra (lo…29Claude Code · Sonnet 4.6…29Claude Code · GLM-5.227Claude Code · Opus 4.7 (m…19Claude Code · Qwen3.7 Plu…19Claude Code · GLM-5.117Claude Code · Kimi K2.616Cursor CLI · Composer 2.5…16Cursor CLI · Composer 2.514Gemini CLI · Gemini 3.1 P…13Codex · GPT-5.6 Terra (no…10Codex · GPT-5.6 Luna (low)9Claude Code · DeepSeek V4…7Codex · GPT-5.6 Luna (non…

Terminal-Bench v2

Solve rate on 84 agentic terminal tasks in a live shell, %.

02040608088Codex · GPT-5.6 Sol (max)86Codex · GPT-5.6 Sol (xhig…85Grok Build · Grok 4.5 (hi…84Codex · GPT-5.6 Terra (ma…84Codex · GPT-5.5 (xhigh)83Codex · GPT-5.6 Sol (high)82Claude Code · Fable 5 (ma…81Codex · GPT-5.6 Terra (xh…80Codex · GPT-5.6 Luna (max)79Claude Code · Opus 4.8 (m…78Codex · GPT-5.6 Sol (medi…76Codex · GPT-5.6 Luna (xhi…76Codex · GPT-5.6 Terra (hi…76Codex · GPT-5.5 (medium)75Claude Code · Opus 4.8 (m…75Opencode · Opus 4.7 (medi…74Claude Code · Opus 4.7 (m…73Cursor CLI · GPT-5.5 (med…73Codex · GPT-5.6 Sol (low)73Opencode · Muse Spark 1.1…72Codex · GPT-5.6 Luna (hig…72Claude Code · GLM-5.271Claude Code · Opus 4.7 (m…71Cursor CLI · Opus 4.7 (me…70Claude Code · Opus 4.6 (m…70Codex · GPT-5.4 (medium)69Codex · GPT-5.6 Terra (me…68Gemini CLI · Gemini 3.1 P…67Cursor CLI · Composer 2.5…67Cursor CLI · Composer 2.566Claude Code · DeepSeek V4…65Claude Code · GLM-5.165Claude Code · Qwen3.7 Plu…65Cursor CLI · GPT-5.4 (med…65Cursor CLI · Composer 265Claude Code · Kimi K2.664Codex · GPT-5.6 Luna (med…64Claude Code · Sonnet 4.6…61Codex · GPT-5.6 Sol (none)58Codex · GPT-5.6 Terra (lo…50Codex · GPT-5.6 Luna (low)39Codex · GPT-5.6 Terra (no…37Codex · GPT-5.6 Luna (non…

SWE-Atlas-QnA

Rubric score on 124 codebase Q&A tasks, %.

02040608084Grok Build · Grok 4.5 (hi…84Codex · GPT-5.6 Sol (high)84Codex · GPT-5.6 Sol (max)83Claude Code · Fable 5 (ma…83Codex · GPT-5.6 Sol (xhig…83Claude Code · Opus 4.8 (m…82Codex · GPT-5.6 Sol (medi…81Codex · GPT-5.6 Terra (ma…81Claude Code · Opus 4.7 (m…81Codex · GPT-5.5 (xhigh)81Codex · GPT-5.6 Sol (low)81Codex · GPT-5.6 Luna (max)81Codex · GPT-5.6 Terra (xh…80Codex · GPT-5.6 Luna (xhi…79Codex · GPT-5.5 (medium)79Codex · GPT-5.6 Sol (none)79Opencode · Opus 4.7 (medi…79Codex · GPT-5.6 Terra (hi…79Codex · GPT-5.6 Luna (hig…78Opencode · Muse Spark 1.1…78Cursor CLI · Opus 4.7 (me…77Codex · GPT-5.6 Terra (me…77Claude Code · Opus 4.8 (m…76Codex · GPT-5.6 Luna (med…75Cursor CLI · GPT-5.5 (med…74Codex · GPT-5.6 Terra (lo…74Claude Code · GLM-5.273Claude Code · GLM-5.173Cursor CLI · GPT-5.4 (med…73Cursor CLI · Composer 2.5…73Cursor CLI · Composer 2.572Codex · GPT-5.4 (medium)72Claude Code · Opus 4.6 (m…72Claude Code · Qwen3.7 Plu…72Claude Code · Opus 4.7 (m…70Claude Code · Sonnet 4.6…69Cursor CLI · Composer 268Codex · GPT-5.6 Terra (no…68Codex · GPT-5.6 Luna (non…68Claude Code · DeepSeek V4…67Codex · GPT-5.6 Luna (low)60Claude Code · Kimi K2.646Gemini CLI · Gemini 3.1 P…

The Harness Effect — Claude Opus 4.7 (medium)

The same model, three harnesses. The scaffold alone moves the Coding Agent Index.

0.010.020.030.040.050.060.064.5Opencode60.2Cursor CLI56.8Claude Code

Identical model weights and settings; only the harness changes. Prompting, context management, and tooling are worth real points.

Harness Spread

Points of Index

Index points between a model's best and worst harness, for every model run in 2+ harnesses

  • 1GPT-5.5 (medium) (2 harnesses)8.6
  • 2Claude Opus 4.7 (medium) (3 harnesses)7.7
  • 3GPT-5.4 (medium) (2 harnesses)2.3

Cost per Task

Mean USD to complete one task, across all three suites. Lower is better.

$0.00$2.00$4.00$6.00$8.00$10.00$12.00$11.75Claude Code · Fable 5 (ma…$7.70Claude Code · Opus 4.8 (m…$7.08Codex · GPT-5.6 Sol (max)$6.47Claude Code · GLM-5.2$6.23Claude Code · Qwen3.7 Plu…$5.64Claude Code · Opus 4.7 (m…$5.07Codex · GPT-5.5 (xhigh)$4.33Claude Code · GLM-5.1$3.26Claude Code · Opus 4.8 (m…$2.93Opencode · Opus 4.7 (medi…$2.76Codex · GPT-5.6 Terra (ma…$2.75Codex · GPT-5.5 (medium)$2.68Cursor CLI · Opus 4.7 (me…$2.59Grok Build · Grok 4.5 (hi…$2.27Codex · GPT-5.4 (medium)$2.01Cursor CLI · GPT-5.5 (med…$2.00Gemini CLI · Gemini 3.1 P…$1.97Claude Code · Sonnet 4.6…$1.90Codex · GPT-5.6 Terra (xh…$1.68Claude Code · Opus 4.7 (m…$1.59Codex · GPT-5.6 Terra (hi…$1.57Codex · GPT-5.6 Luna (max)$1.52Cursor CLI · GPT-5.4 (med…$1.43Opencode · Muse Spark 1.1…$1.40Codex · GPT-5.6 Sol (none)$1.26Claude Code · Opus 4.6 (m…$1.26Codex · GPT-5.6 Luna (xhi…$1.18Claude Code · Kimi K2.6$0.96Codex · GPT-5.6 Luna (hig…$0.90Codex · GPT-5.6 Terra (me…$0.55Cursor CLI · Composer 2.5…$0.48Codex · GPT-5.6 Terra (lo…$0.47Codex · GPT-5.6 Luna (med…$0.37Codex · GPT-5.6 Terra (no…$0.35Codex · GPT-5.6 Luna (non…$0.27Claude Code · DeepSeek V4…$0.21Codex · GPT-5.6 Luna (low)$0.08Cursor CLI · Composer 2.5$0.04Cursor CLI · Composer 2

Measured mean spend per task at list API prices, cache discounts included. The spread is the story: the priciest configuration costs roughly 290× the cheapest.

Coding Agent Index vs. Cost per Task

Capability against mean USD per task (log scale).

020406080$0.05$0.10$0.20$0.50$1.00$2.00$5.00$10.00Cost per task (USD, log scale)Coding Agent Index↖ Most attractive quadrantCodex · GPT-5.6 Sol (…Codex · GPT-5.6 Terra…Claude Code · Fable 5…Codex · GPT-5.5 (xhig…Grok Build · Grok 4.5…Codex · GPT-5.6 Luna…Codex · GPT-5.6 Terra…Claude Code · Opus 4.…Codex · GPT-5.6 Terra…Codex · GPT-5.4 (medi…Claude Code · Opus 4.…Codex · GPT-5.6 Luna…Codex · GPT-5.5 (medi…Cursor CLI · GPT-5.4…Opencode · Muse Spark…Codex · GPT-5.6 Luna…Claude Code · Opus 4.…Cursor CLI · Composer…Claude Code · Opus 4.…Opencode · Opus 4.7 (…Codex · GPT-5.6 Terra…Cursor CLI · GPT-5.5…Cursor CLI · Opus 4.7…Codex · GPT-5.6 Luna…Codex · GPT-5.6 Sol (…Claude Code · GLM-5.2Claude Code · Opus 4.…Claude Code · Sonnet…Codex · GPT-5.6 Terra…Claude Code · GLM-5.1Claude Code · Qwen3.7…Cursor CLI · Composer…Cursor CLI · Composer…Claude Code · DeepSee…Claude Code · Kimi K2…Gemini CLI · Gemini 3…Codex · GPT-5.6 Luna…Codex · GPT-5.6 Terra…Codex · GPT-5.6 Luna…

Up and to the left wins: more solved tasks per dollar. Open-weight models power most of the value corner.

Token Usage per Task

Mean tokens consumed per task, split into fresh input, cache reads, and output.

Fresh inputCache readsOutput0M5M10M15M20M25M25.9MClaude Code · GLM-5.117.8MClaude Code · Opus 4.8 (m…15.8MClaude Code · Opus 4.7 (m…15.5MCodex · GPT-5.6 Luna (max)13.9MClaude Code · Fable 5 (ma…13.2MCodex · GPT-5.6 Sol (max)12.3MCodex · GPT-5.6 Luna (xhi…12.3MCodex · GPT-5.5 (xhigh)12.2MOpencode · Muse Spark 1.1…11.4MClaude Code · Kimi K2.69.9MCodex · GPT-5.6 Sol (xhig…9.8MClaude Code · DeepSeek V4…9.5MCodex · GPT-5.6 Luna (hig…9.5MCodex · GPT-5.6 Terra (ma…8.7MClaude Code · Qwen3.7 Plu…8.4MClaude Code · Sonnet 4.6…8.1MCodex · GPT-5.6 Sol (high)7.7MClaude Code · Opus 4.8 (m…7.5MOpencode · Opus 4.7 (medi…7.0MCodex · GPT-5.5 (medium)6.5MClaude Code · GLM-5.26.5MCodex · GPT-5.6 Terra (xh…5.8MCodex · GPT-5.6 Sol (medi…5.7MCodex · GPT-5.4 (medium)5.6MCursor CLI · Opus 4.7 (me…5.5MCodex · GPT-5.6 Terra (hi…4.7MGemini CLI · Gemini 3.1 P…4.5MClaude Code · Opus 4.7 (m…4.4MCodex · GPT-5.6 Luna (med…4.4MClaude Code · Opus 4.6 (m…4.3MCursor CLI · Composer 2.5…4.0MCursor CLI · GPT-5.5 (med…3.8MCursor CLI · GPT-5.4 (med…3.6MCursor CLI · Composer 2.53.6MGrok Build · Grok 4.5 (hi…3.6MCodex · GPT-5.6 Luna (non…3.4MCodex · GPT-5.6 Sol (none)3.2MCodex · GPT-5.6 Sol (low)3.1MCodex · GPT-5.6 Terra (me…2.9MCursor CLI · Composer 21.5MCodex · GPT-5.6 Terra (lo…1.5MCodex · GPT-5.6 Luna (low)1.1MCodex · GPT-5.6 Terra (no…

Agents read far more than they write — cache reads are the overwhelming majority of tokens everywhere. Output is the thin dark sliver on top.

Cache Hit Rate

Share of context reads served from prompt cache, %. Higher is better for cost.

0%10%20%30%40%50%50%Opencode · Opus 4.7 (medi…50%Claude Code · Opus 4.7 (m…49%Claude Code · Opus 4.8 (m…49%Claude Code · Opus 4.8 (m…49%Claude Code · Fable 5 (ma…49%Claude Code · Opus 4.7 (m…49%Cursor CLI · Opus 4.7 (me…49%Claude Code · Kimi K2.649%Claude Code · Sonnet 4.6…49%Codex · GPT-5.5 (xhigh)49%Codex · GPT-5.5 (medium)49%Cursor CLI · Composer 2.5…49%Cursor CLI · Composer 2.549%Codex · GPT-5.4 (medium)49%Codex · GPT-5.6 Sol (none)49%Cursor CLI · Composer 249%Claude Code · GLM-5.149%Opencode · Muse Spark 1.1…49%Codex · GPT-5.6 Luna (max)49%Claude Code · Opus 4.6 (m…49%Grok Build · Grok 4.5 (hi…48%Codex · GPT-5.6 Terra (ma…48%Codex · GPT-5.6 Luna (xhi…48%Codex · GPT-5.6 Terra (xh…48%Codex · GPT-5.6 Luna (hig…48%Codex · GPT-5.6 Terra (hi…48%Codex · GPT-5.6 Sol (high)48%Codex · GPT-5.6 Sol (xhig…48%Codex · GPT-5.6 Sol (max)48%Codex · GPT-5.6 Sol (medi…48%Cursor CLI · GPT-5.5 (med…48%Codex · GPT-5.6 Terra (me…48%Codex · GPT-5.6 Luna (non…48%Codex · GPT-5.6 Luna (med…48%Codex · GPT-5.6 Sol (low)48%Gemini CLI · Gemini 3.1 P…48%Codex · GPT-5.6 Terra (lo…47%Claude Code · DeepSeek V4…47%Codex · GPT-5.6 Terra (no…47%Codex · GPT-5.6 Luna (low)47%Cursor CLI · GPT-5.4 (med…46%Claude Code · Qwen3.7 Plu…16%Claude Code · GLM-5.2

Harnesses that keep context stable cache better. Every point of hit rate is money: cached reads bill at a tenth of the fresh-input price.

Coding Agent Index vs. Total Tokens

Capability against mean total tokens per task (millions).

0204060800M5M10M15M20M25MTotal tokens per task (millions)Coding Agent Index↖ More capability per tokenCodex · GPT-5.6 Sol (…Codex · GPT-5.6 Sol (…Codex · GPT-5.6 Terra…Claude Code · Fable 5…Codex · GPT-5.6 Sol (…Codex · GPT-5.5 (xhig…Grok Build · Grok 4.5…Codex · GPT-5.6 Sol (…Codex · GPT-5.6 Luna…Codex · GPT-5.6 Terra…Claude Code · Opus 4.…Codex · GPT-5.6 Terra…Codex · GPT-5.4 (medi…Claude Code · Opus 4.…Codex · GPT-5.6 Luna…Codex · GPT-5.5 (medi…Codex · GPT-5.6 Sol (…Cursor CLI · GPT-5.4…Opencode · Muse Spark…Codex · GPT-5.6 Luna…Claude Code · Opus 4.…Cursor CLI · Composer…Claude Code · Opus 4.…Opencode · Opus 4.7 (…Codex · GPT-5.6 Terra…Cursor CLI · GPT-5.5…Cursor CLI · Opus 4.7…Codex · GPT-5.6 Luna…Codex · GPT-5.6 Sol (…Claude Code · GLM-5.2Claude Code · Opus 4.…Claude Code · Sonnet…Codex · GPT-5.6 Terra…Claude Code · GLM-5.1Claude Code · Qwen3.7…Cursor CLI · Composer…Cursor CLI · Composer…Claude Code · DeepSee…Claude Code · Kimi K2…Gemini CLI · Gemini 3…Codex · GPT-5.6 Luna…Codex · GPT-5.6 Terra…Codex · GPT-5.6 Luna…

Reading more of the repo correlates with solving more of it — but the best harnesses get more index per token read.

Execution Time per Task

Mean wall-clock minutes from task start to the agent declaring done. Lower is better.

0m10m20m30m40m1.8mCodex · GPT-5.6 Terra (no…1.9mCodex · GPT-5.6 Luna (low)2.5mCodex · GPT-5.6 Luna (non…2.8mCodex · GPT-5.6 Terra (lo…3.4mCodex · GPT-5.6 Luna (med…3.4mCodex · GPT-5.6 Sol (none)3.7mCodex · GPT-5.6 Sol (low)4.3mCodex · GPT-5.6 Terra (me…5.2mCodex · GPT-5.6 Sol (medi…5.7mCodex · GPT-5.6 Luna (hig…6.2mCodex · GPT-5.6 Terra (hi…6.3mCodex · GPT-5.6 Sol (high)6.3mClaude Code · Opus 4.7 (m…6.4mCodex · GPT-5.5 (medium)6.6mCodex · GPT-5.6 Luna (xhi…6.6mCursor CLI · GPT-5.5 (med…6.8mCursor CLI · Composer 2.5…6.9mCodex · GPT-5.6 Terra (xh…7.1mCodex · GPT-5.4 (medium)7.4mCodex · GPT-5.6 Sol (xhig…8mCodex · GPT-5.6 Luna (max)8mClaude Code · Opus 4.6 (m…8.3mCursor CLI · GPT-5.4 (med…8.4mCodex · GPT-5.6 Terra (ma…8.6mCursor CLI · Composer 29.7mCursor CLI · Composer 2.510.1mCodex · GPT-5.5 (xhigh)10.2mCodex · GPT-5.6 Sol (max)10.6mClaude Code · Qwen3.7 Plu…10.8mGemini CLI · Gemini 3.1 P…12.2mOpencode · Opus 4.7 (medi…12.4mClaude Code · Opus 4.8 (m…12.6mOpencode · Muse Spark 1.1…13.6mCursor CLI · Opus 4.7 (me…13.7mClaude Code · Sonnet 4.6…15.8mClaude Code · Opus 4.7 (m…16.5mGrok Build · Grok 4.5 (hi…17.9mClaude Code · DeepSeek V4…19.6mClaude Code · GLM-5.123.1mClaude Code · Opus 4.8 (m…23.5mClaude Code · Fable 5 (ma…25.2mClaude Code · GLM-5.241.2mClaude Code · Kimi K2.6

Includes model latency, tool calls, builds, and test runs. Fast models in lean harnesses finish in ~10 minutes; deliberate configurations take nearly three times as long.

Coding Agent Index vs. Execution Time

Capability against mean wall-clock minutes per task.

0204060800m10m20m30m40mExecution time per task (minutes)Coding Agent Index↖ Capable and quickCodex · GPT-5.6 Sol (…Codex · GPT-5.6 Sol (…Codex · GPT-5.6 Terra…Claude Code · Fable 5…Codex · GPT-5.6 Sol (…Codex · GPT-5.5 (xhig…Grok Build · Grok 4.5…Codex · GPT-5.6 Sol (…Codex · GPT-5.6 Luna…Codex · GPT-5.6 Terra…Claude Code · Opus 4.…Codex · GPT-5.6 Terra…Codex · GPT-5.4 (medi…Claude Code · Opus 4.…Codex · GPT-5.6 Luna…Codex · GPT-5.5 (medi…Codex · GPT-5.6 Sol (…Cursor CLI · GPT-5.4…Opencode · Muse Spark…Codex · GPT-5.6 Luna…Claude Code · Opus 4.…Cursor CLI · Composer…Claude Code · Opus 4.…Opencode · Opus 4.7 (…Codex · GPT-5.6 Terra…Cursor CLI · GPT-5.5…Cursor CLI · Opus 4.7…Codex · GPT-5.6 Luna…Codex · GPT-5.6 Sol (…Claude Code · GLM-5.2Claude Code · Opus 4.…Claude Code · Sonnet…Codex · GPT-5.6 Terra…Claude Code · GLM-5.1Claude Code · Qwen3.7…Cursor CLI · Composer…Cursor CLI · Composer…Claude Code · DeepSee…Claude Code · Kimi K2…Gemini CLI · Gemini 3…Codex · GPT-5.6 Luna…Codex · GPT-5.6 Terra…Codex · GPT-5.6 Luna…

Up and to the left wins: capable and quick. Slow is only worth it if the index follows.

Turns per Task

Mean assistant turns (tool-call rounds) per task.

050100150174Claude Code · GLM-5.1166Claude Code · Opus 4.8 (m…146Claude Code · Qwen3.7 Plu…138Claude Code · Fable 5 (ma…130Claude Code · Kimi K2.6127Claude Code · GLM-5.2127Claude Code · DeepSeek V4…117Cursor CLI · Composer 2.5…117Cursor CLI · Composer 2.5115Codex · GPT-5.6 Luna (max)114Codex · GPT-5.6 Sol (max)107Claude Code · Opus 4.7 (m…106Codex · GPT-5.5 (xhigh)97Codex · GPT-5.6 Terra (ma…96Codex · GPT-5.6 Sol (xhig…96Codex · GPT-5.6 Luna (xhi…93Claude Code · Opus 4.8 (m…86Codex · GPT-5.6 Sol (high)86Cursor CLI · Opus 4.7 (me…84Codex · GPT-5.6 Luna (hig…78Codex · GPT-5.5 (medium)78Cursor CLI · GPT-5.5 (med…75Codex · GPT-5.6 Terra (xh…72Codex · GPT-5.6 Sol (medi…71Codex · GPT-5.4 (medium)67Codex · GPT-5.6 Terra (hi…67Claude Code · Sonnet 4.6…61Grok Build · Grok 4.5 (hi…58Codex · GPT-5.6 Luna (med…56Codex · GPT-5.6 Luna (non…55Opencode · Muse Spark 1.1…55Codex · GPT-5.6 Sol (none)54Codex · GPT-5.6 Sol (low)54Opencode · Opus 4.7 (medi…51Codex · GPT-5.6 Terra (me…42Claude Code · Opus 4.7 (m…37Codex · GPT-5.6 Terra (lo…35Codex · GPT-5.6 Luna (low)34Claude Code · Opus 4.6 (m…34Codex · GPT-5.6 Terra (no…31Gemini CLI · Gemini 3.1 P…26Cursor CLI · Composer 219Cursor CLI · GPT-5.4 (med…

More turns means more, smaller steps — not necessarily better results. Turn count tracks harness style more than capability.

Run Specifications

Every configuration runs the same way, so the numbers compare clean.

Environment
Fresh container per task, repo pinned to a fixed commit, network limited to package mirrors.
Attempts
One attempt per task (pass@1), no retries, no human nudges.
Configuration
Each harness runs at default settings with its recommended model configuration.
Budget
Hard cap of 60 minutes wall-clock per task; runs that exceed it score zero.
Cost accounting
List API prices at snapshot date; cache reads billed at 10% of the input rate.
Reporting
Cost, tokens, time, and turns are means across all completed tasks in the three suites.

Frequently Asked Questions

What is the Coding Agent Index?

The equal-weight mean of a configuration's scores on the three task suites. One number for how much real software work gets done — no extra weighting tricks, no style points.

What do the three suites actually test?

DeepSWE is 113 real-world software-engineering tasks in real repositories, graded end to end. Terminal-Bench v2 is 84 multi-step jobs in a live shell — builds, migrations, debugging, ops. SWE-Atlas-QnA is 124 questions that require navigating a large codebase and answering precisely.

How are tasks scored?

Implementation and terminal tasks are pass@1: one attempt, and the test suite either passes or it doesn't. Codebase Q&A earns partial credit against a rubric. Nothing is cherry-picked or re-run.

What counts as execution time?

Wall-clock from handing the agent a task to the agent declaring done — model latency, tool calls, builds, and test runs included. It's the number you actually wait.

Why track tokens at all?

Because agents read far more than they write. Cache reads dominate the bill at a 10×-discounted rate, so two agents with the same index can differ several-fold in cost. The token mix is the why behind the cost chart.

Why does the same model score differently across harnesses?

The harness decides what the model sees and which tools it gets — system prompts, context management, edit formats, test loops. Same engine, different car.

Latest Agent Insights

Reporting from the agents desk

Methodology: every configuration runs the same three suites — DeepSWE (113 tasks), Terminal-Bench v2 (84 tasks), and SWE-Atlas-QnA (124 tasks) — and the Coding Agent Index is their equal-weight mean. Suite design and metric definitions follow a standard public coding-agents methodology. Figures are Glsrm editorial estimates calibrated to our model benchmark table, not any external published results. Cost per task is derived from each run's mean token mix at list API prices, with cache reads billed at 10% of the input rate. Prices change frequently. Logos identify the respective model creators.