Debugging/Refactoring
Rank
Model
Lab
Score
1
Claude Fable 5
Anthropic
34.2%
2
Claude Opus 5
Anthropic
34.1%
3
Kimi K3
Moonshot AI
34%
4
GPT 5.6 Sol
OpenAI
33.9%
5
GLM 5.2
Z.ai
33.6%
6
Deepseek V4 Pro
Deepseek
29.9%
7
Claude Opus 4.8
Anthropic
29.8%
8
Muse Spark 1.1
Meta
23.1%
9
Deepseek V4
Deepseek
22%
10
Gemma 4
Google
21.9%
11
Grok 4.5
SpaceXAI
21%
12
Gemini 3.5 Pro
Google
20.7%
13
Fairy 2 Coder
Ahleyrie
18.2%
14
Gemini 3.5 Flash-Lite
Google
17.7%
15
GPT 5.6 Terra
OpenAI
0%