See how models compare against each other based on real coding tasks and votes from Devin Desktop users using Arena Mode.
This leaderboard is no longer maintained. The results below are final as of June 30, 2026; the newest models evaluated are Claude Opus 4.6 and GPT-5.5, and nothing released since is included.
| Rank | Model | ELO | 95% CI | Organization |
|---|---|---|---|---|
| 1 | Claude Opus 4.6 | 1,098 | ±14 | Anthropic |
| 2 | Claude Opus 4.5 | 1,081 | ±19 | Anthropic |
| 3 | Claude Sonnet 4.5 | 1,058 | ±18 | Anthropic |
| 4 | GPT-5.4 | 1,031 | ±23 | OpenAI |
| 5 | Kimi K2.6 | 1,028 | ±65 | Moonshot |
| 6 | GPT-5.5 | 1,022 | ±44 | OpenAI |
| 7 | Claude Haiku 4.5 | 1,015 | ±30 | Anthropic |
| 8 | GPT-5.2 | 1,011 | ±18 | OpenAI |
| 9 | GPT-5.3-Codex | 959 | ±27 | OpenAI |
| 10 | Gemini 3 Flash | 953 | ±28 | |
| 11 | Gemini 3.1 Pro | 937 | ±28 | |
| 12 | GPT-5.3-Codex Spark | 914 | ±35 | OpenAI |
| 13 | Grok Code Fast 1 | 911 | ±28 | xAI |