LMArena Agent Arena
LMArena · agent-2026-09-15-d25aabda0010 · Outcome-based measurements from real LMArena agent sessions.
Model Ranking
Source | |||||||
|---|---|---|---|---|---|---|---|
| #1 | Claude Fable 5.1Anthropic | 13.71 | — | 13,320 | Claude Fable 5.1 (Max); 95% CI [11.98654915, 15.42403622]; sessions 13320; observations 1453463; rank 1unknown | Original sourcewinner eligible | Third-party benchmark |
| #2 | GPT-6 AstraOpenAI | 11.54 | — | 10,372 | GPT 6 Astra (Max); 95% CI [9.43393746, 13.63932109]; sessions 10372; observations 782334; rank 2unknown | Original sourcewinner eligible | Third-party benchmark |
| #3 | Claude Opus 5Anthropic | 10.25 | — | 24,794 | Claude Opus 5 (High); 95% CI [8.83366410, 11.66264949]; sessions 24794; observations 3006741; rank 3unknown | Original sourcewinner eligible | Third-party benchmark |
| #4 | Claude Fable 5Anthropic | 8.81 | — | 38,293 | Claude Fable 5 (High); 95% CI [7.56791873, 10.05963763]; sessions 38293; observations 2061291; rank 5unknown | Original sourcewinner eligible | Third-party benchmark |
| #5 | Claude Opus 4.8Anthropic | 8.19 | — | 39,731 | Claude Opus 4.8 (High); 95% CI [6.91963673, 9.45737628]; sessions 39731; observations 2097389; rank 6unknown | Original sourcewinner eligible | Third-party benchmark |
| #6 | GPT-5.6 SolOpenAI | 7.10 | — | 32,207 | GPT 5.6 Sol (xHigh); 95% CI [5.82839325, 8.38074425]; sessions 32207; observations 3553721; rank 7unknown | Original sourcewinner eligible | Third-party benchmark |
| #7 | Kimi K3Moonshot AI | 6.22 | — | 108,615 | Kimi K3 (Max); 95% CI [5.59393783, 6.84323085]; sessions 108615; observations 9086177; rank 8unknown | Original sourcewinner eligible | Third-party benchmark |
| #8 | Claude Sonnet 5Anthropic | 5.97 | — | 30,631 | Claude Sonnet 5 (High); 95% CI [4.35064977, 7.58850066]; sessions 30631; observations 3176952; rank 9unknown | Original sourcewinner eligible | Third-party benchmark |
| #9 | GPT-5.5OpenAI | 5.03 | — | 53,054 | GPT 5.5 (xHigh); 95% CI [4.10548678, 5.95428244]; sessions 53054; observations 2527480; rank 10unknown | Original sourcewinner eligible | Third-party benchmark |
| #10 | Hy4 previewTencent | 5.01 | — | 38,074 | Hy4 preview; 95% CI [3.98979428, 6.02540735]; sessions 38074; observations 2777850; rank 11unknown | Original sourcewinner eligible | Third-party benchmark |
| #11 | DeepSeek V4.1 FlashDeepSeekSelected model | 4.88 | — | 20,080 | Deepseek V4.1 Flash (Max); 95% CI [3.54852933, 6.21109128]; sessions 20080; observations 2295632; rank 12unknown | Original sourcewinner eligible | Third-party benchmark |
| #12 | Gemini 3.8 FlashGoogle DeepMind | 4.71 | — | 12,534 | Gemini 3.8 Flash (High); 95% CI [2.80246501, 6.61533867]; sessions 12534; observations 712246; rank 13unknown | Original sourcewinner eligible | Third-party benchmark |
| #13 | GLM 5.2Z.ai | 4.37 | — | 76,766 | GLM 5.2 (Max); 95% CI [3.67608698, 5.05982987]; sessions 76766; observations 4943866; rank 14unknown | Original sourcewinner eligible | Third-party benchmark |
| #14 | Muse Spark 1.3Meta | 4.20 | — | 31,052 | Muse Spark 1.3 (Max); 95% CI [3.33950614, 5.06185896]; sessions 31052; observations 2525117; rank 15unknown | Original sourcewinner eligible | Third-party benchmark |
| #15 | DeepSeek V4 Pro 0813DeepSeek | 4.14 | — | 47,602 | DeepSeek V4 Pro (High) (0813); 95% CI [3.35150819, 4.93122185]; sessions 47602; observations 4132769; rank 16unknown | Original sourcewinner eligible | Third-party benchmark |
| #16 | Qwen3.8 MaxQwen | 3.30 | — | 31,489 | Qwen3.8 Max; 95% CI [2.46604139, 4.14181105]; sessions 31489; observations 2502655; rank 17unknown | Original sourcewinner eligible | Third-party benchmark |
| #17 | GLM 5.3Z.ai | 3.05 | — | 73,287 | GLM 5.3 (Max); 95% CI [2.43618871, 3.66634458]; sessions 73287; observations 6652488; rank 18unknown | Original sourcewinner eligible | Third-party benchmark |
| #18 | Grok 4.5xAI | 2.92 | — | 38,146 | Grok 4.5; 95% CI [1.93207740, 3.90928463]; sessions 38146; observations 1942877; rank 19unknown | Original sourcewinner eligible | Third-party benchmark |
| #19 | Grok 4.6xAI | 2.01 | — | 22,548 | Grok 4.6 (xHigh); 95% CI [0.96176804, 3.05247193]; sessions 22548; observations 2390552; rank 21unknown | Original sourcewinner eligible | Third-party benchmark |
| #20 | DeepSeek V4 FlashDeepSeek | 1.80 | — | 64,482 | Deepseek V4 Flash (High) (20260731); 95% CI [1.06225523, 2.53222539]; sessions 64482; observations 6405377; rank 22unknown | Original sourcewinner eligible | Third-party benchmark |
| #21 | GPT-5.6 TerraOpenAI | 1.44 | — | 20,301 | GPT 5.6 Terra (xHigh); 95% CI [0.32735411, 2.55262103]; sessions 20301; observations 1231027; rank 23unknown | Original sourcewinner eligible | Third-party benchmark |
| #22 | GPT-5.4OpenAI | 1.26 | — | 80,406 | GPT 5.4 (High); 95% CI [0.45972893, 2.06967586]; sessions 80406; observations 3735057; rank 24unknown | Original sourcewinner eligible | Third-party benchmark |
| #23 | GLM 5.3 FlashZ.ai | 1.15 | — | 43,164 | GLM 5.3 Flash; 95% CI [0.48275443, 1.81278415]; sessions 43164; observations 4433017; rank 25unknown | Original sourcewinner eligible | Third-party benchmark |
| #24 | GPT-5.6 LunaOpenAI | -0.44 | — | 29,186 | GPT 5.6 Luna (xHigh); 95% CI [-1.27310649, 0.39719069]; sessions 29186; observations 2307801; rank 27unknown | Original sourcewinner eligible | Third-party benchmark |
| #25 | Gemini 3.7 FlashGoogle DeepMind | -0.60 | — | 48,195 | Gemini 3.7 Flash (High); 95% CI [-1.25249139, 0.04302776]; sessions 48195; observations 3925675; rank 28unknown | Original sourcewinner eligible | Third-party benchmark |
| #26 | Qwen3.8 27BQwen | -0.64 | — | 37,257 | Qwen 3.8 27B; 95% CI [-1.36495564, 0.07819043]; sessions 37257; observations 4349219; rank 29unknown | Original sourcewinner eligible | Third-party benchmark |
| #27 | DeepSeek V4 ProDeepSeek | -0.71 | — | 35,465 | DeepSeek V4 Pro; 95% CI [-1.64679871, 0.21730076]; sessions 35465; observations 1910125; rank 30unknown | Original sourcewinner eligible | Third-party benchmark |
| #28 | Claude Sonnet 4.6Anthropic | -1.52 | — | 39,452 | Claude Sonnet 4.6; 95% CI [-2.63863180, -0.39612153]; sessions 39452; observations 1444102; rank 31unknown | Original sourcewinner eligible | Third-party benchmark |
| #29 | Muse Spark 1.2Meta | -1.77 | — | 33,094 | Muse Spark 1.2 (xHigh); 95% CI [-2.69255217, -0.84918781]; sessions 33094; observations 1437075; rank 32unknown | Original sourcewinner eligible | Third-party benchmark |
| #30 | Muse Spark 1.1Meta | -2.98 | — | 109,338 | Muse Spark 1.1; 95% CI [-3.52464364, -2.43839720]; sessions 109338; observations 4434474; rank 33unknown | Original sourcewinner eligible | Third-party benchmark |
| #31 | Qwen3.7 MaxQwen | -3.63 | — | 38,392 | Qwen3.7 Max; 95% CI [-4.47002493, -2.78058186]; sessions 38392; observations 1816729; rank 34unknown | Original sourcewinner eligible | Third-party benchmark |
| #32 | Hy3Tencent | -5.23 | — | 27,371 | Hy3; 95% CI [-6.39472360, -4.07137134]; sessions 27371; observations 992576; rank 35unknown | Original sourcewinner eligible | Third-party benchmark |
| #33 | MiniMax M3MiniMax | -5.76 | — | 39,156 | Minimax M3; 95% CI [-6.59075506, -4.93697068]; sessions 39156; observations 2879059; rank 37unknown | Original sourcewinner eligible | Third-party benchmark |
| #34 | Gemini 3.1 ProGoogle DeepMind | -5.81 | — | 86,017 | Gemini 3.1 Pro Preview; 95% CI [-6.60162758, -5.00976712]; sessions 86017; observations 2915267; rank 38unknown | Original sourcewinner eligible | Third-party benchmark |
| #35 | Gemini 3.6 FlashGoogle DeepMind | -5.94 | — | 20,773 | Gemini 3.6 Flash (High); 95% CI [-6.96648084, -4.90883694]; sessions 20773; observations 1181765; rank 39unknown | Original sourcewinner eligible | Third-party benchmark |
| #36 | Qwen3.7 PlusQwen | -6.08 | — | 20,905 | Qwen3.7 Plus; 95% CI [-7.29245632, -4.87295146]; sessions 20905; observations 993739; rank 40unknown | Original sourcewinner eligible | Third-party benchmark |
| #37 | InklingThinking Machines Lab | -10.02 | — | 42,313 | Inkling; 95% CI [-10.93664189, -9.10513108]; sessions 42313; observations 1624204; rank 42unknown | Original sourcewinner eligible | Third-party benchmark |
| #38 | Mistral Medium 3.5 128BMistral AI | -10.88 | — | 10,244 | Mistral Medium 3.5; 95% CI [-12.33636331, -9.41760729]; sessions 10244; observations 358935; rank 43unknown | Original sourcewinner eligible | Third-party benchmark |
| #39 | MiniMax M2.7MiniMax | -14.02 | — | 37,764 | Minimax M2.7; 95% CI [-15.09137111, -12.95249504]; sessions 37764; observations 858163; rank 44unknown | Original sourcewinner eligible | Third-party benchmark |
| #40 | Gemini 3.5 Flash LiteGoogle DeepMind | -15.35 | — | 23,248 | Gemini 3.5 Flash Lite; 95% CI [-16.65525683, -14.04242266]; sessions 23248; observations 670178; rank 45unknown | Original sourcewinner eligible | Third-party benchmark |
40 models ranked by the best winner-eligible current-version score when available, otherwise the best publisher-artifact score; highest first. Observed Sep 22, 2026. The model you came from is highlighted.
Methodology and Coverage
Primary Evidence
Publisher Artifacts
Questions
LMArena Agent Arena FAQs
What does LMArena Agent Arena measure?+
Outcome-based measurements from real LMArena agent sessions. Model Markets classifies it as an agentic benchmark and preserves the publisher's agent-2026-09-15-d25aabda0010 release as a distinct comparison cohort.
How are models ranked on LMArena Agent Arena?+
Models are ordered by outcome score in score, with higher scores ranked first. Each model appears once; a verified winner-eligible current-version result takes precedence over a publisher-artifact-only result, and missing scores are not estimated.
Which model currently leads LMArena Agent Arena?+
Claude Fable 5.1 leads the current verified table with 13.71 score on agent-2026-09-15-d25aabda0010. This is a benchmark-specific result, not a universal model-quality claim.
How many models have a published LMArena Agent Arena score?+
40 catalog models are published from 46 source rows. 4 source identities remain quarantined rather than guessed.
Can LMArena Agent Arena scores be compared with other benchmarks?+
Raw scores should be compared only within the same benchmark version, metric, and protocol. The Intelligence ranking normalizes its three pinned core sources to a frozen reference range, requires at least two sources, and labels two-source rows partial instead of estimating the missing input. View aggregate rankings →
Why might a model be missing from LMArena Agent Arena?+
A model remains absent when the publisher has no current result, the source model identity is unresolved, the evaluation protocol is incompatible, or the evidence cannot be verified. Model Markets does not substitute a provider claim or infer a score from a related model.
How current is the LMArena Agent Arena leaderboard?+
The current Model Markets snapshot was observed Sep 22, 2026 from LMArena artifacts. The exact publisher source and each retained result artifact are linked on this page.