LMArena Agent Arena
LMArena · agent-2026-08-27-51d09b2e834b · Outcome-based measurements from real LMArena agent sessions.
Model ranking
Publisher benchmark →Source | |||||||
|---|---|---|---|---|---|---|---|
| #1 | Claude Opus 5Anthropic | 12.73 | — | 16,214 | Claude Opus 5 (Max); 95% CI [10.76557334, 14.69307729]; sessions 16214; observations 1961892; rank 2unknown | Original sourcewinner eligible | Third-party benchmark |
| #2 | Claude Fable 5Anthropic | 11.70 | — | 33,805 | Claude Fable 5 (High); 95% CI [10.07161960, 13.32098598]; sessions 33805; observations 1575929; rank 3unknown | Original sourcewinner eligible | Third-party benchmark |
| #3 | GPT-5.6 SolOpenAI | 10.24 | — | 27,506 | GPT 5.6 Sol (xHigh); 95% CI [8.75169248, 11.72000008]; sessions 27506; observations 2731648; rank 4unknown | Original sourcewinner eligible | Third-party benchmark |
| #4 | Claude Sonnet 5Anthropic | 7.65 | — | 26,480 | Claude Sonnet 5 (High); 95% CI [5.40721597, 9.90155163]; sessions 26480; observations 2580319; rank 8unknown | Original sourcewinner eligible | Third-party benchmark |
| #5 | GPT-5.6 LunaOpenAI | 3.41 | — | 13,855 | GPT 5.6 Luna (xHigh); 95% CI [2.03069485, 4.79820702]; sessions 13855; observations 970830; rank 21unknown | Original sourcewinner eligible | Third-party benchmark |
| #6 | GPT-5.6 TerraOpenAI | 3.00 | — | 15,773 | GPT 5.6 Terra (xHigh); 95% CI [1.81214534, 4.19675164]; sessions 15773; observations 867221; rank 23unknown | Original sourcewinner eligible | Third-party benchmark |
| #7 | Hy3Tencent | -1.19 | — | 22,177 | Hy3; 95% CI [-2.46898520, 0.08511072]; sessions 22177; observations 762738; rank 35unknown | Original sourcewinner eligible | Third-party benchmark |
| #8 | Mistral-Medium-3.5-128BMistral AI | -5.76 | — | 6,727 | Mistral Medium 3.5; 95% CI [-7.57289629, -3.94108228]; sessions 6727; observations 205359; rank 43unknown | Original sourcewinner eligible | Third-party benchmark |
8 models ranked by the best winner-eligible current-version score when available, otherwise the best publisher-artifact score; highest first. Observed Aug 29, 2026.
Ranking protocol
outcome score · score. Each model appears once; verified winner-eligible runs take precedence, and missing models are not imputed.
Acquisition coverage
8 published models from 54 source rows; 46 source identities remain quarantined.
Primary evidence