LMArena Agent Arena

LMArena · agent-2026-08-31-011508720696 · Outcome-based measurements from real LMArena agent sessions.

Model Ranking

Source
#1Claude Opus 5Anthropic11.61score17,073Claude Opus 5 (Max); 95% CI [9.58391463, 13.64552719]; sessions 17073; observations 2093237; rank 2unknownOriginal sourcewinner eligibleThird-party benchmark
#2Claude Fable 5Anthropic10.58score34,905Claude Fable 5 (High); 95% CI [9.03695952, 12.11501267]; sessions 34905; observations 1709479; rank 3unknownOriginal sourcewinner eligibleThird-party benchmark
#3GPT-5.6 SolOpenai9.76score28,524GPT 5.6 Sol (xHigh); 95% CI [8.23209281, 11.28769899]; sessions 28524; observations 2917301; rank 4unknownOriginal sourcewinner eligibleThird-party benchmark
#4GPT-5.5Openai7.89score50,040GPT 5.5 (xHigh); 95% CI [6.81615311, 8.96269497]; sessions 50040; observations 2230540; rank 7unknownOriginal sourcewinner eligibleThird-party benchmark
#5Claude Sonnet 5Anthropic7.48score27,467Claude Sonnet 5 (High); 95% CI [5.31247081, 9.65098366]; sessions 27467; observations 2696236; rank 8unknownOriginal sourcewinner eligibleThird-party benchmark
#6Claude Opus 4.7Anthropic6.64score36,570Claude Opus 4.7 (High); 95% CI [5.23775711, 8.03407352]; sessions 36570; observations 1383234; rank 9unknownOriginal sourcewinner eligibleThird-party benchmark
#7Grok 4.5Xai6.06score34,008Grok 4.5; 95% CI [4.91016619, 7.21148996]; sessions 34008; observations 1655564; rank 13unknownOriginal sourcewinner eligibleThird-party benchmark
#8Qwen3.8-MaxQwen6.01score18,386Qwen3.8 Max; 95% CI [4.88117795, 7.13339178]; sessions 18386; observations 1372080; rank 14unknownOriginal sourcewinner eligibleThird-party benchmark
#9Grok 4.6Xai5.76score15,090Grok 4.6 (xHigh); 95% CI [4.47058991, 7.04827601]; sessions 15090; observations 1574671; rank 16unknownOriginal sourcewinner eligibleThird-party benchmark
#10Claude Opus 4.6Anthropic5.22score36,365Claude Opus 4.6; 95% CI [3.87284067, 6.56107425]; sessions 36365; observations 1299912; rank 17unknownOriginal sourcewinner eligibleThird-party benchmark
#11GLM-5.3Z.ai3.82score41,022GLM 5.3 (Max); 95% CI [3.01733683, 4.62585790]; sessions 41022; observations 2958163; rank 20unknownOriginal sourcewinner eligibleThird-party benchmark
#12GPT-5.4Openai3.25score76,973GPT 5.4 (High); 95% CI [2.38938480, 4.10626048]; sessions 76973; observations 3360684; rank 21unknownOriginal sourcewinner eligibleThird-party benchmark
#13GPT-5.6 TerraOpenai2.92score16,778GPT 5.6 Terra (xHigh); 95% CI [1.74076196, 4.09705014]; sessions 16778; observations 953717; rank 23unknownOriginal sourcewinner eligibleThird-party benchmark
#14GPT-5.6 LunaOpenai2.13score16,383GPT 5.6 Luna (xHigh); 95% CI [0.89962762, 3.35915348]; sessions 16383; observations 1269520; rank 26unknownOriginal sourcewinner eligibleThird-party benchmark
#15Muse Spark 1.2Meta0.97score18,416Muse Spark 1.2 (xHigh); 95% CI [-0.15615379, 2.09143176]; sessions 18416; observations 735300; rank 29unknownOriginal sourcewinner eligibleThird-party benchmark
#16Gemini 3.7 FlashGoogle Deepmind0.96score24,413Gemini 3.7 Flash (High); 95% CI [0.05817495, 1.85682345]; sessions 24413; observations 1756405; rank 30unknownOriginal sourcewinner eligibleThird-party benchmark
#17Claude Sonnet 4.6Anthropic0.95score38,385Claude Sonnet 4.6; 95% CI [-0.31540788, 2.21833799]; sessions 38385; observations 1371137; rank 31unknownOriginal sourcewinner eligibleThird-party benchmark
#18Muse Spark 1.1Meta-0.73score87,115Muse Spark 1.1; 95% CI [-1.36365010, -0.10505611]; sessions 87115; observations 3236537; rank 34unknownOriginal sourcewinner eligibleThird-party benchmark
#19Qwen3.7 MaxQwen-1.36score35,069Qwen3.7 Max; 95% CI [-2.27613811, -0.44192410]; sessions 35069; observations 1551158; rank 35unknownOriginal sourcewinner eligibleThird-party benchmark
#20Hy3Tencent-1.64score23,436Hy3; 95% CI [-2.95971591, -0.31896988]; sessions 23436; observations 811149; rank 37unknownOriginal sourcewinner eligibleThird-party benchmark
#21Qwen3.7-PlusQwen-2.70score18,748Qwen3.7 Plus; 95% CI [-4.00378740, -1.40029439]; sessions 18748; observations 834350; rank 38unknownOriginal sourcewinner eligibleThird-party benchmark
#22Gemini 3.5 FlashGoogle Deepmind-2.85score94,447Gemini 3.5 Flash (High); 95% CI [-3.63579810, -2.05541341]; sessions 94447; observations 4118270; rank 39unknownOriginal sourcewinner eligibleThird-party benchmark
#23Gemini 3.1 ProGoogle Deepmind-3.13score83,248Gemini 3.1 Pro Preview; 95% CI [-4.00806078, -2.24630473]; sessions 83248; observations 2709356; rank 40unknownOriginal sourcewinner eligibleThird-party benchmark
#24Gemini 3.6 FlashGoogle Deepmind-3.52score16,850Gemini 3.6 Flash (High); 95% CI [-4.67028409, -2.36170848]; sessions 16850; observations 910940; rank 41unknownOriginal sourcewinner eligibleThird-party benchmark
#25Mistral-Medium-3.5-128BMistral AI-6.12score7,677Mistral Medium 3.5; 95% CI [-7.78867951, -4.45821930]; sessions 7677; observations 248889; rank 46unknownOriginal sourcewinner eligibleThird-party benchmark
#26InklingThinking Machines Lab-7.02score39,537Inkling; 95% CI [-8.08412500, -5.94789916]; sessions 39537; observations 1486696; rank 47unknownOriginal sourcewinner eligibleThird-party benchmark
#27Grok 4.3Xai-10.76score62,791Grok 4.3 (High); 95% CI [-11.82702616, -9.69707800]; sessions 62791; observations 1645971; rank 50unknownOriginal sourcewinner eligibleThird-party benchmark
#28Gemini 3.5 Flash-LiteGoogle Deepmind-10.81score22,348Gemini 3.5 Flash Lite; 95% CI [-12.19929495, -9.42408695]; sessions 22348; observations 634592; rank 51unknownOriginal sourcewinner eligibleThird-party benchmark
#29Gemini 3 FlashGoogle Deepmind-11.24score83,413Gemini 3 Flash; 95% CI [-12.27770994, -10.19849473]; sessions 83413; observations 1925564; rank 52unknownOriginal sourcewinner eligibleThird-party benchmark
#30Grok Build 0.1Xai-11.31score74,459Grok Build 0.1; 95% CI [-12.50212956, -10.11963476]; sessions 74459; observations 5587414; rank 53unknownOriginal sourcewinner eligibleThird-party benchmark
#31Gemma 4 31BGoogle Deepmind-22.33score56,661Gemma 4 31B; 95% CI [-25.65092528, -19.00692476]; sessions 56661; observations 703574; rank 56unknownOriginal sourcewinner eligibleThird-party benchmark

31 models ranked by the best winner-eligible current-version score when available, otherwise the best publisher-artifact score; highest first. Observed Sep 3, 2026.

Methodology and Coverage

Ranking protocoloutcome score · score. Each model appears once; verified winner-eligible runs take precedence, and missing models are not imputed.
Acquisition coverage31 published models from 56 source rows; 20 source identities remain quarantined.

Primary Evidence

Publisher Artifacts

Questions

LMArena Agent Arena FAQs

What does LMArena Agent Arena measure?+

Outcome-based measurements from real LMArena agent sessions. Model Markets classifies it as an agentic benchmark and preserves the publisher's agent-2026-08-31-011508720696 release as a distinct comparison cohort.

How are models ranked on LMArena Agent Arena?+

Models are ordered by outcome score in score, with higher scores ranked first. Each model appears once; a verified winner-eligible current-version result takes precedence over a publisher-artifact-only result, and missing scores are not estimated.

Which model currently leads LMArena Agent Arena?+

Claude Opus 5 leads the current verified table with 11.61 score on agent-2026-08-31-011508720696. This is a benchmark-specific result, not a universal model-quality claim.

How many models have a published LMArena Agent Arena score?+

31 catalog models are published from 56 source rows. 20 source identities remain quarantined rather than guessed.

Can LMArena Agent Arena scores be compared with other benchmarks?+

Raw scores should be compared only within the same benchmark version, metric, and protocol. Model Markets normalizes eligible scores only for aggregate rankings, and groups models by an identical benchmark set before ranking them. View aggregate rankings

Why might a model be missing from LMArena Agent Arena?+

A model remains absent when the publisher has no current result, the source model identity is unresolved, the evaluation protocol is incompatible, or the evidence cannot be verified. Model Markets does not substitute a provider claim or infer a score from a related model.

How current is the LMArena Agent Arena leaderboard?+

The current Model Markets snapshot was observed Sep 3, 2026 from LMArena artifacts. The exact publisher source and each retained result artifact are linked on this page.

Send Feedback