LMArena Text Arena

LMArena · text-2026-08-27-51d09b2e834b · Blind pairwise human preferences from LMArena's text arena.

Source
#1Claude Opus 5Anthropic1504.75rating15,398claude-opus-5-max; 95% CI [1498.76198432, 1510.73188918]; votes 15398; rank 1unknownOriginal sourcewinner eligibleThird-party benchmark
#2Claude Fable 5Anthropic1494.57rating25,824claude-fable-5; 95% CI [1489.51776584, 1499.62569530]; votes 25824; rank 5unknownOriginal sourcewinner eligibleThird-party benchmark
#3Kimi-K3Moonshot AI1476.06rating16,586kimi-k3-max; 95% CI [1470.44912152, 1481.67231358]; votes 16586; rank 16unknownOriginal sourcewinner eligibleThird-party benchmark
#4GLM-5.2Z.ai1466.95rating32,495glm-5.2-max; 95% CI [1462.19875405, 1471.69805536]; votes 32495; rank 25unknownOriginal sourcewinner eligibleThird-party benchmark
#5GLM-5.1Z.ai1463.00rating44,023glm-5.1; 95% CI [1459.00038238, 1467.00730085]; votes 44023; rank 30unknownOriginal sourcewinner eligibleThird-party benchmark
#6Kimi-K2.6Moonshot AI1455.12rating37,545kimi-k2.6; 95% CI [1450.59563552, 1459.63772982]; votes 37545; rank 34unknownOriginal sourcewinner eligibleThird-party benchmark
#7GPT-5.6 SolOpenAI1454.12rating21,537gpt-5.6-sol-xhigh; 95% CI [1448.87956591, 1459.35696358]; votes 21537; rank 36unknownOriginal sourcewinner eligibleThird-party benchmark
#8DeepSeek-V4-ProDeepSeek1451.05rating54,214deepseek-v4-pro; 95% CI [1447.05646256, 1455.03822989]; votes 54214; rank 40unknownOriginal sourcewinner eligibleThird-party benchmark
#9GPT-5.6 TerraOpenAI1446.86rating22,345gpt-5.6-terra-xhigh; 95% CI [1441.73650778, 1451.98969869]; votes 22345; rank 47unknownOriginal sourcewinner eligibleThird-party benchmark
#10GLM-5Z.ai1446.36rating27,649glm-5; 95% CI [1442.02946298, 1450.68440406]; votes 27649; rank 49unknownOriginal sourcewinner eligibleThird-party benchmark
#11Kimi-K2.5Moonshot AI1445.68rating70,610kimi-k2.5-thinking; 95% CI [1442.33624938, 1449.02096442]; votes 70610; rank 50unknownOriginal sourcewinner eligibleThird-party benchmark
#12Claude Sonnet 5Anthropic1442.30rating29,477claude-sonnet-5-high; 95% CI [1437.50389026, 1447.10454888]; votes 29477; rank 58unknownOriginal sourcewinner eligibleThird-party benchmark
#13Hy3Tencent1440.53rating6,466hy3; 95% CI [1432.70469713, 1448.35220311]; votes 6466; rank 62unknownOriginal sourcewinner eligibleThird-party benchmark
#14Qwen3.5-397B-A17BQwen1438.08rating71,882qwen3.5-397b-a17b; 95% CI [1434.68975454, 1441.46559151]; votes 71882; rank 68unknownOriginal sourcewinner eligibleThird-party benchmark
#15Qwen3.8-27BQwen1436.96rating5,046qwen3.8-27b; 95% CI [1428.42636059, 1445.49436282]; votes 5046; rank 73unknownOriginal sourcewinner eligibleThird-party benchmark
#16MiniMax-M3MiniMax1434.24rating42,988minimax-m3; 95% CI [1429.85087552, 1438.63891992]; votes 42988; rank 78unknownOriginal sourcewinner eligibleThird-party benchmark
#17DeepSeek-V4-FlashDeepSeek1431.86rating48,947deepseek-v4-flash; 95% CI [1427.72611296, 1435.99831462]; votes 48947; rank 80unknownOriginal sourcewinner eligibleThird-party benchmark
#18GPT-5.6 LunaOpenAI1429.29rating22,852gpt-5.6-luna-xhigh; 95% CI [1424.18984000, 1434.39657706]; votes 22852; rank 83unknownOriginal sourcewinner eligibleThird-party benchmark
#19DeepSeek-V3.2DeepSeek1424.85rating46,493deepseek-v3.2; 95% CI [1421.32068535, 1428.38405594]; votes 46493; rank 90unknownOriginal sourcewinner eligibleThird-party benchmark
#20Mistral-Medium-3.5-128BMistral AI1421.26rating11,006mistral-medium-3.5; 95% CI [1414.71769986, 1427.80720030]; votes 11006; rank 98unknownOriginal sourcewinner eligibleThird-party benchmark
#21MiniMax-M2.7MiniMax1405.64rating63,907minimax-m2.7; 95% CI [1401.94068888, 1409.34168102]; votes 63907; rank 133unknownOriginal sourcewinner eligibleThird-party benchmark
#22Qwen3.5-35B-A3BQwen1395.76rating29,059qwen3.5-35b-a3b; 95% CI [1391.45555487, 1400.05681685]; votes 29059; rank 143unknownOriginal sourcewinner eligibleThird-party benchmark
#23Claude Haiku 4.5Anthropic1395.09rating123.3Kclaude-haiku-4-5-20251001; 95% CI [1392.53354833, 1397.64754357]; votes 123321; rank 144unknownOriginal sourcewinner eligibleThird-party benchmark
#24DeepSeek-R1DeepSeek1372.49rating18,524deepseek-r1; 95% CI [1367.64968138, 1377.33535654]; votes 18524; rank 164unknownOriginal sourcewinner eligibleThird-party benchmark
#25gpt-oss-120bOpenAI1365.92rating29,938gpt-oss-120b; 95% CI [1361.55097111, 1370.29626132]; votes 29938; rank 172unknownOriginal sourcewinner eligibleThird-party benchmark
#26MiniMax-M2.5MiniMax1359.09rating40,887minimax-m2.5; 95% CI [1355.12314583, 1363.05641474]; votes 40887; rank 179unknownOriginal sourcewinner eligibleThird-party benchmark
#27NVIDIA-Nemotron-3-Nano-30B-A3B-BF16NVIDIA1348.33rating15,332nvidia-nemotron-3-nano-30b-a3b-bf16; 95% CI [1342.87010235, 1353.78054224]; votes 15332; rank 190unknownOriginal sourcewinner eligibleThird-party benchmark
#28DeepSeek-V3DeepSeek1332.29rating21,770deepseek-v3; 95% CI [1327.56053953, 1337.02226188]; votes 21770; rank 205unknownOriginal sourcewinner eligibleThird-party benchmark
#29Olmo-3.1-32B-InstructAi21311.93rating11,463olmo-3.1-32b-instruct; 95% CI [1305.76029426, 1318.09944641]; votes 11463; rank 221unknownOriginal sourcewinner eligibleThird-party benchmark
#30Olmo-3-32B-ThinkAi21299.59rating5,682olmo-3-32b-think; 95% CI [1291.27927286, 1307.89702196]; votes 5682; rank 228unknownOriginal sourcewinner eligibleThird-party benchmark
#31granite-4.1-8bIBM1291.92rating4,032granite-4.1-8b; 95% CI [1281.83897318, 1302.00717592]; votes 4032; rank 234unknownOriginal sourcewinner eligibleThird-party benchmark
#32gpt-oss-20bOpenAI1287.24rating10,385gpt-oss-20b; 95% CI [1280.83748126, 1293.63325353]; votes 10385; rank 239unknownOriginal sourcewinner eligibleThird-party benchmark
#33Llama-4-Maverick-17B-128E-InstructMeta1287.09rating39,347llama-4-maverick-17b-128e-instruct; 95% CI [1282.82796557, 1291.34252783]; votes 39347; rank 240unknownOriginal sourcewinner eligibleThird-party benchmark
#34Llama-4-Scout-17B-16E-InstructMeta1279.20rating29,740llama-4-scout-17b-16e-instruct; 95% CI [1274.49093519, 1283.91406293]; votes 29740; rank 252unknownOriginal sourcewinner eligibleThird-party benchmark
#35Llama-3.3-70B-InstructMeta1273.93rating54,416llama-3.3-70b-instruct; 95% CI [1270.45747418, 1277.41238757]; votes 54416; rank 255unknownOriginal sourcewinner eligibleThird-party benchmark
#36Llama-3.1-70B-InstructMeta1260.71rating55,240llama-3.1-70b-instruct; 95% CI [1256.99798581, 1264.42325848]; votes 55240; rank 269unknownOriginal sourcewinner eligibleThird-party benchmark
#37phi-4Microsoft1216.50rating24,126phi-4; 95% CI [1211.91861833, 1221.07481125]; votes 24126; rank 293unknownOriginal sourcewinner eligibleThird-party benchmark
#38Llama-3.1-8B-InstructMeta1186.38rating49,605llama-3.1-8b-instruct; 95% CI [1182.28064178, 1190.48111360]; votes 49605; rank 306unknownOriginal sourcewinner eligibleThird-party benchmark

38 models ranked by the best winner-eligible current-version score when available, otherwise the best publisher-artifact score; highest first. Observed Aug 29, 2026.

Ranking protocol

arena rating · rating. Each model appears once; verified winner-eligible runs take precedence, and missing models are not imputed.

Acquisition coverage

38 published models from 395 source rows; 357 source identities remain quarantined.

Primary evidence

Publisher artifacts

Send feedback