LMArena Document Arena
LMArena · document-2026-07-30-51d09b2e834b · Blind human preferences for model-generated documents in LMArena.
Model ranking
Publisher benchmark →Source | |||||||
|---|---|---|---|---|---|---|---|
| #1 | Claude Fable 5Anthropic | 1504.25 | — | 5,792 | claude-fable-5; 95% CI [1495.07964874, 1513.41865883]; votes 5792; rank 4unknown | Original sourcewinner eligible | Third-party benchmark |
| #2 | GPT-5.6 TerraOpenAI | 1479.21 | — | 1,969 | gpt-5.6-terra-xhigh; 95% CI [1466.19331424, 1492.21945897]; votes 1969; rank 10unknown | Original sourcewinner eligible | Third-party benchmark |
| #3 | GPT-5.6 SolOpenAI | 1478.68 | — | 1,152 | gpt-5.6-sol-xhigh; 95% CI [1461.94144922, 1495.42273628]; votes 1152; rank 11unknown | Original sourcewinner eligible | Third-party benchmark |
| #4 | Claude Sonnet 5Anthropic | 1470.22 | — | 3,601 | claude-sonnet-5-high; 95% CI [1459.84859101, 1480.59820001]; votes 3601; rank 14unknown | Original sourcewinner eligible | Third-party benchmark |
| #5 | GPT-5.6 LunaOpenAI | 1462.30 | — | 1,888 | gpt-5.6-luna-xhigh; 95% CI [1449.02133383, 1475.58666708]; votes 1888; rank 18unknown | Original sourcewinner eligible | Third-party benchmark |
| #6 | Kimi-K2.6Moonshot AI | 1450.90 | — | 11,181 | kimi-k2.6; 95% CI [1443.21872745, 1458.58325377]; votes 11181; rank 21unknown | Original sourcewinner eligible | Third-party benchmark |
| #7 | MiniMax-M3MiniMax | 1434.82 | — | 6,263 | minimax-m3; 95% CI [1426.45297239, 1443.17975284]; votes 6263; rank 26unknown | Original sourcewinner eligible | Third-party benchmark |
| #8 | Kimi-K2.5Moonshot AI | 1429.49 | — | 19,891 | kimi-k2.5-thinking; 95% CI [1422.63887395, 1436.33791058]; votes 19891; rank 28unknown | Original sourcewinner eligible | Third-party benchmark |
| #9 | Claude Haiku 4.5Anthropic | 1423.03 | — | 30,937 | claude-haiku-4-5-20251001; 95% CI [1416.59570790, 1429.45877492]; votes 30937; rank 30unknown | Original sourcewinner eligible | Third-party benchmark |
9 models ranked by the best winner-eligible current-version score when available, otherwise the best publisher-artifact score; highest first. Observed Aug 29, 2026.
Ranking protocol
arena rating · rating. Each model appears once; verified winner-eligible runs take precedence, and missing models are not imputed.
Acquisition coverage
9 published models from 38 source rows; 29 source identities remain quarantined.
Primary evidence