LiveBench
LiveBench · 2026-06-25 · A contamination-resistant language-model benchmark with scores and token accounting published by the benchmark owner.
Model ranking
Publisher benchmark →Source | |||||||
|---|---|---|---|---|---|---|---|
| #1 | Claude Fable 5Anthropic | 86.55 | 20,255 | 1,270 | claude-fable-5-max-effortaverage per case | Original sourcewinner eligible | Third-party benchmark |
| #2 | GPT-5.6 SolOpenAI | 85.26 | 11,729 | 1,270 | gpt-5.6-sol-maxaverage per case | Original sourcewinner eligible | Third-party benchmark |
| #3 | Claude Opus 5Anthropic | 83.44 | 14,826 | 1,271 | claude-opus-5-max-effortaverage per case | Original sourcewinner eligible | Third-party benchmark |
| #4 | GPT-5.6 TerraOpenAI | 82.31 | 22,145 | 1,270 | gpt-5.6-terra-maxaverage per case | Original sourcewinner eligible | Third-party benchmark |
| #5 | Kimi-K3Moonshot AI | 81.02 | 13,647 | 1,270 | kimi-k3average per case | Original sourcewinner eligible | Third-party benchmark |
| #6 | Qwen3.8-27BQwen | 78.02 | 28,740 | 1,270 | qwen3.8-27baverage per case | Original sourcewinner eligible | Third-party benchmark |
| #7 | GPT-5.6 LunaOpenAI | 77.05 | 21,799 | 1,270 | gpt-5.6-luna-maxaverage per case | Original sourcewinner eligible | Third-party benchmark |
| #8 | GLM-5.2Z.ai | 76.96 | 23,463 | 1,270 | glm-5.2average per case | Original sourcewinner eligible | Third-party benchmark |
| #9 | DeepSeek-V4-ProDeepSeek | 76.79 | 35,014 | 1,270 | deepseek-v4-proaverage per case | Original sourcewinner eligible | Third-party benchmark |
| #10 | Kimi-K2.6Moonshot AI | 74.18 | 27,001 | 1,270 | kimi-k2.6-thinkingaverage per case | Original sourcewinner eligible | Third-party benchmark |
| #11 | MiniMax-M3MiniMax | 70.26 | 15,530 | 1,270 | minimax-m3average per case | Original sourcewinner eligible | Third-party benchmark |
| #12 | DeepSeek-V4-FlashDeepSeek | 69.67 | 34,434 | 1,270 | deepseek-v4-flashaverage per case | Original sourcewinner eligible | Third-party benchmark |
12 models ranked by the best winner-eligible current-version score when available, otherwise the best publisher-artifact score; highest first. Observed Aug 29, 2026.
Ranking protocol
overall · percent. Each model appears once; verified winner-eligible runs take precedence, and missing models are not imputed.
Acquisition coverage
12 published models from 49 source rows; 37 source identities remain quarantined.
Primary evidence