LiveBench

LiveBench · 2026-06-25 · A contamination-resistant language-model benchmark with scores and token accounting published by the benchmark owner.

Source
#1Claude Fable 5Anthropic86.55percent20,2551,270claude-fable-5-max-effortaverage per caseOriginal sourcewinner eligibleThird-party benchmark
#2GPT-5.6 SolOpenAI85.26percent11,7291,270gpt-5.6-sol-maxaverage per caseOriginal sourcewinner eligibleThird-party benchmark
#3Claude Opus 5Anthropic83.44percent14,8261,271claude-opus-5-max-effortaverage per caseOriginal sourcewinner eligibleThird-party benchmark
#4GPT-5.6 TerraOpenAI82.31percent22,1451,270gpt-5.6-terra-maxaverage per caseOriginal sourcewinner eligibleThird-party benchmark
#5Kimi-K3Moonshot AI81.02percent13,6471,270kimi-k3average per caseOriginal sourcewinner eligibleThird-party benchmark
#6Qwen3.8-27BQwen78.02percent28,7401,270qwen3.8-27baverage per caseOriginal sourcewinner eligibleThird-party benchmark
#7GPT-5.6 LunaOpenAI77.05percent21,7991,270gpt-5.6-luna-maxaverage per caseOriginal sourcewinner eligibleThird-party benchmark
#8GLM-5.2Z.ai76.96percent23,4631,270glm-5.2average per caseOriginal sourcewinner eligibleThird-party benchmark
#9DeepSeek-V4-ProDeepSeek76.79percent35,0141,270deepseek-v4-proaverage per caseOriginal sourcewinner eligibleThird-party benchmark
#10Kimi-K2.6Moonshot AI74.18percent27,0011,270kimi-k2.6-thinkingaverage per caseOriginal sourcewinner eligibleThird-party benchmark
#11MiniMax-M3MiniMax70.26percent15,5301,270minimax-m3average per caseOriginal sourcewinner eligibleThird-party benchmark
#12DeepSeek-V4-FlashDeepSeek69.67percent34,4341,270deepseek-v4-flashaverage per caseOriginal sourcewinner eligibleThird-party benchmark

12 models ranked by the best winner-eligible current-version score when available, otherwise the best publisher-artifact score; highest first. Observed Aug 29, 2026.

Ranking protocol

overall · percent. Each model appears once; verified winner-eligible runs take precedence, and missing models are not imputed.

Acquisition coverage

12 published models from 49 source rows; 37 source identities remain quarantined.

Primary evidence

Publisher artifacts

Send feedback