LiveBench

LiveBench · 2026-06-25 · A contamination-resistant language-model benchmark with scores and token accounting published by the benchmark owner.

Model Ranking

Source
#1Claude Fable 5.1Anthropic86.82percent16,4701,270claude-fable-5-1-max-effortaverage per caseRecomputedwinner eligibleThird-party benchmark
#2Claude Fable 5Anthropic86.55percent20,2551,270claude-fable-5-max-effortaverage per caseRecomputedwinner eligibleThird-party benchmark
#3GPT-6 AstraOpenAI86.47percent10,4071,270gpt-6-astra-maxaverage per caseRecomputedwinner eligibleThird-party benchmark
#4Muse Spark 1.3Meta85.47percent28,2341,270muse-spark-1.3-xhighaverage per caseRecomputedwinner eligibleThird-party benchmark
#5GPT-5.6 SolOpenAI85.26percent11,7291,270gpt-5.6-sol-maxaverage per caseRecomputedwinner eligibleThird-party benchmark
#6GPT-5.5OpenAI84.54percent11,3551,270gpt-5.5-xhighaverage per caseRecomputedwinner eligibleThird-party benchmark
#7Claude Opus 5Anthropic83.44percent14,8261,271claude-opus-5-max-effortaverage per caseRecomputedwinner eligibleThird-party benchmark
#8DeepSeek V4.1 FlashDeepSeekSelected model83.20percent36,3551,270deepseek-v4.1-flash-maxaverage per caseRecomputedwinner eligibleThird-party benchmark
#9Gemini 3.7 FlashGoogle DeepMind83.15percent22,6101,270gemini-3.7-flash-highaverage per caseRecomputedwinner eligibleThird-party benchmark
#10GPT-5.4OpenAI82.38percent18,2731,270gpt-5.4-xhighaverage per caseRecomputedwinner eligibleThird-party benchmark
#11GPT-5.6 TerraOpenAI82.31percent22,1451,270gpt-5.6-terra-maxaverage per caseRecomputedwinner eligibleThird-party benchmark
#12Grok 4.6xAI82.17percent16,1541,270grok-4.6average per caseRecomputedwinner eligibleThird-party benchmark
#13DeepSeek V4 Pro 0813DeepSeek81.91percent36,3391,270deepseek-v4-pro-0813average per caseRecomputedwinner eligibleThird-party benchmark
#14Qwen3.8 MaxQwen81.88percent21,6371,270qwen3.8-maxaverage per caseRecomputedwinner eligibleThird-party benchmark
#15Muse Spark 1.2Meta81.88percent18,7001,270muse-spark-1.2-xhighaverage per caseRecomputedwinner eligibleThird-party benchmark
#16Gemini 3.1 ProGoogle DeepMind81.66percent13,3801,270gemini-3.1-pro-preview-highaverage per caseRecomputedwinner eligibleThird-party benchmark
#17Claude Opus 4.8Anthropic81.18percent24,1711,270claude-opus-4-8-max-effortaverage per caseRecomputedwinner eligibleThird-party benchmark
#18Kimi K3Moonshot AI81.02percent13,6471,270kimi-k3average per caseRecomputedwinner eligibleThird-party benchmark
#19Claude Opus 4.7Anthropic80.97percent11,4601,270claude-opus-4-7-xhigh-effortaverage per caseRecomputedwinner eligibleThird-party benchmark
#20Gemini 3.8 FlashGoogle DeepMind80.85percent42,7861,270gemini-3.8-flash-highaverage per caseRecomputedwinner eligibleThird-party benchmark
#21Claude Sonnet 5Anthropic80.01percent19,4281,270claude-sonnet-5-xhigh-effortaverage per caseRecomputedwinner eligibleThird-party benchmark
#22Grok 4.5xAI80.01percent10,5171,270grok-4.5average per caseRecomputedwinner eligibleThird-party benchmark
#23DeepSeek V4 Flash Vision ExpDeepSeek79.67percent52,6441,270deepseek-v4-flash-vision-expaverage per caseRecomputedwinner eligibleThird-party benchmark
#24GPT-5.2OpenAI79.21percent11,5121,270gpt-5.2-2025-12-11-highaverage per caseRecomputedwinner eligibleThird-party benchmark
#25GLM 5.3Z.ai79.15percent62,0901,270glm-5.3average per caseRecomputedwinner eligibleThird-party benchmark
#26Qwen3.8 FlashQwen79.12percent54,4381,270qwen3.8-flash-nextaverage per caseRecomputedwinner eligibleThird-party benchmark
#27Gemini 3.5 FlashGoogle DeepMind78.84percent15,5221,270gemini-3.5-flash-highaverage per caseRecomputedwinner eligibleThird-party benchmark
#28Claude Opus 4.6Anthropic78.69percent9,6511,270claude-opus-4-6-thinking-auto-high-effortaverage per caseRecomputedwinner eligibleThird-party benchmark
#29Muse Spark 1.1Meta78.57percent13,6521,270muse-spark-1.1-xhighaverage per caseRecomputedwinner eligibleThird-party benchmark
#30DeepSeek V4 FlashDeepSeek78.08percent21,0791,270deepseek-v4-flash-0731average per caseRecomputedwinner eligibleThird-party benchmark
#31Gemini 3.6 FlashGoogle DeepMind78.05percent14,7461,270gemini-3.6-flash-highaverage per caseRecomputedwinner eligibleThird-party benchmark
#32Qwen3.8 27BQwen78.02percent28,7401,270qwen3.8-27baverage per caseRecomputedwinner eligibleThird-party benchmark
#33Qwen3.7 MaxQwen77.50percent12,9091,270qwen3.7-maxaverage per caseRecomputedwinner eligibleThird-party benchmark
#34Claude Opus 4.5Anthropic77.39percent15,2031,270claude-opus-4-5-20251101-thinking-64k-high-effortaverage per caseRecomputedwinner eligibleThird-party benchmark
#35Claude Sonnet 4.6Anthropic77.11percent13,2261,270claude-sonnet-4-6-thinking-auto-medium-effortaverage per caseRecomputedwinner eligibleThird-party benchmark
#36GPT-5.6 LunaOpenAI77.05percent21,7991,270gpt-5.6-luna-maxaverage per caseRecomputedwinner eligibleThird-party benchmark
#37GLM 5.2Z.ai76.96percent23,4631,270glm-5.2average per caseRecomputedwinner eligibleThird-party benchmark
#38DeepSeek V4 ProDeepSeek76.79percent35,0141,270deepseek-v4-proaverage per caseRecomputedwinner eligibleThird-party benchmark
#39InklingThinking Machines Lab76.47percent22,2131,270inkling-xhighaverage per caseRecomputedwinner eligibleThird-party benchmark
#40GPT-5.4 NanoOpenAI75.27percent46,1791,246gpt-5.4-nano-xhighaverage per caseRecomputedwinner eligibleThird-party benchmark
#41Kimi K2.6Moonshot AI74.18percent27,0011,270kimi-k2.6-thinkingaverage per caseRecomputedwinner eligibleThird-party benchmark
#42NVIDIA Nemotron 3 Ultra 550B A55B BF16NVIDIA73.49percent41,6541,270nemotron-3-ultra-550b-a55baverage per caseRecomputedwinner eligibleThird-party benchmark
#43GLM 5.3 FlashZ.ai73.27percent34,7071,270glm-5.3-flashaverage per caseRecomputedwinner eligibleThird-party benchmark
#44Kimi K2.7 CodeMoonshot AI71.45percent13,0071,270kimi-k2.7-codeaverage per caseRecomputedwinner eligibleThird-party benchmark
#45Grok Build 0.1xAI71.09percent9801,270grok-build-0.1average per caseRecomputedwinner eligibleThird-party benchmark
#46MiniMax M3MiniMax70.26percent15,5301,270minimax-m3average per caseRecomputedwinner eligibleThird-party benchmark
#47GPT-5.4 MiniOpenAI69.53percent47,4481,257gpt-5.4-mini-xhighaverage per caseRecomputedwinner eligibleThird-party benchmark
#48Grok 4.3xAI69.27percent11,1841,270grok-4.3average per caseRecomputedwinner eligibleThird-party benchmark
#49Gemini 3.5 Flash LiteGoogle DeepMind66.35percent11,5261,270gemini-3.5-flash-lite-highaverage per caseRecomputedwinner eligibleThird-party benchmark

49 models ranked by the best winner-eligible current-version score when available, otherwise the best publisher-artifact score; highest first. Observed Sep 22, 2026. The model you came from is highlighted.

Methodology and Coverage

Ranking protocoloverall · percent. Each model appears once; verified winner-eligible runs take precedence, and missing models are not imputed.
Acquisition coverage49 published models from 59 source rows; 9 source identities remain quarantined.

Primary Evidence

Publisher Artifacts

Questions

LiveBench FAQs

What does LiveBench measure?+

A contamination-resistant language-model benchmark with scores and token accounting published by the benchmark owner. Model Markets classifies it as a general language benchmark and preserves the publisher's 2026-06-25 release as a distinct comparison cohort.

How are models ranked on LiveBench?+

Models are ordered by overall in percent, with higher scores ranked first. Each model appears once; a verified winner-eligible current-version result takes precedence over a publisher-artifact-only result, and missing scores are not estimated.

Which model currently leads LiveBench?+

Claude Fable 5.1 leads the current verified table with 86.82 percent on 2026-06-25. This is a benchmark-specific result, not a universal model-quality claim.

How many models have a published LiveBench score?+

49 catalog models are published from 59 source rows. 9 source identities remain quarantined rather than guessed.

Can LiveBench scores be compared with other benchmarks?+

Raw scores should be compared only within the same benchmark version, metric, and protocol. The Intelligence ranking normalizes its three pinned core sources to a frozen reference range, requires at least two sources, and labels two-source rows partial instead of estimating the missing input. View aggregate rankings

Why might a model be missing from LiveBench?+

A model remains absent when the publisher has no current result, the source model identity is unresolved, the evaluation protocol is incompatible, or the evidence cannot be verified. Model Markets does not substitute a provider claim or infer a score from a related model.

How current is the LiveBench leaderboard?+

The current Model Markets snapshot was observed Sep 22, 2026 from LiveBench artifacts. The exact publisher source and each retained result artifact are linked on this page.

Send Feedback