Rankings
Published benchmark performance, LiveBench value, and output-token efficiency.
Raw Firepower
Maximum-Token Performance
- 1Claude Fable 581.1482% coverage · 9 benchmarks
- 2GPT-5.6 Sol80.4482% coverage · 9 benchmarks
- 3GPT-5.578.4982% coverage · 9 benchmarks
- 4Claude Opus 4.777.8982% coverage · 9 benchmarks
- 5Claude Opus 4.677.0782% coverage · 9 benchmarks
- 6GPT-5.476.5482% coverage · 9 benchmarks
- 7Claude Sonnet 4.674.1482% coverage · 9 benchmarks
- 8Grok 4.573.8082% coverage · 9 benchmarks
- 9GPT-5.270.2882% coverage · 9 benchmarks
- 10GPT-5.6 Terra69.2773% coverage · 8 benchmarks
- 11Claude Opus 4.868.2873% coverage · 8 benchmarks
- 12Gemini 3.5 Flash65.9173% coverage · 8 benchmarks
| 1 | Claude Fable 5Anthropic | 81.14 | 11,558.5 | |
| 2 | GPT-5.6 SolOpenai | 80.44 | 7,342 | |
| 3 | GPT-5.5Openai | 78.49 | 7,580 | |
| 4 | Claude Opus 4.7Anthropic | 77.89 | 7,019 | |
| 5 | Claude Opus 4.6Anthropic | 77.07 | 6,129 | |
| 6 | GPT-5.4Openai | 76.54 | 10,763.5 | |
| 7 | Claude Sonnet 4.6Anthropic | 74.14 | 7,875.5 | |
| 8 | Grok 4.5Xai | 73.80 | 6,602.5 | |
| 9 | GPT-5.2Openai | 70.28 | 7,889 | |
| 10 | GPT-5.6 TerraOpenai | 69.27 | 12,533 | |
| 11 | Claude Opus 4.8Anthropic | 68.28 | 13,456 | |
| 12 | Gemini 3.5 FlashGoogle Deepmind | 65.91 | 17,067 | |
| 13 | GPT-5.6 LunaOpenai | 64.99 | 12,547 | |
| 14 | Gemini 3.1 ProGoogle Deepmind | 59.90 | 11,694.5 | 64% ranking coverage |
| 15 | Gemini 3.6 FlashGoogle Deepmind | 56.22 | 12,837.5 | |
| 16 | Claude Opus 5Anthropic | 53.89 | 8,727 | |
| 17 | Muse Spark 1.1Meta | 51.24 | 9,844.5 | 55% ranking coverage |
| 18 | Gemini 3.7 FlashGoogle Deepmind | 51.05 | 15,874.5 | |
| 19 | GPT-5.1Openai | 50.38 | 3,970 | 64% ranking coverage |
| 20 | Grok 4.6Xai | 49.48 | 15,864.5 | |
| 21 | GPT-5Openai | 49.02 | 8,777.8 | |
| 22 | Grok 4.3Xai | 46.80 | 8,169 | 55% ranking coverage |
| 23 | Gemini 3.5 Flash-LiteGoogle Deepmind | 45.03 | 6,746 | |
| 24 | Claude Sonnet 4.5Anthropic | 44.70 | 2,441 | |
| 25 | Qwen3.8-MaxQwen | 43.42 | 22,485.5 | 45% ranking coverage |
| 26 | Gemini 2.5 ProGoogle Deepmind | 42.26 | 4,521 | 45% ranking coverage |
| 27 | Gemini 3 FlashGoogle Deepmind | 41.79 | — | 45% ranking coverage |
| 28 | Kimi-K3Moonshot AI | 41.09 | 14,335 | |
| 29 | 40.74 | — | 45% ranking coverage | |
| 30 | GPT-5.4 MiniOpenai | 40.29 | 25,003.5 | |
| 31 | Claude Opus 4.5Anthropic | 39.38 | 15,203 | BFCLLiveBenchDocument Arena+2 more 45% ranking coverage |
| 32 | GPT-5.4 NanoOpenai | 36.76 | 25,005 | |
| 33 | InklingThinking Machines Lab | 35.29 | 5,785 | 45% ranking coverage |
| 34 | Claude Sonnet 5Anthropic | 35.08 | — | 36% ranking coverage |
| 35 | Muse Spark 1.2Meta | 34.73 | 18,700 | 36% ranking coverage |
| 36 | Qwen3.7-PlusQwen | 34.16 | — | 36% ranking coverage |
| 37 | Kimi-K2.6Moonshot AI | 34.10 | 27,001 | 36% ranking coverage |
| 38 | GPT-5 MiniOpenai | 34.01 | 3,925 | |
| 39 | MiniMax-M3MiniMax | 33.30 | 15,530 | 36% ranking coverage |
| 40 | Gemma 4 31BGoogle Deepmind | 32.36 | — | 36% ranking coverage |
| 41 | Gemini 2.5 FlashGoogle Deepmind | 32.21 | 4,399 | BFCLText ArenaVision Arena+1 more 36% ranking coverage |
| 42 | DeepSeek-V4-FlashDeepSeek | 30.22 | 34,434 | |
| 43 | GPT-4.1Openai | 28.66 | — | |
| 44 | GPT-5 NanoOpenai | 28.60 | 7,465 | |
| 45 | Kimi-K2.5Moonshot AI | 26.02 | — | 27% ranking coverage |
| 46 | GLM-5.3Z.ai | 25.68 | 62,090 | 27% ranking coverage |
| 47 | Qwen3.8-27BQwen | 25.63 | 28,740 | 27% ranking coverage |
| 48 | GLM-5.3-FlashZ.ai | 25.45 | 34,707 | 27% ranking coverage |
| 49 | Mistral-Medium-3.5-128BMistral AI | 24.59 | — | 27% ranking coverage |
| 50 | Qwen3.7 MaxQwen | 24.47 | 10,772.5 | 27% ranking coverage |
| 51 | Mistral Large 3Mistral AI | 24.20 | 2,056 | 27% ranking coverage |
| 52 | GPT-4.1 MiniOpenai | 24.10 | — | AiderBFCLText Arena+1 more 36% ranking coverage |
| 53 | GPT-4oOpenai | 23.40 | 1,174 | AiderText ArenaVision Arena+1 more 36% ranking coverage |
| 54 | DeepSeek-V4-Pro-0813DeepSeek | 22.95 | 18,922 | |
| 55 | Command ACohere | 22.65 | 1,177 | AiderBFCLText Arena+1 more 36% ranking coverage |
| 56 | Claude Haiku 4.5Anthropic | 21.81 | — | 36% ranking coverage |
| 57 | GPT-4o MiniOpenai | 21.36 | 1,347 | AiderText ArenaVision Arena+1 more 36% ranking coverage |
| 58 | GPT-4.1 NanoOpenai | 19.78 | — | AiderBFCLText Arena+1 more 36% ranking coverage |
| 59 | 19.70 | — | 27% ranking coverage | |
| 60 | Claude Fable 5.1Anthropic | 17.84 | — | |
| 61 | ERNIE 5.1Baidu | 17.74 | — | 18% ranking coverage |
| 62 | 17.33 | — | 18% ranking coverage | |
| 63 | Gemma 4 26B-A4BGoogle Deepmind | 17.28 | — | 18% ranking coverage |
| 64 | GPT-5.5 ProOpenai | 17.22 | — | |
| 65 | 17.19 | — | 27% ranking coverage | |
| 66 | GLM-5.2Z.ai | 16.94 | 23,463 | 18% ranking coverage |
| 67 | GPT-5.4 ProOpenai | 16.91 | — | |
| 68 | DeepSeek-V4-ProDeepSeek | 16.83 | 35,014 | 18% ranking coverage |
| 69 | Hy3Tencent | 16.71 | — | 18% ranking coverage |
| 70 | Kimi-K2-InstructMoonshot AI | 15.20 | 1,617.1 | |
| 71 | 14.69 | 980 | 18% ranking coverage | |
| 72 | GPT-5.2 ProOpenai | 13.68 | — | |
| 73 | 12.61 | — | 18% ranking coverage | |
| 74 | gpt-oss-120bOpenai | 12.57 | 3,806.6 | 18% ranking coverage |
| 75 | Nova 2 LiteAmazon | 12.40 | — | 18% ranking coverage |
| 76 | phi-4Microsoft | 11.78 | — | 18% ranking coverage |
| 77 | Gemini 2.5 Flash-LiteGoogle Deepmind | 11.33 | 2,360 | |
| 78 | 11.14 | — | 18% ranking coverage | |
| 79 | GLM-5.1Z.ai | 8.84 | — | 9% ranking coverage |
| 80 | GLM-5Z.ai | 8.74 | — | 9% ranking coverage |
| 81 | DeepSeek-V3.2DeepSeek | 8.61 | — | 9% ranking coverage |
| 82 | MiniMax-M2.7MiniMax | 8.49 | — | 9% ranking coverage |
| 83 | Qwen3.5-35B-A3BQwen | 8.43 | — | 9% ranking coverage |
| 84 | Muse Glimmer 30BMeta | 8.41 | — | 9% ranking coverage |
| 85 | DeepSeek-V4-Flash-Vision-ExpDeepSeek | 8.37 | 52,644 | 9% ranking coverage |
| 86 | DeepSeek-R1DeepSeek | 8.29 | — | 9% ranking coverage |
| 87 | GPT-5 ProOpenai | 8.28 | — | |
| 88 | Sonar Reasoning ProPerplexity | 8.23 | — | 9% ranking coverage |
| 89 | 8.23 | — | 9% ranking coverage | |
| 90 | MiniMax-M2.5MiniMax | 8.21 | — | 9% ranking coverage |
| 91 | Sonar ProPerplexity | 8.17 | — | 9% ranking coverage |
| 92 | 8.15 | — | 9% ranking coverage | |
| 93 | DeepSeek-V3DeepSeek | 8.05 | — | 9% ranking coverage |
| 94 | 8.05 | — | 9% ranking coverage | |
| 95 | 7.96 | — | 9% ranking coverage | |
| 96 | 7.92 | — | 9% ranking coverage | |
| 97 | 7.85 | — | 9% ranking coverage | |
| 98 | 7.85 | — | 9% ranking coverage | |
| 99 | 7.80 | — | 9% ranking coverage | |
| 100 | gpt-oss-20bOpenai | 7.78 | — | 9% ranking coverage |
| 101 | 7.62 | — | 9% ranking coverage | |
| 102 | Gemini 3.1 Flash-LiteGoogle Deepmind | 7.28 | 1,628 | 9% ranking coverage |
| 103 | Command A ReasoningCohere | 6.42 | 2,002 | 9% ranking coverage |
| 104 | Ministral-8B-Instruct-2410Mistral AI | 1.71 | — | 9% ranking coverage |
Rank is the table order. Each benchmark leader earns 100 points; other models earn proportional points. Missing results earn no points, so coverage matters. If a model has multiple runs, this table uses its highest published output-token spend.
Value Frontier
LiveBench Quality Versus Estimated Output Cost
Cost Ranking
Score-Adjusted Output Cost
- 1DeepSeek-V4-Flash$0.0086
- 2GLM-5.3-Flash$0.012
- 3MiniMax-M3$0.024
- 4GPT-5.6 Luna (max)$0.034
- 5Gemini 3.5 Flash-Lite (high)$0.043
- 6DeepSeek-V4-Flash-Vision-Exp$0.044
- 7DeepSeek-V4-Pro$0.070
- 8Gemini 3.6 Flash (high)$0.071
- 9GLM-5.2$0.073
- 10Qwen3.7 Max$0.074
- 11GPT-5.4 Nano (extra high)$0.077
- 12Gemini 3.7 Flash (high)$0.102
- 13Qwen3.8-27B$0.111
- 14Kimi-K2.6$0.127
- 15Qwen3.8-Max$0.131
- 16GPT-5.6 Sol (max)$0.138
- 17Gemini 3.5 Flash (high)$0.177
- 18Gemini 3.1 Pro (high)$0.197
- 19GPT-5.2 (high)$0.203
- 20Kimi-K3$0.240
- 21Claude Sonnet 4.6$0.257
- 22GPT-5.4 Mini (extra high)$0.307
- 23GLM-5.3$0.314
- 24GPT-5.6 Terra (max)$0.323
- 25GPT-5.4 (extra high)$0.333
- 26Claude Opus 4.7$0.354
- 27GPT-5.5 (extra high)$0.403
- 28Claude Opus 5$0.444
- 29Claude Opus 4.8$0.744
- 30Claude Fable 5$1.17
Token Efficiency
Efficiency Ranking
| 1 | 33.33 | 82.14 | 980 | 33% token benchmark coverage | |
| 2 | 33.33 | 68.38 | 1,177 | 33% token benchmark coverage | |
| 3 | 33.33 | 67.17 | 1,617.1 | 33% token benchmark coverage | |
| 4 | 32.19 | 65.87 | 1,174 | 33% token benchmark coverage | |
| 5 | 28.21 | 80.06 | 1,628 | 33% token benchmark coverage | |
| 6 | 27.80 | 65.27 | 1,347 | 33% token benchmark coverage | |
| 7 | 26.70 | 79.55 | 6,746 | ||
| 8 | 24.61 | 94.77 | 7,019 | ||
| 9 | 24.56 | 92.74 | 6,129 | ||
| 10 | 24.34 | 98.03 | 8,727 | ||
| 11 | 24.02 | 91.50 | 7,875.5 | ||
| 12 | 23.20 | 92.39 | 6,602.5 | ||
| 13 | 22.38 | 98.30 | 7,342 | ||
| 14 | 22.21 | 96.25 | 13,456 | ||
| 15 | 22.06 | 79.04 | 2,056 | 33% token benchmark coverage | |
| 16 | 22.01 | 100.00 | 11,558.5 | ||
| 17 | 20.92 | 85.33 | 25,003.5 | ||
| 18 | 20.61 | 95.67 | 12,533 | ||
| 19 | 20.39 | 86.74 | 2,441 | 33% token benchmark coverage | |
| 20 | 20.24 | 70.63 | 2,002 | 33% token benchmark coverage | |
| 21 | 18.77 | 77.21 | 2,360 | 33% token benchmark coverage | |
| 22 | 18.40 | 93.89 | 10,763.5 | ||
| 23 | 17.55 | 90.25 | 12,547 | ||
| 24 | 17.22 | 94.61 | 7,580 | ||
| 25 | 15.39 | 93.69 | 8,777.8 | ||
| 26 | 14.95 | 89.59 | 7,889 | ||
| 27 | 12.49 | 85.41 | 3,925 | 33% token benchmark coverage | |
| 28 | 12.37 | 82.29 | 25,005 | ||
| 29 | 12.33 | 85.31 | 3,970 | 33% token benchmark coverage | |
| 30 | 12.21 | 82.07 | 8,169 | ||
| 31 | 11.26 | 90.73 | 9,844.5 | ||
| 32 | 11.15 | 87.88 | 4,521 | 33% token benchmark coverage | |
| 33 | 10.57 | 81.04 | 4,399 | 33% token benchmark coverage | |
| 34 | 10.01 | 47.47 | 3,806.6 | 33% token benchmark coverage | |
| 35 | 8.84 | 89.16 | 5,785 | 33% token benchmark coverage | |
| 36 | 8.82 | 90.39 | 10,772.5 | ||
| 37 | 7.95 | 92.03 | 11,694.5 | ||
| 38 | 7.18 | 91.80 | 15,874.5 | ||
| 39 | 7.04 | 89.02 | 12,837.5 | ||
| 40 | 6.51 | 96.32 | 14,335 | ||
| 41 | 5.92 | 96.09 | 15,864.5 | ||
| 42 | 5.32 | 69.19 | 7,465 | 33% token benchmark coverage | |
| 43 | 4.88 | 86.83 | 17,067 | ||
| 44 | 3.98 | 92.81 | 22,485.5 | ||
| 45 | 2.86 | 94.36 | 18,922 | 33% token benchmark coverage | |
| 46 | 2.34 | 89.41 | 15,203 | 33% token benchmark coverage | |
| 47 | 2.08 | 81.18 | 15,530 | 33% token benchmark coverage | |
| 48 | 2.01 | 94.60 | 18,700 | 33% token benchmark coverage | |
| 49 | 1.51 | 88.92 | 23,463 | 33% token benchmark coverage | |
| 50 | 1.26 | 85.71 | 27,001 | 33% token benchmark coverage | |
| 51 | 1.25 | 90.15 | 28,740 | 33% token benchmark coverage | |
| 52 | 1.01 | 88.72 | 35,014 | 33% token benchmark coverage | |
| 53 | 0.97 | 84.66 | 34,707 | 33% token benchmark coverage | |
| 54 | 0.93 | 80.50 | 34,434 | 33% token benchmark coverage | |
| 55 | 0.70 | 92.05 | 52,644 | 33% token benchmark coverage | |
| 56 | 0.59 | 91.45 | 62,090 | 33% token benchmark coverage |
Rank is global across models with published token accounting. Each token-accounted benchmark gives 100 points to its most efficient run; missing token benchmarks earn no points.
Each benchmark leader is set to 100. A model earns weighted points from every benchmark where it has a verified result; missing benchmarks earn no points, and the total produces one overall rank. Missing benchmarks are never estimated. They earn no ranking points, and coverage is shown beside every score.
Within each token-accounted benchmark, performance points per 1,000 output tokens are scored relative to the most efficient eligible run. Missing token-accounted benchmarks earn no points, and the total produces one overall rank. The graph uses the benchmark with the strongest configuration coverage and includes every published configuration. Highlighted points are not dominated on both benchmark performance and actual output-token spend.
LiveBench quality is compared with estimated output cost using the lowest currently published USD output-token rate for each model. Score-adjusted output cost divides the estimated output cost for one published benchmark case by the model's LiveBench score as a fraction of 100. It is an estimate from published price and token artifacts, not an invoice or a task success rate.

