Rankings

Published benchmark performance, LiveBench value, and output-token efficiency.

Raw Firepower

Maximum-Token Performance

Inspect benchmark evidence →
Maximum Verified PerformanceTop 12 eligible models
Coverage included for every model
  1. 1Claude Fable 581.1482% coverage · 9 benchmarks
  2. 2GPT-5.6 Sol80.4482% coverage · 9 benchmarks
  3. 3GPT-5.578.4982% coverage · 9 benchmarks
  4. 4Claude Opus 4.777.8982% coverage · 9 benchmarks
  5. 5Claude Opus 4.677.0782% coverage · 9 benchmarks
  6. 6GPT-5.476.5482% coverage · 9 benchmarks
  7. 7Claude Sonnet 4.674.1482% coverage · 9 benchmarks
  8. 8Grok 4.573.8082% coverage · 9 benchmarks
  9. 9GPT-5.270.2882% coverage · 9 benchmarks
  10. 10GPT-5.6 Terra69.2773% coverage · 8 benchmarks
  11. 11Claude Opus 4.868.2873% coverage · 8 benchmarks
  12. 12Gemini 3.5 Flash65.9173% coverage · 8 benchmarks
Scores are normalized within each eligible benchmark and aggregated only from published results. The axis is zoomed to the displayed range; coverage remains visible because missing benchmarks are not estimated.
181.1411,558.5
82% ranking coverage
280.447,342
82% ranking coverage
378.497,580
82% ranking coverage
477.897,019
82% ranking coverage
577.076,129
82% ranking coverage
676.5410,763.5
82% ranking coverage
774.147,875.5
82% ranking coverage
873.806,602.5
82% ranking coverage
970.287,889
82% ranking coverage
1069.2712,533
73% ranking coverage
1168.2813,456
73% ranking coverage
1265.9117,067
73% ranking coverage
1364.9912,547
73% ranking coverage
1459.9011,694.5
64% ranking coverage
1556.2212,837.5
64% ranking coverage
1653.898,727
55% ranking coverage
1751.249,844.5
55% ranking coverage
1851.0515,874.5
55% ranking coverage
1950.383,970
64% ranking coverage
2049.4815,864.5
55% ranking coverage
2149.028,777.8
64% ranking coverage
2246.808,169
55% ranking coverage
2345.036,746
64% ranking coverage
2444.702,441
64% ranking coverage
2543.4222,485.5
45% ranking coverage
2642.264,521
45% ranking coverage
2741.79
45% ranking coverage
2841.0914,335
45% ranking coverage
2940.74
45% ranking coverage
3040.2925,003.5
55% ranking coverage
3139.3815,203
45% ranking coverage
3236.7625,005
55% ranking coverage
3335.295,785
45% ranking coverage
3435.08
36% ranking coverage
3534.7318,700
36% ranking coverage
3634.16
36% ranking coverage
3734.1027,001
36% ranking coverage
3834.013,925
55% ranking coverage
3933.3015,530
36% ranking coverage
4032.36
36% ranking coverage
4132.214,399
36% ranking coverage
4230.2234,434
36% ranking coverage
4328.66
55% ranking coverage
4428.607,465
55% ranking coverage
4526.02
4625.6862,090
27% ranking coverage
4725.6328,740
4825.4534,707
4924.59
5024.4710,772.5
27% ranking coverage
5124.202,056
5224.10
36% ranking coverage
5323.401,174
36% ranking coverage
5422.9518,922
27% ranking coverage
5522.651,177
36% ranking coverage
5621.81
36% ranking coverage
5721.361,347
36% ranking coverage
5819.78
36% ranking coverage
5919.70
27% ranking coverage
6017.84
18% ranking coverage
6117.74
18% ranking coverage
6217.33
18% ranking coverage
6317.28
18% ranking coverage
6417.22
18% ranking coverage
6517.19
27% ranking coverage
6616.9423,463
18% ranking coverage
6716.91
18% ranking coverage
6816.8335,014
18% ranking coverage
6916.71
18% ranking coverage
7015.201,617.1
18% ranking coverage
7114.69980
18% ranking coverage
7213.68
18% ranking coverage
7312.61
18% ranking coverage
7412.573,806.6
18% ranking coverage
7512.40
18% ranking coverage
7611.78
18% ranking coverage
7711.332,360
18% ranking coverage
7811.14
18% ranking coverage
798.84
9% ranking coverage
808.74
9% ranking coverage
818.61
9% ranking coverage
828.49
9% ranking coverage
838.43
9% ranking coverage
848.41
9% ranking coverage
858.3752,644
9% ranking coverage
868.29
9% ranking coverage
878.28
18% ranking coverage
888.23
9% ranking coverage
898.23
9% ranking coverage
908.21
9% ranking coverage
918.17
9% ranking coverage
928.15
9% ranking coverage
938.05
9% ranking coverage
948.05
9% ranking coverage
957.96
9% ranking coverage
967.92
9% ranking coverage
977.85
9% ranking coverage
987.85
9% ranking coverage
997.80
9% ranking coverage
1007.78
9% ranking coverage
1017.62
9% ranking coverage
1027.281,628
9% ranking coverage
1036.422,002
9% ranking coverage
1041.71
9% ranking coverage

Rank is the table order. Each benchmark leader earns 100 points; other models earn proportional points. Missing results earn no points, so coverage matters. If a model has multiple runs, this table uses its highest published output-token spend.

Value Frontier

LiveBench Quality Versus Estimated Output Cost

LiveBench
Efficiency FrontierLiveBench overall · output estimate
Clear highlight
DeepSeekZ.aiMiniMaxOpenaiGoogle DeepmindQwenMoonshot AIAnthropic
LiveBench quality versus score-adjusted output costEach dot is a model configuration and is colored by developer. Higher means a better LiveBench overall score. Farther left means lower estimated output cost after adjusting by the score. A dotted line connects the non-dominated frontier observations. The highlighted ring identifies the current model.$0.010$0.020$0.050$0.100$0.200$0.500$1.006470778389DeepSeek-V4-FlashGLM-5.3-FlashGPT-5.6 Luna (max)DeepSeek-V4-Flash-Vision-ExpGemini 3.7 Flash (high)GPT-5.6 Sol (max)Claude Fable 5Score-adjusted output cost per LiveBench case (log) →LiveBench overall →
The blue dotted line connects measured, non-dominated observations. Developer-colored dashed lines connect models only when their sourced family and generation match. Cost is estimated from published output tokens and the lowest current USD output rate; it excludes input, caching, batch discounts, and provider-specific benchmark execution details.

Cost Ranking

Score-Adjusted Output Cost

Token Efficiency

Efficiency Ranking

133.3382.14980
33% token benchmark coverage
233.3368.381,177
33% token benchmark coverage
333.3367.171,617.1
33% token benchmark coverage
432.1965.871,174
33% token benchmark coverage
528.2180.061,628
33% token benchmark coverage
627.8065.271,347
33% token benchmark coverage
726.7079.556,746
67% token benchmark coverage
824.6194.777,019
67% token benchmark coverage
924.5692.746,129
67% token benchmark coverage
1024.3498.038,727
67% token benchmark coverage
1124.0291.507,875.5
67% token benchmark coverage
1223.2092.396,602.5
67% token benchmark coverage
1322.3898.307,342
67% token benchmark coverage
1422.2196.2513,456
67% token benchmark coverage
1522.0679.042,056
33% token benchmark coverage
1622.01100.0011,558.5
67% token benchmark coverage
1720.9285.3325,003.5
67% token benchmark coverage
1820.6195.6712,533
67% token benchmark coverage
1920.3986.742,441
33% token benchmark coverage
2020.2470.632,002
33% token benchmark coverage
2118.7777.212,360
33% token benchmark coverage
2218.4093.8910,763.5
67% token benchmark coverage
2317.5590.2512,547
67% token benchmark coverage
2417.2294.617,580
67% token benchmark coverage
2515.3993.698,777.8
67% token benchmark coverage
2614.9589.597,889
67% token benchmark coverage
2712.4985.413,925
33% token benchmark coverage
2812.3782.2925,005
67% token benchmark coverage
2912.3385.313,970
33% token benchmark coverage
3012.2182.078,169
67% token benchmark coverage
3111.2690.739,844.5
67% token benchmark coverage
3211.1587.884,521
33% token benchmark coverage
3310.5781.044,399
33% token benchmark coverage
3410.0147.473,806.6
33% token benchmark coverage
358.8489.165,785
33% token benchmark coverage
368.8290.3910,772.5
67% token benchmark coverage
377.9592.0311,694.5
67% token benchmark coverage
387.1891.8015,874.5
67% token benchmark coverage
397.0489.0212,837.5
67% token benchmark coverage
406.5196.3214,335
67% token benchmark coverage
415.9296.0915,864.5
67% token benchmark coverage
425.3269.197,465
33% token benchmark coverage
434.8886.8317,067
67% token benchmark coverage
443.9892.8122,485.5
67% token benchmark coverage
452.8694.3618,922
33% token benchmark coverage
462.3489.4115,203
33% token benchmark coverage
472.0881.1815,530
33% token benchmark coverage
482.0194.6018,700
33% token benchmark coverage
491.5188.9223,463
33% token benchmark coverage
501.2685.7127,001
33% token benchmark coverage
511.2590.1528,740
33% token benchmark coverage
521.0188.7235,014
33% token benchmark coverage
530.9784.6634,707
33% token benchmark coverage
540.9380.5034,434
33% token benchmark coverage
550.7092.0552,644
33% token benchmark coverage
560.5991.4562,090
33% token benchmark coverage

Rank is global across models with published token accounting. Each token-accounted benchmark gives 100 points to its most efficient run; missing token benchmarks earn no points.

How Performance Is Aggregated

Each benchmark leader is set to 100. A model earns weighted points from every benchmark where it has a verified result; missing benchmarks earn no points, and the total produces one overall rank. Missing benchmarks are never estimated. They earn no ranking points, and coverage is shown beside every score.

How Efficiency Is Aggregated

Within each token-accounted benchmark, performance points per 1,000 output tokens are scored relative to the most efficient eligible run. Missing token-accounted benchmarks earn no points, and the total produces one overall rank. The graph uses the benchmark with the strongest configuration coverage and includes every published configuration. Highlighted points are not dominated on both benchmark performance and actual output-token spend.

How Estimated Cost Is Calculated

LiveBench quality is compared with estimated output cost using the lowest currently published USD output-token rate for each model. Score-adjusted output cost divides the estimated output cost for one published benchmark case by the model's LiveBench score as a fraction of 100. It is an estimate from published price and token artifacts, not an invoice or a task success rate.

Send Feedback