Rankings
Intelligence, cost, and their combined efficiency—using every eligible model.
Intelligence
22 eligible · v1.2 · Sep 3, 2026 · Higher is better
- 96.1
Claude Fable 5
- 94.1
Claude Opus 5
- 87.8
Gemini 3.7 Flash
- 85.2
GPT-5.6 Sol
- 84.2
GPT-5.5
- 78.9
Claude Opus 4.7
- 76.2
Claude Opus 4.6
- 75.0
GPT-5.6 Terra
- 72.8
GPT-5.4
- 72.0
Gemini 3.5 Flash
- 71.3
Kimi K3 - 69.9
Claude Opus 4.8
- 67.6
Grok 4.6
- 66.5
Gemini 3.6 Flash
- 60.5
Grok 4.5
- 60.3
Claude Sonnet 4.6
- 52.8
GPT-5.6 Luna
- 49.3
GPT-5.2
- 41.8
DeepSeek V4 Flash - 20.2
GPT-5.4 Mini
- 17.8
Gemini 3.5 Flash Lite
- 14.7
GPT-5.4 Nano
Cost
36 eligible · output cost per LiveBench case · Lower is better
- $0.0020
Grok Build 0.1
- $0.0060
DeepSeek V4 Flash - $0.0087
GLM 5.3 Flash
- $0.017
MiniMax M3 - $0.026
GPT-5.6 Luna
- $0.028
Grok 4.3
- $0.029
Gemini 3.5 Flash Lite
- $0.035
DeepSeek V4 Flash Vision Exp - $0.054
DeepSeek V4 Pro - $0.055
Gemini 3.6 Flash
- $0.056
GLM 5.2
- $0.057
Qwen3.7 Max - $0.058
GPT-5.4 Nano
- $0.063
Grok 4.5
- $0.085
Gemini 3.7 Flash
- $0.086
Qwen3.8 27B - $0.095
Kimi K2.6 - $0.097
Grok 4.6
- $0.107
Qwen3.8 Max - $0.117
GPT-5.6 Sol
- $0.140
Gemini 3.5 Flash
- $0.161
Gemini 3.1 Pro
- $0.161
GPT-5.2
- $0.194
Kimi K3 - $0.198
Claude Sonnet 4.6
- $0.214
GPT-5.4 Mini
- $0.241
Claude Opus 4.6
- $0.248
GLM 5.3
- $0.266
GPT-5.6 Terra
- $0.274
GPT-5.4
- $0.286
Claude Opus 4.7
- $0.341
GPT-5.5
- $0.371
Claude Opus 5
- $0.380
Claude Opus 4.5
- $0.604
Claude Opus 4.8
- $1.01
Claude Fable 5
Efficiency
22 eligible · v1.0 · Higher is better
- 70.9
DeepSeek V4 Flash - 68.1
Gemini 3.7 Flash
- 63.6
GPT-5.6 Sol
- 62.0
GPT-5.6 Luna
- 61.6
Gemini 3.6 Flash
- 57.3
Grok 4.5
- 56.8
Claude Opus 5
- 56.6
Grok 4.6
- 55.3
Gemini 3.5 Flash
- 52.7
GPT-5.5
- 52.1
Claude Opus 4.6
- 51.8
Claude Opus 4.7
- 51.7
Kimi K3 - 50.5
GPT-5.6 Terra
- 49.1
GPT-5.4
- 48.0
Claude Fable 5
- 46.0
Claude Sonnet 4.6
- 43.6
Gemini 3.5 Flash Lite
- 42.6
GPT-5.2
- 40.0
Claude Opus 4.8
- 35.3
GPT-5.4 Nano
- 25.3
GPT-5.4 Mini
Every panel includes the complete eligible cohort in exact rank order. Scroll horizontally to compare all models; unavailable benchmark, token, or pricing inputs remain unranked rather than estimated.