ToneBench
Towards AI · 2026-09-11-10-task-4ef099199c9c · Blind, panel-scored writing benchmark across a fixed set of real editorial scripts.
Model Ranking
Source | |||||||
|---|---|---|---|---|---|---|---|
| #1 | Claude Fable 5.1Anthropic | 89.71 | 60,786 | 50 | Claude Fable 5.1 (max effort)average per case | Original sourcenot winner eligible | Third-party benchmark |
| #2 | Claude Fable 5Anthropic | 89.06 | 18,129 | 50 | Claude Fable 5 (xhigh)average per case | Original sourcenot winner eligible | Third-party benchmark |
| #3 | Claude Opus 5Anthropic | 88.76 | 9,446 | 50 | Claude Opus 5 (max effort)average per case | Original sourcenot winner eligible | Third-party benchmark |
| #4 | GLM 5.3Z.ai | 88.34 | 22,204 | 50 | GLM-5.3average per case | Original sourcenot winner eligible | Third-party benchmark |
| #5 | GLM 5.3 FlashZ.ai | 88.19 | 25,960 | 50 | GLM-5.3 Flashaverage per case | Original sourcenot winner eligible | Third-party benchmark |
| #5 | Kimi K3Moonshot AI | 88.19 | 15,023 | 50 | Kimi K3average per case | Original sourcenot winner eligible | Third-party benchmark |
| #7 | DeepSeek V4.1 FlashDeepSeekSelected model | 88.03 | 18,199 | 50 | DeepSeek V4.1 Flash (max)average per case | Original sourcenot winner eligible | Third-party benchmark |
| #8 | GPT-5.6 SolOpenAI | 87.97 | 10,204 | 50 | GPT-5.6 Sol (ultra)average per case | Original sourcenot winner eligible | Third-party benchmark |
| #9 | Claude Opus 4.8Anthropic | 87.91 | 24,846 | 50 | Claude Opus 4.8 (max effort)average per case | Original sourcenot winner eligible | Third-party benchmark |
| #10 | Grok 4.6xAI | 86.61 | 15,575 | 50 | Grok 4.6average per case | Original sourcenot winner eligible | Third-party benchmark |
| #11 | Claude Sonnet 5Anthropic | 86.51 | 71,003 | 50 | Claude Sonnet 5 (max effort)average per case | Original sourcenot winner eligible | Third-party benchmark |
| #12 | GPT-5.6 TerraOpenAI | 86.39 | 11,336 | 50 | GPT-5.6 Terra (ultra)average per case | Original sourcenot winner eligible | Third-party benchmark |
| #13 | GPT-6 AstraOpenAI | 86.21 | 14,778 | 50 | GPT-6 Astra (max)average per case | Original sourcenot winner eligible | Third-party benchmark |
| #14 | GPT-5.4OpenAI | 85.60 | 10,941 | 50 | GPT-5.4 (xhigh)average per case | Original sourcenot winner eligible | Third-party benchmark |
| #15 | Claude Opus 4.7Anthropic | 85.49 | 4,840 | 50 | Claude Opus 4.7average per case | Original sourcenot winner eligible | Third-party benchmark |
| #16 | DeepSeek V4 Pro 0813DeepSeek | 84.68 | 18,462 | 50 | DeepSeek V4 Pro 0813 (max)average per case | Original sourcenot winner eligible | Third-party benchmark |
| #17 | GPT-5.6 LunaOpenAI | 84.47 | 17,605 | 50 | GPT-5.6 Luna (ultra)average per case | Original sourcenot winner eligible | Third-party benchmark |
| #18 | Claude Opus 4.6Anthropic | 84.21 | 13,556 | 50 | Claude Opus 4.6average per case | Original sourcenot winner eligible | Third-party benchmark |
| #19 | Claude Sonnet 4.6Anthropic | 83.63 | 18,675 | 50 | Claude Sonnet 4.6average per case | Original sourcenot winner eligible | Third-party benchmark |
| #20 | MiniMax M3MiniMax | 83.44 | 16,142 | 50 | MiniMax M3average per case | Original sourcenot winner eligible | Third-party benchmark |
| #21 | Qwen3.8 MaxQwen | 83.32 | 22,888 | 50 | Qwen3.8 Maxaverage per case | Original sourcenot winner eligible | Third-party benchmark |
| #22 | Qwen3.8 FlashQwen | 83.20 | 24,187 | 50 | Qwen3.8 Flashaverage per case | Original sourcenot winner eligible | Third-party benchmark |
| #23 | GLM 5Z.ai | 82.89 | 15,496 | 50 | GLM-5average per case | Original sourcenot winner eligible | Third-party benchmark |
| #24 | GPT-5.5OpenAI | 82.80 | 4,048 | 50 | GPT-5.5 (high)average per case | Original sourcenot winner eligible | Third-party benchmark |
| #25 | Muse Spark 1.3Meta | 82.63 | 6,301 | 50 | Muse Spark 1.3 (thinking)average per case | Original sourcenot winner eligible | Third-party benchmark |
| #26 | Kimi K2.6Moonshot AI | 82.55 | 16,745 | 50 | Kimi K2.6average per case | Original sourcenot winner eligible | Third-party benchmark |
| #27 | Grok 4.5xAI | 82.23 | 2,688 | 50 | Grok 4.5average per case | Original sourcenot winner eligible | Third-party benchmark |
| #28 | GPT-5.4 MiniOpenAI | 82.16 | 9,924 | 50 | GPT-5.4 mini (high)average per case | Original sourcenot winner eligible | Third-party benchmark |
| #29 | GLM 5.2Z.ai | 82.14 | 5,633 | 50 | GLM-5.2average per case | Original sourcenot winner eligible | Third-party benchmark |
| #30 | Qwen3.7 MaxQwen | 81.26 | 8,636 | 50 | Qwen3.7 Max (default)average per case | Original sourcenot winner eligible | Third-party benchmark |
| #31 | Muse Spark 1.1Meta | 80.76 | 6,037 | 50 | Muse Spark 1.1 (thinking)average per case | Original sourcenot winner eligible | Third-party benchmark |
| #32 | Gemini 3.1 ProGoogle DeepMind | 80.45 | 9,801 | 50 | Gemini 3.1 Pro (default)average per case | Original sourcenot winner eligible | Third-party benchmark |
| #33 | InklingThinking Machines Lab | 79.41 | 5,785 | 50 | Inklingaverage per case | Original sourcenot winner eligible | Third-party benchmark |
| #34 | DeepSeek V4 ProDeepSeek | 79.29 | 4,677 | 50 | DeepSeek V4 Pro (default)average per case | Original sourcenot winner eligible | Third-party benchmark |
| #35 | Gemini 3.7 FlashGoogle DeepMind | 79.18 | 5,196 | 50 | Gemini 3.7 Flash (default)average per case | Original sourcenot winner eligible | Third-party benchmark |
| #36 | Kimi K2 ThinkingMoonshot AI | 78.55 | 7,821 | 50 | Kimi K2 Thinkingaverage per case | Original sourcenot winner eligible | Third-party benchmark |
| #37 | Gemini 2.5 ProGoogle DeepMind | 78.27 | 4,521 | 50 | Gemini 2.5 Proaverage per case | Original sourcenot winner eligible | Third-party benchmark |
| #38 | Gemini 3.6 FlashGoogle DeepMind | 78.25 | 10,929 | 50 | Gemini 3.6 Flash (high thinking)average per case | Original sourcenot winner eligible | Third-party benchmark |
| #39 | Gemini 3.8 FlashGoogle DeepMind | 78.08 | 6,075 | 50 | Gemini 3.8 Flash (default)average per case | Original sourcenot winner eligible | Third-party benchmark |
| #39 | GPT-5.2OpenAI | 78.08 | 4,266 | 50 | GPT-5.2average per case | Original sourcenot winner eligible | Third-party benchmark |
| #41 | DeepSeek V4 FlashDeepSeek | 78.00 | 12,709 | 50 | DeepSeek V4 Flash (xhigh)average per case | Original sourcenot winner eligible | Third-party benchmark |
| #42 | GPT-5OpenAI | 77.82 | 5,896 | 50 | GPT-5average per case | Original sourcenot winner eligible | Third-party benchmark |
| #43 | Claude Sonnet 4.5Anthropic | 77.25 | 7,415 | 50 | Claude Sonnet 4.5average per case | Original sourcenot winner eligible | Third-party benchmark |
| #44 | NVIDIA Nemotron 3 Ultra 550B A55B BF16NVIDIA | 76.79 | 2,863 | 50 | Nemotron 3 Ultra 550Baverage per case | Original sourcenot winner eligible | Third-party benchmark |
| #45 | Gemini 3.5 FlashGoogle DeepMind | 76.43 | 13,736 | 50 | Gemini 3.5 Flash (default)average per case | Original sourcenot winner eligible | Third-party benchmark |
| #46 | GPT-5 MiniOpenAI | 76.07 | 3,925 | 50 | GPT-5 miniaverage per case | Original sourcenot winner eligible | Third-party benchmark |
| #47 | GPT-5.1OpenAI | 75.98 | 3,970 | 50 | GPT-5.1average per case | Original sourcenot winner eligible | Third-party benchmark |
| #48 | Claude Haiku 4.5Anthropic | 75.15 | 10,996 | 50 | Claude Haiku 4.5average per case | Original sourcenot winner eligible | Third-party benchmark |
| #49 | Grok 4.3xAI | 74.91 | 5,154 | 50 | Grok 4.3 (high)average per case | Original sourcenot winner eligible | Third-party benchmark |
| #50 | Gemini 3.5 Flash LiteGoogle DeepMind | 73.42 | 1,966 | 50 | Gemini 3.5 Flash-Liteaverage per case | Original sourcenot winner eligible | Third-party benchmark |
| #51 | Gemini 2.5 FlashGoogle DeepMind | 72.17 | 4,399 | 50 | Gemini 2.5 Flashaverage per case | Original sourcenot winner eligible | Third-party benchmark |
| #52 | Gemini 3.1 Flash LiteGoogle DeepMind | 71.30 | 1,628 | 50 | Gemini 3.1 Flash-Liteaverage per case | Original sourcenot winner eligible | Third-party benchmark |
| #53 | Mistral Large 3Mistral AI | 70.39 | 2,056 | 50 | Mistral Large 3average per case | Original sourcenot winner eligible | Third-party benchmark |
| #54 | GPT-5.4 NanoOpenAI | 69.12 | 3,831 | 50 | GPT-5.4 nanoaverage per case | Original sourcenot winner eligible | Third-party benchmark |
| #55 | Gemini 2.5 Flash LiteGoogle DeepMind | 68.76 | 2,360 | 50 | Gemini 2.5 Flash-Liteaverage per case | Original sourcenot winner eligible | Third-party benchmark |
| #56 | gpt-oss-120bOpenAI | 68.01 | 7,577 | 50 | gpt-oss 120B (high)average per case | Original sourcenot winner eligible | Third-party benchmark |
| #57 | Command A ReasoningCohere | 62.90 | 2,002 | 50 | Cohere Command A Reasoningaverage per case | Original sourcenot winner eligible | Third-party benchmark |
| #58 | Llama 4 Maverick 17B 128E InstructMeta | 62.45 | 1,154 | 50 | Llama 4 Maverickaverage per case | Original sourcenot winner eligible | Third-party benchmark |
| #59 | GPT-5 NanoOpenAI | 61.62 | 7,465 | 50 | GPT-5 nanoaverage per case | Original sourcenot winner eligible | Third-party benchmark |
| #60 | Command ACohere | 60.90 | 1,177 | 50 | Cohere Command A (03-2025)average per case | Original sourcenot winner eligible | Third-party benchmark |
| #61 | GPT-4oOpenAI | 58.66 | 1,174 | 50 | GPT-4oaverage per case | Original sourcenot winner eligible | Third-party benchmark |
| #62 | GPT-4o MiniOpenAI | 58.13 | 1,347 | 50 | GPT-4o miniaverage per case | Original sourcenot winner eligible | Third-party benchmark |
| #63 | Llama 3.1 8B InstructMeta | 47.92 | 1,165 | 50 | Llama 3.1 8Baverage per case | Original sourcenot winner eligible | Third-party benchmark |
| #64 | Llama 4 Scout 17B 16E InstructMeta | 47.32 | 696 | 50 | Llama 4 Scoutaverage per case | Original sourcenot winner eligible | Third-party benchmark |
64 models ranked by the best winner-eligible current-version score when available, otherwise the best publisher-artifact score; highest first. Observed Sep 22, 2026. The model you came from is highlighted.
Methodology and Coverage
Primary Evidence
Publisher Artifacts
Questions
ToneBench FAQs
What does ToneBench measure?+
Blind, panel-scored writing benchmark across a fixed set of real editorial scripts. Model Markets classifies it as a writing benchmark and preserves the publisher's 2026-09-11-10-task-4ef099199c9c release as a distinct comparison cohort.
How are models ranked on ToneBench?+
Models are ordered by overall score in points, with higher scores ranked first. Each model appears once; a verified winner-eligible current-version result takes precedence over a publisher-artifact-only result, and missing scores are not estimated.
Which model currently leads ToneBench?+
Claude Fable 5.1 leads the current verified table with 89.71 points on 2026-09-11-10-task-4ef099199c9c. This is a benchmark-specific result, not a universal model-quality claim.
How many models have a published ToneBench score?+
64 catalog models are published from 148 source rows. 31 source identities remain quarantined rather than guessed.
Can ToneBench scores be compared with other benchmarks?+
Raw scores should be compared only within the same benchmark version, metric, and protocol. The Intelligence ranking normalizes its three pinned core sources to a frozen reference range, requires at least two sources, and labels two-source rows partial instead of estimating the missing input. View aggregate rankings →
Why might a model be missing from ToneBench?+
A model remains absent when the publisher has no current result, the source model identity is unresolved, the evaluation protocol is incompatible, or the evidence cannot be verified. Model Markets does not substitute a provider claim or infer a score from a related model.
How current is the ToneBench leaderboard?+
The current Model Markets snapshot was observed Sep 22, 2026 from Towards AI artifacts. The exact publisher source and each retained result artifact are linked on this page.