ToneBench

Towards AI · 2026-09-11-10-task-4ef099199c9c · Blind, panel-scored writing benchmark across a fixed set of real editorial scripts.

Model Ranking

Source
#1Claude Fable 5.1Anthropic89.71points60,78650Claude Fable 5.1 (max effort)average per caseOriginal sourcenot winner eligibleThird-party benchmark
#2Claude Fable 5Anthropic89.06points18,12950Claude Fable 5 (xhigh)average per caseOriginal sourcenot winner eligibleThird-party benchmark
#3Claude Opus 5Anthropic88.76points9,44650Claude Opus 5 (max effort)average per caseOriginal sourcenot winner eligibleThird-party benchmark
#4GLM 5.3Z.ai88.34points22,20450GLM-5.3average per caseOriginal sourcenot winner eligibleThird-party benchmark
#5GLM 5.3 FlashZ.ai88.19points25,96050GLM-5.3 Flashaverage per caseOriginal sourcenot winner eligibleThird-party benchmark
#5Kimi K3Moonshot AI88.19points15,02350Kimi K3average per caseOriginal sourcenot winner eligibleThird-party benchmark
#7DeepSeek V4.1 FlashDeepSeekSelected model88.03points18,19950DeepSeek V4.1 Flash (max)average per caseOriginal sourcenot winner eligibleThird-party benchmark
#8GPT-5.6 SolOpenAI87.97points10,20450GPT-5.6 Sol (ultra)average per caseOriginal sourcenot winner eligibleThird-party benchmark
#9Claude Opus 4.8Anthropic87.91points24,84650Claude Opus 4.8 (max effort)average per caseOriginal sourcenot winner eligibleThird-party benchmark
#10Grok 4.6xAI86.61points15,57550Grok 4.6average per caseOriginal sourcenot winner eligibleThird-party benchmark
#11Claude Sonnet 5Anthropic86.51points71,00350Claude Sonnet 5 (max effort)average per caseOriginal sourcenot winner eligibleThird-party benchmark
#12GPT-5.6 TerraOpenAI86.39points11,33650GPT-5.6 Terra (ultra)average per caseOriginal sourcenot winner eligibleThird-party benchmark
#13GPT-6 AstraOpenAI86.21points14,77850GPT-6 Astra (max)average per caseOriginal sourcenot winner eligibleThird-party benchmark
#14GPT-5.4OpenAI85.60points10,94150GPT-5.4 (xhigh)average per caseOriginal sourcenot winner eligibleThird-party benchmark
#15Claude Opus 4.7Anthropic85.49points4,84050Claude Opus 4.7average per caseOriginal sourcenot winner eligibleThird-party benchmark
#16DeepSeek V4 Pro 0813DeepSeek84.68points18,46250DeepSeek V4 Pro 0813 (max)average per caseOriginal sourcenot winner eligibleThird-party benchmark
#17GPT-5.6 LunaOpenAI84.47points17,60550GPT-5.6 Luna (ultra)average per caseOriginal sourcenot winner eligibleThird-party benchmark
#18Claude Opus 4.6Anthropic84.21points13,55650Claude Opus 4.6average per caseOriginal sourcenot winner eligibleThird-party benchmark
#19Claude Sonnet 4.6Anthropic83.63points18,67550Claude Sonnet 4.6average per caseOriginal sourcenot winner eligibleThird-party benchmark
#20MiniMax M3MiniMax83.44points16,14250MiniMax M3average per caseOriginal sourcenot winner eligibleThird-party benchmark
#21Qwen3.8 MaxQwen83.32points22,88850Qwen3.8 Maxaverage per caseOriginal sourcenot winner eligibleThird-party benchmark
#22Qwen3.8 FlashQwen83.20points24,18750Qwen3.8 Flashaverage per caseOriginal sourcenot winner eligibleThird-party benchmark
#23GLM 5Z.ai82.89points15,49650GLM-5average per caseOriginal sourcenot winner eligibleThird-party benchmark
#24GPT-5.5OpenAI82.80points4,04850GPT-5.5 (high)average per caseOriginal sourcenot winner eligibleThird-party benchmark
#25Muse Spark 1.3Meta82.63points6,30150Muse Spark 1.3 (thinking)average per caseOriginal sourcenot winner eligibleThird-party benchmark
#26Kimi K2.6Moonshot AI82.55points16,74550Kimi K2.6average per caseOriginal sourcenot winner eligibleThird-party benchmark
#27Grok 4.5xAI82.23points2,68850Grok 4.5average per caseOriginal sourcenot winner eligibleThird-party benchmark
#28GPT-5.4 MiniOpenAI82.16points9,92450GPT-5.4 mini (high)average per caseOriginal sourcenot winner eligibleThird-party benchmark
#29GLM 5.2Z.ai82.14points5,63350GLM-5.2average per caseOriginal sourcenot winner eligibleThird-party benchmark
#30Qwen3.7 MaxQwen81.26points8,63650Qwen3.7 Max (default)average per caseOriginal sourcenot winner eligibleThird-party benchmark
#31Muse Spark 1.1Meta80.76points6,03750Muse Spark 1.1 (thinking)average per caseOriginal sourcenot winner eligibleThird-party benchmark
#32Gemini 3.1 ProGoogle DeepMind80.45points9,80150Gemini 3.1 Pro (default)average per caseOriginal sourcenot winner eligibleThird-party benchmark
#33InklingThinking Machines Lab79.41points5,78550Inklingaverage per caseOriginal sourcenot winner eligibleThird-party benchmark
#34DeepSeek V4 ProDeepSeek79.29points4,67750DeepSeek V4 Pro (default)average per caseOriginal sourcenot winner eligibleThird-party benchmark
#35Gemini 3.7 FlashGoogle DeepMind79.18points5,19650Gemini 3.7 Flash (default)average per caseOriginal sourcenot winner eligibleThird-party benchmark
#36Kimi K2 ThinkingMoonshot AI78.55points7,82150Kimi K2 Thinkingaverage per caseOriginal sourcenot winner eligibleThird-party benchmark
#37Gemini 2.5 ProGoogle DeepMind78.27points4,52150Gemini 2.5 Proaverage per caseOriginal sourcenot winner eligibleThird-party benchmark
#38Gemini 3.6 FlashGoogle DeepMind78.25points10,92950Gemini 3.6 Flash (high thinking)average per caseOriginal sourcenot winner eligibleThird-party benchmark
#39Gemini 3.8 FlashGoogle DeepMind78.08points6,07550Gemini 3.8 Flash (default)average per caseOriginal sourcenot winner eligibleThird-party benchmark
#39GPT-5.2OpenAI78.08points4,26650GPT-5.2average per caseOriginal sourcenot winner eligibleThird-party benchmark
#41DeepSeek V4 FlashDeepSeek78.00points12,70950DeepSeek V4 Flash (xhigh)average per caseOriginal sourcenot winner eligibleThird-party benchmark
#42GPT-5OpenAI77.82points5,89650GPT-5average per caseOriginal sourcenot winner eligibleThird-party benchmark
#43Claude Sonnet 4.5Anthropic77.25points7,41550Claude Sonnet 4.5average per caseOriginal sourcenot winner eligibleThird-party benchmark
#44NVIDIA Nemotron 3 Ultra 550B A55B BF16NVIDIA76.79points2,86350Nemotron 3 Ultra 550Baverage per caseOriginal sourcenot winner eligibleThird-party benchmark
#45Gemini 3.5 FlashGoogle DeepMind76.43points13,73650Gemini 3.5 Flash (default)average per caseOriginal sourcenot winner eligibleThird-party benchmark
#46GPT-5 MiniOpenAI76.07points3,92550GPT-5 miniaverage per caseOriginal sourcenot winner eligibleThird-party benchmark
#47GPT-5.1OpenAI75.98points3,97050GPT-5.1average per caseOriginal sourcenot winner eligibleThird-party benchmark
#48Claude Haiku 4.5Anthropic75.15points10,99650Claude Haiku 4.5average per caseOriginal sourcenot winner eligibleThird-party benchmark
#49Grok 4.3xAI74.91points5,15450Grok 4.3 (high)average per caseOriginal sourcenot winner eligibleThird-party benchmark
#50Gemini 3.5 Flash LiteGoogle DeepMind73.42points1,96650Gemini 3.5 Flash-Liteaverage per caseOriginal sourcenot winner eligibleThird-party benchmark
#51Gemini 2.5 FlashGoogle DeepMind72.17points4,39950Gemini 2.5 Flashaverage per caseOriginal sourcenot winner eligibleThird-party benchmark
#52Gemini 3.1 Flash LiteGoogle DeepMind71.30points1,62850Gemini 3.1 Flash-Liteaverage per caseOriginal sourcenot winner eligibleThird-party benchmark
#53Mistral Large 3Mistral AI70.39points2,05650Mistral Large 3average per caseOriginal sourcenot winner eligibleThird-party benchmark
#54GPT-5.4 NanoOpenAI69.12points3,83150GPT-5.4 nanoaverage per caseOriginal sourcenot winner eligibleThird-party benchmark
#55Gemini 2.5 Flash LiteGoogle DeepMind68.76points2,36050Gemini 2.5 Flash-Liteaverage per caseOriginal sourcenot winner eligibleThird-party benchmark
#56gpt-oss-120bOpenAI68.01points7,57750gpt-oss 120B (high)average per caseOriginal sourcenot winner eligibleThird-party benchmark
#57Command A ReasoningCohere62.90points2,00250Cohere Command A Reasoningaverage per caseOriginal sourcenot winner eligibleThird-party benchmark
#58Llama 4 Maverick 17B 128E InstructMeta62.45points1,15450Llama 4 Maverickaverage per caseOriginal sourcenot winner eligibleThird-party benchmark
#59GPT-5 NanoOpenAI61.62points7,46550GPT-5 nanoaverage per caseOriginal sourcenot winner eligibleThird-party benchmark
#60Command ACohere60.90points1,17750Cohere Command A (03-2025)average per caseOriginal sourcenot winner eligibleThird-party benchmark
#61GPT-4oOpenAI58.66points1,17450GPT-4oaverage per caseOriginal sourcenot winner eligibleThird-party benchmark
#62GPT-4o MiniOpenAI58.13points1,34750GPT-4o miniaverage per caseOriginal sourcenot winner eligibleThird-party benchmark
#63Llama 3.1 8B InstructMeta47.92points1,16550Llama 3.1 8Baverage per caseOriginal sourcenot winner eligibleThird-party benchmark
#64Llama 4 Scout 17B 16E InstructMeta47.32points69650Llama 4 Scoutaverage per caseOriginal sourcenot winner eligibleThird-party benchmark

64 models ranked by the best winner-eligible current-version score when available, otherwise the best publisher-artifact score; highest first. Observed Sep 22, 2026. The model you came from is highlighted.

Methodology and Coverage

Ranking protocoloverall score · points. Each model appears once; verified winner-eligible runs take precedence, and missing models are not imputed.
Acquisition coverage64 published models from 148 source rows; 31 source identities remain quarantined.

Primary Evidence

Publisher Artifacts

Questions

ToneBench FAQs

What does ToneBench measure?+

Blind, panel-scored writing benchmark across a fixed set of real editorial scripts. Model Markets classifies it as a writing benchmark and preserves the publisher's 2026-09-11-10-task-4ef099199c9c release as a distinct comparison cohort.

How are models ranked on ToneBench?+

Models are ordered by overall score in points, with higher scores ranked first. Each model appears once; a verified winner-eligible current-version result takes precedence over a publisher-artifact-only result, and missing scores are not estimated.

Which model currently leads ToneBench?+

Claude Fable 5.1 leads the current verified table with 89.71 points on 2026-09-11-10-task-4ef099199c9c. This is a benchmark-specific result, not a universal model-quality claim.

How many models have a published ToneBench score?+

64 catalog models are published from 148 source rows. 31 source identities remain quarantined rather than guessed.

Can ToneBench scores be compared with other benchmarks?+

Raw scores should be compared only within the same benchmark version, metric, and protocol. The Intelligence ranking normalizes its three pinned core sources to a frozen reference range, requires at least two sources, and labels two-source rows partial instead of estimating the missing input. View aggregate rankings

Why might a model be missing from ToneBench?+

A model remains absent when the publisher has no current result, the source model identity is unresolved, the evaluation protocol is incompatible, or the evidence cannot be verified. Model Markets does not substitute a provider claim or infer a score from a related model.

How current is the ToneBench leaderboard?+

The current Model Markets snapshot was observed Sep 22, 2026 from Towards AI artifacts. The exact publisher source and each retained result artifact are linked on this page.

Send Feedback