Benchmark suiteLatest source data: Sep 1, 2026Checked: September 2, 2026

Reasoning and knowledge rankings.

A clean reasoning surface that starts with available Arena signals and keeps LiveBench, HELM Capabilities, MMLU-Pro, GPQA, and AIME-style math benchmarks visible as planned source integrations.

Ranked models

142

Text, docs, or vision signal

Reasoning variants

50

Models tagged from public names

Top proxy

Claude Fable 5

100 reasoning proxy

LiveBench

Planned

Fresh reasoning feed

Reasoning formula

A proxy until dedicated reasoning feeds are wired.

The current index blends Text, Docs, and Vision Arena scores. It is useful for broad comparison, but dedicated LiveBench, GPQA, AIME, MMLU-Pro, and HELM signals should be treated as the next data layer.

Reasoning and knowledge proxy

Higher proxy index is better. Dedicated reasoning benchmarks are source-ready but not silently mixed in yet.

Top 30 of 142

#1
Claude Fable 5

claude-fable-5

AnthropicProprietary
100reasoning proxy
Text
1,507Text Arena rank #1
Docs
1,507Docs Arena rank #1
Vision
1,313Vision Arena rank #1
Mode
Standardmode signal
Text ArenaDocs ArenaVision Arena
#2
Claude Opus 4.6 High

claude-opus-4-6-high

AnthropicProprietary
95reasoning proxy
Text
1,505Text Arena rank #2
Docs
Not listedDocs Arena
Vision
1,299Vision Arena rank #5
Mode
Reasoningmode signal
Text ArenaDocs ArenaVision Arena
#3
Claude Opus 4.7 High

claude-opus-4-7-high

AnthropicProprietary
93reasoning proxy
Text
1,502Text Arena rank #3
Docs
Not listedDocs Arena
Vision
1,301Vision Arena rank #2
Mode
Reasoningmode signal
Text ArenaDocs ArenaVision Arena
#4
Claude Opus 4.7 Thinking

claude-opus-4-7-thinking

AnthropicProprietary
90reasoning proxy
Text
Not listedText Arena
Docs
1,496Docs Arena rank #3
Vision
Not listedVision Arena
Mode
Reasoningmode signal
Text ArenaDocs ArenaVision Arena
#5
Muse Spark 1.2

muse-spark-1.2 (xHigh)

MetaProprietary
89reasoning proxy
Text
1,499Text Arena rank #4
Docs
Not listedDocs Arena
Vision
1,292Vision Arena rank #8
Mode
Reasoningmode signal
Text ArenaDocs ArenaVision Arena
#6
Claude Opus 4.6

claude-opus-4-6

AnthropicProprietary
88reasoning proxy
Text
1,498Text Arena rank #5
Docs
1,495Docs Arena rank #4
Vision
1,293Vision Arena rank #7
Mode
Standardmode signal
Text ArenaDocs ArenaVision Arena
#7
Claude Opus 4.7

claude-opus-4-7

AnthropicProprietary
88reasoning proxy
Text
1,494Text Arena rank #6
Docs
1,497Docs Arena rank #2
Vision
1,299Vision Arena rank #4
Mode
Standardmode signal
Text ArenaDocs ArenaVision Arena
#8
Claude Opus 4.6 Thinking

claude-opus-4-6-thinking

AnthropicProprietary
87reasoning proxy
Text
Not listedText Arena
Docs
1,493Docs Arena rank #5
Vision
Not listedVision Arena
Mode
Reasoningmode signal
Text ArenaDocs ArenaVision Arena
#9
Claude Opus 5 High

claude-opus-5-high

AnthropicProprietary
84reasoning proxy
Text
1,492Text Arena rank #7
Docs
1,493Docs Arena rank #6
Vision
1,290Vision Arena rank #9
Mode
Reasoningmode signal
Text ArenaDocs ArenaVision Arena
#10
Claude Opus 4.8 Thinking

claude-opus-4-8-thinking

AnthropicProprietary
81reasoning proxy
Text
Not listedText Arena
Docs
1,487Docs Arena rank #7
Vision
Not listedVision Arena
Mode
Reasoningmode signal
Text ArenaDocs ArenaVision Arena
#11
Gemini 3.7 Flash High

gemini-3.7-flash-high

GoogleProprietary
80reasoning proxy
Text
1,491Text Arena rank #9
Docs
Not listedDocs Arena
Vision
Not listedVision Arena
Mode
Reasoningmode signal
Text ArenaDocs ArenaVision Arena
#12
Muse Spark 1.1

muse-spark-1.1

MetaProprietary
80reasoning proxy
Text
1,492Text Arena rank #8
Docs
1,483Docs Arena rank #8
Vision
1,279Vision Arena rank #22
Mode
Standardmode signal
Text ArenaDocs ArenaVision Arena
#13
Kimi K3 Max

kimi-k3-max

Moonshot AIProprietary
78reasoning proxy
Text
1,489Text Arena rank #10
Docs
Not listedDocs Arena
Vision
Not listedVision Arena
Mode
Standardmode signal
Text ArenaDocs ArenaVision Arena
#14
Claude Opus 5 Max

claude-opus-5-max

AnthropicProprietary
76reasoning proxy
Text
1,488Text Arena rank #12
Docs
Not listedDocs Arena
Vision
Not listedVision Arena
Mode
Standardmode signal
Text ArenaDocs ArenaVision Arena
#15
Muse Spark

muse-spark

MetaProprietary
75reasoning proxy
Text
1,488Text Arena rank #11
Docs
1,466Docs Arena rank #18
Vision
1,294Vision Arena rank #6
Mode
Standardmode signal
Text ArenaDocs ArenaVision Arena
#16
Qwen3.8 Max

qwen3.8-max

AlibabaProprietary
75reasoning proxy
Text
1,479Text Arena rank #20
Docs
Not listedDocs Arena
Vision
1,300Vision Arena rank #3
Mode
Standardmode signal
Text ArenaDocs ArenaVision Arena
#17
GPT-5.6 Sol xHigh

gpt-5.6-sol-xhigh

OpenAIProprietary
74reasoning proxy
Text
1,483Text Arena rank #16
Docs
1,481Docs Arena rank #11
Vision
1,282Vision Arena rank #17
Mode
Reasoningmode signal
Text ArenaDocs ArenaVision Arena
#18
Claude Opus 4.8 High

claude-opus-4-8-high

AnthropicProprietary
74reasoning proxy
Text
1,482Text Arena rank #18
Docs
Not listedDocs Arena
Vision
1,285Vision Arena rank #12
Mode
Reasoningmode signal
Text ArenaDocs ArenaVision Arena
#19
GPT-5.5 High

gpt-5.5-high

OpenAIProprietary
73reasoning proxy
Text
1,482Text Arena rank #17
Docs
1,478Docs Arena rank #13
Vision
1,284Vision Arena rank #15
Mode
Reasoningmode signal
Text ArenaDocs ArenaVision Arena
#20
Gemini 3.6 Flash High

gemini-3.6-flash-high

GoogleProprietary
72reasoning proxy
Text
1,480Text Arena rank #19
Docs
Not listedDocs Arena
Vision
1,285Vision Arena rank #13
Mode
Reasoningmode signal
Text ArenaDocs ArenaVision Arena
#21
Gemini 3.5 Flash High

gemini-3.5-flash-high

GoogleProprietary
71reasoning proxy
Text
1,479Text Arena rank #21
Docs
Not listedDocs Arena
Vision
1,284Vision Arena rank #14
Mode
Reasoningmode signal
Text ArenaDocs ArenaVision Arena
#22
Gemini 3.1 Pro Preview

gemini-3.1-pro-preview

GoogleProprietary
71reasoning proxy
Text
1,487Text Arena rank #13
Docs
1,460Docs Arena rank #22
Vision
1,278Vision Arena rank #24
Mode
Standardmode signal
Text ArenaDocs ArenaVision Arena
#23
GLM 5.3 Max

glm-5.3-max

Z.aiOpen weights
70reasoning proxy
Text
1,483Text Arena rank #15
Docs
Not listedDocs Arena
Vision
Not listedVision Arena
Mode
Standardmode signal
Text ArenaDocs ArenaVision Arena
#24
GPT-5.5

gpt-5.5

OpenAIProprietary
70reasoning proxy
Text
1,477Text Arena rank #22
Docs
1,475Docs Arena rank #15
Vision
1,286Vision Arena rank #11
Mode
Standardmode signal
Text ArenaDocs ArenaVision Arena
#25
Gemini 3 Pro

gemini-3-pro

GoogleProprietary
70reasoning proxy
Text
1,486Text Arena rank #14
Docs
1,451Docs Arena rank #24
Vision
1,289Vision Arena rank #10
Mode
Standardmode signal
Text ArenaDocs ArenaVision Arena
#26
Claude Opus 4.8

claude-opus-4-8

AnthropicProprietary
68reasoning proxy
Text
1,473Text Arena rank #31
Docs
1,482Docs Arena rank #10
Vision
1,279Vision Arena rank #21
Mode
Standardmode signal
Text ArenaDocs ArenaVision Arena
#27
GPT-5.4 High

gpt-5.4-high

OpenAIProprietary
68reasoning proxy
Text
1,476Text Arena rank #23
Docs
Not listedDocs Arena
Vision
1,281Vision Arena rank #19
Mode
Reasoningmode signal
Text ArenaDocs ArenaVision Arena
#28
GPT-5.2 Chat Latest 20260210

gpt-5.2-chat-latest-20260210

OpenAIProprietary
68reasoning proxy
Text
1,476Text Arena rank #24
Docs
Not listedDocs Arena
Vision
1,279Vision Arena rank #23
Mode
Standardmode signal
Text ArenaDocs ArenaVision Arena
#29
Claude Sonnet 4.6

claude-sonnet-4-6

AnthropicProprietary
66reasoning proxy
Text
1,472Text Arena rank #33
Docs
1,478Docs Arena rank #14
Vision
1,275Vision Arena rank #26
Mode
Standardmode signal
Text ArenaDocs ArenaVision Arena
#30
GLM 5.3 Flash

glm-5.3-flash

Z.aiOpen weights
65reasoning proxy
Text
1,474Text Arena rank #27
Docs
Not listedDocs Arena
Vision
1,273Vision Arena rank #27
Mode
Standardmode signal
Text ArenaDocs ArenaVision Arena

Benchmark guide

What the scores mean.

A quick reading key for reasoning and knowledge rankings while dedicated reasoning benchmark feeds are being integrated.

Higher: reasoning proxyLiveBench planned
What does the reasoning proxy measure?

The reasoning proxy currently blends Text, Document, and Vision Arena scores. It is an orientation layer for broad model capability, not a replacement for dedicated reasoning benchmarks like LiveBench, GPQA, AIME, or MMLU-Pro.

Why use Arena scores for reasoning?

Arena scores are live public signals with broad model coverage. They are useful while dedicated reasoning feeds are being wired, but they should be read as preference-based capability signals rather than exam-style accuracy scores.

What will LiveBench add?

LiveBench is designed to update over time and reduce benchmark contamination risk. Once integrated, it can add more direct reasoning, math, data, and coding task signals to this page.

Why are reasoning modes only a signal?

A model name or tag like Thinking, Reasoning, or High can indicate an inference mode, but it is not itself a benchmark score. The page treats those labels as context, not as proof of better reasoning.