Benchmark suiteLatest source data: Sep 1, 2026Checked: September 3, 2026

Long context rankings.

A focused page for document-heavy and retrieval-heavy work. The current view uses Docs, Search, and Text Arena signals while HELM Long Context and context-window metadata are prepared as the next data layer.

Ranked models

128

Docs, search, or text signal

Docs coverage

38

Document Arena rows

Search coverage

34

Search Arena rows

HELM context

Planned

Long-context leaderboard feed

Context formula

Document skill first, retrieval support second.

The context proxy blends Document Arena, Search Arena, and Text Arena scores. It does not claim a context-window size or true long-context pass rate until a dedicated source row is available.

Long-context proxy

Higher proxy index is better. HELM Long Context is shown as a planned source rather than a hidden assumption.

Top 30 of 128

#1
Claude Opus 4.6 High

claude-opus-4-6-high

AnthropicProprietary
98context proxy
Docs
Not listedDocs Arena
Search
Not listedSearch Arena
Text
1,505Text Arena rank #2
Context
HELM pendinglong-context feed
Docs ArenaSearch ArenaText Arena
#2
Claude Fable 5

claude-fable-5

AnthropicProprietary
96context proxy
Docs
1,507Docs Arena rank #1
Search
1,229Search Arena rank #2
Text
1,507Text Arena rank #1
Context
HELM pendinglong-context feed
Docs ArenaSearch ArenaText Arena
#3
Claude Opus 4.7 High

claude-opus-4-7-high

AnthropicProprietary
94context proxy
Docs
Not listedDocs Arena
Search
Not listedSearch Arena
Text
1,502Text Arena rank #3
Context
HELM pendinglong-context feed
Docs ArenaSearch ArenaText Arena
#4
Muse Spark 1.2

muse-spark-1.2 (xHigh)

MetaProprietary
90context proxy
Docs
Not listedDocs Arena
Search
Not listedSearch Arena
Text
1,499Text Arena rank #4
Context
HELM pendinglong-context feed
Docs ArenaSearch ArenaText Arena
#5
Claude Opus 4.7 Thinking

claude-opus-4-7-thinking

AnthropicProprietary
90context proxy
Docs
1,496Docs Arena rank #3
Search
Not listedSearch Arena
Text
Not listedText Arena
Context
HELM pendinglong-context feed
Docs ArenaSearch ArenaText Arena
#6
Claude Opus 4.6

claude-opus-4-6

AnthropicProprietary
89context proxy
Docs
1,495Docs Arena rank #4
Search
Not listedSearch Arena
Text
1,498Text Arena rank #5
Context
HELM pendinglong-context feed
Docs ArenaSearch ArenaText Arena
#7
Claude Opus 4.6 Thinking

claude-opus-4-6-thinking

AnthropicProprietary
87context proxy
Docs
1,493Docs Arena rank #5
Search
Not listedSearch Arena
Text
Not listedText Arena
Context
HELM pendinglong-context feed
Docs ArenaSearch ArenaText Arena
#8
Claude Opus 4.7

claude-opus-4-7

AnthropicProprietary
85context proxy
Docs
1,497Docs Arena rank #2
Search
1,212Search Arena rank #5
Text
1,494Text Arena rank #6
Context
HELM pendinglong-context feed
Docs ArenaSearch ArenaText Arena
#9
Claude Opus 5 High

claude-opus-5-high

AnthropicProprietary
85context proxy
Docs
1,493Docs Arena rank #6
Search
Not listedSearch Arena
Text
1,492Text Arena rank #7
Context
HELM pendinglong-context feed
Docs ArenaSearch ArenaText Arena
#10
GPT-5.5 Search

gpt-5.5-search

OpenAIProprietary
84context proxy
Docs
Not listedDocs Arena
Search
1,224Search Arena rank #3
Text
Not listedText Arena
Context
HELM pendinglong-context feed
Docs ArenaSearch ArenaText Arena
#11
Claude Opus 4.6 Search

claude-opus-4-6-search

AnthropicProprietary
83context proxy
Docs
Not listedDocs Arena
Search
1,223Search Arena rank #4
Text
Not listedText Arena
Context
HELM pendinglong-context feed
Docs ArenaSearch ArenaText Arena
#12
Claude Opus 4.8 Thinking

claude-opus-4-8-thinking

AnthropicProprietary
81context proxy
Docs
1,487Docs Arena rank #7
Search
Not listedSearch Arena
Text
Not listedText Arena
Context
HELM pendinglong-context feed
Docs ArenaSearch ArenaText Arena
#13
GPT-5.6 Sol xHigh

gpt-5.6-sol-xhigh

OpenAIProprietary
81context proxy
Docs
1,481Docs Arena rank #11
Search
1,256Search Arena rank #1
Text
1,483Text Arena rank #16
Context
HELM pendinglong-context feed
Docs ArenaSearch ArenaText Arena
#14
Gemini 3.7 Flash High

gemini-3.7-flash-high

GoogleProprietary
80context proxy
Docs
Not listedDocs Arena
Search
Not listedSearch Arena
Text
1,491Text Arena rank #9
Context
HELM pendinglong-context feed
Docs ArenaSearch ArenaText Arena
#15
Muse Spark 1.1

muse-spark-1.1

MetaProprietary
79context proxy
Docs
1,483Docs Arena rank #8
Search
Not listedSearch Arena
Text
1,492Text Arena rank #8
Context
HELM pendinglong-context feed
Docs ArenaSearch ArenaText Arena
#16
Kimi K3 Max

kimi-k3-max

Moonshot AIProprietary
78context proxy
Docs
Not listedDocs Arena
Search
Not listedSearch Arena
Text
1,489Text Arena rank #10
Context
HELM pendinglong-context feed
Docs ArenaSearch ArenaText Arena
#17
Claude Opus 5 Max

claude-opus-5-max

AnthropicProprietary
76context proxy
Docs
Not listedDocs Arena
Search
Not listedSearch Arena
Text
1,488Text Arena rank #12
Context
HELM pendinglong-context feed
Docs ArenaSearch ArenaText Arena
#18
Gemini 3.1 Pro Grounding

gemini-3.1-pro-grounding

GoogleProprietary
75context proxy
Docs
Not listedDocs Arena
Search
1,208Search Arena rank #6
Text
Not listedText Arena
Context
HELM pendinglong-context feed
Docs ArenaSearch ArenaText Arena
#19
Gemini 3 Pro Grounding

gemini-3-pro-grounding

GoogleProprietary
72context proxy
Docs
Not listedDocs Arena
Search
1,201Search Arena rank #9
Text
Not listedText Arena
Context
HELM pendinglong-context feed
Docs ArenaSearch ArenaText Arena
#20
Claude Sonnet 4.6 Search

claude-sonnet-4-6-search

AnthropicProprietary
72context proxy
Docs
Not listedDocs Arena
Search
1,201Search Arena rank #10
Text
Not listedText Arena
Context
HELM pendinglong-context feed
Docs ArenaSearch ArenaText Arena
#21
GPT-5.5 High

gpt-5.5-high

OpenAIProprietary
71context proxy
Docs
1,478Docs Arena rank #13
Search
Not listedSearch Arena
Text
1,482Text Arena rank #17
Context
HELM pendinglong-context feed
Docs ArenaSearch ArenaText Arena
#22
GLM 5.3 Max

glm-5.3-max

Z.aiOpen weights
70context proxy
Docs
Not listedDocs Arena
Search
Not listedSearch Arena
Text
1,483Text Arena rank #15
Context
HELM pendinglong-context feed
Docs ArenaSearch ArenaText Arena
#23
Claude Opus 4.8

claude-opus-4-8

AnthropicProprietary
70context proxy
Docs
1,482Docs Arena rank #10
Search
1,195Search Arena rank #13
Text
1,473Text Arena rank #31
Context
HELM pendinglong-context feed
Docs ArenaSearch ArenaText Arena
#24
Claude Sonnet 5 Search

claude-sonnet-5-search

AnthropicProprietary
69context proxy
Docs
Not listedDocs Arena
Search
1,196Search Arena rank #12
Text
Not listedText Arena
Context
HELM pendinglong-context feed
Docs ArenaSearch ArenaText Arena
#25
Claude Opus 4.8 High

claude-opus-4-8-high

AnthropicProprietary
69context proxy
Docs
Not listedDocs Arena
Search
Not listedSearch Arena
Text
1,482Text Arena rank #18
Context
HELM pendinglong-context feed
Docs ArenaSearch ArenaText Arena
#26
GPT-5.4 Search

gpt-5.4-search

OpenAIProprietary
69context proxy
Docs
Not listedDocs Arena
Search
1,195Search Arena rank #14
Text
Not listedText Arena
Context
HELM pendinglong-context feed
Docs ArenaSearch ArenaText Arena
#27
Grok 4.1 Fast Search

grok-4-1-fast-search

xAIProprietary
68context proxy
Docs
Not listedDocs Arena
Search
1,194Search Arena rank #15
Text
Not listedText Arena
Context
HELM pendinglong-context feed
Docs ArenaSearch ArenaText Arena
#28
GPT-5.5

gpt-5.5

OpenAIProprietary
67context proxy
Docs
1,475Docs Arena rank #15
Search
Not listedSearch Arena
Text
1,477Text Arena rank #22
Context
HELM pendinglong-context feed
Docs ArenaSearch ArenaText Arena
#29
GPT-5.6 Terra xHigh

gpt-5.6-terra-xhigh

OpenAIProprietary
67context proxy
Docs
1,482Docs Arena rank #9
Search
Not listedSearch Arena
Text
1,466Text Arena rank #41
Context
HELM pendinglong-context feed
Docs ArenaSearch ArenaText Arena
#30
O3 Search

o3-search

OpenAIProprietary
67context proxy
Docs
Not listedDocs Arena
Search
1,192Search Arena rank #18
Text
Not listedText Arena
Context
HELM pendinglong-context feed
Docs ArenaSearch ArenaText Arena

Benchmark guide

What the scores mean.

A quick reading key for long-context rankings, document-heavy work, retrieval signals, and planned context-window data.

Higher: context proxyHELM feed planned
What does the long-context proxy measure?

The long-context proxy blends Document Arena, Search Arena, and Text Arena scores. It is meant to surface models that appear strong on document-heavy and retrieval-heavy work while dedicated long-context benchmarks are being wired.

Does this measure context window size?

Not yet. Context window size and max output tokens need a reliable source before they become table fields. This ranking focuses on public task performance, not advertised token limits.

Why is HELM Long Context listed as planned?

HELM Long Context is the right benchmark family for more direct long-context evaluation, but it is not mixed into the score until the feed is integrated and matched cleanly to model rows.

How should I read document and search scores?

Document scores point toward long-form reading and file-style tasks. Search scores point toward retrieval-style workflows. Both are useful signals, but neither proves that a model can reliably use every token in a huge context window.