Lab comparison rankings.
A provider-level view of who is strongest across public benchmark coverage, best-category wins, open/proprietary mix, fastest matched models, and value leaders.
Labs covered
22
From public benchmark rows
Top lab score
Meta
Avg rank 27
Most models
OpenAI
Largest tracked model set
Open-weight depth
Z.ai
9 open models
Provider view
Lab strength, coverage, and portfolio mix.
Average rank is computed across available Arena scores, so labs with fewer public rows should be read with coverage in mind.
Lab leaderboard
| Rank | Lab | Models | Avg rank | Best model | Best value | Fastest |
|---|---|---|---|---|---|---|
| #1 | Meta Coverage 53% | 41 open | 27Best #4 | Muse Spark 1.2 | Muse Spark 1.1 | Muse Glimmer |
| #2 | Anthropic Coverage 31% | 350 open | 27.8Best #1 | Claude Fable 5 | Claude Opus 4.6 Thinking | Claude Haiku 4.5 20251001 |
| #3 | Google Coverage 37% | 232 open | 43.1Best #6 | Gemini 3.1 Pro Grounding | Gemini 3.7 Flash High | Gemma 4 31b |
| #4 | Moonshot AI Coverage 39% | 65 open | 50.6Best #3 | Kimi K3 Max | Kimi K2.6 | Kimi K2.7 Code |
| #5 | xAI Coverage 30% | 130 open | 40.1Best #7 | Grok 4.20 Multi Agent Beta 0309 | Grok 4.5 | Grok 4.5 |
| #6 | Alibaba Coverage 35% | 176 open | 49.3Best #1 | Qwen3.8 Max 0902 | Qwen3.8 Flash Next | Qwen3.5 122b A10B |
| #7 | Z.ai Coverage 32% | 109 open | 50.7Best #11 | GLM 5.3 Max | GLM 5.3 Flash | GLM 5.3 Flash |
| #8 | OpenAI Coverage 28% | 420 open | 46.2Best #1 | GPT-5.6 Sol xHigh | GPT-5.6 Sol xHigh | GPT-5.6 Luna xHigh |
| #9 | Perplexity Coverage 11% | 20 open | 29Best #28 | Ppl Sonar Pro High | No price match | No latency match |
| #10 | Thinky Coverage 56% | 22 open | 71.3Best #66 | Inkling | Inkling Small | Inkling Small |
| #11 | MiniMax Coverage 36% | 43 open | 61Best #32 | Minimax M3 | Minimax M3 | Minimax M3 |
| #12 | ByteDance Coverage 17% | 20 open | 40.7Best #29 | Seed 2.1 Pro Preview | No price match | No latency match |
| #13 | Diffbot Coverage 11% | 11 open | 34Best #34 | Diffbot Small Xl | No price match | No latency match |
| #14 | Xiaomi Coverage 38% | 53 open | 67.4Best #39 | MiMo V2.5 Pro | MiMo V2.5 Pro | MiMo V2.5 |
| #15 | Upstage Coverage 44% | 10 open | 82Best #82 | Solar Pro4 | Solar Pro4 | Solar Pro4 |
| #16 | DeepSeek Coverage 24% | 88 open | 59.7Best #16 | DeepSeek V4 Pro High 20260813 | DeepSeek V4 Pro | DeepSeek V4 Pro |
| #17 | Baidu Coverage 14% | 40 open | 51.6Best #16 | ERNIE 5.1 | No price match | No latency match |
| #18 | Tencent Coverage 15% | 52 open | 64Best #6 | Hy4 Preview | Hy3 | No latency match |
| #19 | Mistral Coverage 28% | 42 open | 85Best #72 | Mistral Large 3 | Mistral Large 3 | Mistral Medium 3.5 |
| #20 | Meituan Coverage 11% | 10 open | 88Best #88 | Longcat Flash Chat 2602 Exp | No price match | No latency match |
| #21 | Poolside Coverage 11% | 11 open | 92Best #92 | Laguna M.1 | No price match | No latency match |
| #22 | Stepfun Coverage 11% | 10 open | 97Best #97 | Step 1o Turbo 202506 | No price match | No latency match |
Meta
4 models, 1 open
Avg rank
27
Coverage
53%
Anthropic
35 models, 0 open
Avg rank
27.8
Coverage
31%
23 models, 2 open
Avg rank
43.1
Coverage
37%
Moonshot AI
6 models, 5 open
Avg rank
50.6
Coverage
39%
xAI
13 models, 0 open
Avg rank
40.1
Coverage
30%
Alibaba
17 models, 6 open
Avg rank
49.3
Coverage
35%
Z.ai
10 models, 9 open
Avg rank
50.7
Coverage
32%
OpenAI
42 models, 0 open
Avg rank
46.2
Coverage
28%
Perplexity
2 models, 0 open
Avg rank
29
Coverage
11%
Thinky
2 models, 2 open
Avg rank
71.3
Coverage
56%
MiniMax
4 models, 3 open
Avg rank
61
Coverage
36%
ByteDance
2 models, 0 open
Avg rank
40.7
Coverage
17%
Diffbot
1 models, 1 open
Avg rank
34
Coverage
11%
Xiaomi
5 models, 3 open
Avg rank
67.4
Coverage
38%
Upstage
1 models, 0 open
Avg rank
82
Coverage
44%
DeepSeek
8 models, 8 open
Avg rank
59.7
Coverage
24%
Baidu
4 models, 0 open
Avg rank
51.6
Coverage
14%
Tencent
5 models, 2 open
Avg rank
64
Coverage
15%
Mistral
4 models, 2 open
Avg rank
85
Coverage
28%
Meituan
1 models, 0 open
Avg rank
88
Coverage
11%
Poolside
1 models, 1 open
Avg rank
92
Coverage
11%
Stepfun
1 models, 0 open
Avg rank
97
Coverage
11%
Benchmark guide
What the scores mean.
A quick reading key for provider-level comparisons, coverage, average rank, and open-weight portfolio signals.
How is the lab score ranked?
Labs are ranked from available public Arena performance with a coverage adjustment, so broad benchmark coverage matters. A lab with one excellent score should not automatically outrank a lab with many strong model rows.
What does average rank mean?
Average rank is computed across the Arena rows available for that lab's tracked models. It is useful for comparing portfolio strength, but it should be read alongside model count and coverage.
Why do open-weight counts matter?
Open-weight counts show how much of a lab's tracked portfolio can plausibly be self-hosted or inspected outside a closed API. It is a portfolio signal, not a quality score by itself.
Why can labs with fewer models move around?
Small portfolios are more sensitive to one strong or weak model. The page keeps model count and coverage visible so lab comparisons are not reduced to a single rank number.
