Model performance
Compare published benchmark results while keeping the model, source and observation date visible.
16 benchmarks across 273 models. Each list is ranked best first and shows the top 30.
A composite index Artificial Analysis computes from several independent evaluations, so one weak or strong result moves it less than a single test would.
A rating or index rather than a percentage. Higher is better, and each index defines its own range.
| Rank | Model | Score | Source |
|---|---|---|---|
| 1 | Claude Opus 5 | 63.10 | SourceArtificial Analysis Intelligence via OpenRouter See where this value came from and when it was checked.
|
| 2 | Claude Opus 5 (batch) | 63.10 | SourceArtificial Analysis Intelligence via OpenRouter See where this value came from and when it was checked.
|
| 3 | Anthropic: Claude Fable 5 | 62.10 | SourceArtificial Analysis Intelligence via OpenRouter See where this value came from and when it was checked.
|
| 4 | Anthropic: Claude Fable 5 (batch) | 62.10 | SourceArtificial Analysis Intelligence via OpenRouter See where this value came from and when it was checked.
|
| 5 | SpaceXAI: Grok 4.6 | 60.90 | SourceArtificial Analysis Intelligence via OpenRouter See where this value came from and when it was checked.
|
| 6 | OpenAI: GPT-5.6 Sol | 60.90 | SourceArtificial Analysis Intelligence via OpenRouter See where this value came from and when it was checked.
|
| 7 | OpenAI: GPT-5.6 Sol (batch) | 60.90 | SourceArtificial Analysis Intelligence via OpenRouter See where this value came from and when it was checked.
|
| 8 | MoonshotAI: Kimi K3 | 59.70 | SourceArtificial Analysis Intelligence via OpenRouter See where this value came from and when it was checked.
|
| 9 | Z.ai: GLM 5.3 | 59.50 | SourceArtificial Analysis Intelligence via OpenRouter See where this value came from and when it was checked.
|
| 10 | Qwen: Qwen3.8 Max | 58.10 | SourceArtificial Analysis Intelligence via OpenRouter See where this value came from and when it was checked.
|
| 11 | Qwen: Qwen3.8 2.4T A95B | 57.70 | SourceArtificial Analysis Intelligence via OpenRouter See where this value came from and when it was checked.
|
| 12 | Anthropic: Claude Opus 4.8 | 57.30 | SourceArtificial Analysis Intelligence via OpenRouter See where this value came from and when it was checked.
|
| 13 | Anthropic: Claude Opus 4.8 (batch) | 57.30 | SourceArtificial Analysis Intelligence via OpenRouter See where this value came from and when it was checked.
|
| 14 | Meta: Muse Spark 1.2 Contributor | 56.80 | SourceArtificial Analysis Intelligence via OpenRouter — measured on muse-spark-1.2 See where this value came from and when it was checked.
|
| 15 | Meta: Muse Spark 1.2 | 56.80 | SourceArtificial Analysis Intelligence via OpenRouter See where this value came from and when it was checked.
|
| 16 | OpenAI: GPT-5.6 Terra | 56.60 | SourceArtificial Analysis Intelligence via OpenRouter See where this value came from and when it was checked.
|
| 17 | OpenAI: GPT-5.6 Terra (batch) | 56.60 | SourceArtificial Analysis Intelligence via OpenRouter See where this value came from and when it was checked.
|
| 18 | OpenAI: GPT-5.5 | 56.30 | SourceArtificial Analysis Intelligence via OpenRouter See where this value came from and when it was checked.
|
| 19 | OpenAI: GPT-5.5 (batch) | 56.30 | SourceArtificial Analysis Intelligence via OpenRouter See where this value came from and when it was checked.
|
| 20 | Google: Gemini 3.7 Flash | 56.00 | SourceArtificial Analysis Intelligence via OpenRouter See where this value came from and when it was checked.
|
| 21 | Google: Gemini 3.7 Flash (batch) | 56.00 | SourceArtificial Analysis Intelligence via OpenRouter See where this value came from and when it was checked.
|
| 22 | SpaceXAI: Grok 4.5 | 55.80 | SourceArtificial Analysis Intelligence via OpenRouter See where this value came from and when it was checked.
|
| 23 | Anthropic: Claude Sonnet 5 | 55.30 | SourceArtificial Analysis Intelligence via OpenRouter See where this value came from and when it was checked.
|
| 24 | Anthropic: Claude Sonnet 5 (batch) | 55.30 | SourceArtificial Analysis Intelligence via OpenRouter See where this value came from and when it was checked.
|
| 25 | Anthropic: Claude Opus 4.7 | 55.00 | SourceArtificial Analysis Intelligence via OpenRouter See where this value came from and when it was checked.
|
| 26 | Anthropic: Claude Opus 4.7 (batch) | 55.00 | SourceArtificial Analysis Intelligence via OpenRouter See where this value came from and when it was checked.
|
| 27 | DeepSeek: DeepSeek V4 Pro 0813 | 53.20 | SourceArtificial Analysis Intelligence via OpenRouter See where this value came from and when it was checked.
|
| 28 | Meta: Muse Spark 1.1 | 53.20 | SourceArtificial Analysis Intelligence via OpenRouter See where this value came from and when it was checked.
|
| 29 | OpenAI: GPT-5.4 | 53.10 | SourceArtificial Analysis Intelligence via OpenRouter See where this value came from and when it was checked.
|
| 30 | OpenAI: GPT-5.4 (batch) | 53.10 | SourceArtificial Analysis Intelligence via OpenRouter See where this value came from and when it was checked.
|
Artificial Analysis's composite index over its coding evaluations.
A rating or index rather than a percentage. Higher is better, and each index defines its own range.
| Rank | Model | Score | Source |
|---|---|---|---|
| 1 | Claude Opus 5 | 78.00 | SourceArtificial Analysis Coding via OpenRouter See where this value came from and when it was checked.
|
| 2 | Claude Opus 5 (batch) | 78.00 | SourceArtificial Analysis Coding via OpenRouter See where this value came from and when it was checked.
|
| 3 | OpenAI: GPT-5.6 Sol | 77.40 | SourceArtificial Analysis Coding via OpenRouter See where this value came from and when it was checked.
|
| 4 | OpenAI: GPT-5.6 Sol (batch) | 77.40 | SourceArtificial Analysis Coding via OpenRouter See where this value came from and when it was checked.
|
| 5 | SpaceXAI: Grok 4.6 | 76.80 | SourceArtificial Analysis Coding via OpenRouter See where this value came from and when it was checked.
|
| 6 | OpenAI: GPT-5.6 Terra | 76.70 | SourceArtificial Analysis Coding via OpenRouter See where this value came from and when it was checked.
|
| 7 | OpenAI: GPT-5.6 Terra (batch) | 76.70 | SourceArtificial Analysis Coding via OpenRouter See where this value came from and when it was checked.
|
| 8 | Anthropic: Claude Fable 5 | 76.50 | SourceArtificial Analysis Coding via OpenRouter See where this value came from and when it was checked.
|
| 9 | Anthropic: Claude Fable 5 (batch) | 76.50 | SourceArtificial Analysis Coding via OpenRouter See where this value came from and when it was checked.
|
| 10 | MoonshotAI: Kimi K3 | 76.20 | SourceArtificial Analysis Coding via OpenRouter See where this value came from and when it was checked.
|
| 11 | Google: Gemini 3.7 Flash | 76.10 | SourceArtificial Analysis Coding via OpenRouter See where this value came from and when it was checked.
|
| 12 | Google: Gemini 3.7 Flash (batch) | 76.10 | SourceArtificial Analysis Coding via OpenRouter See where this value came from and when it was checked.
|
| 13 | OpenAI: GPT-5.5 | 74.90 | SourceArtificial Analysis Coding via OpenRouter See where this value came from and when it was checked.
|
| 14 | OpenAI: GPT-5.5 (batch) | 74.90 | SourceArtificial Analysis Coding via OpenRouter See where this value came from and when it was checked.
|
| 15 | Z.ai: GLM 5.3 | 74.80 | SourceArtificial Analysis Coding via OpenRouter See where this value came from and when it was checked.
|
| 16 | Anthropic: Claude Opus 4.8 | 74.30 | SourceArtificial Analysis Coding via OpenRouter See where this value came from and when it was checked.
|
| 17 | Anthropic: Claude Opus 4.8 (batch) | 74.30 | SourceArtificial Analysis Coding via OpenRouter See where this value came from and when it was checked.
|
| 18 | Anthropic: Claude Opus 4.7 | 73.60 | SourceArtificial Analysis Coding via OpenRouter See where this value came from and when it was checked.
|
| 19 | Anthropic: Claude Opus 4.7 (batch) | 73.60 | SourceArtificial Analysis Coding via OpenRouter See where this value came from and when it was checked.
|
| 20 | SpaceXAI: Grok 4.5 | 72.40 | SourceArtificial Analysis Coding via OpenRouter See where this value came from and when it was checked.
|
| 21 | Meta: Muse Spark 1.2 Contributor | 72.20 | SourceArtificial Analysis Coding via OpenRouter — measured on muse-spark-1.2 See where this value came from and when it was checked.
|
| 22 | Meta: Muse Spark 1.2 | 72.20 | SourceArtificial Analysis Coding via OpenRouter See where this value came from and when it was checked.
|
| 23 | Qwen: Qwen3.8 2.4T A95B | 71.90 | SourceArtificial Analysis Coding via OpenRouter See where this value came from and when it was checked.
|
| 24 | Qwen: Qwen3.8 Max | 71.80 | SourceArtificial Analysis Coding via OpenRouter See where this value came from and when it was checked.
|
| 25 | Anthropic: Claude Sonnet 5 | 71.50 | SourceArtificial Analysis Coding via OpenRouter See where this value came from and when it was checked.
|
| 26 | Anthropic: Claude Sonnet 5 (batch) | 71.50 | SourceArtificial Analysis Coding via OpenRouter See where this value came from and when it was checked.
|
| 27 | OpenAI: GPT-5.6 Luna | 71.40 | SourceArtificial Analysis Coding via OpenRouter See where this value came from and when it was checked.
|
| 28 | OpenAI: GPT-5.6 Luna (batch) | 71.40 | SourceArtificial Analysis Coding via OpenRouter See where this value came from and when it was checked.
|
| 29 | Meta: Muse Spark 1.1 | 71.30 | SourceArtificial Analysis Coding via OpenRouter See where this value came from and when it was checked.
|
| 30 | OpenAI: GPT-5.4 | 71.10 | SourceArtificial Analysis Coding via OpenRouter See where this value came from and when it was checked.
|
Graduate-level questions in biology, physics and chemistry, written so the answers cannot be found by searching. The Diamond subset is the hardest tier.
A rating or index rather than a percentage. Higher is better, and each index defines its own range.
| Rank | Model | Score | Source |
|---|---|---|---|
| 1 | Google: Gemini 3.7 Flash | 94.60 | SourceGPQA Diamond via OpenRouter See where this value came from and when it was checked.
|
| 2 | Google: Gemini 3.7 Flash (batch) | 94.60 | SourceGPQA Diamond via OpenRouter See where this value came from and when it was checked.
|
| 3 | Google: Gemini 3.1 Pro Preview | 94.30 | SourceGPQA Diamond via OpenRouter See where this value came from and when it was checked.
|
| 4 | Google: Gemini 3.1 Pro Preview (batch) | 94.30 | SourceGPQA Diamond via OpenRouter See where this value came from and when it was checked.
|
| 5 | Google: Gemini 3.6 Flash | 93.50 | SourceGPQA Diamond via OpenRouter See where this value came from and when it was checked.
|
| 6 | Google: Gemini 3.6 Flash (batch) | 93.50 | SourceGPQA Diamond via OpenRouter See where this value came from and when it was checked.
|
| 7 | Google: Gemini 3.5 Flash (batch) | 93.30 | SourceGPQA Diamond via OpenRouter See where this value came from and when it was checked.
|
| 8 | OpenAI: GPT-5.5 | 93.30 | SourceGPQA Diamond via OpenRouter See where this value came from and when it was checked.
|
| 9 | OpenAI: GPT-5.5 (batch) | 93.30 | SourceGPQA Diamond via OpenRouter See where this value came from and when it was checked.
|
| 10 | Google: Gemini 3.5 Flash | 93.30 | SourceGPQA Diamond via OpenRouter See where this value came from and when it was checked.
|
| 11 | OpenAI: GPT-5.6 Sol Pro | 92.10 | SourceGPQA Diamond via OpenRouter See where this value came from and when it was checked.
|
| 12 | OpenAI: GPT-5.6 Sol Pro (batch) | 92.10 | SourceGPQA Diamond via OpenRouter See where this value came from and when it was checked.
|
| 13 | SpaceXAI: Grok 4.6 | 91.40 | SourceGPQA Diamond via OpenRouter See where this value came from and when it was checked.
|
| 14 | OpenAI: GPT-5.6 Sol | 91.40 | SourceGPQA Diamond via OpenRouter See where this value came from and when it was checked.
|
| 15 | OpenAI: GPT-5.6 Sol (batch) | 91.40 | SourceGPQA Diamond via OpenRouter See where this value came from and when it was checked.
|
| 16 | MiniMax: MiniMax M3 (free) | 90.50 | SourceGPQA Diamond via OpenRouter See where this value came from and when it was checked.
|
| 17 | MiniMax: MiniMax M3 | 90.50 | SourceGPQA Diamond via OpenRouter See where this value came from and when it was checked.
|
| 18 | MiniMax: MiniMax M3 (batch) | 90.50 | SourceGPQA Diamond via OpenRouter See where this value came from and when it was checked.
|
| 19 | OpenAI: GPT-5.6 Luna Pro | 90.40 | SourceGPQA Diamond via OpenRouter See where this value came from and when it was checked.
|
| 20 | OpenAI: GPT-5.6 Luna Pro (batch) | 90.40 | SourceGPQA Diamond via OpenRouter See where this value came from and when it was checked.
|
| 21 | OpenAI: GPT-5.6 Terra | 90.40 | SourceGPQA Diamond via OpenRouter See where this value came from and when it was checked.
|
| 22 | OpenAI: GPT-5.6 Terra (batch) | 90.40 | SourceGPQA Diamond via OpenRouter See where this value came from and when it was checked.
|
| 23 | DeepSeek: DeepSeek V4 Flash Vision Exp | 90.00 | SourceGPQA Diamond via OpenRouter — measured on deepseek-v4-flash-0731 See where this value came from and when it was checked.
|
| 24 | DeepSeek: DeepSeek V4 Flash 0731 | 90.00 | SourceGPQA Diamond via OpenRouter See where this value came from and when it was checked.
|
| 25 | DeepSeek: DeepSeek V4 Flash 0423 | 89.80 | SourceGPQA Diamond via OpenRouter See where this value came from and when it was checked.
|
| 26 | Anthropic: Claude Opus 4.8 | 89.30 | SourceGPQA Diamond via OpenRouter See where this value came from and when it was checked.
|
| 27 | Anthropic: Claude Opus 4.8 (batch) | 89.30 | SourceGPQA Diamond via OpenRouter See where this value came from and when it was checked.
|
| 28 | OpenAI: GPT-5.4 | 89.20 | SourceGPQA Diamond via OpenRouter See where this value came from and when it was checked.
|
| 29 | OpenAI: GPT-5.4 (batch) | 89.20 | SourceGPQA Diamond via OpenRouter See where this value came from and when it was checked.
|
| 30 | MoonshotAI: Kimi K3 | 89.20 | SourceGPQA Diamond via OpenRouter See where this value came from and when it was checked.
|
Multi-turn tasks where the model has to use tools and follow a domain's rules to finish what a user asked for, rather than answer a single question.
A rating or index rather than a percentage. Higher is better, and each index defines its own range.
| Rank | Model | Score | Source |
|---|---|---|---|
| 1 | Google: Gemini 3 Flash Preview | 81.30 | SourceTAU-Bench via OpenRouter See where this value came from and when it was checked.
|
| 2 | Google: Gemini 3 Flash Preview (batch) | 81.30 | SourceTAU-Bench via OpenRouter See where this value came from and when it was checked.
|
| 3 | Google: Gemini 3.7 Flash | 80.70 | SourceTAU-Bench via OpenRouter See where this value came from and when it was checked.
|
| 4 | Google: Gemini 3.7 Flash (batch) | 80.70 | SourceTAU-Bench via OpenRouter See where this value came from and when it was checked.
|
| 5 | Qwen: Qwen3.8 27B | 80.70 | SourceTAU-Bench via OpenRouter See where this value came from and when it was checked.
|
| 6 | Anthropic: Claude Fable 5 | 80.70 | SourceTAU-Bench via OpenRouter See where this value came from and when it was checked.
|
| 7 | Anthropic: Claude Fable 5 (batch) | 80.70 | SourceTAU-Bench via OpenRouter See where this value came from and when it was checked.
|
| 8 | Claude Opus 5 | 80.20 | SourceTAU-Bench via OpenRouter See where this value came from and when it was checked.
|
| 9 | Claude Opus 5 (batch) | 80.20 | SourceTAU-Bench via OpenRouter See where this value came from and when it was checked.
|
| 10 | Google: Gemma 4 31B | 79.50 | SourceTAU-Bench via OpenRouter See where this value came from and when it was checked.
|
| 11 | Google: Gemma 4 31B (free) | 79.50 | SourceTAU-Bench via OpenRouter See where this value came from and when it was checked.
|
| 12 | OpenAI: GPT-5.5 | 79.30 | SourceTAU-Bench via OpenRouter See where this value came from and when it was checked.
|
| 13 | OpenAI: GPT-5.5 (batch) | 79.30 | SourceTAU-Bench via OpenRouter See where this value came from and when it was checked.
|
| 14 | SpaceXAI: Grok 4.6 | 79.30 | SourceTAU-Bench via OpenRouter See where this value came from and when it was checked.
|
| 15 | DeepSeek: DeepSeek V4 Pro 0423 | 79.00 | SourceTAU-Bench via OpenRouter See where this value came from and when it was checked.
|
| 16 | Google: Gemini 3.5 Flash (batch) | 78.70 | SourceTAU-Bench via OpenRouter See where this value came from and when it was checked.
|
| 17 | Z.ai: GLM 5 | 78.70 | SourceTAU-Bench via OpenRouter See where this value came from and when it was checked.
|
| 18 | OpenAI: GPT-5.6 Sol Pro | 78.70 | SourceTAU-Bench via OpenRouter See where this value came from and when it was checked.
|
| 19 | OpenAI: GPT-5.6 Sol Pro (batch) | 78.70 | SourceTAU-Bench via OpenRouter See where this value came from and when it was checked.
|
| 20 | Google: Gemini 3.5 Flash | 78.70 | SourceTAU-Bench via OpenRouter See where this value came from and when it was checked.
|
| 21 | Anthropic: Claude Opus 4.7 | 78.40 | SourceTAU-Bench via OpenRouter See where this value came from and when it was checked.
|
| 22 | Anthropic: Claude Opus 4.7 (batch) | 78.40 | SourceTAU-Bench via OpenRouter See where this value came from and when it was checked.
|
| 23 | Anthropic: Claude Opus 4.8 | 78.10 | SourceTAU-Bench via OpenRouter See where this value came from and when it was checked.
|
| 24 | Anthropic: Claude Opus 4.8 (batch) | 78.10 | SourceTAU-Bench via OpenRouter See where this value came from and when it was checked.
|
| 25 | Anthropic: Claude Opus 4.5 | 78.00 | SourceTAU-Bench via OpenRouter See where this value came from and when it was checked.
|
| 26 | Anthropic: Claude Opus 4.5 (batch) | 78.00 | SourceTAU-Bench via OpenRouter See where this value came from and when it was checked.
|
| 27 | Anthropic: Claude Sonnet 5 | 77.90 | SourceTAU-Bench via OpenRouter See where this value came from and when it was checked.
|
| 28 | Anthropic: Claude Sonnet 5 (batch) | 77.90 | SourceTAU-Bench via OpenRouter See where this value came from and when it was checked.
|
| 29 | MoonshotAI: Kimi K2.6 | 77.80 | SourceTAU-Bench via OpenRouter See where this value came from and when it was checked.
|
| 30 | DeepSeek: DeepSeek V4 Flash Vision Exp | 77.80 | SourceTAU-Bench via OpenRouter — measured on deepseek-v4-flash-0731 See where this value came from and when it was checked.
|
Artificial Analysis's composite index over evaluations that require tool use and multi-step work.
A rating or index rather than a percentage. Higher is better, and each index defines its own range.
| Rank | Model | Score | Source |
|---|---|---|---|
| 1 | Claude Opus 5 | 59.20 | SourceArtificial Analysis Agentic via OpenRouter See where this value came from and when it was checked.
|
| 2 | Claude Opus 5 (batch) | 59.20 | SourceArtificial Analysis Agentic via OpenRouter See where this value came from and when it was checked.
|
| 3 | Z.ai: GLM 5.3 | 59.10 | SourceArtificial Analysis Agentic via OpenRouter See where this value came from and when it was checked.
|
| 4 | SpaceXAI: Grok 4.6 | 58.70 | SourceArtificial Analysis Agentic via OpenRouter See where this value came from and when it was checked.
|
| 5 | Qwen: Qwen3.8 Max | 58.40 | SourceArtificial Analysis Agentic via OpenRouter See where this value came from and when it was checked.
|
| 6 | OpenAI: GPT-5.6 Sol | 57.80 | SourceArtificial Analysis Agentic via OpenRouter See where this value came from and when it was checked.
|
| 7 | OpenAI: GPT-5.6 Sol (batch) | 57.80 | SourceArtificial Analysis Agentic via OpenRouter See where this value came from and when it was checked.
|
| 8 | Qwen: Qwen3.8 2.4T A95B | 57.10 | SourceArtificial Analysis Agentic via OpenRouter See where this value came from and when it was checked.
|
| 9 | Anthropic: Claude Fable 5 | 56.60 | SourceArtificial Analysis Agentic via OpenRouter See where this value came from and when it was checked.
|
| 10 | Anthropic: Claude Fable 5 (batch) | 56.60 | SourceArtificial Analysis Agentic via OpenRouter See where this value came from and when it was checked.
|
| 11 | MoonshotAI: Kimi K3 | 54.30 | SourceArtificial Analysis Agentic via OpenRouter See where this value came from and when it was checked.
|
| 12 | Qwen: Qwen3.8 27B | 50.90 | SourceArtificial Analysis Agentic via OpenRouter See where this value came from and when it was checked.
|
| 13 | OpenAI: GPT-5.6 Terra | 50.20 | SourceArtificial Analysis Agentic via OpenRouter See where this value came from and when it was checked.
|
| 14 | OpenAI: GPT-5.6 Terra (batch) | 50.20 | SourceArtificial Analysis Agentic via OpenRouter See where this value came from and when it was checked.
|
| 15 | Anthropic: Claude Sonnet 5 | 49.70 | SourceArtificial Analysis Agentic via OpenRouter See where this value came from and when it was checked.
|
| 16 | Anthropic: Claude Sonnet 5 (batch) | 49.70 | SourceArtificial Analysis Agentic via OpenRouter See where this value came from and when it was checked.
|
| 17 | DeepSeek: DeepSeek V4 Pro 0813 | 49.60 | SourceArtificial Analysis Agentic via OpenRouter See where this value came from and when it was checked.
|
| 18 | Anthropic: Claude Opus 4.8 | 49.40 | SourceArtificial Analysis Agentic via OpenRouter See where this value came from and when it was checked.
|
| 19 | Anthropic: Claude Opus 4.8 (batch) | 49.40 | SourceArtificial Analysis Agentic via OpenRouter See where this value came from and when it was checked.
|
| 20 | Meta: Muse Spark 1.2 Contributor | 49.30 | SourceArtificial Analysis Agentic via OpenRouter — measured on muse-spark-1.2 See where this value came from and when it was checked.
|
| 21 | Meta: Muse Spark 1.2 | 49.30 | SourceArtificial Analysis Agentic via OpenRouter See where this value came from and when it was checked.
|
| 22 | SpaceXAI: Grok 4.5 | 48.90 | SourceArtificial Analysis Agentic via OpenRouter See where this value came from and when it was checked.
|
| 23 | DeepSeek: DeepSeek V4 Flash Vision Exp | 48.40 | SourceArtificial Analysis Agentic via OpenRouter — measured on deepseek-v4-flash-0731 See where this value came from and when it was checked.
|
| 24 | DeepSeek: DeepSeek V4 Flash 0731 | 48.40 | SourceArtificial Analysis Agentic via OpenRouter See where this value came from and when it was checked.
|
| 25 | OpenAI: GPT-5.5 | 47.40 | SourceArtificial Analysis Agentic via OpenRouter See where this value came from and when it was checked.
|
| 26 | OpenAI: GPT-5.5 (batch) | 47.40 | SourceArtificial Analysis Agentic via OpenRouter See where this value came from and when it was checked.
|
| 27 | OpenAI: GPT-5.6 Luna | 46.90 | SourceArtificial Analysis Agentic via OpenRouter See where this value came from and when it was checked.
|
| 28 | OpenAI: GPT-5.6 Luna (batch) | 46.90 | SourceArtificial Analysis Agentic via OpenRouter See where this value came from and when it was checked.
|
| 29 | Anthropic: Claude Opus 4.7 | 46.30 | SourceArtificial Analysis Agentic via OpenRouter See where this value came from and when it was checked.
|
| 30 | Anthropic: Claude Opus 4.7 (batch) | 46.30 | SourceArtificial Analysis Agentic via OpenRouter See where this value came from and when it was checked.
|
The same head-to-head human voting, counted only on coding prompts.
A rating or index rather than a percentage. Higher is better, and each index defines its own range.
| Rank | Model | Score | Source |
|---|---|---|---|
| 1 | OpenAI: GPT-5.6 Sol | 1567.00 | SourceChatbot Arena Coding Elo via openlm.ai See where this value came from and when it was checked.
|
| 2 | Claude Opus 5 | 1566.00 | SourceChatbot Arena Coding Elo via openlm.ai See where this value came from and when it was checked.
|
| 3 | Anthropic: Claude Fable 5 | 1566.00 | SourceChatbot Arena Coding Elo via openlm.ai See where this value came from and when it was checked.
|
| 4 | SpaceXAI: Grok 4.6 | 1563.00 | SourceChatbot Arena Coding Elo via openlm.ai See where this value came from and when it was checked.
|
| 5 | MoonshotAI: Kimi K3 | 1562.00 | SourceChatbot Arena Coding Elo via openlm.ai See where this value came from and when it was checked.
|
| 6 | OpenAI: GPT-5.6 Terra | 1562.00 | SourceChatbot Arena Coding Elo via openlm.ai See where this value came from and when it was checked.
|
| 7 | Qwen: Qwen3.8 Max | 1560.00 | SourceChatbot Arena Coding Elo via openlm.ai See where this value came from and when it was checked.
|
| 8 | Z.ai: GLM 5.3 | 1560.00 | SourceChatbot Arena Coding Elo via openlm.ai See where this value came from and when it was checked.
|
| 9 | Google: Gemini 3.7 Flash | 1557.00 | SourceChatbot Arena Coding Elo via openlm.ai See where this value came from and when it was checked.
|
| 10 | SpaceXAI: Grok 4.5 | 1556.00 | SourceChatbot Arena Coding Elo via openlm.ai See where this value came from and when it was checked.
|
| 11 | Meta: Muse Spark 1.2 Contributor | 1540.00 | SourceChatbot Arena Coding Elo via openlm.ai — measured on muse-spark-1.2 See where this value came from and when it was checked.
|
| 12 | Meta: Muse Spark 1.2 | 1540.00 | SourceChatbot Arena Coding Elo via openlm.ai See where this value came from and when it was checked.
|
| 13 | Anthropic: Claude Opus 4.6 | 1535.00 | SourceChatbot Arena Coding Elo via openlm.ai See where this value came from and when it was checked.
|
| 14 | Google: Gemini 3.6 Flash | 1535.00 | SourceChatbot Arena Coding Elo via openlm.ai See where this value came from and when it was checked.
|
| 15 | Meta: Muse Spark 1.1 | 1521.00 | SourceChatbot Arena Coding Elo via openlm.ai See where this value came from and when it was checked.
|
| 16 | SpaceXAI: Grok 4.20 | 1518.00 | SourceChatbot Arena Coding Elo via openlm.ai See where this value came from and when it was checked.
|
| 17 | Qwen: Qwen3.7 Max | 1505.00 | SourceChatbot Arena Coding Elo via openlm.ai See where this value came from and when it was checked.
|
| 18 | Anthropic: Claude Opus 4.5 | 1496.00 | SourceChatbot Arena Coding Elo via openlm.ai See where this value came from and when it was checked.
|
| 19 | Qwen: Qwen3.6 Plus | 1482.00 | SourceChatbot Arena Coding Elo via openlm.ai See where this value came from and when it was checked.
|
| 20 | OpenAI: GPT-5.4 | 1468.00 | SourceChatbot Arena Coding Elo via openlm.ai See where this value came from and when it was checked.
|
| 21 | Qwen: Qwen3 Max | 1468.00 | SourceChatbot Arena Coding Elo via openlm.ai See where this value came from and when it was checked.
|
| 22 | OpenAI: GPT-5.2 | 1465.00 | SourceChatbot Arena Coding Elo via openlm.ai See where this value came from and when it was checked.
|
| 23 | Anthropic: Claude Opus 4.1 | 1465.00 | SourceChatbot Arena Coding Elo via openlm.ai See where this value came from and when it was checked.
|
| 24 | Google: Gemini 2.5 Pro | 1465.00 | SourceChatbot Arena Coding Elo via openlm.ai See where this value came from and when it was checked.
|
| 25 | OpenAI: GPT-5.6 Luna | 1465.00 | SourceChatbot Arena Coding Elo via openlm.ai See where this value came from and when it was checked.
|
| 26 | Qwen: Qwen3.8 27B | 1465.00 | SourceChatbot Arena Coding Elo via openlm.ai See where this value came from and when it was checked.
|
| 27 | Anthropic: Claude Sonnet 4.5 | 1464.00 | SourceChatbot Arena Coding Elo via openlm.ai See where this value came from and when it was checked.
|
| 28 | Qwen: Qwen3.5 397B A17B | 1463.00 | SourceChatbot Arena Coding Elo via openlm.ai See where this value came from and when it was checked.
|
| 29 | Google: Gemma 4 31B | 1462.00 | SourceChatbot Arena Coding Elo via openlm.ai See where this value came from and when it was checked.
|
| 30 | Google: Gemma 4 26B A4B | 1460.00 | SourceChatbot Arena Coding Elo via openlm.ai See where this value came from and when it was checked.
|
A rating from head-to-head votes by people who compared two anonymous models on their own prompts. It measures what humans preferred, not correctness.
A rating or index rather than a percentage. Higher is better, and each index defines its own range.
| Rank | Model | Score | Source |
|---|---|---|---|
| 1 | Claude Opus 5 | 1511.00 | SourceChatbot Arena Elo via openlm.ai See where this value came from and when it was checked.
|
| 2 | Anthropic: Claude Fable 5 | 1510.00 | SourceChatbot Arena Elo via openlm.ai See where this value came from and when it was checked.
|
| 3 | OpenAI: GPT-5.6 Sol | 1509.00 | SourceChatbot Arena Elo via openlm.ai See where this value came from and when it was checked.
|
| 4 | SpaceXAI: Grok 4.6 | 1507.00 | SourceChatbot Arena Elo via openlm.ai See where this value came from and when it was checked.
|
| 5 | Qwen: Qwen3.8 Max | 1506.00 | SourceChatbot Arena Elo via openlm.ai See where this value came from and when it was checked.
|
| 6 | MoonshotAI: Kimi K3 | 1506.00 | SourceChatbot Arena Elo via openlm.ai See where this value came from and when it was checked.
|
| 7 | OpenAI: GPT-5.6 Terra | 1505.00 | SourceChatbot Arena Elo via openlm.ai See where this value came from and when it was checked.
|
| 8 | Z.ai: GLM 5.3 | 1505.00 | SourceChatbot Arena Elo via openlm.ai See where this value came from and when it was checked.
|
| 9 | SpaceXAI: Grok 4.5 | 1504.00 | SourceChatbot Arena Elo via openlm.ai See where this value came from and when it was checked.
|
| 10 | Google: Gemini 3.7 Flash | 1503.00 | SourceChatbot Arena Elo via openlm.ai See where this value came from and when it was checked.
|
| 11 | Meta: Muse Spark 1.2 Contributor | 1502.00 | SourceChatbot Arena Elo via openlm.ai — measured on muse-spark-1.2 See where this value came from and when it was checked.
|
| 12 | Meta: Muse Spark 1.2 | 1502.00 | SourceChatbot Arena Elo via openlm.ai See where this value came from and when it was checked.
|
| 13 | Google: Gemini 3.6 Flash | 1501.00 | SourceChatbot Arena Elo via openlm.ai See where this value came from and when it was checked.
|
| 14 | Meta: Muse Spark 1.1 | 1496.00 | SourceChatbot Arena Elo via openlm.ai See where this value came from and when it was checked.
|
| 15 | SpaceXAI: Grok 4.20 | 1495.00 | SourceChatbot Arena Elo via openlm.ai See where this value came from and when it was checked.
|
| 16 | Anthropic: Claude Opus 4.6 | 1490.00 | SourceChatbot Arena Elo via openlm.ai See where this value came from and when it was checked.
|
| 17 | Qwen: Qwen3.7 Max | 1486.00 | SourceChatbot Arena Elo via openlm.ai See where this value came from and when it was checked.
|
| 18 | OpenAI: GPT-5.4 | 1465.00 | SourceChatbot Arena Elo via openlm.ai See where this value came from and when it was checked.
|
| 19 | OpenAI: GPT-5.2 | 1464.00 | SourceChatbot Arena Elo via openlm.ai See where this value came from and when it was checked.
|
| 20 | Anthropic: Claude Opus 4.5 | 1462.00 | SourceChatbot Arena Elo via openlm.ai See where this value came from and when it was checked.
|
| 21 | Google: Gemini 2.5 Pro | 1459.00 | SourceChatbot Arena Elo via openlm.ai See where this value came from and when it was checked.
|
| 22 | Qwen: Qwen3.6 Plus | 1456.00 | SourceChatbot Arena Elo via openlm.ai See where this value came from and when it was checked.
|
| 23 | OpenAI: GPT-5.6 Luna | 1451.00 | SourceChatbot Arena Elo via openlm.ai See where this value came from and when it was checked.
|
| 24 | Qwen: Qwen3.5 397B A17B | 1450.00 | SourceChatbot Arena Elo via openlm.ai See where this value came from and when it was checked.
|
| 25 | Qwen: Qwen3.8 27B | 1450.00 | SourceChatbot Arena Elo via openlm.ai See where this value came from and when it was checked.
|
| 26 | Google: Gemma 4 31B | 1449.00 | SourceChatbot Arena Elo via openlm.ai See where this value came from and when it was checked.
|
| 27 | Google: Gemma 4 26B A4B | 1443.00 | SourceChatbot Arena Elo via openlm.ai See where this value came from and when it was checked.
|
| 28 | Qwen: Qwen3 Max | 1443.00 | SourceChatbot Arena Elo via openlm.ai See where this value came from and when it was checked.
|
| 29 | OpenAI: GPT-5.1 | 1440.00 | SourceChatbot Arena Elo via openlm.ai See where this value came from and when it was checked.
|
| 30 | MoonshotAI: Kimi K2 Thinking | 1438.00 | SourceChatbot Arena Elo via openlm.ai See where this value came from and when it was checked.
|
Knowledge and reasoning across professional and academic subjects, with ten answer choices instead of four to leave less room for guessing.
A rating or index rather than a percentage. Higher is better, and each index defines its own range.
| Rank | Model | Score | Source |
|---|---|---|---|
| 1 | Claude Opus 5 | 91.60 | SourceMMLU-Pro via openlm.ai See where this value came from and when it was checked.
|
| 2 | Anthropic: Claude Fable 5 | 91.50 | SourceMMLU-Pro via openlm.ai See where this value came from and when it was checked.
|
| 3 | OpenAI: GPT-5.6 Sol | 90.20 | SourceMMLU-Pro via openlm.ai See where this value came from and when it was checked.
|
| 4 | Google: Gemini 3.7 Flash | 90.00 | SourceMMLU-Pro via openlm.ai See where this value came from and when it was checked.
|
| 5 | Google: Gemini 3.6 Flash | 90.00 | SourceMMLU-Pro via openlm.ai See where this value came from and when it was checked.
|
| 6 | Qwen: Qwen3.8 Max | 89.80 | SourceMMLU-Pro via openlm.ai See where this value came from and when it was checked.
|
| 7 | SpaceXAI: Grok 4.6 | 89.60 | SourceMMLU-Pro via openlm.ai See where this value came from and when it was checked.
|
| 8 | OpenAI: GPT-5.6 Terra | 89.60 | SourceMMLU-Pro via openlm.ai See where this value came from and when it was checked.
|
| 9 | Qwen: Qwen3.7 Max | 89.60 | SourceMMLU-Pro via openlm.ai See where this value came from and when it was checked.
|
| 10 | Anthropic: Claude Opus 4.6 | 89.50 | SourceMMLU-Pro via openlm.ai See where this value came from and when it was checked.
|
| 11 | SpaceXAI: Grok 4.5 | 89.50 | SourceMMLU-Pro via openlm.ai See where this value came from and when it was checked.
|
| 12 | MoonshotAI: Kimi K3 | 89.30 | SourceMMLU-Pro via openlm.ai See where this value came from and when it was checked.
|
| 13 | Meta: Muse Spark 1.2 Contributor | 88.80 | SourceMMLU-Pro via openlm.ai — measured on muse-spark-1.2 See where this value came from and when it was checked.
|
| 14 | Anthropic: Claude Opus 4.5 | 88.80 | SourceMMLU-Pro via openlm.ai See where this value came from and when it was checked.
|
| 15 | Meta: Muse Spark 1.2 | 88.80 | SourceMMLU-Pro via openlm.ai See where this value came from and when it was checked.
|
| 16 | Meta: Muse Spark 1.1 | 88.70 | SourceMMLU-Pro via openlm.ai See where this value came from and when it was checked.
|
| 17 | SpaceXAI: Grok 4.20 | 88.60 | SourceMMLU-Pro via openlm.ai See where this value came from and when it was checked.
|
| 18 | Qwen: Qwen3.6 Plus | 88.50 | SourceMMLU-Pro via openlm.ai See where this value came from and when it was checked.
|
| 19 | OpenAI: GPT-5.4 | 88.40 | SourceMMLU-Pro via openlm.ai See where this value came from and when it was checked.
|
| 20 | Qwen: Qwen3.5 397B A17B | 87.80 | SourceMMLU-Pro via openlm.ai See where this value came from and when it was checked.
|
| 21 | Z.ai: GLM 5.3 | 87.80 | SourceMMLU-Pro via openlm.ai See where this value came from and when it was checked.
|
| 22 | OpenAI: GPT-5.2 | 87.40 | SourceMMLU-Pro via openlm.ai See where this value came from and when it was checked.
|
| 23 | Anthropic: Claude Opus 4.1 | 87.30 | SourceMMLU-Pro via openlm.ai See where this value came from and when it was checked.
|
| 24 | MiniMax: MiniMax M2.5 | 87.00 | SourceMMLU-Pro via openlm.ai See where this value came from and when it was checked.
|
| 25 | MiniMax: MiniMax M2.1 | 87.00 | SourceMMLU-Pro via openlm.ai See where this value came from and when it was checked.
|
| 26 | OpenAI: GPT-5.1 | 87.00 | SourceMMLU-Pro via openlm.ai See where this value came from and when it was checked.
|
| 27 | NVIDIA: Nemotron 3 Ultra | 86.80 | SourceMMLU-Pro via openlm.ai See where this value came from and when it was checked.
|
| 28 | Qwen: Qwen3.8 27B | 86.30 | SourceMMLU-Pro via openlm.ai See where this value came from and when it was checked.
|
| 29 | Google: Gemini 3.1 Flash Lite | 86.20 | SourceMMLU-Pro via openlm.ai See where this value came from and when it was checked.
|
| 30 | Google: Gemini 2.5 Pro | 86.20 | SourceMMLU-Pro via openlm.ai See where this value came from and when it was checked.
|
The same head-to-head human voting, counted only on prompts that include an image.
A rating or index rather than a percentage. Higher is better, and each index defines its own range.
| Rank | Model | Score | Source |
|---|---|---|---|
| 1 | Claude Opus 5 | 1314.00 | SourceChatbot Arena Vision Elo via openlm.ai See where this value came from and when it was checked.
|
| 2 | Qwen: Qwen3.8 Max | 1312.00 | SourceChatbot Arena Vision Elo via openlm.ai See where this value came from and when it was checked.
|
| 3 | OpenAI: GPT-5.6 Sol | 1312.00 | SourceChatbot Arena Vision Elo via openlm.ai See where this value came from and when it was checked.
|
| 4 | Anthropic: Claude Fable 5 | 1312.00 | SourceChatbot Arena Vision Elo via openlm.ai See where this value came from and when it was checked.
|
| 5 | MoonshotAI: Kimi K3 | 1311.00 | SourceChatbot Arena Vision Elo via openlm.ai See where this value came from and when it was checked.
|
| 6 | SpaceXAI: Grok 4.6 | 1310.00 | SourceChatbot Arena Vision Elo via openlm.ai See where this value came from and when it was checked.
|
| 7 | OpenAI: GPT-5.6 Terra | 1310.00 | SourceChatbot Arena Vision Elo via openlm.ai See where this value came from and when it was checked.
|
| 8 | SpaceXAI: Grok 4.5 | 1305.00 | SourceChatbot Arena Vision Elo via openlm.ai See where this value came from and when it was checked.
|
| 9 | Google: Gemini 3.7 Flash | 1303.00 | SourceChatbot Arena Vision Elo via openlm.ai See where this value came from and when it was checked.
|
| 10 | Google: Gemini 3.6 Flash | 1301.00 | SourceChatbot Arena Vision Elo via openlm.ai See where this value came from and when it was checked.
|
| 11 | Meta: Muse Spark 1.2 Contributor | 1300.00 | SourceChatbot Arena Vision Elo via openlm.ai — measured on muse-spark-1.2 See where this value came from and when it was checked.
|
| 12 | Meta: Muse Spark 1.2 | 1300.00 | SourceChatbot Arena Vision Elo via openlm.ai See where this value came from and when it was checked.
|
| 13 | Anthropic: Claude Opus 4.6 | 1298.00 | SourceChatbot Arena Vision Elo via openlm.ai See where this value came from and when it was checked.
|
| 14 | Meta: Muse Spark 1.1 | 1298.00 | SourceChatbot Arena Vision Elo via openlm.ai See where this value came from and when it was checked.
|
| 15 | Qwen: Qwen3.7 Max | 1289.00 | SourceChatbot Arena Vision Elo via openlm.ai See where this value came from and when it was checked.
|
| 16 | SpaceXAI: Grok 4.20 | 1279.00 | SourceChatbot Arena Vision Elo via openlm.ai See where this value came from and when it was checked.
|
| 17 | OpenAI: GPT-5.4 | 1275.00 | SourceChatbot Arena Vision Elo via openlm.ai See where this value came from and when it was checked.
|
| 18 | Google: Gemini 2.5 Pro | 1266.00 | SourceChatbot Arena Vision Elo via openlm.ai See where this value came from and when it was checked.
|
| 19 | OpenAI: GPT-5.2 | 1248.00 | SourceChatbot Arena Vision Elo via openlm.ai See where this value came from and when it was checked.
|
| 20 | Qwen: Qwen3 VL 235B A22B Instruct | 1246.00 | SourceChatbot Arena Vision Elo via openlm.ai See where this value came from and when it was checked.
|
| 21 | OpenAI: GPT-5.1 | 1243.00 | SourceChatbot Arena Vision Elo via openlm.ai See where this value came from and when it was checked.
|
| 22 | Google: Gemini 2.5 Flash | 1235.00 | SourceChatbot Arena Vision Elo via openlm.ai See where this value came from and when it was checked.
|
| 23 | Google: Gemini 3.1 Flash Lite | 1230.00 | SourceChatbot Arena Vision Elo via openlm.ai See where this value came from and when it was checked.
|
| 24 | Qwen: Qwen3 VL 235B A22B Thinking | 1215.00 | SourceChatbot Arena Vision Elo via openlm.ai See where this value came from and when it was checked.
|
| 25 | OpenAI: GPT-5 Mini | 1214.00 | SourceChatbot Arena Vision Elo via openlm.ai See where this value came from and when it was checked.
|
| 26 | Google: Gemini 2.5 Flash Lite | 1205.00 | SourceChatbot Arena Vision Elo via openlm.ai See where this value came from and when it was checked.
|
| 27 | Anthropic: Claude Opus 4 | 1173.00 | SourceChatbot Arena Vision Elo via openlm.ai See where this value came from and when it was checked.
|
| 28 | Anthropic: Claude Sonnet 4 | 1170.00 | SourceChatbot Arena Vision Elo via openlm.ai See where this value came from and when it was checked.
|
| 29 | OpenAI: GPT-5 Nano | 1166.00 | SourceChatbot Arena Vision Elo via openlm.ai See where this value came from and when it was checked.
|
| 30 | Google: Gemma 3 27B | 1163.00 | SourceChatbot Arena Vision Elo via openlm.ai See where this value came from and when it was checked.
|
BIG-Bench Hard: the subset of BIG-Bench tasks that models were still failing when the set was assembled.
A rating or index rather than a percentage. Higher is better, and each index defines its own range.
| Rank | Model | Score | Source |
|---|---|---|---|
| 1 | Qwen2.5 72B Instruct | 61.87 | SourceBBH via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 2 | qwen2-72b-instruct | 57.48 | SourceBBH via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 3 | Meta: Llama 3.3 70B Instruct | 56.56 | SourceBBH via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 4 | qwen2-vl-72b-instruct | 56.31 | SourceBBH via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 5 | Meta: Llama 3.1 70B Instruct | 55.93 | SourceBBH via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 6 | Nous: Hermes 3 70B Instruct | 53.77 | SourceBBH via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 7 | Microsoft: Phi 4 | 52.43 | SourceBBH via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 8 | Qwen2.5 Coder 32B Instruct | 52.27 | SourceBBH via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 9 | Google: Gemma 2 27B | 49.27 | SourceBBH via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 10 | dolphin-2-9-2-qwen2-72b | 47.70 | SourceBBH via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 11 | gemma2-9b-it | 42.14 | SourceBBH via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 12 | deepseek-r1-distill-qwen-14b | 40.69 | SourceBBH via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 13 | qwen2-7b-instruct | 37.81 | SourceBBH via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 14 | nous-hermes-2-mixtral-8x7b-dpo | 37.11 | SourceBBH via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 15 | phi-3-mini-128k-instruct | 37.10 | SourceBBH via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 16 | qwen2-vl-7b-instruct | 35.88 | SourceBBH via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 17 | DeepSeek: R1 Distill Llama 70B | 35.82 | SourceBBH via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 18 | Qwen: Qwen2.5 7B Instruct | 34.89 | SourceBBH via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 19 | mistralai/Mistral-Nemo-Instruct-2407 | 29.68 | SourceBBH via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 20 | hermes-2-pro-mistral-7b | 29.43 | SourceBBH via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 21 | Meta: Llama 3.1 8B Instruct | 29.38 | SourceBBH via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 22 | mistral-nemo-base-2407 | 29.37 | SourceBBH via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 23 | openhermes-2-mistral-7b | 29.25 | SourceBBH via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 24 | Meta: Llama 3.2 3B Instruct | 24.06 | SourceBBH via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 25 | zephyr-7b-beta | 21.49 | SourceBBH via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 26 | gemma-7b | 21.12 | SourceBBH via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 27 | deepseek-r1-distill-qwen-32b | 17.15 | SourceBBH via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 28 | nous-hermes-llama2-7b | 13.79 | SourceBBH via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 29 | gemma-7b-it | 11.94 | SourceBBH via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 30 | Meta: Llama 3.2 1B Instruct | 8.74 | SourceBBH via the Open LLM Leaderboard See where this value came from and when it was checked.
|
Whether a model follows instructions that can be checked automatically - a word limit, a required format, a forbidden phrase.
A rating or index rather than a percentage. Higher is better, and each index defines its own range.
| Rank | Model | Score | Source |
|---|---|---|---|
| 1 | Meta: Llama 3.3 70B Instruct | 89.98 | SourceIFEval via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 2 | Meta: Llama 3.1 70B Instruct | 86.69 | SourceIFEval via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 3 | Qwen2.5 72B Instruct | 86.38 | SourceIFEval via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 4 | qwen2-72b-instruct | 79.89 | SourceIFEval via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 5 | Google: Gemma 2 27B | 79.78 | SourceIFEval via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 6 | Nous: Hermes 3 70B Instruct | 76.61 | SourceIFEval via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 7 | Qwen: Qwen2.5 7B Instruct | 75.85 | SourceIFEval via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 8 | gemma2-9b-it | 74.36 | SourceIFEval via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 9 | Meta: Llama 3.2 3B Instruct | 73.93 | SourceIFEval via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 10 | Qwen2.5 Coder 32B Instruct | 72.65 | SourceIFEval via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 11 | mistralai/Mistral-Nemo-Instruct-2407 | 63.80 | SourceIFEval via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 12 | dolphin-2-9-2-qwen2-72b | 63.44 | SourceIFEval via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 13 | qwen2-vl-72b-instruct | 59.82 | SourceIFEval via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 14 | phi-3-mini-128k-instruct | 59.76 | SourceIFEval via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 15 | nous-hermes-2-mixtral-8x7b-dpo | 58.97 | SourceIFEval via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 16 | Meta: Llama 3.2 1B Instruct | 56.98 | SourceIFEval via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 17 | qwen2-7b-instruct | 56.79 | SourceIFEval via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 18 | hermes-2-pro-mistral-7b | 56.68 | SourceIFEval via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 19 | openhermes-2-mistral-7b | 52.86 | SourceIFEval via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 20 | zephyr-7b-beta | 49.50 | SourceIFEval via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 21 | Meta: Llama 3.1 8B Instruct | 49.22 | SourceIFEval via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 22 | qwen2-vl-7b-instruct | 45.99 | SourceIFEval via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 23 | @cf/mistral/mistral-7b-instruct-v0.1 | 44.87 | SourceIFEval via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 24 | deepseek-r1-distill-qwen-14b | 43.82 | SourceIFEval via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 25 | DeepSeek: R1 Distill Llama 70B | 43.36 | SourceIFEval via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 26 | deepseek-r1-distill-qwen-32b | 41.86 | SourceIFEval via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 27 | deepseek-r1-distill-qwen-7b | 40.38 | SourceIFEval via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 28 | qwq-32b | 39.77 | SourceIFEval via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 29 | gemma-7b-it | 38.68 | SourceIFEval via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 30 | deepseek-r1-distill-llama-8b | 37.82 | SourceIFEval via the Open LLM Leaderboard See where this value came from and when it was checked.
|
The hardest tier of competition mathematics problems, scored on the final answer.
A rating or index rather than a percentage. Higher is better, and each index defines its own range.
| Rank | Model | Score | Source |
|---|---|---|---|
| 1 | Qwen2.5 72B Instruct | 59.82 | SourceMATH Lvl 5 via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 2 | deepseek-r1-distill-qwen-14b | 57.02 | SourceMATH Lvl 5 via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 3 | Qwen: Qwen2.5 7B Instruct | 50.00 | SourceMATH Lvl 5 via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 4 | Qwen2.5 Coder 32B Instruct | 49.55 | SourceMATH Lvl 5 via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 5 | Meta: Llama 3.3 70B Instruct | 48.34 | SourceMATH Lvl 5 via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 6 | qwen2-72b-instruct | 41.77 | SourceMATH Lvl 5 via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 7 | Meta: Llama 3.1 70B Instruct | 38.07 | SourceMATH Lvl 5 via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 8 | qwen2-vl-72b-instruct | 34.44 | SourceMATH Lvl 5 via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 9 | Microsoft: Phi 4 | 31.65 | SourceMATH Lvl 5 via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 10 | DeepSeek: R1 Distill Llama 70B | 30.74 | SourceMATH Lvl 5 via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 11 | dolphin-2-9-2-qwen2-72b | 28.02 | SourceMATH Lvl 5 via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 12 | qwen2-7b-instruct | 27.64 | SourceMATH Lvl 5 via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 13 | Google: Gemma 2 27B | 23.87 | SourceMATH Lvl 5 via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 14 | deepseek-r1-distill-llama-8b | 21.98 | SourceMATH Lvl 5 via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 15 | Nous: Hermes 3 70B Instruct | 21.00 | SourceMATH Lvl 5 via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 16 | qwen2-vl-7b-instruct | 19.86 | SourceMATH Lvl 5 via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 17 | deepseek-r1-distill-qwen-7b | 19.56 | SourceMATH Lvl 5 via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 18 | gemma2-9b-it | 19.49 | SourceMATH Lvl 5 via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 19 | Meta: Llama 3.2 3B Instruct | 17.67 | SourceMATH Lvl 5 via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 20 | deepseek-r1-distill-qwen-32b | 17.07 | SourceMATH Lvl 5 via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 21 | qwq-32b | 16.09 | SourceMATH Lvl 5 via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 22 | Meta: Llama 3.1 8B Instruct | 15.56 | SourceMATH Lvl 5 via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 23 | phi-3-mini-128k-instruct | 14.05 | SourceMATH Lvl 5 via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 24 | mistralai/Mistral-Nemo-Instruct-2407 | 12.69 | SourceMATH Lvl 5 via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 25 | nous-hermes-2-mixtral-8x7b-dpo | 12.24 | SourceMATH Lvl 5 via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 26 | gemma-7b | 7.40 | SourceMATH Lvl 5 via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 27 | Meta: Llama 3.2 1B Instruct | 7.02 | SourceMATH Lvl 5 via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 28 | hermes-2-pro-mistral-7b | 6.04 | SourceMATH Lvl 5 via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 29 | mistral-nemo-base-2407 | 5.97 | SourceMATH Lvl 5 via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 30 | openhermes-2-mistral-7b | 4.53 | SourceMATH Lvl 5 via the Open LLM Leaderboard See where this value came from and when it was checked.
|
Knowledge and reasoning across professional and academic subjects. Reported here from the Open LLM Leaderboard's own run.
A rating or index rather than a percentage. Higher is better, and each index defines its own range.
| Rank | Model | Score | Source |
|---|---|---|---|
| 1 | qwen2-vl-72b-instruct | 52.41 | SourceMMLU-PRO via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 2 | Qwen2.5 72B Instruct | 51.40 | SourceMMLU-PRO via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 3 | dolphin-2-9-2-qwen2-72b | 49.68 | SourceMMLU-PRO via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 4 | qwen2-72b-instruct | 48.92 | SourceMMLU-PRO via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 5 | Meta: Llama 3.3 70B Instruct | 48.13 | SourceMMLU-PRO via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 6 | Meta: Llama 3.1 70B Instruct | 47.88 | SourceMMLU-PRO via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 7 | Microsoft: Phi 4 | 47.63 | SourceMMLU-PRO via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 8 | DeepSeek: R1 Distill Llama 70B | 41.65 | SourceMMLU-PRO via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 9 | Nous: Hermes 3 70B Instruct | 41.41 | SourceMMLU-PRO via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 10 | deepseek-r1-distill-qwen-32b | 40.96 | SourceMMLU-PRO via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 11 | deepseek-r1-distill-qwen-14b | 40.74 | SourceMMLU-PRO via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 12 | Google: Gemma 2 27B | 38.35 | SourceMMLU-PRO via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 13 | Qwen2.5 Coder 32B Instruct | 37.92 | SourceMMLU-PRO via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 14 | Qwen: Qwen2.5 7B Instruct | 36.52 | SourceMMLU-PRO via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 15 | qwen2-vl-7b-instruct | 34.39 | SourceMMLU-PRO via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 16 | gemma2-9b-it | 31.95 | SourceMMLU-PRO via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 17 | qwen2-7b-instruct | 31.64 | SourceMMLU-PRO via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 18 | Meta: Llama 3.1 8B Instruct | 31.09 | SourceMMLU-PRO via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 19 | phi-3-mini-128k-instruct | 30.38 | SourceMMLU-PRO via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 20 | nous-hermes-2-mixtral-8x7b-dpo | 29.62 | SourceMMLU-PRO via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 21 | mistralai/Mistral-Nemo-Instruct-2407 | 27.97 | SourceMMLU-PRO via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 22 | mistral-nemo-base-2407 | 27.46 | SourceMMLU-PRO via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 23 | Meta: Llama 3.2 3B Instruct | 24.39 | SourceMMLU-PRO via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 24 | gemma-7b | 21.64 | SourceMMLU-PRO via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 25 | hermes-2-pro-mistral-7b | 21.63 | SourceMMLU-PRO via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 26 | openhermes-2-mistral-7b | 21.46 | SourceMMLU-PRO via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 27 | zephyr-7b-beta | 19.79 | SourceMMLU-PRO via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 28 | @cf/mistral/mistral-7b-instruct-v0.1 | 15.72 | SourceMMLU-PRO via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 29 | deepseek-r1-distill-qwen-7b | 14.68 | SourceMMLU-PRO via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 30 | deepseek-r1-distill-llama-8b | 12.10 | SourceMMLU-PRO via the Open LLM Leaderboard See where this value came from and when it was checked.
|
Reasoning that has to be carried across a long narrative - who could have done it, where an object ended up, who fits which role.
A rating or index rather than a percentage. Higher is better, and each index defines its own range.
| Rank | Model | Score | Source |
|---|---|---|---|
| 1 | deepseek-r1-distill-qwen-14b | 28.71 | SourceMUSR via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 2 | Microsoft: Phi 4 | 23.79 | SourceMUSR via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 3 | Nous: Hermes 3 70B Instruct | 23.43 | SourceMUSR via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 4 | Meta: Llama 3.1 70B Instruct | 17.69 | SourceMUSR via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 5 | qwen2-72b-instruct | 17.17 | SourceMUSR via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 6 | dolphin-2-9-2-qwen2-72b | 17.04 | SourceMUSR via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 7 | nous-hermes-2-mixtral-8x7b-dpo | 16.68 | SourceMUSR via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 8 | deepseek-r1-distill-qwen-32b | 16.14 | SourceMUSR via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 9 | openhermes-2-mistral-7b | 16.06 | SourceMUSR via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 10 | qwen2-vl-72b-instruct | 15.89 | SourceMUSR via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 11 | Meta: Llama 3.3 70B Instruct | 15.57 | SourceMUSR via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 12 | hermes-2-pro-mistral-7b | 14.13 | SourceMUSR via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 13 | Qwen2.5 Coder 32B Instruct | 13.72 | SourceMUSR via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 14 | qwen2-vl-7b-instruct | 13.55 | SourceMUSR via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 15 | DeepSeek: R1 Distill Llama 70B | 13.28 | SourceMUSR via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 16 | gemma-7b-it | 12.53 | SourceMUSR via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 17 | Qwen2.5 72B Instruct | 11.74 | SourceMUSR via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 18 | nous-hermes-llama2-7b | 11.68 | SourceMUSR via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 19 | qwq-32b | 11.05 | SourceMUSR via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 20 | gemma-7b | 10.98 | SourceMUSR via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 21 | gemma2-9b-it | 9.74 | SourceMUSR via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 22 | Google: Gemma 2 27B | 9.11 | SourceMUSR via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 23 | Meta: Llama 3.1 8B Instruct | 8.61 | SourceMUSR via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 24 | mistralai/Mistral-Nemo-Instruct-2407 | 8.48 | SourceMUSR via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 25 | Qwen: Qwen2.5 7B Instruct | 8.45 | SourceMUSR via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 26 | zephyr-7b-beta | 7.73 | SourceMUSR via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 27 | phi-3-mini-128k-instruct | 7.71 | SourceMUSR via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 28 | qwen2-7b-instruct | 7.37 | SourceMUSR via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 29 | mistral-nemo-base-2407 | 6.52 | SourceMUSR via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 30 | @cf/mistral/mistral-7b-instruct-v0.1 | 6.13 | SourceMUSR via the Open LLM Leaderboard See where this value came from and when it was checked.
|
Graduate-level questions in the sciences, written to resist search. Reported here from the Open LLM Leaderboard's own run.
A rating or index rather than a percentage. Higher is better, and each index defines its own range.
| Rank | Model | Score | Source |
|---|---|---|---|
| 1 | Microsoft: Phi 4 | 20.81 | SourceGPQA via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 2 | deepseek-r1-distill-qwen-14b | 18.34 | SourceGPQA via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 3 | qwen2-vl-72b-instruct | 18.34 | SourceGPQA via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 4 | Qwen2.5 72B Instruct | 16.67 | SourceGPQA via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 5 | Google: Gemma 2 27B | 16.67 | SourceGPQA via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 6 | qwen2-72b-instruct | 16.33 | SourceGPQA via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 7 | dolphin-2-9-2-qwen2-72b | 16.00 | SourceGPQA via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 8 | Nous: Hermes 3 70B Instruct | 14.88 | SourceGPQA via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 9 | gemma2-9b-it | 14.77 | SourceGPQA via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 10 | Meta: Llama 3.1 70B Instruct | 14.21 | SourceGPQA via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 11 | Qwen2.5 Coder 32B Instruct | 13.20 | SourceGPQA via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 12 | Meta: Llama 3.3 70B Instruct | 10.51 | SourceGPQA via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 13 | nous-hermes-2-mixtral-8x7b-dpo | 9.51 | SourceGPQA via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 14 | qwen2-vl-7b-instruct | 9.28 | SourceGPQA via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 15 | phi-3-mini-128k-instruct | 9.06 | SourceGPQA via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 16 | Meta: Llama 3.1 8B Instruct | 8.72 | SourceGPQA via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 17 | qwen2-7b-instruct | 6.38 | SourceGPQA via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 18 | mistral-nemo-base-2407 | 5.82 | SourceGPQA via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 19 | Qwen: Qwen2.5 7B Instruct | 5.48 | SourceGPQA via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 20 | zephyr-7b-beta | 5.37 | SourceGPQA via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 21 | mistralai/Mistral-Nemo-Instruct-2407 | 5.37 | SourceGPQA via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 22 | gemma-7b | 4.92 | SourceGPQA via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 23 | deepseek-r1-distill-qwen-32b | 4.59 | SourceGPQA via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 24 | gemma-7b-it | 4.59 | SourceGPQA via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 25 | openhermes-2-mistral-7b | 4.47 | SourceGPQA via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 26 | deepseek-r1-distill-qwen-7b | 3.91 | SourceGPQA via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 27 | gemma-2b-it | 3.80 | SourceGPQA via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 28 | Meta: Llama 3.2 3B Instruct | 3.80 | SourceGPQA via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 29 | Meta: Llama 3.2 1B Instruct | 3.36 | SourceGPQA via the Open LLM Leaderboard See where this value came from and when it was checked.
|
| 30 | hermes-2-pro-mistral-7b | 3.13 | SourceGPQA via the Open LLM Leaderboard See where this value came from and when it was checked.
|
Abstract pattern puzzles built to resist memorisation: each one is solvable from a handful of examples and unlike anything in training data.
A rating or index rather than a percentage. Higher is better, and each index defines its own range.
| Rank | Model | Score | Source |
|---|---|---|---|
| 1 | OpenAI: GPT-5.6 Sol | 92.50 | SourceARC-AGI via openlm.ai See where this value came from and when it was checked.
|
| 2 | Claude Opus 5 | 90.40 | SourceARC-AGI via openlm.ai See where this value came from and when it was checked.
|
| 3 | Anthropic: Claude Fable 5 | 89.20 | SourceARC-AGI via openlm.ai See where this value came from and when it was checked.
|
| 4 | OpenAI: GPT-5.6 Terra | 83.90 | SourceARC-AGI via openlm.ai See where this value came from and when it was checked.
|
| 5 | Google: Gemini 3.7 Flash | 80.60 | SourceARC-AGI via openlm.ai See where this value came from and when it was checked.
|
| 6 | SpaceXAI: Grok 4.6 | 75.00 | SourceARC-AGI via openlm.ai See where this value came from and when it was checked.
|
| 7 | Google: Gemini 3.6 Flash | 72.10 | SourceARC-AGI via openlm.ai See where this value came from and when it was checked.
|
| 8 | SpaceXAI: Grok 4.20 | 65.10 | SourceARC-AGI via openlm.ai See where this value came from and when it was checked.
|
| 9 | Anthropic: Claude Opus 4.6 | 64.60 | SourceARC-AGI via openlm.ai See where this value came from and when it was checked.
|
| 10 | OpenAI: GPT-5.6 Luna | 59.50 | SourceARC-AGI via openlm.ai See where this value came from and when it was checked.
|
| 11 | OpenAI: GPT-5.4 | 29.20 | SourceARC-AGI via openlm.ai See where this value came from and when it was checked.
|
| 12 | OpenAI: GPT-5.2 | 26.70 | SourceARC-AGI via openlm.ai See where this value came from and when it was checked.
|
| 13 | Anthropic: Claude Opus 4.5 | 7.80 | SourceARC-AGI via openlm.ai See where this value came from and when it was checked.
|
| 14 | OpenAI: GPT-5.1 | 7.50 | SourceARC-AGI via openlm.ai See where this value came from and when it was checked.
|
| 15 | Qwen: Qwen3.5 397B A17B | 5.00 | SourceARC-AGI via openlm.ai See where this value came from and when it was checked.
|
| 16 | MiniMax: MiniMax M2.5 | 4.90 | SourceARC-AGI via openlm.ai See where this value came from and when it was checked.
|
| 17 | Google: Gemini 2.5 Pro | 4.90 | SourceARC-AGI via openlm.ai See where this value came from and when it was checked.
|
| 18 | OpenAI: GPT-5 Mini | 4.40 | SourceARC-AGI via openlm.ai See where this value came from and when it was checked.
|
| 19 | OpenAI: o3 Mini High | 3.00 | SourceARC-AGI via openlm.ai See where this value came from and when it was checked.
|
| 20 | OpenAI: GPT-5 Nano | 2.60 | SourceARC-AGI via openlm.ai See where this value came from and when it was checked.
|
| 21 | Google: Gemini 2.5 Flash | 2.50 | SourceARC-AGI via openlm.ai See where this value came from and when it was checked.
|
| 22 | OpenAI: o3 Mini | 2.10 | SourceARC-AGI via openlm.ai See where this value came from and when it was checked.
|
| 23 | Anthropic: Claude Opus 4 | 1.30 | SourceARC-AGI via openlm.ai See where this value came from and when it was checked.
|
| 24 | Anthropic: Claude Sonnet 4 | 1.30 | SourceARC-AGI via openlm.ai See where this value came from and when it was checked.
|
| 25 | DeepSeek: R1 | 1.30 | SourceARC-AGI via openlm.ai See where this value came from and when it was checked.
|
Reading these scores
External results are attributed to their original benchmark, conditions, model snapshot and source. StackTicker does not silently claim ownership.
Most scores here, including the Artificial Analysis indices, reach us through the OpenRouter catalogue rather than from the benchmark directly. Each row carries the date it was read, and the publisher may have released a newer round since. Open the source beside a score to see exactly what we read and when.
Repeated workloads can target decision-relevant behavior, long-horizon consistency and drift—with the raw evidence available.