Claude Opus 4.6 vs gpt-oss-120b
Head to head on 19 shared benchmarks, with price, context window, and release dates.
Benchmark scores
51evals · sort by any column, ⤢ to expand fullscreen
| Model | ||||||||||||||||||||||||||||||||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.6 Anthropic | 67.0% | 69.0% | 1809elo | 77.7 | 89.6% | 39.9% | 53.1% | 78.8% | 78.2% | 69.9% | 63.3% | 83.3% | 89.3% | 88.7% | 51.9% | 75.6% | 76.0% | 46.2% | 92.1% | - | - | 99.79 | 56.1% | 1.5 | - | - | 2.08 | 1223elo | 40.7% | - | 84.9% | 88771 | 58 | - | - | - | 78.5% | 48.2% | 86.7% | - | - | 68.5% | 93 | 50.0% | 51.6% | 44.5 | - | 72.0% | - | 80.6 | 57.6% | 68.1% |
| gpt-oss-120b OpenAI | 58.2% | 11.0% | 961elo | 35.8 | 78.2% | 19.6% | 69.0% | 51.0% | 60.2% | 38.8% | 50.3% | 48.6% | 68.9% | 39.2% | 34.0% | 26.0% | 71.6% | 23.5% | 65.8% | 41.8% | 93.4% | - | - | - | 38.9% | 7.6% | - | - | - | 57.6 | - | - | - | 87.8% | 1.62 | 1.53 | - | - | - | 80.0% | 80.8% | - | - | - | - | - | 97.9% | - | 65.6% | - | - | 54.1% |
2 / 2 models
| Attribute | Claude Opus 4.6 Anthropic | gpt-oss-120b OpenAI |
|---|---|---|
| Description | Claude Opus 4.6 is an AI model from Anthropic. | GPT-Oss 120b is an AI model from OpenAI, released with open weights. |
| Family | Claude | GPT |
| Params | - | - |
| Open weights | closed | open |
| License | proprietary | apache-2.0 |
| Released | 5 Feb 2026 | 5 Aug 2025 |
| Context | 1,000,000 | 131,072 |
| Input $/1M | $5.00 | $0.15 |
| Output $/1M | $25.00 | $0.59 |
| Cache read $/1M | $0.500 | $0.075 |
| Cache write $/1M | $6.250 | - |
| Speed | 0 tok/s | 209 tok/s |
| Latency | 0.00 s | 0.51 s |
| Modalities | text, image, file | text |
| Providers | - | - |
| Publisher | Anthropic | OpenAI |
| Reported scores | GPQA Diamond89.6% (AA) Humanity's Last Exam (HLE)39.9% (AA) SciCode51.9% (AA) τ²-bench (Tau²-bench)92.1% (AA) Terminal-Bench (Hard)46.2% (AA) | GPQA Diamond78.2% (AA) Humanity's Last Exam (HLE)19.6% (AA) LiveCodeBench87.8% (AA) MMLU-Pro80.8% (AA) SciCode34.0% (AA) |
FAQ
- Is Claude Opus 4.6 or gpt-oss-120b better?
- Across the 19 benchmarks both models report on Sophon, Claude Opus 4.6 leads on 18 of them. Which one is "better" depends on the benchmark - the table above shows every shared score.
- How do Claude Opus 4.6 and gpt-oss-120b compare on GPQA Diamond?
- Claude Opus 4.6 scores 89.6% and gpt-oss-120b scores 78.2% on GPQA Diamond.
- Which is cheaper, Claude Opus 4.6 or gpt-oss-120b?
- gpt-oss-120b is cheaper at $0.59 per million output tokens against $25.00 for Claude Opus 4.6 - about 42.4x.
- When were Claude Opus 4.6 and gpt-oss-120b released?
- Claude Opus 4.6 was released 5 Feb 2026 by Anthropic. gpt-oss-120b was released 5 Aug 2025 by OpenAI.
Other head-to-heads
56Claude Opus 4.6 vs GPT-5.433 shared evalsClaude Opus 4.6 vs Gemini 3.1 Pro Preview31 shared evalsClaude Opus 4.6 vs Kimi K2.531 shared evalsClaude Opus 4.6 vs GPT-5.230 shared evalsClaude Opus 4.6 vs Claude Opus 4.729 shared evalsClaude Opus 4.6 vs Claude Sonnet 4.528 shared evalsClaude Opus 4.6 vs GPT-5 Mini28 shared evalsClaude Opus 4.6 vs GPT-5.528 shared evalsClaude Opus 4.6 vs Claude Opus 4.828 shared evalsClaude Opus 4.5 vs Claude Opus 4.628 shared evalsClaude Opus 4.6 vs Claude Sonnet 4.628 shared evalsClaude Opus 4.6 vs GLM 5.127 shared evalsClaude Fable 5 vs Claude Opus 4.626 shared evalsClaude Opus 4.6 vs DeepSeek V3.226 shared evalsGPT-5 Mini vs gpt-oss-120b25 shared evalsClaude Opus 4.6 vs Grok 4.1 Fast25 shared evalsClaude Opus 4.6 vs GPT-5.4 Mini25 shared evalsClaude Opus 4.6 vs Qwen3.6 Plus24 shared evalsClaude Sonnet 4.5 vs gpt-oss-120b23 shared evalsClaude Opus 4.6 vs GPT-5 Nano23 shared evalsDeepSeek V3.2 vs gpt-oss-120b23 shared evalsGPT-5 Nano vs gpt-oss-120b22 shared evalsGPT-5.2 vs gpt-oss-120b22 shared evalsClaude 4 Sonnet vs Claude Opus 4.622 shared evalsClaude Opus 4.5 vs gpt-oss-120b21 shared evalsClaude 4 Sonnet vs gpt-oss-120b21 shared evalsClaude Opus 4.6 vs Gemini 2.5 Pro21 shared evalsClaude Opus 4.6 vs GLM 4.721 shared evalsgpt-oss-120b vs Grok 4.1 Fast20 shared evalsGLM 4.7 vs gpt-oss-120b20 shared evalsClaude Opus 4.6 vs GPT-519 shared evalsGPT-5.5 vs gpt-oss-120b19 shared evalsgpt-oss-120b vs Kimi K2.519 shared evalsGLM 5.1 vs gpt-oss-120b19 shared evalsGemini 2.5 Pro vs gpt-oss-120b19 shared evalsGemini 3.1 Pro Preview vs gpt-oss-120b18 shared evalsClaude Opus 4.8 vs gpt-oss-120b18 shared evalsClaude Fable 5 vs gpt-oss-120b18 shared evalsGPT-5.4 vs gpt-oss-120b18 shared evalsClaude Sonnet 4.6 vs gpt-oss-120b18 shared evalsClaude Opus 4.7 vs gpt-oss-120b18 shared evalsGPT-5 vs gpt-oss-120b17 shared evalsGPT-4o vs gpt-oss-120b17 shared evalsGPT-5.4 Mini vs gpt-oss-120b17 shared evalsGPT-4.1 vs gpt-oss-120b16 shared evalsgpt-oss-120b vs Qwen3.6 Plus16 shared evalsGPT-4.1 Mini vs gpt-oss-120b15 shared evalsClaude Opus 4.6 vs GPT-4o15 shared evalsGPT-4o-mini vs gpt-oss-120b15 shared evalsGPT-4.1 Nano vs gpt-oss-120b14 shared evalsClaude Opus 4.6 vs GPT-4.1 Mini13 shared evalsClaude Opus 4.6 vs GPT-4.113 shared evalsClaude Opus 4.6 vs GPT-6 Astra13 shared evalsClaude Opus 4.6 vs GPT-4o-mini12 shared evalsClaude Opus 4.6 vs GPT-4.1 Nano12 shared evalsGPT-6 Astra vs gpt-oss-120b6 shared evals
Comparing something else? Build your own side-by-side.