Claude 4 Sonnet vs gpt-oss-120b
Head to head on 21 shared benchmarks, with price, context window, and release dates.
Benchmark scores
50evals · sort by any column, ⤢ to expand fullscreen
| Model | |||||||||||||||||||||||||||||||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Claude 4 Sonnet Anthropic | 38.0% | 54.7% | 1480elo | 58.4 | 68.3% | 4.3% | 45.4% | 64.8% | 77.5% | 54.6% | 44.3% | 72.9% | 70.5% | 69.0% | 44.9% | 83.7% | 37.3% | 74.6% | 69.6% | 27.3% | 52.3% | - | 40.7% | - | - | 22.9% | 47.8% | - | 19.8% | 67.5% | - | - | - | 93.4% | 33.9% | 72.4% | 86.7% | - | 62.5% | 43.9% | 6.18 | 6.18 | 35.0% | - | 58.3% | 35.6% | - | 0.59 | 84.0% | 84.0% | 55.5% |
| gpt-oss-120b OpenAI | 66.7% | 58.2% | 959elo | 35.8 | 67.2% | 5.9% | 58.3% | 51.0% | 60.2% | 38.8% | 50.3% | 48.6% | 68.9% | 39.2% | 70.7% | 77.5% | 36.0% | 26.0% | 71.6% | 5.3% | 45.0% | 41.8% | - | 38.9% | 7.6% | - | - | 13.0% | - | - | 57.6 | 1.62 | 1.53 | - | - | - | - | 80.0% | - | - | - | - | - | 97.9% | - | - | 65.6% | - | - | - | 49.6% |
2 / 2 models
| Attribute | Claude 4 Sonnet Anthropic | gpt-oss-120b OpenAI |
|---|---|---|
| Description | Claude 4 Sonnet is an AI model from Anthropic. | GPT-Oss 120b is an AI model from OpenAI, released with open weights. |
| Family | Claude | GPT |
| Params | - | - |
| Open weights | closed | open |
| License | proprietary | apache-2.0 |
| Released | 22 May 2025 | 5 Aug 2025 |
| Context | 200,000 | 131,072 |
| Input $/1M | $3.00 | $0.15 |
| Output $/1M | $15.00 | $0.60 |
| Cache read $/1M | - | $0.030 |
| Cache write $/1M | - | - |
| Speed | 0 tok/s | 186 tok/s |
| Latency | 0.00 s | 0.50 s |
| Modalities | text, image | text |
| Providers | - | - |
| Publisher | Anthropic | OpenAI |
| Reported scores | GPQA Diamond67.2% (AA) Humanity's Last Exam (HLE)5.9% (AA) LiveCodeBench70.7% (AA) MMLU-Pro77.5% (AA) SciCode36.0% (AA) |
FAQ
- Is Claude 4 Sonnet or gpt-oss-120b better?
- Across the 21 benchmarks both models report on Sophon, Claude 4 Sonnet leads on 14 of them. Which one is "better" depends on the benchmark - the table above shows every shared score.
- How do Claude 4 Sonnet and gpt-oss-120b compare on GPQA Diamond?
- Claude 4 Sonnet scores 68.3% and gpt-oss-120b scores 67.2% on GPQA Diamond.
- Which is cheaper, Claude 4 Sonnet or gpt-oss-120b?
- gpt-oss-120b is cheaper at $0.60 per million output tokens against $15.00 for Claude 4 Sonnet - about 25.0x.
- When were Claude 4 Sonnet and gpt-oss-120b released?
- Claude 4 Sonnet was released 22 May 2025 by Anthropic. gpt-oss-120b was released 5 Aug 2025 by OpenAI.
Comparing something else? Build your own side-by-side.