GPT-4o vs Kimi K2.5
Head to head on 15 shared benchmarks, with price, context window, and release dates.
Benchmark scores
55evals · sort by any column, ⤢ to expand fullscreen
| Model | ||||||||||||||||||||||||||||||||||||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Kimi K2.5 Moonshot AI | 68.3% | 27.9% | 87.9% | 30.7% | 70.2% | 72.5% | 77.9% | 57.4% | 77.7% | 66.5% | 49.0% | 70.8% | 74.2% | 34.8% | 95.9% | - | - | - | - | 96.1 | - | - | 35.0% | - | 1579elo | 74.9 | 35.8% | - | 95.4 | 78.5% | 10421 | - | 61.4% | 84.9% | 76.0% | - | - | 62.0% | 39.3% | - | 76.4% | 87.1 | - | 63.3% | - | 49.9% | - | 73 | 67.3% | - | 69.4 | - | 26.3% | 17.5% | - | 59.8% |
| GPT-4o OpenAI | 45.9% | 0.3% | 54.3% | 2.4% | 34.3% | 55.1% | 46.1% | 70.1% | 49.0% | 57.4% | 33.3% | 21.6% | 74.5% | 8.3% | 25.1% | 18.2% | 15.0% | 6.0% | 38 | - | 0.0% | 0.33 | - | 6.1% | - | - | - | 96.1 | - | - | - | 0.0% | - | - | - | 30.9% | 75.9% | - | - | 10.8% | - | - | 74.8% | - | 54.0% | - | 5.71 | - | - | 61.2 | - | 0.98 | - | - | 32.5% | 33.4% |
2 / 2 models
| Attribute | GPT-4o OpenAI | Kimi K2.5 Moonshot AI |
|---|---|---|
| Description | GPT-4o is an AI model from OpenAI. | Kimi K2.5 is an AI model from Kimi. |
| Family | GPT | Kimi |
| Params | - | - |
| Open weights | closed | open |
| License | proprietary | Modified MIT |
| Released | 20 Nov 2024 | 27 Jan 2026 |
| Context | 128,000 | 262,144 |
| Input $/1M | $2.50 | $0.60 |
| Output $/1M | $10.00 | $2.75 |
| Cache read $/1M | $1.250 | $0.070 |
| Cache write $/1M | - | - |
| Speed | 0 tok/s | 0 tok/s |
| Latency | 0.00 s | 0.00 s |
| Modalities | text, image, file | text, image |
| Providers | - | - |
| Publisher | OpenAI | Moonshot AI |
| Reported scores | Taubench61.2 pass^1 GSM8K96.1 Accuracy ScholarSearch5.71 Social Sciences & Humanities (%) MortgageTax57.4% AIME202438 pass@1 | GPQA Diamond87.9% (AA) Humanity's Last Exam (HLE)30.7% (AA) IFBench70.2% (AA) SciCode49.0% (AA) τ²-bench (Tau²-bench)95.9% (AA) |
FAQ
- Is GPT-4o or Kimi K2.5 better?
- Across the 15 benchmarks both models report on Sophon, Kimi K2.5 leads on 13 of them. Which one is "better" depends on the benchmark - the table above shows every shared score.
- How do GPT-4o and Kimi K2.5 compare on GPQA Diamond?
- GPT-4o scores 54.3% and Kimi K2.5 scores 87.9% on GPQA Diamond.
- Which is cheaper, GPT-4o or Kimi K2.5?
- Kimi K2.5 is cheaper at $2.75 per million output tokens against $10.00 for GPT-4o - about 3.6x.
- When were GPT-4o and Kimi K2.5 released?
- GPT-4o was released 20 Nov 2024 by OpenAI. Kimi K2.5 was released 27 Jan 2026 by Moonshot AI.
Other head-to-heads
56Claude Opus 4.6 vs Kimi K2.531 shared evalsGemini 3.1 Pro Preview vs Kimi K2.530 shared evalsGPT-5.2 vs Kimi K2.529 shared evalsKimi K2.5 vs Qwen3.6 Plus29 shared evalsClaude Sonnet 4.5 vs Kimi K2.528 shared evalsGPT-5.5 vs Kimi K2.528 shared evalsClaude Opus 4.8 vs Kimi K2.528 shared evalsGPT-5.4 vs Kimi K2.528 shared evalsClaude Opus 4.7 vs Kimi K2.528 shared evalsClaude Sonnet 4.6 vs Kimi K2.527 shared evalsClaude Opus 4.5 vs Kimi K2.526 shared evalsClaude Fable 5 vs Kimi K2.526 shared evalsGLM 5.1 vs Kimi K2.526 shared evalsGPT-5 Mini vs Kimi K2.525 shared evalsDeepSeek V3.2 vs Kimi K2.525 shared evalsGPT-5.4 Mini vs Kimi K2.525 shared evalsGrok 4.1 Fast vs Kimi K2.524 shared evalsClaude 4 Sonnet vs Kimi K2.523 shared evalsGPT-5 Nano vs Kimi K2.522 shared evalsGemini 2.5 Pro vs GPT-4o22 shared evalsClaude Sonnet 4.5 vs GPT-4o21 shared evalsGemini 2.5 Pro vs Kimi K2.521 shared evalsGPT-4o vs GPT-4o-mini21 shared evalsGPT-4.1 Mini vs GPT-4o20 shared evalsGPT-4o vs GPT-5 Mini20 shared evalsClaude 4 Sonnet vs GPT-4o20 shared evalsGLM 4.7 vs Kimi K2.520 shared evalsGPT-4o vs GPT-519 shared evalsGPT-4.1 vs GPT-4o19 shared evalsgpt-oss-120b vs Kimi K2.519 shared evalsGPT-5 vs Kimi K2.518 shared evalsGPT-4o vs GPT-5 Nano18 shared evalsGPT-4o vs GPT-5.218 shared evalsClaude Opus 4.5 vs GPT-4o18 shared evalsDeepSeek V3.2 vs GPT-4o18 shared evalsGPT-4o vs gpt-oss-120b17 shared evalsGPT-4.1 Nano vs GPT-4o16 shared evalsGPT-4o vs Grok 4.1 Fast16 shared evalsGLM 4.7 vs GPT-4o16 shared evalsGPT-4o vs GPT-5.515 shared evalsClaude Opus 4.6 vs GPT-4o15 shared evalsGemini 3.1 Pro Preview vs GPT-4o14 shared evalsClaude Opus 4.8 vs GPT-4o14 shared evalsGPT-4o vs GPT-5.414 shared evalsClaude Sonnet 4.6 vs GPT-4o14 shared evalsGLM 5.1 vs GPT-4o14 shared evalsClaude Opus 4.7 vs GPT-4o14 shared evalsGPT-4o vs Qwen3.6 Plus14 shared evalsGPT-4o vs GPT-5.4 Mini14 shared evalsClaude Fable 5 vs GPT-4o13 shared evalsGPT-6 Astra vs Kimi K2.513 shared evalsGPT-4.1 Mini vs Kimi K2.512 shared evalsGPT-4.1 vs Kimi K2.512 shared evalsGPT-4o-mini vs Kimi K2.512 shared evalsGPT-4.1 Nano vs Kimi K2.512 shared evalsGPT-4o vs GPT-6 Astra4 shared evals
Comparing something else? Build your own side-by-side.