LiveCodeBench
A holistic, contamination-free benchmark that continuously collects new competitive-programming problems from LeetCode, AtCoder, and Codeforces (released after model training cutoffs) and measures code-generation correctness via Pass@1.
What is LiveCodeBench?
A holistic, contamination-free benchmark that continuously collects new competitive-programming problems from LeetCode, AtCoder, and Codeforces (released after model training cutoffs) and measures code-generation correctness via Pass@1. evals.report tracks reported LiveCodeBench scores with the model, source, status, date, and run caveats attached — official leaderboard scores, vendor-reported launches, and clearly labeled community runs.
Top reported LiveCodeBench score: Fugu Ultra — 93.2% (Pass@1).
| Model | Lab | Score↓ | Source model | Status | Date | |
|---|---|---|---|---|---|---|
| Fugu Ultra | Sakana AI | 93.2% | Fugu Ultra | Verified | Jun 15, 2026 | Details |
| Fugu | Sakana AI | 92.9% | Fugu | Verified | Jun 15, 2026 | Details |
| Gemini 3 Pro | Google DeepMind | 91.7% | — | Unverified | Nov 18, 2025 | Details |
| GPT-5.2 | OpenAI | 89.4% | — | Unverified | Dec 11, 2025 | Details |
| GPT-OSS-120BOpen | OpenAI | 87.8% | — | Unverified | Aug 5, 2025 | Details |
| GPT-5.1 | OpenAI | 86.8% | — | Unverified | Nov 12, 2025 | Details |
| o4-mini | OpenAI | 85.9% | — | Unverified | Apr 16, 2025 | Details |
| Kimi K2 InstructOpen | Moonshot AI | 85.3% | — | Unverified | Jul 11, 2025 | Details |
| GPT-5 | OpenAI | 84.6% | — | Unverified | Aug 7, 2025 | Details |
| GPT-5 mini | OpenAI | 83.8% | — | Unverified | Aug 7, 2025 | Details |
| Grok 4.1 fast reasoning | xAI | 82.2% | — | Unverified | Nov 19, 2025 | Details |
| Grok 4 | xAI | 81.9% | — | Unverified | Jul 9, 2025 | Details |
| MiniMax M2.1Open | MiniMax | 81.0% | — | Unverified | Dec 23, 2025 | Details |
| o3 | OpenAI | 80.8% | — | Unverified | Apr 16, 2025 | Details |
| Gemini 2.5 Pro | Google DeepMind | 80.1% | — | Unverified | Mar 25, 2025 | Details |
| Gemini 3 Flash | Google DeepMind | 79.7% | — | Unverified | Dec 17, 2025 | Details |
| Qwen3 Max | Alibaba / Qwen | 76.7% | — | Unverified | Sep 5, 2025 | Details |
| Claude Opus 4.5 | Anthropic | 73.8% | — | Unverified | Nov 24, 2025 | Details |
| DeepSeek R1Open | DeepSeek | 61.7% | — | Unverified | Jan 20, 2025 | Details |
| DeepSeek V3.2Open | DeepSeek | 59.3% | — | Unverified | Dec 1, 2025 | Details |
| Claude Sonnet 4.5 | Anthropic | 59.0% | — | Unverified | Sep 29, 2025 | Details |
| Qwen 3 Coder 480BOpen | Alibaba / Qwen | 58.5% | — | Unverified | Jul 22, 2025 | Details |
| DeepSeek V3.1Open | DeepSeek | 57.7% | — | Unverified | Aug 21, 2025 | Details |
| GLM-4.6Open | Z.ai | 56.1% | — | Unverified | Sep 30, 2025 | Details |
| Claude Opus 4 | Anthropic | 54.2% | — | Unverified | May 22, 2025 | Details |
| Qwen3 235B A22B Instruct 2507Open | Alibaba / Qwen | 52.4% | — | Unverified | Jul 21, 2025 | Details |
| Claude Haiku 4.5 | Anthropic | 51.1% | — | Unverified | Oct 15, 2025 | Details |
| Gemini 2.5 Flash | Google DeepMind | 49.5% | — | Unverified | Apr 17, 2025 | Details |
| GPT-4.1 | OpenAI | 45.7% | — | Unverified | Apr 14, 2025 | Details |
| Claude Sonnet 4 | Anthropic | 44.9% | — | Unverified | May 22, 2025 | Details |
| DeepSeek V3 0324Open | DeepSeek | 40.5% | — | Unverified | Mar 24, 2025 | Details |
| Llama 4 MaverickOpen | Meta | 39.7% | — | Unverified | Apr 5, 2025 | Details |
| Claude 3.7 Sonnet | Anthropic | 39.4% | — | Unverified | Feb 24, 2025 | Details |
| Claude 3.5 Sonnet | Anthropic | 38.1% | — | Unverified | Jun 20, 2024 | Details |
| Amazon Nova 2 Lite | Amazon | 34.6% | — | Unverified | Dec 2, 2025 | Details |
| Gemini 2.0 Flash | Google DeepMind | 33.4% | — | Unverified | Dec 11, 2024 | Details |
| Llama 3.1 405BOpen | Meta | 30.5% | — | Unverified | Jul 23, 2024 | Details |
| Llama 4 ScoutOpen | Meta | 29.9% | — | Unverified | Apr 5, 2025 | Details |
| Jamba 1.7 LargeOpen | AI21 Labs | 18.1% | — | Unverified | Jul 3, 2025 | Details |
| Mistral Large | Mistral AI | 17.8% | — | Unverified | Feb 26, 2024 | Details |
Each row reports the model’s Pass@1 on LiveCodeBench. Click a row for the full run context.