evals.report
BenchmarksLabsCompareRun guidesIn the wild

Kimi K2 Thinking

Moonshot AI · Kimi K2. Released Nov 6, 2025.

Kimi K2 Thinking is a model from Moonshot AI in the Kimi K2 family, released Nov 6, 2025. evals.report tracks 15 reported Kimi K2 Thinking benchmark scores across SWE-bench Verified, GPQA Diamond, Humanity's Last Exam, PostTrainBench, Epoch Capabilities Index, MMLU-Pro, BrowseComp, GDPval, and 7 more — each shown with its benchmark, metric, source status, and date, and never combined into a single ranking.

Open15 results

Benchmark results 15

Compare this model
BenchmarkCategoryScoreMetricStatusDate
SWE-bench VerifiedCoding71.3%% resolvedVerifiedNov 6, 2025Details
GPQA DiamondReasoning84.5%accuracyVerifiedNov 6, 2025Details
Humanity's Last ExamReasoning23.9%accuracyVerifiedNov 6, 2025Details
PostTrainBenchAgents7.25%weighted average scoreOfficialNov 6, 2025Details
Epoch Capabilities IndexReasoning145.6IndexOfficialNov 6, 2025Details
MMLU-ProReasoning84.6%accuracyUnverifiedNov 6, 2025Details
BrowseCompAgents60.2%accuracyVerifiedNov 6, 2025Details
GDPvalAgents992EloOfficialNov 6, 2025Details
MultiChallengeReasoning55.42%accuracyVerifiedNov 6, 2025Details
Global-MMLUReasoning73.5%accuracyUnverifiedNov 6, 2025Details
WebDev ArenaChat preference1329EloVerifiedNov 6, 2025Details
EQ-Bench Creative Writing v3Chat preference1695EloVerifiedNov 6, 2025Details
MCP-UniverseTool use26.41%Overall Success RateVerifiedNov 6, 2025Details
Gray Swan Arena (Agent Red-Teaming / Indirect Prompt Injection)Agents4.8%Attack Success Rate (ASR)VerifiedNov 6, 2025Details
Terminal-Bench 2.0Agents35.7%task successOfficialNov 6, 2025Details