evals.report
BenchmarksLabsCompareRun guidesIn the wild

GPT-5.6 Luna

OpenAI · GPT. Released Jul 9, 2026.

GPT-5.6 Luna is a model from OpenAI in the GPT family, released Jul 9, 2026. evals.report tracks 11 reported GPT-5.6 Luna benchmark scores across AA-Omniscience: Knowledge and Hallucination Benchmark, ARC-AGI-1, ARC-AGI-2, FrontierCode, Terminal-Bench 2.1, SWE-bench Pro, GPQA Diamond, BrowseComp, and 3 more — each shown with its benchmark, metric, source status, and date, and never combined into a single ranking.

11 results

Benchmark results 11

Compare this model
BenchmarkCategoryScoreMetricStatusDate
AA-Omniscience: Knowledge and Hallucination BenchmarkReasoning-10AA-Omniscience IndexOfficialJul 9, 2026Details
ARC-AGI-1Reasoning88%accuracyOfficialJul 9, 2026Details
ARC-AGI-2Reasoning59.54%accuracyOfficialJul 9, 2026Details
FrontierCodeCoding39.8%weighted score (Main)OfficialJul 9, 2026Details
Terminal-Bench 2.1Agents84.7%task successVerifiedJul 9, 2026Details
SWE-bench ProCoding62.7%% resolvedVerifiedJul 9, 2026Details
GPQA DiamondReasoning92.3%accuracyVerifiedJul 9, 2026Details
BrowseCompAgents83.3%accuracyVerifiedJul 9, 2026Details
MMMU-ProMultimodal78.4%accuracyVerifiedJul 9, 2026Details
OpenAI-MRCR v2 (Multi-Round Coreference Resolution)Reasoning41.3%accuracy (mean SequenceMatcher similarity)VerifiedJul 9, 2026Details
ARC-AGI-3Reasoning0.18%accuracyVerifiedJul 9, 2026Details