evals.report
BenchmarksLabsCompareRun guidesIn the wild
AnthropicClaude

Claude Mythos Preview

Anthropic · Claude. Released Apr 7, 2026.

Claude Mythos Preview is a model from Anthropic in the Claude family, released Apr 7, 2026. evals.report tracks 10 reported Claude Mythos Preview benchmark scores across SWE-bench Verified, SWE-bench Pro, GPQA Diamond, Humanity's Last Exam, OSWorld, GAIA: A Benchmark for General AI Assistants, METR Task-Completion Time Horizons, CharXiv, and 2 more — each shown with its benchmark, metric, source status, and date, and never combined into a single ranking.

10 results

Benchmark results 10

Compare this model
BenchmarkCategoryScoreMetricStatusDate
SWE-bench VerifiedCoding93.9%% resolvedUnverifiedApr 7, 2026Details
SWE-bench ProCoding77.8%% resolvedUnverifiedApr 7, 2026Details
GPQA DiamondReasoning94.6%accuracyUnverifiedApr 7, 2026Details
Humanity's Last ExamReasoning56.8%accuracyUnverifiedApr 7, 2026Details
OSWorldAgents79.6%task success rateUnverifiedApr 7, 2026Details
GAIA: A Benchmark for General AI AssistantsAgents52.3%accuracyUnverifiedApr 7, 2026Details
METR Task-Completion Time HorizonsAgents1044.8 min50% time horizonOfficialApr 7, 2026Details
CharXivMultimodal93.2%accuracyUnverifiedApr 7, 2026Details
SWE-bench MultimodalCoding59.0%% resolvedVerifiedApr 7, 2026Details
Terminal-Bench 2.0Agents82.0%task successUnverifiedApr 7, 2026Details