evals.report
BenchmarksLabsCompareRun guidesIn the wild
LabsAgent systems

Agent systems

Track Agent systems model scores across public AI benchmarks including SWE-Marathon, Terminal-Bench 2.1, and Terminal-Bench 4.0. Each result is shown one benchmark at a time, with source links and evaluation dates — no blended score or composite ranking. 26 models tracked, spanning Agent.

26 models34 results

Models 26

Claude Code + Claude Sonnet 5
Agent · claude code sonnet 5
1 results
Grok Build + Grok 4.5
Agent · grok build grok 4.5
1 results
Grok Build + Grok 4.6
Agent · grok build grok 4.6
1 results
Codex + GPT-5.6 Luna
Agent · codex gpt-5.6 luna
1 results
Codex + GPT-5.6 Terra
Agent · codex gpt-5.6 terra
1 results
Codex + GPT-5.6 Sol
Agent · codex gpt-5.6 sol
1 results
Claude Code + GLM-5.3
Agent · claude code glm-5.3
1 results
Claude Code + Claude Fable 5
Agent · claude code fable 5
1 results
Claude Code + Claude Opus 5
Agent · claude code opus 5
1 results
Terminus 2 + Kimi K2.6
Agent · terminus 2 + kimi k2.6
1 results
Kimi Code CLI + Kimi K2.6
Agent · kimi code cli + kimi k2.6
1 results
Terminus 2 + MiniMax M2.7
Agent · terminus 2 + minimax m2.7
1 results
Terminus 2 + GLM 5.1
Agent · terminus 2 + glm 5.1
1 results
Terminus 2 + DeepSeek V4 Pro
Agent · terminus 2 + deepseek v4 pro
1 results
Gemini CLI + Gemini 3.5 Flash
Agent · gemini cli + gemini 3.5 flash
1 results
Claude Code + GLM 5.1
Agent · claude code glm 5.1
1 results
Terminus 2 + Claude Opus 4.7
Agent · terminus 2 opus 4.7
2 results
Gemini CLI + Gemini 3 Pro
Agent · gemini cli gemini 3 pro
1 results
Claude Code + Claude Opus 4.7
Agent · claude code opus 4.7
2 results
Terminus 2 + Gemini 3.1 Pro
Agent · terminus 2 gemini 3.1 pro
2 results
Gemini CLI + Gemini 3.1 Pro
Agent · gemini cli gemini 3.1 pro
2 results
Terminus 2 + Gemini 3 Pro
Agent · terminus 2 gemini 3 pro
1 results
Terminus 2 + Claude Opus 4.8
Agent · terminus 2 opus 4.8
1 results
Terminus 2 + GPT-5.5
Agent · terminus 2 gpt-5.5
2 results
Claude Code + Claude Opus 4.8
Agent · claude code opus 4.8
3 results
Codex CLI + GPT-5.5
Agent · codex cli gpt-5.5
2 results

Progress by benchmark

Show progress on
Single benchmark only
This view shows SWE-Marathon (resolution rate (pass@1)) only. Other benchmarks use different metrics and are not directly comparable.

Progress matrix

ModelSWE-bench Verified
% resolved
Terminal-Bench 2.1
task success
DeepSWE
% resolved
GPQA Diamond
accuracy
LiveCodeBench Pro
Codeforces Elo
Humanity's Last Exam
accuracy
LiveBench
score
SWE-bench Pro
% resolved
Berkeley Function Calling Leaderboard
accuracy
MMMU-Pro
accuracy
LMArena
source-defined rating
ARC-AGI-1
accuracy
ARC-AGI-2
accuracy
ARC-AGI-3
accuracy
FrontierMath
accuracy
AIME (OTIS Mock)
accuracy
SimpleQA Verified
accuracy
GBA Eval
overall score
WeirdML
average accuracy
MCP Atlas
pass rate
Remote Labor Index
automation rate
Artificial Analysis Intelligence Index
Index
Epoch Capabilities Index
Index
Aider Polyglot
% correct
SWE-rebench
Resolved rate (pass@1)
MMLU-Pro
accuracy
OSWorld
task success rate
GAIA: A Benchmark for General AI Assistants
accuracy
BrowseComp
accuracy
τ²-bench (Telecom)
pass^1
AIME 2026
accuracy
MathVista
accuracy
Video-MME
accuracy
GDPval
Elo
LiveCodeBench
Pass@1
METR Task-Completion Time Horizons
50% time horizon
SciCode
accuracy
MMMU (Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark)
accuracy
AA-Omniscience: Knowledge and Hallucination Benchmark
AA-Omniscience Index
IFBench
accuracy
MultiChallenge
accuracy
OpenAI-MRCR v2 (Multi-Round Coreference Resolution)
accuracy (mean SequenceMatcher similarity)
LongBench v2
accuracy
Global-MMLU
accuracy
Video-MMMU
accuracy
WebDev Arena
Elo
Search Arena
Elo
Arena-Hard-Auto v2.0
% win rate
EQ-Bench Creative Writing v3
Elo
Design Arena
Elo
AILuminate AI Safety Benchmark
Safety grade
MASK (Model Alignment between Statements and Knowledge)
Honesty score
MCP-Universe
Overall Success Rate
CharXiv
accuracy
OCRBench v2
accuracy
ScreenSpot-Pro
accuracy
FACTS Grounding
Grounding accuracy
BigCodeBench
calibrated Pass@1
SWE-bench Multilingual
% resolved
SWE-bench Multimodal
% resolved
SuperGPQA
accuracy
EnigmaEval
accuracy
ZeroBench
accuracy
IMO-Bench
accuracy
PutnamBench
Problems solved
MathArena HMMT February 2026
accuracy
FrontierMath Tier 4
accuracy
Vectara Hallucination Leaderboard
Hallucination Rate
Gray Swan Arena (Agent Red-Teaming / Indirect Prompt Injection)
Attack Success Rate (ASR)
PolyMath: Evaluating Mathematical Reasoning in Multilingual Contexts
Difficulty-Weighted Accuracy (DW-ACC)
Vibe Code Bench
Overall accuracy
Online-Mind2Web
Task success rate
WebArena
Task success rate
GSO: Software Optimization Benchmark for SWE-Agents
Opt@1
MultiNRC
accuracy
Terminal-Bench 2.0
task success
Terminal-Bench 4.0
resolution rate
SWE-Marathon
resolution rate (pass@1)
FrontierCode
weighted score (Main)
FrontierSWE
dominance score
ProgramBench
almost-resolved rate
CursorBench
score
PostTrainBench
weighted average score
Codex CLI + GPT-5.5
Agent
83.4%12.0%
Claude Code + Claude Opus 4.8
Agent
78.9%23.6%26.0%
Terminus 2 + GPT-5.5
Agent
78.2%6.0%
Terminus 2 + Claude Opus 4.8
Agent
74.6%
Terminus 2 + Gemini 3 Pro
Agent
74.4%
Gemini CLI + Gemini 3.1 Pro
Agent
70.7%2.0%
Terminus 2 + Gemini 3.1 Pro
Agent
70.3%4.0%
Claude Code + Claude Opus 4.7
Agent
69.7%16.0%
Gemini CLI + Gemini 3 Pro
Agent
66.3%
Terminus 2 + Claude Opus 4.7
Agent
66.1%11.0%
Claude Code + GLM 5.1
Agent
58.7%
Gemini CLI + Gemini 3.5 Flash
Agent
7.0%
Terminus 2 + DeepSeek V4 Pro
Agent
4.0%
Terminus 2 + GLM 5.1
Agent
1.0%
Terminus 2 + MiniMax M2.7
Agent
0.0%
Kimi Code CLI + Kimi K2.6
Agent
0.0%
Terminus 2 + Kimi K2.6
Agent
0.0%
Claude Code + Claude Opus 5
Agent
51.8%
Claude Code + Claude Fable 5
Agent
44.5%
Claude Code + GLM-5.3
Agent
41.8%
Codex + GPT-5.6 Sol
Agent
37.3%
Codex + GPT-5.6 Terra
Agent
21.5%
Codex + GPT-5.6 Luna
Agent
17.3%
Grok Build + Grok 4.6
Agent
20.3%
Grok Build + Grok 4.5
Agent
12.4%
Claude Code + Claude Sonnet 5
Agent
12.4%

Scores are not normalised across benchmarks. Each column uses its own metric. Compare columns independently.

Related pages