evals.report
BenchmarksLabsCompareRun guidesIn the wild

Terminal-Bench 4.0

An agentic benchmark measuring whether an AI model can complete real command-line / terminal software tasks end-to-end inside sandboxed containers, scored by resolution rate. Version 4.0 (released 2026-08-28) is a 66-task set that calibrates per-task resources (time, CPU, memory), applies fixes to 19 tasks, removes 8 tasks from 3.0 (saturation, refusals, published solutions, platform issues), and sets a flat 8-hour agent timeout. A different task set from Terminal-Bench 2.0 / 2.1, so scores are not comparable across versions.

Agentsresolution rateHigher is better

What is Terminal-Bench 4.0?

An agentic benchmark measuring whether an AI model can complete real command-line / terminal software tasks end-to-end inside sandboxed containers, scored by resolution rate. Version 4.0 (released 2026-08-28) is a 66-task set that calibrates per-task resources (time, CPU, memory), applies fixes to 19 tasks, removes 8 tasks from 3.0 (saturation, refusals, published solutions, platform issues), and sets a flat 8-hour agent timeout. A different task set from Terminal-Bench 2.0 / 2.1, so scores are not comparable across versions. evals.report tracks reported Terminal-Bench 4.0 scores with the model, source, status, date, and run caveats attached — official leaderboard scores, vendor-reported launches, and clearly labeled community runs.

Top reported Terminal-Bench 4.0 score: Claude Code + Claude Opus 5 51.8% (resolution rate).

ModelLabScoreSource modelStatusDate
Claude Code + Claude Opus 5Agent systems51.8%Claude Code + Opus 5OfficialDetails
Claude Code + Claude Fable 5Agent systems44.5%Claude Code + Fable 5OfficialDetails
Claude Code + GLM-5.3Agent systems41.8%Claude Code + GLM-5.3OfficialDetails
Codex + GPT-5.6 SolAgent systems37.3%Codex + GPT-5.6 SolOfficialDetails
Claude Code + Claude Opus 4.8Agent systems23.6%Claude Code + Opus 4.8OfficialDetails
Codex + GPT-5.6 TerraAgent systems21.5%Codex + GPT-5.6 TerraOfficialDetails
Grok Build + Grok 4.6Agent systems20.3%Grok Build + Grok 4.6OfficialDetails
Codex + GPT-5.6 LunaAgent systems17.3%Codex + GPT-5.6 LunaOfficialDetails
Grok Build + Grok 4.5Agent systems12.4%Grok Build + Grok 4.5OfficialDetails
Claude Code + Claude Sonnet 5Agent systems12.4%Claude Code + Sonnet 5OfficialDetails

Each row reports the model’s resolution rate on Terminal-Bench 4.0. Click a row for the full run context.