BenchmarksAgents
Terminal-Bench 4.0
An agentic benchmark measuring whether an AI model can complete real command-line / terminal software tasks end-to-end inside sandboxed containers, scored by resolution rate. Version 4.0 (released 2026-08-28) is a 66-task set that calibrates per-task resources (time, CPU, memory), applies fixes to 19 tasks, removes 8 tasks from 3.0 (saturation, refusals, published solutions, platform issues), and sets a flat 8-hour agent timeout. A different task set from Terminal-Bench 2.0 / 2.1, so scores are not comparable across versions.
Agentsresolution rateHigher is better
No run guide for this benchmark yet.