Skip to main content
Terminal-Bench 2 evaluates agents on hard command-line tasks in task-specific workspaces.

Runtime Status

Run Example

Recipes can infer task images and use /root as the Terminal-Bench workspace root.

Outputs

Per-task details are written to results/terminal_bench_2/<model>/<run>/details/. Aggregate metrics are written to summary.md.