跳转到主要内容
Runtime 是 AgentCompass 的中心。它接收 CLI flags 或 Python 参数,归一化成 RunRequest,加载注册组件,在并发上限内执行任务,并写出可复用的结果产物。 当你想理解 agentcompass run 启动后发生了什么,先读这一页。

Runtime 负责什么

请求构造

合并 config/defaults.yaml、组件默认值、CLI overrides 和 Python kwargs,生成 RunRequest

执行计划

为每个任务构造 ExecutionPlan,并在 environment 启动前让 recipe 改写计划。

并发控制

同时处理 per-run task_concurrency 和 process-global provider limits。

产物持久化

写出 run info、task details、summary、progress events、logs 和可选 analysis output。
Runtime 不实现 benchmark scoring、agent 行为、provider SDK 调用或 badcase 诊断。这些分别属于 benchmarks、harnesses、environments 和 analyzers。

核心对象

执行流

单个 pending task 的流程:

CLI 用法

三个位置参数选择 benchmarkharnessmodel。environment、model endpoint、concurrency 和 output directories 都会进入同一个 RunRequest

Python 用法

返回值包含聚合 metadata、metrics、summary、output paths 和 applied recipes。per-task details 仍然写在磁盘上,避免大规模评测把所有细节留在内存中。

配置优先级

常见模式

开发者说明

大多数扩展不需要修改 runtime。优先新增或修改 benchmark、harness、environment、recipe 或 analyzer。只有当你需要新的跨模块执行行为,例如新的 progress event、新的结果持久化行为或新的 request-level control 时,才应该改 runtime。

相关页面